将物理世界表示为可执行代码,用智能体闭环发现世界并为VLM提供可扩展物理监督
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
扩展上下文管理工具集,用细粒度强化学习教智能体主动管理自身工作上下文
把游戏开发变成“引擎检查+人类验收”的可验证奖励环境,驱动世界模型自我改进
PILOT:长程智能体的实时自我改进
👍 30监督者-工作者架构让智能体在执行中实时纠偏并把经验沉淀为可复用技能
把智能体经验编译进永不回滚的Wiki知识库,与技能协同进化,全面超越现有技能进化方法
用YOLO定位加确定性几何验证取代VLM直接预测,CT空间问答准确率达94.1%
用环境扩展与智能体协作扩展两条路线,把推理模型变成能完成长周期复杂工作的系统。
把电影编码为可编辑的电影知识图谱,用重构残差驱动双环文本梯度自进化
以GDLA注意力与384选8细粒度MoE,13.2B激活参数实现智能体任务开源领先
用粗到细的智能体管线,从开放文本生成可探索、可编辑的大规模三维世界
让单一策略同时扮演行动者与环境,内化世界模型以摆脱外部环境依赖。
用When/Where/How三轴框架重定义大模型时代的持续学习
提出音视频协同编辑评测基准AVE-Compass,并配套规划式智能体AVE-Agent。
把世界模型重构为面向智能体的信息转移代理,提出6类功能×3层赋能的设计空间。
用结构先于语言的事件图数据,让视觉证据真正驱动多轮搜索。
面向真实设备的统一 GUI+CLI 基础智能体,在移动端全面 SOTA。
单一策略在任务序列中边解题边整理技能文档,实现端到端的可迁移技能学习。
用可控环境系统揭示长程规划能力在预训练、GRPO/OPD、多教师蒸馏三阶段的获取、塑造与整合规律。
基于前缀重放的多轮在线策略蒸馏
👍 11复用教师轨迹做离线多轮 agent 蒸馏,零工具调用、4倍加速且不掉点。
构建可验证的离线维基百科环境,让搜索智能体自蒸馏迭代进化。