通过轨迹锦标赛提取非多样化奖励组中的细粒度推理质量信号
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用集合距离奖励解决胸部X光报告生成的顺序无关性问题
通过异步系统设计和归一化修复,将视觉网页智能体的多步RL训练吞吐量提升2.9倍
提出hacker-fixer循环自动加固Agent基准测试验证器,防御reward hacking
基础LLM已具备预测外部judge评分的能力,仅需少量数据激发
通用机器人智能的核心瓶颈是缺乏将物理世界经验转化为机器人可用监督信号的机制,需要构建四大支柱组件。
LIMMT:少即是多的运动跟踪方法
👍 16通过数据质量选择而非数量堆叠,仅用3%数据实现超越完整数据集的人形机器人运动跟踪性能
同时更新agent scaffold和权重的自改进系统
Astra让VLM通过调用世界模拟器生成想象观测,学习何时、何地、如何想象以提升空间推理能力
利用历史求解轨迹派生技能,闭环生成训练任务,实现SWE智能体自演进
提出 DistIL 算法,通过前向交叉熵和序列级信用分配解决自蒸馏方法的单调性缺陷
强化学习引发未见语言的语境学习翻译能力
👍 25用强化学习教会模型利用语言学知识而非记忆,实现极低资源语言翻译的泛化
信任区域Q伴随匹配
👍 24通过自适应信任区域控制稳定离策略流策略微调
首次将在线蒸馏提升到隐藏状态空间,解决方差瓶颈和信息压缩问题,实现Pareto优势
迈向一对多时序定位
👍 7首个一对多时序定位框架,解决现实视频中重复事件定位问题
通过在语言和潜在视觉空间之间交错推理,保留动态未来视觉结构以提升视频事件预测性能
引入信念熵提供细粒度记忆监督,解决长周期智能体的噪声积累和信念漂移问题
首个机械工程图理解基准数据集与专用模型,提升多模态LLM在工程制图中的能力
EvoDS通过自主技能获取和自适应上下文压缩实现自进化数据科学代理
ADR框架通过原子分解重组生成高质量可验证代码任务,突破RLVR数据瓶颈