仅用15k合成积木题训练,LVLM域外空间推理全面超越空间专精模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
开源Nemotron流水线纯自然语言证明获IMO 2026金牌(30/42分)
仅训封闭任务即浮现开放报告能力,冠脉造影端到端可审计解读
基于世界模型的自动研究智能体规模化训练
👍 444用世界模型替代昂贵的沙箱执行训练研究智能体,在线去偏去噪,训练加速3-4倍且性能更优。
T1:面向长程任务的终端智能体强化学习
👍 52密集执行奖励+TITO/R3稳定化,将122B MoE模型RL训练为64.0%解题率的终端智能体
冻结子代理并行读全文,主代理散射-聚合多轮推理,长文多跳问答更准且最高提速11倍。
重思完整推理轨迹在后训练中的必要性
👍 17推理轨迹中段约20%是冗余的:SFT只保留首尾,效果反超完整轨迹训练
把广告视频生成分解为策略选择与草稿生成两阶段,用线上业务反馈训练奖励模型驱动DPO+GRPO优化。
AuK:开源语音生成与编辑基础模型技术报告
👍 213用自然语言指令与音频上下文统一语音生成和编辑的开源基础模型,四步推理提速4.5倍
解耦预训练感知与决策、蒸馏统一,端到端驾驶首次超越人类司机
智能体视觉生成:从生成模型到智能体控制
👍 29按控制器决策的最大因果触达,把智能体视觉生成统一划分为 L0–L4 五层的综述与评估框架
把适应从智能体侧转向环境侧,用分阶段增强反馈破解长程RL奖励稀疏
一个症状,三个杠杆:在策自蒸馏批判性综述
👍 14OPSD以自身加特权信息当教师,但不对称也扭曲信号,可用三个杠杆治理坍缩。
OPD的增益并非来自教师蒸馏,而是压制学生低概率token;据此提出零监督OPSA,性能反超OPD
保持解析-生成-放置顺序,把精度留给VLM闭环gizmo交互,实拍还原为可编辑仿真场景
把每篇论文改造成可验证训练环境,双阶段利用评分标准进化科研计划生成能力
将物理世界表示为可执行代码,用智能体闭环发现世界并为VLM提供可扩展物理监督
三方自博弈让裁判与解题者共同进化,突破固定裁判的自改进上限
扩展上下文管理工具集,用细粒度强化学习教智能体主动管理自身工作上下文
并行管解码:面向视频的高效生成式时空定位
👍 16把时空管解码深度压到固定1+1轮,延迟降79倍、吞吐升92倍且精度更优。