仅用15k合成积木题训练,LVLM域外空间推理全面超越空间专精模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
开源Nemotron流水线纯自然语言证明获IMO 2026金牌(30/42分)
把多镜头叙事从时间轴搬进空间网格,联合生成长视频
纯后训练专用模型家族,单次调用生成幻灯片与可交互课件,用可执行探针把交互性变成可测量的奖励信号
把执行轨迹建成状态图,定位首个偏离断点,仅对恢复段做局部监督的自蒸馏框架
用统一数据对象 (E,q,τ,v) 与 ACE 框架把智能体数据生成重构为受限分布设计
进化策略比GRPO推理覆盖更广:升Pass@1同时保住Pass@K,大参数漂移不等于灾难性遗忘
把参考答案拆成原子量规条目,为VLM后训练提供细粒度、前缀定位的RL奖励
将标注作为oracle加入RL组,解耦优势估计防反转,免CoT高效训练统一视频感知。
将真实CVE转化为可执行数据训练OpenAegis,CyberGym通过率达58.1%
用独立估计的推理进展排序检测并屏蔽误导性蒸馏监督,显著提升 OPD 推理能力
重构技能场景并以真实容器状态对齐工件,合成高密度可验证终端任务
三阶段后训练把文档语料内化为参数知识,免检索答题同时保住通用能力。
把黑盒智能体框架当作不透明环境,用沙箱、服务代理与前缀树实现稳定的智能体RL
固定免记忆近窗推理,用思考模式蒸馏与线索门控让4B学生追平9B教师
训练时预测未来视觉嵌入、推理时直接作答,精度持平或超越Visual CoT且延迟降5倍以上
反转师生不对称方向:教师看原图、学生看增强退化视图,用视图落差当免费蒸馏信号
397B 参数科学智能体基础模型:多模态科学理解、可验证强化学习与长程智能体训练的统一
用对抗学习的动态表征补足静态Fréchet目标盲区,抑制Fréchet hacking
让统一多模态模型自主推理、调用工具并原生生成图像。