开源Nemotron流水线纯自然语言证明获IMO 2026金牌(30/42分)
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
负向自蒸馏:通过规避缺陷学会推理
👍 17让模型自演“粗心推理者”生成负向教师,推开缺陷token的概率分布,无标签提升数学推理
可验证奖励下的在策略蒸馏(OPDVR)
👍 17用一个 ReLU 门控把在策略蒸馏改造成合法的 RLVR 方法,零新增超参数
MathForm用知识检索与验证迭代构造36.7万条Lean数据,8B形式化模型超越32B对手
用稀疏位置探测与验证器校准的蒸馏目标,提升小模型数学推理覆盖
面向多语言数学推理的在线策略增量蒸馏
👍 31将OPD2蒸馏扩展至英/韩/日数学推理,揭示推理迁移与语言保留的差异。
用层循环配方让循环MoE在等算力下稳定胜过普通堆叠
把零 RL 直接做到 1T 参数,揭示规模带来的涌现推理行为。
首个系统评测大模型高级数学证明生成与验证能力的基准套件
信任区域策略蒸馏
👍 32通过动态构造近端教师解决OPD优化不稳定性,零计算开销实现数学推理性能大幅提升
面向智能体强化学习的单轮次异步优化
👍 15提出SAO方法,通过单轮次采样和双向token级剪裁稳定异步强化学习训练
TREK:蒸馏以探索、强化以精炼
👍 8TREK扩展GRPO探索支持,提升数学和Agent性能
构建18种低资源语言的数学推理基准,揭示多语言模型在低资源语言上的持续性能差距。
dOPSD:扩散语言模型在策略自蒸馏方法
👍 16从扩散解码轨迹中自生成特权信息,实现dLLM的有效在策略自蒸馏
揭示训练-推理不匹配导致的目标错位,提出 MIPI 原则和 MIPU 两步框架
揭示现有LLM多样性度量只捕捉表面措辞变化而非方法层面的策略差异,并提出方法级多样性评估框架
通过可验证的数据构建解决视觉数学推理中的数据质量和奖励信号可靠性问题
MaxProof框架使M3模型在IMO/USAMO达超人类金牌水平
通过嵌入级语义邻居混合提升强化学习推理探索能力
通过二元验证器信任信号改进在线策略蒸馏,在数学推理基准上平均提升1.98%