用同一模型的双角色自蒸馏,将英语推理能力迁移到17种低资源非洲语言。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
在单流自回归中把『何时披露中间推理』变成可学习的决策变量,用蕴含对齐SFT+RL实现。
将SFT重写为带稀疏奖励的on-policy RL,提出GAL+DCR统一后训练框架
构建了跨越47国17语、3万+奥数题的MathNet基准,并首次系统性评测模型在数学等价检索上的能力。
在数学竞赛中,模型本身的能力差距远超任何提示工程优化
用原子知识点重构强化学习提示,实现最小充分引导
提出分歧子集评估框架,揭示LLM关于答案正确性的特权知识仅在事实任务中存在。
两阶段RLVR框架联合训练推理和自我改进,无需外部监督信号
Adam 定律:面向大语言模型的文本频率定律
👍 509提出文本频率定律:同等语义下高频文本更适合 LLM 提示与微调,结合 TFD 蒸馏与 CTFT 课程训练在 4 大任务验证。
提出ScratchMath基准评估MLLM诊断学生数学错误能力
Actor-Judge架构实现多模态推理无监督自进化,无需标注数据
提出Principia基准和RLLM、ParaGator方法,显著提升LLM推导复杂数学对象的能力
通过策略驱动的技能选择与分层奖励实现数学推理能力的持续进化
首个大规模未解数学问题的自动化验证基准,评估AI的数学发现能力
用预训练的泛化价值模型V0作为先验,自适应融合稀疏采样经验均值,实现低方差基线估计
ODD:免训练、顺序正交投影,提升扩散语言模型Pass@k。
把一阶梯度下降搬进 LLM 解码循环,直接优化 token logits 来精细化推理策略
V1:统一生成与自验证的并行推理框架
👍 14通过成对比较和联合训练统一生成与验证,提升并行推理性能
提出多智能体框架,利用代码驱动的探索自动将数学问题演化为更难的变体
基于参考引导微调在强化学习中学习困难问题
👍 13通过参考引导微调(ReGFT)合成模型自有推理轨迹,解决RL训练中的奖励稀疏问题