将推理链渲染为图像,用视觉token替代文本token,实现3.4×压缩和2.7×加速
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用难度感知策略优化与多角度改题,显著提升数学推理
揭示LLM基准饱和的真正瓶颈:数据集质量与评判者能力
通过元强化学习生成自适应课程,突破数学推理性能瓶颈
通过模型自我验证和提出单步纠正干预,解决强化学习在LLM推理中的信用分配问题
测试时多智能体协作与经验注入提升推理准确性
在GRPO优势之后加反向累积log比,修正自回归KL信用分配
面向卓越长链式思维推理的分布对齐序列蒸馏
👍 64三项蒸馏改进技术将4B小模型推理能力提升至超越32B大模型水平
两阶段训练:先学判断再学生成,提升推理效率
将CoT推理重新表述为迭代去噪过程,通过扩散滑动窗口缓解错误积累
单个精心设计的数学样本通过RL训练可跨学科提升推理能力
研究发现大型推理模型存在多语言潜在推理能力,但强弱不均:高资源语言强,低资源语言弱,且在困难任务上几乎不可检测
提出FIGR方法,将可执行的图表构建集成到多轮推理中,通过强化学习学习何时以及如何外化中间结构作为视觉状态。