用显式约束生成高质量交互数据并确定性验证,训练4B小模型匹敌70B大模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
提出INSIGHT方法通过贝叶斯加权互信息优化RLVR训练数据选择
基于参考引导微调在强化学习中学习困难问题
👍 13通过参考引导微调(ReGFT)合成模型自有推理轨迹,解决RL训练中的奖励稀疏问题
基于自博弈RL的零数据框架,让LLM自主进化为通用工具调用智能体
提出基于置信度的递归推理框架,让模型自我修正提升精度
用三阶段训练和数据工厂将通用VLM转为OCR专家,OmniDocBench达92.94%
通过大规模智能体 RL 训练 LLM 生成超越 torch.compile 的高性能 CUDA 内核
通过奖励模型增强图像生成中的空间理解
👍 60提出专用空间奖励模型与数据集,显著提升图像生成的多对象空间关系理解能力
通过层次化推理和主动探索,实现高效长视频问答
提出RLAD框架,通过信任区域比率蒸馏将教师指导嵌入GRPO更新,实现选择性模仿
DPE 通过诊断-生成-强化闭环迭代,用 1K 种子数据让 8B 多模态模型超越 72B 模型
用复合奖励信号的强化学习训练医学视觉语言模型,实现开放性临床推理
通过并行证据采集替代顺序推理,实现高效且泛化的长期智能体搜索
通过双曲JEPA和几何强化学习,提升能量预测世界模型的长程规划能力
ACE通过非对称惩罚过自信错误,在不损失Pass@1的前提下显著扩展推理边界
通过四维策略梯度分析揭示ARL训练不稳定根源,提出SAMPO统一算法实现稳定训练
提出动作感知SFT和保守RL框架,解决GUI代理推理-定位干扰和部分可验证奖励下的训练不稳定问题
用过采样-过滤-排序和累积工具奖励解决多模态RL训练中的交互坍缩问题
高效推理的艺术:数据、奖励与优化
👍 7系统研究高效推理训练机制,通过数据、奖励和优化策略实现更短、更准确的推理链生成
提出反思式测试时规划框架,让具身LLM在部署时通过三种反思机制从失败中学习