用三 Agent 架构与四阶段训练流水线,让 30B 模型在深度搜索与研究任务上比肩百亿参数大模型。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
面向高效视觉推理的自适应推理路径学习
👍 10提出 AVR 框架,让视觉推理模型按任务复杂度动态选择直接回答、感知或完整推理三种格式,token 消耗降低 50–90%。
用扩散生成器采样轨迹、RL判别器在低维打分,再配BEV特征级仿真,把闭环规划的安全性提升56%。
分层动作加密集奖励GRPO,把LVLM改造成统一视觉RAG智能体。
通过只更新Q/K投影中高幅度激活对应的权重行实现长上下文RL稀疏更新。
用强化学习训练的工具调用Agent在胸部CT报告生成中显著超越3D视觉语言模型
用结构化多维推理奖励替代标量打分,缓解奖励黑客并实现零参数测试时优化
提出 PreRL 与 DSRL:在预训练空间以 NSR 修剪错误推理路径,再切换到标准 RL 精调。
把组内候选重加权变成闭式目标分布,用交叉熵直接拟合,梯度自动消失。
让模型自己当老师,把稀疏二元奖励转成稠密 token 级自监督。
统一开源框架,覆盖 GUI 智能体训练、评估、部署全链路
用原子知识点重构强化学习提示,实现最小充分引导
将推理任务重构为序列级上下文强盗问题,用标量价值函数解决PPO在长链推理中的信用分配不稳定问题
通过预先计算教师logprob,把OPD从需要实时教师服务变成单阶段训练,效率提升4倍。
在PyBoy环境里把反循环与访问掩码显式建模,让PPO学会宝可梦前期任务。
用历史错误模式的记忆惩罚,缓解 LLM 强化学习的错误坍缩。
基于轨迹正确性和困惑度进行双路自适应加权的在线策略蒸馏框架,提升LLM推理对齐效果
将物理模拟器转化为可扩展的问答生成器,用合成数据训练LLM提升物理推理能力
TRACE:能力目标化智能体训练
👍 15自动识别智能体能力缺失并合成针对性训练环境的端到端系统
首篇系统综述 LLM 强化学习中信用分配的论文,梳理 2024-2026 年 47 种方法并提出粒度×方法学二维分类体系。