提出 CaRR 细粒度奖励框架和 C-GRPO 算法,解决深度搜索 RL 中的捷径利用与幻觉问题
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
评测基准
LLM评估
高效推理
信息检索
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
综述
自蒸馏
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
自动化合成可执行的工具交互环境,用于训练LLM Agent解决多轮多工具复杂任务
将智能体交互历史渲染为压缩图像,用视觉 token 替代文本 token,节省 50%+ 消耗
通过双层信用评估和查询优化机制,显著提升搜索代理的中间查询质量与整体性能
提出推理驱动的多智能体路由器,支持动态加入Agent和多Agent协作执行
轻量级塔防游戏环境,用于评估LLM的长期规划和决策能力
通过熵驱动潜在分支和信息瓶颈正则化,解决大语言模型推理中的探索崩溃问题
通过解耦多奖励归一化解决GRPO信号坍塌问题,提升RL对齐效果
首个将强化学习应用于夜间白平衡的框架,用5张训练图片实现跨传感器泛化。
提出自适应视频推理框架,只在必要时进行CoT推理,大幅提升效率同时保持准确率
让小模型主动调用大模型,用1.07%的token成本恢复60%性能差距
单个精心设计的数学样本通过RL训练可跨学科提升推理能力
提出IC-CoT结构化推理和GRPO对齐训练,提升多参考图像的生成与编辑能力
提出多会话协作基准与记忆框架,使对话代理跨会话学习用户偏好并持续提升协作质量。
演化式程序化技能网络
👍 88提出PSN框架,让智能体通过可执行符号程序持续获取、精炼和重用技能
提出双路径框架ATLAS,通过集群路由和强化学习实现动态模型-工具协同编排。
让LLM学会在有限预算下智能分配计算资源,最大化投资回报率
通过合并低熵去噪步骤为高熵SDE步骤,提升流模型GRPO训练效率
首个端到端分子动力学代码生成与QA框架,结合三阶段训练与闭环强化学习
提出将推理与生成解耦的RL框架,通过CoT采样和检查表奖励提升推理驱动图像编辑性能