提出 Manager-Planner-Executor 三体架构的双记忆深度研究代理,通过交替强化学习与测试时学习解决长上下文记忆噪声与检索成本问题。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
LLM 能否在含噪监督下学习鲁棒推理?
👍 43首次系统分析 RLVR 噪声标签机制,提出在线标签精炼方法 OLR。
自执行模拟提升代码生成模型性能
👍 35让代码模型学会模拟程序执行,通过自验证和自修复提升代码正确率
提出完全开源的视觉推理训练方案,通过六类任务的多任务RL实现广泛能力提升
通过样本路由统一组相对和自蒸馏策略优化
👍 32SRPO将正确样本路由到GRPO、失败样本路由到SDPO,实现早期效率和长期稳定性的双重优势
用于训练机器学习工程智能体的合成沙箱
👍 14通过微尺度合成数据集使MLE任务的轨迹级在线强化学习成为现实
通过连接生成和理解能力,提升统一多模态模型对退化图像的鲁棒性
通过任务重构和自适应课程学习解决RLVR中无法从pass@64=0的困难问题学习的根本局限
多智能体RL系统,首次在3场Codeforces现场赛中击败所有人类选手夺冠
通过上下文强化学习将agent技能内化到模型参数,实现零样本自主行为
用端到端微调 LLM 从新闻预测供应链中断概率,显著优于 GPT-5 等基线。
大语言模型在线策略蒸馏综述
👍 13系统性综述LLM在线策略蒸馏(OPD)的理论框架、方法分类、失败模式和工业实践
用RL训练的压缩偏好记忆替代长购买历史,提升LLM购物代理的重排性能
通过引入Future-KL散度重构GRPO的信用分配机制,突破LLM推理长度停滞瓶颈
提出MUPO方法解决RL模型的多样性崩溃问题
潜在空间几何引导的4D世界一致性视频生成框架
代码生成中的任意位置思考
👍 26允许LLM在代码生成过程中任意位置按需调用推理的新机制,实现自适应计算
首个覆盖草图到SVG、文本到SVG、SVG编辑和描述的多任务SVG基准
进化搜索+逐步训练框架实现GPU内核自动优化,超越Gemini-3.0-pro
以验证为中心的三阶段设计,让 8B 深度研究智能体逼近 30B 级别性能