把完成轨迹的事后技能蒸馏回策略,实现自进化密集监督。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个无需语言监督、直接在视觉空间学习异构推理任务并配套 VR-X 基准的框架
揭秘在线策略蒸馏:角色、病理与调控
👍 20系统揭示OPD的探索催化本质,诊断信号失真病理,用零开销信号调控修复训练不稳定
首个MeanFlow前向过程强化学习,用诱导瞬时速度预测器优化平均速度生成器。
用强化学习训练智能体 RAG 协调语义检索、关键词检索与段落读取三类工具。
把零 RL 直接做到 1T 参数,揭示规模带来的涌现推理行为。
0.8B端到端文档解析模型,靠数据引擎+多组件RL奖励+策略蒸馏刷新多项OCR榜单
现代智能体系统中的自我改进:综述
👍 29把自我改进智能体形式化为参数更新与脚手架更新两条路径,统一梳理历史、分类、应用与评估。
长度惩罚削弱思维链的可监控性
👍 11长度惩罚RL压缩CoT并保留答案行为,但让监控者更难发现引导答案的隐藏影响
开放权重多乐器音乐转录模型,结合合成数据预训练、真实数据微调与强化学习后训练
信任区域策略蒸馏
👍 32通过动态构造近端教师解决OPD优化不稳定性,零计算开销实现数学推理性能大幅提升
基于疾病本体和靶点序列的条件生成模型
通过停止梯度算子实现无界正向更新的非对称优化框架,解决RL中探索与稳定性的矛盾
面向智能体强化学习的单轮次异步优化
👍 15提出SAO方法,通过单轮次采样和双向token级剪裁稳定异步强化学习训练
自动设计具身智能体架构
👍 12提出AGENTCANVAS和KDLOOP系统化评估 embodied agents 的架构搜索效果
通过两阶段真实世界RL,将触觉反馈残差适应到预训练视觉策略,大幅提升接触丰富操作任务的成功率
提出iKCE诊断方法揭示世界模型长期预测失败的本质是运动学而非动力学想象
用LLM导师动态调整提示词难度,解决强化学习中提示词与策略能力不匹配的问题
通过回合级预算策略优化长期Agent的在线策略蒸馏效率
让多模态大模型通过生成SVG代码进行可视化推理,提升空间理解能力