用技能熵度量技能切换难度,构建Skill2-Bench基准并用Skill-Entropy RL训练
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
RSTG在负零方差样本上选择性施加自适应蒸馏,恢复GRPO丢失的梯度信号
用图表-表格-代码三表征一致性作为自监督信号协同优化多模态跨表征理解
自进化代码智能体
👍 6系统综述让代码智能体从软件反馈中持续自我进化的方法与分类框架
把世界模型重构为面向智能体的信息转移代理,提出6类功能×3层赋能的设计空间。
用工具执行结果构造轮次级多视野事后监督,自适应调制强化学习优势。
DASH通过检测答案漂移为推理段落分配信用,在减少过度思考的同时提升准确率。
用专家失败轨迹做反思学习,提升LLM推理能力
把自动驾驶规划变成轨迹选择题,先推理后揭示候选,治好教师的锚定偏置
把技能生成建模为顺序编辑过程,用回滚奖励训练技能编辑策略
CADENA:逐步式CAD逆向工程
👍 38逐步执行CAD操作并对比几何反馈,重建可编辑参数化程序
统一世界预测与价值估计的VLA强化学习评论家模型,149任务达SOTA
用任务变换把开放式任务变成可验证的自我博弈环境,无需外部裁判即可规模化训练。
弱到强同策略蒸馏
👍 55用弱模型的对数几率差合成代理教师,蒸馏出超越弱教师、逼近自身的强学生。
面向在策略蒸馏的稳定优势融合
👍 34提出SAF四阶段流水线融合GRPO与OPD优势,避免熵坍塌并稳定提升性能。
CriPO用策略内自蒸馏注入缺失行为、翻转被压制的优势,约2×更少步数超越GRPO
提出EVR奖励:多假设评估+视觉验证,强化学习优化多参考图像编辑。
将特权偏移重解为反事实敏感度,重分配 GRPO token 信用以提升长链推理。
面向真实设备的统一 GUI+CLI 基础智能体,在移动端全面 SOTA。
开源全栈OpenMLE训练元进化智能体,MLE-Bench Lite奖牌率达71.21%。