把游戏求解器的状态价值变化转成逐回合信用信号,注入 RLVR 实现无需 logits 的策略蒸馏
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用于代码优化的强化学习
👍 11让RL真正学会写更快的正确代码:从测试、沙箱、奖励到GRPO全链路改造。
用轻量代理与容器编排解耦训练与推理,让任意 harness 和环境直接接标准 RL 训练
群组熵控制的策略优化
👍 29用群组熵引导的非对称优势塑形,缓解GRPO多任务训练的探索-利用失衡
将教师监督直接融入强化学习目标,通过反向重要性采样实现选择性知识迁移
用 MDLM 双向去噪打造可控文本世界模型,零样本提升 RL agent 达 47%
用国际象棋测试床建立预训练-RL联合缩放律并揭示RL机制
用参考答案引导的对比概率差作为token级正确性信号来塑形RLVR优势
让两个模型互相当考官,竞争式RL隐式评估推理过程质量。
把VLM二值自验证循环嵌入GRPO,无需外部监督大幅提升多模态推理
在固定 GPU 预算下让 GRPO 训练跑到 2M+ token 上下文
首个无需语言监督、直接在视觉空间学习异构推理任务并配套 VR-X 基准的框架
用强化学习训练智能体 RAG 协调语义检索、关键词检索与段落读取三类工具。
通过步骤级奖励重塑解决医学VQA早期推理级联失败问题
揭示 GRPO/Dr. GRPO/DAPO 是对组标准差的三种操作
为智能体RL的每个动作片段判定语义角色,按角色修正GRPO信用分配
通过差分答案探针奖励和结果门控优势路由,精确评估视觉工具调用的贡献并智能控制工具使用
将RLHF和OPD应用于扩散模型,提升图像生成与编辑质量
利用3D视觉基础模型提供密集可验证奖励,提升多视图空间推理能力
通过惊异度引导的令牌级优势重加权解决GRPO训练中的策略熵坍塌问题