自蒸馏只控更新幅度,环境奖励锚定方向
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过引入Future-KL散度重构GRPO的信用分配机制,突破LLM推理长度停滞瓶颈
提出MUPO方法解决RL模型的多样性崩溃问题
首个用强化学习训练多跳搜索智能体,为知识密集型图像生成收集外部知识与视觉参考
通过规划先于感知的迭代推理,让MLLM自主决定看什么、何时看、怎么看
Actor-Judge架构实现多模态推理无监督自进化,无需标注数据
将文生图的推理与生成统一为MDP,用GRPO联合优化文本和图像策略
视频生成强化学习中的流形感知探索方法
👍 34通过微观精确SDE和宏观双重信任区域,使视频GRPO探索保持在数据流形附近
通过筛选高方差轮次和功能等价奖励,将SFT轨迹转化为高效RL训练,实现4倍计算节省同时保持OOD泛化
AI可以学会科学品味
👍 431用大规模社区反馈强化学习训练AI判断和提出高影响力研究想法
通过增强条件空间构建多视角奖励映射,提升流模型GRPO对齐效果
ROVA框架通过结构化时空扰动与自反思难度调度,提升视频推理在真实世界扰动下的鲁棒性
GRPO 多任务强化学习联合训练 MLLM 评判器,显著提升分布外泛化
利用群体级自然语言反馈引导强化学习中的探索
👍 211聚合外部批评与组内对比两种NL反馈,以离策略脚手架引导RL探索,实现2.2倍样本效率提升
ICRL:纯RL框架实现LLM工具调用,无需SFT,渐进消除少样本提示
首个零数据三角色自进化框架,让VLM自主生成图像并提升推理能力
通过解耦推理与置信度优化目标,解决 RLVR 训练中模型过度自信的根本问题
用RL训练LLM智能体判断动作优劣,自主涌现批判性推理
MicroCoder-GRPO在LiveCodeBench v6最高相对涨17.6%。
稳定扩散语言模型的强化学习训练
👍 3提出StableDRL,通过无条件裁剪和自归一化解决dLLM强化学习中的奖励崩溃问题