剖析OPD/OPSD成败,提出三类失败机制与对应稳定化修复。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
多模态学习
具身智能
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
多模态大语言模型
可解释性
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
训练 LLM 智能体从低成本实验总结规律并外推到高成本 LLM 实验配置
SEIF:面向指令遵循的自进化强化学习
👍 30用 Instructor–Follower 闭环共进化让指令难度随模型能力自动升级,无需外部教师即可提升开源 LLM 的多约束指令遵循能力
面向智能体强化学习的动态技能生命周期管理
👍 13SLIM:把外部技能集当成可训练变量,动态增删扩展
提出在线审计框架,每步对展开中的多智能体轨迹判CONTINUE/ALARM
提出双前向传播RL框架,使MLLM抗视觉退化且不牺牲干净精度。
将多模态奖励评估重构为计划-执行两阶段过程,用多角色强化学习联合优化规划与验证
首个面向已构建RAG知识库的强化学习后精炼框架
用单次并行「定位+检索」原子动作+双粒度RL,让多实体搜索又快又准。
基于评分标准的在线策略蒸馏
👍 41用语义化评分标准替代教师 logits 的黑箱在线蒸馏框架。
面向多轮智能体强化学习的自适应熵调制
👍 23用响应级熵代理实现无监督信用分配与自适应探索-利用切换
让 VLM 在潜空间"想象"4D 动态以推理时空演化
用强化学习微调嵌入器而非LLM,在10M tokens长上下文上实现SOTA多步检索。
提出残差潜在动作RLA,在紧凑潜在空间中流匹配预测DINO特征动力学
RL 只在 1-3% 高熵分叉点重排序,REASONMAXXER 无需 RL 即匹敌完整训练
提出平衡多维奖励的RL框架,统一效用、正确性与流畅性
通过advisor模型和相位自适应RL,改进进化搜索代理在昂贵评估场景下的策略适应能力
梯度空间均衡多奖励,单模型同时提升扩散RL所有质量维度
在GRPO失败样本前添加Lorem Ipsum乱文,破解零优势困境以拓宽LLM推理探索。
用轮次分组归一化与自适应裁剪改进智能体强化学习的过程信用分配