用在线动态奖励权重与每题目标长度,兼顾正确性与简洁性
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
流式记忆+问题分解重读,免检索地解决长上下文证据丢失
推导OPD外推系数闭式安全阈值λ★(p,b,c),揭示结构化输出任务格式崩塌机制
EAPO 教会 LLM 智能体在不确定时才探索,4B 模型在 GUI 任务上击败 GPT-4 级对手。
THINC框架让代码本身成为推理主体,4B模型击败235B基线
提出「稀疏奖励给大教师、稠密信号传小部署模型」的分配原则,四阶段流程在 MATH 提升 3.4 点
RL通过概率重分配让LLM事实回忆准确率平均提升27%。
SEIF:面向指令遵循的自进化强化学习
👍 30用 Instructor–Follower 闭环共进化让指令难度随模型能力自动升级,无需外部教师即可提升开源 LLM 的多约束指令遵循能力
反转自蒸馏信号,放大正确 rollout 中模型自驱推理的 token
用 Hint-δ 内禀奖励让 LLM 在无验证器的开放任务上自博弈进化
提出Entrocraft拒绝采样方法精确控制LLM RL训练熵曲线
面向智能体强化学习的动态技能生命周期管理
👍 13SLIM:把外部技能集当成可训练变量,动态增删扩展
提出双前向传播RL框架,使MLLM抗视觉退化且不牺牲干净精度。
将多模态奖励评估重构为计划-执行两阶段过程,用多角色强化学习联合优化规划与验证
首个面向已构建RAG知识库的强化学习后精炼框架
首个将OPD引入Flow Matching T2I的多任务对齐框架
用单次并行「定位+检索」原子动作+双粒度RL,让多实体搜索又快又准。
基于评分标准的在线策略蒸馏
👍 41用语义化评分标准替代教师 logits 的黑箱在线蒸馏框架。
面向多轮智能体强化学习的自适应熵调制
👍 23用响应级熵代理实现无监督信用分配与自适应探索-利用切换
提出平衡多维奖励的RL框架,统一效用、正确性与流畅性