用预训练的泛化价值模型V0作为先验,自适应融合稀疏采样经验均值,实现低方差基线估计
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
LLM智能体
知识蒸馏
多智能体系统
智能体
流匹配
具身智能
多模态学习
基准评测
图像生成
代码生成
LLM Agent
检索增强生成
机器人操作
注意力机制
可解释性
多模态大语言模型
视频理解
数学推理
图像编辑
RLVR
多模态
机器人学习
长上下文
自监督学习
后训练
对比学习
Transformer
数据合成
工具使用
视觉-语言-动作模型
推理加速
LoRA
多模态推理
工具调用
LLM评估
高效推理
信息检索
评测基准
RAG
计算机视觉
参数高效微调
扩散语言模型
视觉推理
自蒸馏
综述
3D重建
Flow Matching
模型压缩
自回归生成
持续学习
自回归模型
通过可执行代码作为感知媒介,系统性提升多模态大模型在STEM领域的视觉理解能力
提出回顾性双重内在反馈框架,通过数值探索奖励和语言经验复用提升LLM智能体强化学习效果
通过对比学习对齐成功推理轨迹,增强RLVR泛化能力
HCAPO:用 LLM 自身做后视评分,把稀疏终局奖励拆解到关键步骤上。
几何引导的强化学习实现多视角一致的3D场景编辑
👍 145基于强化学习的单次推理3D场景编辑框架
首个零数据三角色自进化框架,让VLM自主生成图像并提升推理能力
开源TTS系统,通过双自回归架构与多奖励RL实现自然语言指令控制
通过解耦推理与置信度优化目标,解决 RLVR 训练中模型过度自信的根本问题
提出基于RL的自我反思-修正框架,将调试能力内化到模型权重,无需外部预言机
基于因子化世界状态的奖励预测
👍 2通过将观测分解为对象-属性结构,实现零样本跨域奖励预测
揭示内在奖励的分布锐化机制与不可避免的崩溃,提出外部奖励作为可扩展替代路径
通过自适应工具加载和基于评分标准的强化微调,让4B小模型逼近前沿大模型的智能体性能
用RL训练LLM智能体判断动作优劣,自主涌现批判性推理
释放金融数据价值:蒸馏与难度感知训练研究
👍 13通过高质量CoT蒸馏和难度感知RL训练提升金融LLM性能
用不可微奖励强化少步扩散模型,4步生成质量超越80步基线
揭示冷启动中视觉注意力不足的瓶颈,提出AVAR框架重塑注意力分配,平均提升7%
MicroCoder 用难度感知数据筛选,让 4B 代码模型 300 步内获得 3 倍提升
MicroCoder-GRPO在LiveCodeBench v6最高相对涨17.6%。
SDF 非完整水弹性模型高保真模拟触觉剪切,实现零样本 sim-to-real 触觉 RL 迁移。