提出PICA训练机制提升关节物体操作鲁棒性
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过对比性上下文选择任务增强LLM的上下文 grounding 能力
视觉接地思考
👍 11让视觉推理轨迹显式指向图像证据,提升计数和空间理解能力
理解环境感知信息检索的行为
👍 9通过强化学习让大语言模型适应不同检索器的查询策略
用 2K 仿真轨迹蒸馏到 4B 模型,实现前沿级操作性能
让LLM策略模型主动设计自己的RL训练环境,实现自适应环境工程
通过量化drafter、智能切换和动态draft长度,将RL训练延迟降低19.6%
提出判别器引导的强化学习(DRL),在不依赖人类偏好的情况下修正流匹配模型的分布偏差
原生主动感知作为全模态理解的推理
👍 18首个原生全模态Agent框架,通过迭代Observation-Thought-Action循环解耦视频时长与推理复杂度,实现测试时正扩展
强化空间视觉语言模型中的双路径推理
👍 15提出SR-ReaL框架,通过LOR和DTR双路径推理+强化学习提升空间VLM的几何推理能力
通过惊异度引导的令牌级优势重加权解决GRPO训练中的策略熵坍塌问题
用轻量8B模型编排16个商业API,科学推理准确率达56.66%
利用奖励方差检测能力边界,动态合成高质量多轮工具使用训练数据
用图灵奖励学习用户模拟器
👍 3基于图灵测试判别奖励训练人类不可区分的用户模拟器
通过将中间错误答案转化为修订与验证提示,训练LLM的测试时序列修订能力
首个用RL指导演示检索的模仿学习方法,无需重训练即可处理摄像头丢失,在LIBERO基准上大幅领先基线
ZPPO通过BCQ/NCQ将教师知识仅注入提示词,在31个基准上显著提升小模型性能
通过token级梯度分析提出WAPO方法,解决RLVR训练不稳定性问题
使用冻结MLLM作为监督器,通过属性感知梯度改进视觉编码器训练
3B小模型经Spectrum-to-Signal后训练在可验证任务上达到千亿级旗舰性能