提出交互式3D物理基准CHAIN,揭示VLM在结构化物理推理中的系统性失败
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出新范式将图像检索从独立匹配转变为语料级上下文推理,构建首个基准DISBench
通过拆解-干预-重组的弗兰肯斯坦框架,揭示 RL 真正改进的是中后层的视觉-推理对齐
以草稿进行思考:基于逻辑重建的光学解压
👍 36将视觉推理重构为逻辑解压,通过极简DSL草稿实现确定性视觉验证
首个端到端视觉强化学习框架,让多模态大模型真正理解图像隐喻
将视觉感知与语言推理解耦为两阶段流水线,以更少token实现更强视觉推理
视频生成模型不仅是媒体工具,更是可扩展、可泛化的视觉推理范式
多模态过程奖励模型的训练数据效率研究
👍 80提出BIS评分筛选MPRM训练rollout,10%数据即可匹配全量性能
用多格漫画作为图像和视频之间的中间推理媒介,兼顾时序结构与计算效率
面向多模态大语言模型的认知超感知
👍 16用视觉想象链增强MLLM的认知推理能力
LoopViT通过权重共享循环和动态退出机制提升视觉推理效率
通过强化学习训练多模态模型自适应选择和编排视觉工具,实现复杂推理任务的突破性性能。
将文本思维链渲染成图像,用视觉编码器压缩推理过程
用视频模型的逐帧推理能力替代文本规划,实现高质量文生图
通过知识蒸馏对齐教师模型的视觉注意力轨迹,让小模型获得大模型的视觉推理能力
BabyVision:超越语言的视觉推理
👍 201揭示当前MLLMs在人类幼儿就能解决的基础视觉任务上存在巨大缺陷
提出将推理与生成解耦的RL框架,通过CoT采样和检查表奖励提升推理驱动图像编辑性能
提出认知启发的三阶段框架,通过知识内化解决视觉数学推理中的推理漂移问题
将多模态推理重新定义为图像到图像生成任务,在长时程视觉推理任务上显著超越SOTA MLLMs,实现了高效、可控、并行且可协作的推理范式
提出FIGR方法,将可执行的图表构建集成到多轮推理中,通过强化学习学习何时以及如何外化中间结构作为视觉状态。