27任务810实例的过程敏感基准:最强视频模型Seedance 2.0推理也仅51.0分
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
课程学习框架让多模态模型内化视觉接地推理,图表问答性能提升高达20.5%
面向视频模型的视觉提示工程
👍 19用图像编辑模型改造任务图片,系统提升视频模型视觉推理能力
分类法驱动的可验证视觉推理环境,RLVR训练后24个外部基准平均提升约4个百分点
首个让文本与图像在同一步内互相纠正的并发扩散采样器
首个无需语言监督、直接在视觉空间学习异构推理任务并配套 VR-X 基准的框架
视觉推理中的局部性与长度泛化
👍 4局部感知加循环计算让视觉模型获得长度泛化能力
OpenCoF:通过视频生成学习推理
👍 23构建OpenCoF-17K数据集,通过多样化时间监督和推理token机制提升视频生成模型的推理能力
提出P2R框架,将细粒度视觉推理解耦为感知定位和推理回答两个阶段,仅需最终答案监督
解耦感知与推理的多轮视觉推理agent,通过mask引导和语义BFS实现高效证据定位
提出GauntletBench基准测试,评估AI智能体在专业复杂场景中的泛化能力
无需文本标注答案,通过对比正负视觉证据门控提升细粒度视觉推理能力
通过可验证的数据构建解决视觉数学推理中的数据质量和奖励信号可靠性问题
视觉接地思考
👍 11让视觉推理轨迹显式指向图像证据,提升计数和空间理解能力
通过主动视觉推理实现视觉原生的多模态深度搜索代理
提出单策略多智能体框架,通过角色解耦优化和KV缓存重用,在视觉推理任务上显著减少幻觉并提升推理效率
提出Actor-Critic框架和ArogyaBodha数据集,解决7种印度语言医疗推理问题
利用Fisher-Rao距离检测注意力转移,动态重加权token级优势以提升MLLM跨模态推理。
首个基于像素级确定性评估的精确视觉编辑基准,揭示当前多模态模型在基本栅格操作上的显著局限性。
用520个可规则验证的在线生成器-验证器环境,为视觉推理RL提供无限新鲜训练信号。