从42个基准的模型失败中归纳10项原子感知能力并构建3000题评测集
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
单一解码器模型实现15种模态间的任意到任意生成
把试穿重新定义成多参考理解驱动生成,靠数据引擎+CPT-SFT-RL达到任意品类SOTA
组合式级联视觉编码器+RoI评测,统一2D/3D医学影像理解
ActiveVision:测试 MLLM 能否反复回到图像中验证假设的视觉推理基准
以几何一致性组织视频证据并自监督强化跨视角稳定性,平均提升12.6分
把时序证据当区间集,从数据验证到 Wasserstein 奖励全程对齐,小模型全面超越超大模型。
统一处理主体间与主体内参考的HOCVP框架,借助MLLM推理实现SOTA人-物交互视频生成
首个由盲人实拍、覆盖主动提醒/问答/交互三大任务的在线视频评测基准
0.8B端到端文档解析模型,靠数据引擎+多组件RL奖励+策略蒸馏刷新多项OCR榜单
用大模型检测并投票纠正3D/4D生成中的时空幻觉,无需重训
用图像条件下的提示词似然,把多模态大模型变成文生图RL的免训练奖励
通过双上下文状态实现低延迟、高效率的长视频理解
系统刻画MLLM生成时逐token注意力动态,并用注意力阻断与增强干预验证因果并提升性能
通过原子化规则和门控评分机制,解决多模态评估中的饱和与脆弱性问题
提出P2R框架,将细粒度视觉推理解耦为感知定位和推理回答两个阶段,仅需最终答案监督
通过单前向跨层证据桥接,解决GUI定位中区域感知到点坐标的转换瓶颈
提出GauntletBench基准测试,评估AI智能体在专业复杂场景中的泛化能力
ConAct 范式将上下文管理集成到策略,解决长视界移动 GUI 任务中的上下文爆炸问题
提出RNG-Bench评估多模态模型在非马尔可夫游戏中的记忆追踪能力