Video-SFT提升视频理解但损害图像能力,本文揭示这一"时间陷阱"并提出混合帧策略缓解
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个视频到网页生成基准,用细粒度视觉评分标准评估MLLM复现能力
提出分段级记忆机制实现流式视频多轮问答,解耦感知与生成
提出手势意图tokens和EGOPOINTVQA数据集,解决手势指示性视频问答难题
用测试时训练在线更新快权重,实现长视频流式空间理解
提出FIRM框架,通过专门训练的奖励模型和新颖的奖励策略,解决图像编辑与生成中强化学习奖励信号不可靠的问题。
通过迭代潜隐状态精炼实现扩散模型的内生链式思维推理
诊断MLLM图文模态鸿沟根因,提出自蒸馏方法弥合差距
提出主动意图推荐基准PIRA-Bench,评估GUI代理预测用户意图的能力
通过为每种模态学习独立平滑因子并用低秩补偿统一量化权重,解决多模态LLM量化难题
从规模到速度:图像编辑的自适应测试时缩放
👍 138ADE-CoT通过难度感知分配、编辑验证和自适应停止,实现2倍加速
首次提出图像记忆度反馈任务,用激活引导让MLLM生成可执行的记忆度改进建议
通过层次化推理和主动探索,实现高效长视频问答
提出Ref-Adv基准测试,暴露MLLM在指代表达理解上对视觉捷径的依赖
通过因果中介分析证明潜空间视觉推理方法无效,并提出基于文本想象的替代方案CapImagine
用复合奖励信号的强化学习训练医学视觉语言模型,实现开放性临床推理
提出稀疏拓扑注意力和33K多尺度QA数据集,专攻肝癌WSI诊断
提出多层次评估框架,揭示MLLMs在双手协调中「高级推理强、精细执行弱」的协调悖论
提出基于可执行代码的框架评估MLLMs物理推理能力,发现模型依赖视觉模式匹配而非真正物理理解
字节跳动医疗AI团队提出的医疗视觉语言基础模型,在30+基准测试中达到SOTA性能。