用多智能体+双桥一致性框架在百镜头量级实现角色一致的长视频换脸/风格化重制
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把视频当码率流处理,codec-stream 在事件级定位上 +44.8。
首个系统化的隐喻视频理解基准MetaphorVU-Bench与基于隐喻知识图谱的推理时增强框架MetaphorBoost
SWIM 用纯文本提示实现视频物体定位,训练时用掩码监督跨模态注意力。
提出GPR任务与MM-OCEAN基准,揭示MLLM 51%正确评分无证据支撑。
揭示Video-LLM靠视觉先验幻觉声音而非真正听音,提出THUD诊断与干预对齐方案。
ViMU:面向视频隐喻理解的基准测试
👍 13首个无提示视频潜台词理解基准,揭示前沿多模态模型在讽刺、反讽与社会含义上的系统短板
让 VLM 在潜空间"想象"4D 动态以推理时空演化
NVIDIA开源30B-A3B MoE全模态模型,文本图像视频音频全支持。
用镜头查询 Transformer 与全合成数据,把镜头边界检测扩展到带场景关系。
看见快与慢:学习视频中的时间流
👍 19把时间做成可学习概念,教会模型感知并按指定播放速度生成视频
首个专为视频RL设计的端到端训练评测框架,带离线缓存与异步推理
打开 Gemini 思维流黑盒,揭示思考预算与视频理解质量的真实关系。
提出三级层次和组基评估的视频理解基准,揭示SOTA模型与人类差距
先看再回答:从视觉基础的后训练中学习
👍 36发现视频理解数据集严重依赖语言捷径,提出仅用视觉基础问题后训练提升模型性能
500题+5级层次化评估协议,证明主流视频MLLM在长视频细粒度时空证据定位上几乎全部失败(Level-5最高仅1%)。
首个强调感知中心推理的复杂视频理解基准,现有最强模型准确率仅45.96%
通过掩码与门控融合,强制VLM利用几何token进行空间推理
通过输入侧自适应分辨率分配,在消除90%视觉token的同时保持或超越基线性能
通过规划先于感知的迭代推理,让MLLM自主决定看什么、何时看、怎么看