快慢解耦架构只在异常时唤醒重型模型,实现因果流式视频异常理解。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把真实香港搬进物理仿真沙盒,测出多模态智能体“认得出却走不到”的城市行动能力断层。
用直接推理、实际编辑、理想参考三条件对照,测出图像编辑中间态在20个任务上的效用边界
多智能体协作推理检测深伪视频,并构建10万级细粒度标注数据集
课程学习框架让多模态模型内化视觉接地推理,图表问答性能提升高达20.5%
揭示MLLM视觉失败多为"利用"而非"感知",并找到可控旋钮
提出EVR奖励:多假设评估+视觉验证,强化学习优化多参考图像编辑。
让多模态大模型学会按需调用视觉工具,既不过度也不漏用,真正提升能力。
Gemma 4 技术报告
👍 62Gemma 4:具备思维模式的原生多模态开放模型家族,在推理和多模态理解上实现显著性能提升
首个评估MLLM视听艺术理解能力的综合基准,揭示模型在艺术意图推理方面的显著短板
不牺牲文本智能的统一音频智能模型
👍 18在保持文本LLM核心推理能力不退化的前提下,实现统一的音频理解与生成。
基于非对称互变分学习的多模态连续推理
👍 27通过双向KL校准解决变分推理中的训练-推理不匹配,实现高效多模态连续推理
通过结构去噪和逆向规划实现个性化幻灯片设计
提出可控基准评估视频时间逻辑推理能力,揭示模型与人类巨大差距
通过头级拓扑对齐提升MLLMs视觉感知能力
首个支持摄影师构图和被摄者姿态推荐的拍摄时MLLM摄影指导系统
无需文本标注答案,通过对比正负视觉证据门控提升细粒度视觉推理能力
将视觉规划内化到潜在查询,单前向传播实现结构感知图像生成。
基于多模态扩散语言模型的并行区域感知框架
👍 64利用扩散语言模型的并行解码特性,实现单次前向传播同时描述多个图像区域
多模态大语言模型的社会偏见集中在少数视觉线索上,时尚风格等自我展示信号对判断影响最大