通过识别音频专家注意力头,实现推理时激活干预以缓解音频语言模型的文本主导问题
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
评估VLM细微视觉差异识别能力的基准,揭示时空推理与人类的显著差距
用 Masking Warmup 把 CLIP 对比学习与文生图生成在单阶段端到端模型中真正统一,并带来推理时自导向的语义对齐解码。
面向群聊场景的多 Agent 边缘-云协作框架,3×降低令牌消耗并保护隐私。
基于混合扩散框架的统一多模态模型,解耦离散/连续扩散实现理解与生成
提出全模态智能体基准OmniGAIA和原生全模态基础智能体OmniAtlas
双流MMDiT架构统一视频-音频联合生成、修复与编辑任务
统一框架同时实现参考生成、视频编辑和音频驱动动画三任务
首个统一评估视频基础模型理解、生成、编辑和重构能力的综合基准
首个涵盖30个任务、100+语言、50+模型的音频嵌入模型综合基准测试
UniT:统一多模态思维链测试时缩放
👍 20通过思维链推理实现统一多模态模型的测试时迭代优化
通过双约束任务合成、中训练与强化学习,打造高效长时程深度搜索智能体
提出UniDFlow统一框架,用离散流匹配同时实现图像理解、生成和编辑
整合安全评估与内部诊断的开源工具包,实现从黑盒测试到白盒洞察的范式转变
大规模适配视觉语言模型以理解电子商务
👍 13系统性研究如何将通用VLM适配到电商领域,在保留通用能力的同时大幅提升商品理解性能
提出OmniDenseCaptioning任务,生成六维度剧本式视频描述
通过解耦语义推理与时间生成,让全模态LLM原生支持语音同步3D面部动画
一个7B参数的端到端大型音频语言模型,通过分层三模态交错和智能-说话人解耦技术,在语音对话和音频理解任务上实现SOTA性能。
首个评估统一多模态模型在计算机使用任务中规划能力的基准
VLMs地理位置推断能力强但隐私推理差,过度披露率达47.6%