提出模态非对称token压缩框架,先修剪视频冗余再视觉引导音频选择,显著提升Omni-LLMs效率
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
批判碎片化的任务知识注入范式,提出统一世界模型框架的五大核心组件
面向视觉生成的统一个性化奖励模型
👍 20提出 UnifiedReward-Flex,通过上下文自适应层次化推理动态构建个性化奖励模型。
评测基准,隔离视觉知识与推理,评估MLLM的实体识别能力
评估AI智能体在日常工作/生活/学习场景中完成多样化任务的能力
将文本记忆渲染为视觉图像,通过自适应信息密度突破上下文预算瓶颈
扩散大语言模型用于音频理解,四阶段训练超越自回归基线
首个端到端统一文本OCR与视觉OCR的全场景方法,4B参数媲美70B模型。
将推理链渲染为图像,用视觉token替代文本token,实现3.4×压缩和2.7×加速
通过透明高效的训练流程,用不到500万科学样本构建竞争性的科学多模态大模型
提出评估AI理解音视频模因能力的基准,揭示当前模型在文化理解和无文本音频上的不足
单遍处理60分钟音频,统一ASR/说话人分离/时间戳的端到端框架
首个覆盖感知/推理/预测/决策四维度的多模态时间序列推理基准,评测30+主流模型
Qwen系列首个TTS模型,双轨架构实现97ms超低延迟流式语音合成,支持10语言500万小时训练
首个端到端多模态深度研究基准,评估智能体的图文证据整合与报告生成能力
1B参数VLM在OCR基准上超越9B模型,支持图像定位与高效推理
首个可复现Suno级别商业系统的开源音乐基础模型家族,支持长达6分钟的可控歌曲生成
Mistral 3B/8B/14B 模型,级联蒸馏实现高效训练
首个用强化学习优化文本到可视化生成的框架,通过多目标奖励提升图表质量
通过正交几何基统一运动码本与LLM嵌入空间