面向om-LLM推理加速的阶段自适应token选择方法SEATS。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首个系统评估实时双工全模态交互的基准,含660视频与LLM时序评判框架
用 MLLM 智能体分阶段生成 Blender 代码,从俯视图重建可执行 3D 房间。
提出首个基于 WISC 心理测量的交互式基准 ChildAgentEval,系统评估多模态智能体能否模拟 6-17 岁儿童的真实认知发展轨迹。
构建GRASP数据集并提出SGR奖励,使MLLM能基于注视手势进行多人交互推理
前沿多模态 LLM 在 CDT 临床评分上呈现系统性的中心化偏差,零样本无法消除。
要求Doc-VQA同时输出元素级BBox引用与答案,揭示『答案对但证据错』的归因幻觉。
用检查表引导的自训练规划器+VLM奖励驱动的工具编排器,解决抽象长程图像编辑难题
提出全景原生 MLLM 框架,统一推理 ERP 球面空间
ViMU:面向视频隐喻理解的基准测试
👍 13首个无提示视频潜台词理解基准,揭示前沿多模态模型在讽刺、反讽与社会含义上的系统短板
首个覆盖36类任务、融合结构化推理评分的图像编辑与奖励模型统一基准。
视觉美学基准:前沿模型能评判美吗?
👍 11提出 VAB 基准:把美学判断改为同主题集合比较,揭示前沿模型距人类专家仍有 42.4 点巨大差距。
首个无视觉编码器与VAE的端到端统一多模态原生架构,在32倍压缩比下同时比肩顶级理解与生成模型。
切片编码+ViT内早期压缩,55.75%降算力且精度持平
提出全模态个性化基准与PMG框架,系统揭示SFT与RLVR的权衡
提出双前向传播RL框架,使MLLM抗视觉退化且不牺牲干净精度。
让 VLM 在潜空间"想象"4D 动态以推理时空演化
用结构化规约贯穿生成流程,按承诺状态条件调用检索/推理/修复,解决图像生成的概念鸿沟。
大模型时代的音视觉智能:一项综合性综述
👍 35首篇系统综述大模型时代音视觉感知/生成/交互三大支柱的统一分类法与方法论
用语义验证替代坐标监督,实现无标注的地理空间定位自进化