多维刻画实体稀有性,推理+迭代检索的免训练框架超SOTA 6.9%,稀有实体最高提升23.3%
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
让VLM先生成因果推理图代码再作答,幽默理解提升1-20%
基于一年真实移动经验的设备端记忆基准与KEME数据合成框架,现有记忆系统远未达标
用GNN+ViT+GRU联合建模冻结VLM内部计算轨迹,实现词元级幻觉检测与解码期干预
397B 参数科学智能体基础模型:多模态科学理解、可验证强化学习与长程智能体训练的统一
单一模型同时支持自然语言设计声音与参考音频克隆声音的多模态语音音频生成系统
3B参数把内容审核统一成yes/no问答,策略自适应且刷新多模态SOTA
从人教版教材抽取课程知识图谱,统一支撑教育大模型的评测与微调。
视频 = 世界 + 事件流
👍 21Wan-Streamer v0.3 将视频分解为世界与事件流,实现通用预训练可迁移的实时音视频交互。
离散扩散模型的统一框架:从分词到生成
👍 19以分词为核心视角的离散扩散模型全景综述
首个覆盖多任务和结构编辑的200万级视频编辑数据集及Goku-Edit模型
ZPPO通过BCQ/NCQ将教师知识仅注入提示词,在31个基准上显著提升小模型性能
世界模型自蒸馏:训练世界模型解决通用任务
👍 15通过自蒸馏和VLM反馈将视频扩散模型转为指令跟随的任务求解器
提出分层图记忆与智能检索机制,将长视频理解转化为多步智能探索任务,实现感知与推理解耦
MMAE:大规模多任务音频编辑基准
👍 46首个通用指令式音频编辑综合评估基准,覆盖7种模态和6级复杂度
5B参数的高效统一视频生成编辑框架,推理速度提升5.4倍
个人相册视觉问答的个人AI代理
👍 20提出camroll数据集和分层记忆代理,实现个人相册长程视觉问答
统一处理多视图配置、多模态融合、长时程感知和度量尺度的几何感知框架
提出基于实体级分解的抽象图像编辑评估框架 ENTITY-RUBRICS 与 ABSTRACTEDIT 基准,揭示模型在意图理解与保持之间的根本矛盾。
60个真实长任务,在容器化CLI智能体中评估前沿多模态大模型。