用集合距离奖励解决胸部X光报告生成的顺序无关性问题
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
从语言和视频证据直接生成LoRA适配器,实现零样本机器人策略适应
余弦相似度与VLM准确率负相关,PRISM揭示潜在变量被绕过
想象性感知令牌增强多模态语言模型的空间推理能力
👍 126通过生成中间视觉想象表示来增强VLM的空间推理能力
通用机器人智能的核心瓶颈是缺乏将物理世界经验转化为机器人可用监督信号的机制,需要构建四大支柱组件。
提出视觉多样性优先的多模态推理基准WorldBench
首个面向知识与推理密集型视频理解的大规模训练语料库,通过技能导向的QA生成框架和严格质量控制,显著提升模型在知识密集型视频推理任务上的表现
首个支持点击和文本两种交互方式的统一物体与材料选择框架
通过Perceiver超网络将视频编码为LoRA适配器,实现零视觉token的视频问答。
首个在BRep原语上直接进行多模态对比预训练的CAD理解框架
提出反事实上下文修订框架审计LLM姿态模拟,发现多模态策略效果显著
提出融合音频、歌词、语义元数据和用户参与度信号的多模态音乐推荐框架,在LLaMA-3-70B等大模型上验证了多模态特征可提升Recall达95%、NDCG达79%
面向AI助手的长期记忆评估基准,52.9小时多模态数据,6种记忆任务类型
提出TVR任务和TVRBench基准,发现基础模型难以通过主动探索重现目标视角,后训练提升至51.4%
VLM-as-Teacher范式,通过测试时优化提升视频推理能力
表示强制:无瓶颈统一多模态模型
👍 63通过预测理解表示来指导像素空间生成,消除VAE瓶颈
提出SwanSphere框架,实现全景视频和文本提示驱动的高保真空间音频流式生成
万物计数:跨领域文本引导的通用物体计数
👍 11提出双粒度计数架构,结合区域级稀疏计数和像素级密集计数,在六个视觉领域实现高精度文本引导计数
用于生成的原生音频-视频对齐
👍 33提出NAVA框架,通过原生音频-视频对齐实现高质量联合音视频生成
利用图像转换、语言和3D流的三模态对齐学习动力学感知的机器人视觉表示