构建1.47亿动作片段的大规模视频动作数据集,显著提升零样本动作识别性能
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
人类标注的多模态RAG基准,评估视觉检索、答案生成与定位能力
真实用户的模糊查询导致VLM准确率不足50%,显式化查询可提升8-22分
用动态窗口对齐学习将视觉推理压缩到潜在空间,97%省token
将人类桌面录屏转化为结构化动作轨迹,实现 60.1% 的 OSWorld 任务成功率
统一多模态Embedding与Reranker,MMEB-V2达77.8分
将智能体交互历史渲染为压缩图像,用视觉 token 替代文本 token,节省 50%+ 消耗
提出多模态自动补全任务MAC,通过动态路由在文本模型与VLM间智能切换,实现2.3-10倍加速
通过降维可视化VLM视觉嵌入空间,聚类定位性能瓶颈并针对性增强训练数据
通过解耦的Thinker-Generator架构和两阶段强化学习,显著提升图像生成的推理能力
评估LVLM在多模态文档问答中遵守用户定义的非披露策略能力的基准
通过对比感知损失增强VLM视觉推理能力的RL微调方法