首个多智能体框架,通过规划-生成-批评流程赋予任意图像生成器交错生成能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出单策略多智能体框架,通过角色解耦优化和KV缓存重用,在视觉推理任务上显著减少幻觉并提升推理效率
通过将推理内化到分数分布中超越标量奖励
👍 65提出Z-Reward教师-学生框架,将推理增强的分数分布蒸馏到高效的学生奖励模型中
通过残差流适配器将预训练VLM离散解码扩展到精确连续预测
通过异步系统设计和归一化修复,将视觉网页智能体的多步RL训练吞吐量提升2.9倍
余弦相似度与VLM准确率负相关,PRISM揭示潜在变量被绕过
Astra让VLM通过调用世界模拟器生成想象观测,学习何时、何地、如何想象以提升空间推理能力
首个基于布鲁姆分类法的英阿双语VLM认知评估基准,揭示模型认知不对称性
提出SPACENUM基准揭示VLMs在空间数值理解上的系统性缺陷
提出10K价值冲突场景基准,揭示VLM机器人难以在价值观冲突中正确选择行动
首个支持点击和文本两种交互方式的统一物体与材料选择框架
通过Perceiver超网络将视频编码为LoRA适配器,实现零视觉token的视频问答。
首个系统评测多模态模型视频记忆能力的认知心理学基准。
在冻结骨干上加验证驱动智能体,把车道地图自动化率推到95%+
用VLM作为判别器的无监督层分解强化学习微调
以欠优化区域挖掘与CPT-SFT-RL渐进训练把0.9B文档解析模型推至新SOTA。
在视觉编码器内注入跨图交叉注意力,使每张图编码依赖历史视觉特征。
从图像生成的物理因素出发,评测具身场景下VLM在材质/视角/光照/几何四类视觉应力下的鲁棒性。
用日本政府白皮书构建日语图表 VQA 基准,揭示开源与闭源 VLM 的巨大能力差距。
VLM3:视觉语言模型是天生的3D学习者
👍 26通过焦距统一、文本像素引用和数据缩放,标准VLM无需复杂设计即可掌握多样化3D任务