结合人类专家CoT数据与地理相似性奖励,实现细粒度图像地理定位
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
揭示RL微调VLMs在文本扰动下的脆弱性及准确性-忠实性权衡现象
用冻结VLM提取情感曲线,双分支注入实现长视频叙事配乐生成
大规模适配视觉语言模型以理解电子商务
👍 13系统性研究如何将通用VLM适配到电商领域,在保留通用能力的同时大幅提升商品理解性能
提出EXSTRUCTINY基准,评估VLM在多文档类型上的结构化信息抽取能力
显式建模推理延迟,实现秒级VLM推理下的实时机器人导航
首个开源视觉语言模型,在物理奥赛中斩获12枚金牌,排名第3
多智能体分层框架实现4K原生分辨率高保真多轮图像编辑
提出LATENTLENS方法,证明LLM中视觉token在各层均具有高度可解释性
提出Octopus框架,通过配对推理轨迹实现VLM的可控自我纠正能力学习
首个系统评估VLM在图像化文本与纯文本间性能差距的基准测试
基于潜在动作的自改进世界建模
👍 32将动作视为潜在变量,通过前向-逆向模型交替优化实现无标注世界建模
将视觉感知与语言推理解耦为两阶段流水线,以更少token实现更强视觉推理
统一视觉语言模型,将自然语言指令直接转化为人形机器人的自我中心动作序列
提出训练无关的推理时引导框架,利用VLM生成可微奖励函数来引导冻结的机器人扩散策略适应分布外场景。
提出1400对真实场景视觉QA基准,揭示VLM空间推理与人类差距超30个百分点
用两个协作智能体自动构建平衡评测基准并生成可执行评测流程,压缩85%冗余样本、降低77%评测成本
两阶段DPO框架,无需长视频标注即可让短上下文VLM理解超长视频
提出首个评估VLM自适应推理模式选择能力的基准,揭示准确率与模式选择能力解耦现象
通过在预填充阶段裁剪深层网络、在解码阶段保留完整模型,实现 1.37 倍加速且精度几乎无损