PEPO:通过视觉感知与探索耦合的token级优势估计优化多模态推理
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
VLM引导JEPA隐式世界模型,双时序通路融合语义与动态建模
通过稀疏化视觉-语言交互而非减少token数量来提升LVLM效率的新方法
通过双曲不确定度建模部分-整体语义代表性,提升多对象场景理解能力
通过工具调用按需检索高分辨率裁剪区域,实现VLM高效推理
用SAE分解CLIP嵌入,在稀疏空间精准去偏
通过在自回归序列中显式生成分割和深度token增强VLM空间推理
通过合成多跳视觉-语言推理数据训练VLM,提升长链思维推理的泛化能力
首个在地球观测中实现像素级推理的视觉语言模型
VLM对问题表述方式敏感,不同格式下视觉注意力分配差异显著
基于视频的2D VLM框架,实现语言定位与视角感知3D推理
STTS 在 ViT 和 LLM 中统一剪枝视觉 token,50% 剪枝提速 62%
基于模拟环境的诊断基准,系统评估VLM在机器人任务中的空间推理能力
通过LoRA和超图神经网络高效适配通用医学视觉语言模型
千帆OCR:统一的端到端文档智能模型
👍 1554B参数端到端文档智能模型,通过Layout-as-Thought实现布局分析与文本理解统一
通过熵感知的离散-潜在推理模式切换和视觉锚点注入,缓解多模态推理模型幻觉
引入链式思维推理与多任务多奖励RL优化SVG生成
用强化学习将视频MLLM转变为主动评论者,实现机器人任务进度精确估计和零样本故障检测
通过认知状态空间的几何异常检测诊断VLM幻觉
全景图像中的功能预测研究
👍 10首次探索全景功能预测任务,提出PAP-12K数据集和模拟人眼中央凹视觉的PAP框架