将目标识别建模为索引候选框的单token选择,结合TVBI时序记忆实现单目具身跟踪
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
视觉对比自蒸馏
👍 48用原图与擦除图像的预测对比构造自蒸馏目标,无需外部教师或答案提示。
提出 ProVisE 与 SpatialGen-Bench,让文生图模型在像素空间作答并公平评测。
仅用单目RGB即达具身导航SOTA的8B视觉语言模型
分类法驱动的可验证视觉推理环境,RLVR训练后24个外部基准平均提升约4个百分点
用VLM预测种子点,再用流匹配生成多本体抓取姿态。
提出双模态上下文牵引分类法与1500条数据集,作为VLM牵引效应诊断工具。
HPD-Parsing:层级并行文档解析
👍 11用层级并行解码范式重构文档解析,吞吐量达4752 TPS。
用世界模型预测动作后果,在执行前拦截移动端高风险操作。
首个评估VLM从纯截图推断Web应用交互行为的基准,揭示视觉保真度不等于交互推理能力
把VLM二值自验证循环嵌入GRPO,无需外部监督大幅提升多模态推理
提出策略自适应图像护栏基准,并训练出紧凑护栏模型PolicyShiftGuard。
首个全合成长文档视觉理解基准,系统揭示VLM三类失败模式
双路径智能体框架ChartCynics解耦视觉诊断与OCR验证,抵御误导性图表的视觉欺骗
自动从 PMC 文献策划千万级医学图文对,显著提升医学视觉基础模型。
从专家视频演示中学习进度排名,用Spearman相关系数作为无奖励RL的奖励信号
首个系统化评估VLM数据集策划策略的基准,发现数据混合比过滤更关键
基于VLM自动建立文本-视觉对应关系,实现无标注多实例精确可控图像生成
首个评估VLM在专业领域视频定位适应能力的基准
解耦感知与推理的多轮视觉推理agent,通过mask引导和语义BFS实现高效证据定位