提出基于置信度的递归推理框架,让模型自我修正提升精度
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用三阶段训练和数据工厂将通用VLM转为OCR专家,OmniDocBench达92.94%
通过视觉侧局部聚类+语言侧文本引导逐层剪枝的双阶段框架,实现VLM的极致token压缩
构建AI游戏商店平台,用100款人类游戏评估VLM与人类的通用智能差距
提出动作感知SFT和保守RL框架,解决GUI代理推理-定位干扰和部分可验证奖励下的训练不稳定问题
对比多模态与纯文本输出分布,动态抑制语言先验,有效减少LVLM物体幻觉
ArtiAgent智能体框架自动合成图像伪影数据,训练VLM超越GPT-5的伪影理解能力
通过能力反思和记忆反思机制,实现VLM稳定迭代自我修正的OCR框架
从 VLM 的 token 概率中提取隐式任务进度信号,实现零样本机器人奖励估计
DODO:离散OCR扩散模型
👍 10首个利用块离散扩散实现并行解码的OCR视觉语言模型,推理速度提升5倍
仅0.5B参数的VLA基线通过标准化训练细节实现SOTA,超越数十亿参数大模型。
提出10.3万规模的多模态数学数据集,通过三阶段自动清洗管道构建,显著提升视觉推理能力
提出VIG指标量化视觉贡献,通过选择性训练提升LVLM视觉接地能力
RynnBrain:开源具身智能基础模型
👍 46阿里达摩院开源具身智能基础模型,统一感知/推理/规划,四个核心能力全面超越SOTA
多轮对话中的视觉记忆注入攻击
👍 3通过微小图像扰动,在多轮对话中隐蔽地注入针对特定话题的恶意输出
利用VLM视觉接口实现异构多智能体间无文本潜空间通信
通过嵌入器引导的强化学习优化思维链,提升多模态检索嵌入质量
提出对话式图像分割任务与基准,用自动数据引擎生成106K训练对,轻量模型超越大模型基线
通过异步批量推理框架将VLM语义知识蒸馏到轻量RL策略,实现实时自动驾驶
字节跳动医疗AI团队提出的医疗视觉语言基础模型,在30+基准测试中达到SOTA性能。