构建5.2万条带视觉工作区的多模态推理轨迹,教模型在纯文本推理中内化视觉草稿纸
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
面向强化微调的动态重要样本挖掘
👍 1用梯度对齐实时估计样本边际贡献并约束重加权,让RFT数据利用全程自适应
提出含1.2K基准与VAoT协议的See2Think框架,分离视觉状态效用与行为依赖。
把VLM二值自验证循环嵌入GRPO,无需外部监督大幅提升多模态推理
让多模态大模型通过生成SVG代码进行可视化推理,提升空间理解能力
将交错多模态推理统一为单一决策过程
👍 37BRAID框架将文本-图像交错推理统一为MDP,联合优化文本和图像生成
基于置信度感知的工具编排的鲁棒视频理解
👍 11通过逐帧可靠性评估和置信度引导的工具调度,提升视频理解模型在真实损坏条件下的鲁棒性
系统评估多模态CoT的边界与瓶颈
通过对比性上下文选择任务增强LLM的上下文 grounding 能力
用轻量8B模型编排16个商业API,科学推理准确率达56.66%
首个iOS模拟器手机代理基准测试,26应用133跨应用任务
通过多模态上下文推理框架和高效注意力机制,实现长视频理解与智能Agent能力
提出将图像作为独立的推理媒介,通过排版和图形两种变体实现高效推理
首个基于布鲁姆分类法的英阿双语VLM认知评估基准,揭示模型认知不对称性
用单源奖励作锚点,量化多源融合的信息增益
在统一隐空间交错文本推理与音视频潜状态,突破CoT文本瓶颈
LLM驱动的多智能体预测框架,分宏观与微观双视角合成预测
提出渐进式模态迁移基准与盲训练控制,揭示多模态推理的视觉变量接地瓶颈与 RL 视觉虚假提升。
三阶段管线,用黑盒对抗式在线策略蒸馏修复 SFT 分布漂移
为LVLM设计并行PVM模块,缓解长序列生成中的视觉信号衰减