让潜在视觉推理成为预测的因果必经之路,且不损失预训练视觉能力。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
以图像-指令-回答的损失差分一致性为样本打分,25%数据即可超越全量微调
并行管解码:面向视频的高效生成式时空定位
👍 16把时空管解码深度压到固定1+1轮,延迟降79倍、吞吐升92倍且精度更优。
首个系统评测视频指令遵循的基准:20余模型中最强者仅得54.5分
把参考答案拆成原子量规条目,为VLM后训练提供细粒度、前缀定位的RL奖励
构建G2WEngine数据引擎与免掩码GameCleaner,剥离游戏HUD提升世界模型数据质量
把LLM前馈层改造成任务专家,任务级路由让1B模型超越8B基线且可即插即拔增删任务。
PatternEval诊断基准与PatternRL训练对齐混合思考MLLM的响应行为
155个日本长视频、1481道选择题,联合评测长视频叙事追踪与文化隐含义推理
构建20万条组合指令视频编辑数据集,并用区域感知注意力训练22B编辑模型
把视频理解重构为多轮工具增强任务,20个前沿模型全部低于60%准确率
固定免记忆近窗推理,用思考模式蒸馏与线索门控让4B学生追平9B教师
训练时预测未来视觉嵌入、推理时直接作答,精度持平或超越Visual CoT且延迟降5倍以上
以真实危机视频为锚构建RA-Bench,系统评测发现现有检测器与人眼在逼真AI视频面前双双失守
多模态模型差异分析:面向特征发现与控制
👍 10用基座LM与多模态模型的SAE特征差异来发现并定向控制多模态行为
把视觉生成当作训练期辅助监督,训后丢弃生成分支,零推理开销提升理解能力
用LLM在残差式DSL空间中自动搜索视觉token剪枝策略,94.4%剪枝下保留99%以上性能
三级因果干预显示视觉工具调用的收益集中于少数校准轨迹,多数调用与答案无因果耦合。
按神经元模态角色分配更新约束,多模态微调中恢复94.5%语言能力损失
低分辨率通读全文、按需放大关键区域,让8B模型在长文档问答上同时更准、更快、更少幻觉