仅用15k合成积木题训练,LVLM域外空间推理全面超越空间专精模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
仅训封闭任务即浮现开放报告能力,冠脉造影端到端可审计解读
仅用3D坐标、免训练地把多视角词元精确剪到目标数量,8%词元保留93.5%性能
蒸馏2D编辑模型、VLM与3D生成先验,无配对数据训练前馈3D编辑器
双通道指向当潜思考、RVQ三token出轨迹,4B VLM统一十大导航基准并零样本上真机
提出图像束组合检索范式与BundleWeaver智能体,增量拼装满足跨图关系的连贯图像组合。
判别式标注器与生成式VLM互补融合,同时实现幻觉片段定位与概率校准
统一多模态虚假信息分类体系并用VLM自动标注2.7万条社区笔记案例,揭示图文误导机制分布规律
将物理世界表示为可执行代码,用智能体闭环发现世界并为VLM提供可扩展物理监督
免重训地在单位球面上做偏差感知的测地引导,大幅降低生成式VLM人口学偏见且不损通用能力
让VLM先生成因果推理图代码再作答,幽默理解提升1-20%
把视觉反馈变成结构化、可积累的评分细则修复上下文,让 UI 转代码自演化更稳更高
994 项最小对比对诊断揭示:GUI 定位失败主因是候选定位而非关系理解
用YOLO定位加确定性几何验证取代VLM直接预测,CT空间问答准确率达94.1%
自蒸馏QAT与S3D8格式将11B VLM压至3.7GB,Arm CPU手机端高效推理
用门控交叉注意力与轻量实时SFT实现"边看边说"的开源视觉语言模型家族
以形变感知学习与内容-结构解耦训练,让1.2B参数VLM统一高精度解析数字与拍摄文档
反转师生不对称方向:教师看原图、学生看增强退化视图,用视图落差当免费蒸馏信号
用GNN+ViT+GRU联合建模冻结VLM内部计算轨迹,实现词元级幻觉检测与解码期干预
冻结VLM用可迁移教训记忆与迁移可靠性校准,实现免训练的空间推理自进化