提出RAHA方法,用双曲几何和秩感知对齐进行视觉语言数据集蒸馏
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
DOPD:双重在线策略蒸馏
👍 104通过优势感知的动态双蒸馏缓解特权幻觉问题,显著提升LLM和VLM的蒸馏性能
基于Qwen3-VL的可扩展导航模型,通过参数化接口支持多种导航任务和可配置的观察策略。
Vesta:通才型具身推理模型
👍 10统一定位、导航、推理和规划的通用具身模型,超越各领域专家模型
首个端到端AI系统,从自然语言生成可平折的可识别折纸设计,结合神经符号方法与强化学习优化美学质量
首个零样本同时支持对象计数、人群计数、指代表达计数和精确计数图像生成的统一视觉语言模型
通过前瞻性稀疏视觉证据记忆解决机器人长时程操控中的记忆瓶颈问题,实现40%性能提升
提出R-SWA注意力机制,实现KV cache恒定,支持一次解析数十页文档
利用3D视觉基础模型提供密集可验证奖励,提升多视图空间推理能力
通过VQA范式对比人类和VLM在跨文化驾驶场景中的认知差异
用图像编辑替代视频生成作为世界动作模型骨干,降低推理成本并提升机器人控制性能
视觉接地思考
👍 11让视觉推理轨迹显式指向图像证据,提升计数和空间理解能力
提出语言引导的三维物体点轨迹预测方法,构建百万级数据集和基准,显著超越现有运动预测方法
用 2K 仿真轨迹蒸馏到 4B 模型,实现前沿级操作性能
强化空间视觉语言模型中的双路径推理
👍 15提出SR-ReaL框架,通过LOR和DTR双路径推理+强化学习提升空间VLM的几何推理能力
通过软正确性门控和教师概率缩放改进 GUI 定位自蒸馏中的教师信号质量
自进化视觉提问者
👍 15让VLM无需外部监督,通过自我迭代学会主动提问并持续进化。
ProCUA-SFT通过310万样本将CUA性能提升至45.0%
用 Noisy ViT 编码器统一视觉空间,解耦扩散解码器与文本解码,实现理解与生成的协同提升。
SpatialClaw用持久化Python内核替代传统工具调用,提升VLM空间推理能力