训练时预测未来视觉嵌入、推理时直接作答,精度持平或超越Visual CoT且延迟降5倍以上
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把世界探索变成可复用轨迹数据源:一次离线渲染,多视角多外观多模态标注同步产出。
显式276维世界状态加零参数渲染器承担精确几何与控制,神经网络只负责画外观
Alaya-EVOKE:从线性开销监督到无尽世界
👍 130外置相机位姿索引的几何记忆,配合长时程教师蒸馏,实现三步生成、小时级不间断的交互世界模型
SE(3) 几何感知的动作条件视频世界模型,登顶 WorldArena 2.0 预测赛道
用多模态智能体模拟真人玩家,围绕长时程目标闭环评测九个视频世界模型
用因果教师与前缀评分对齐师生信息集,实现低延迟可控长视频生成
以可编辑的持久3D世界状态为中心,把预可视化从一次性视频生成变为可构建、演化、访问的世界建模
让AI编码智能体在6小时固定算力内自主改进世界模型,64次会话63次成功提升
把轨迹打分重构为条件OOD检测,用不确定性子空间分离可解释与不可解释残差,提升无人机图像目标导航。
把世界生成模型构造未来的内部计算蒸馏为仅由当前观测预测的表征,控制时无需执行生成器
让单一策略同时扮演行动者与环境,内化世界模型以摆脱外部环境依赖。
借鉴网游权威服务器架构,以类型化共享状态解耦世界推演与视角渲染。
提出DENSEWORLD基准与FactorJEPA,将未来潜表示因子分解为布局、智能体、交互三通道
用遮挡感知点云渲染加双流视频扩散,从单目输入实现大基线可控新视角合成与4D重建
用层次化JEPA编码器与像素空间流匹配,打造CPU实时可运行的音乐协作智能体
把世界模型重构为面向智能体的信息转移代理,提出6类功能×3层赋能的设计空间。
统一世界预测与价值估计的VLA强化学习评论家模型,149任务达SOTA
将信念、意图、情绪等心智变量纳入世界模型以预测人类决策。
用QQ匹配替代EP正则化,矫正潜在空间重尾偏差,提升规划性能。