把世界动力学建模为物理时间上的潜在ODE速度场,未来预测即潜在空间积分
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
PhiZero:围绕物理语言构建的物理世界模型
👍 166从野外视频自监督学习离散'物理语言',先推理后渲染的物理世界模型。
用单一共享动作算子把JEPA世界模型变成免搜索、可直接部署的意图到动作接口
从离线演示中挖掘有向时序代价,弥合 JEPA 训练与规划鸿沟
用代码归纳世界动力学,可仿真、可规划、可解释。
具身操作的数据金字塔
👍 36用五层数据金字塔系统化组织具身智能数据生态
用可控环境系统揭示长程规划能力在预训练、GRPO/OPD、多教师蒸馏三阶段的获取、塑造与整合规律。
统一扩散Transformer融合动作生成与未来视觉预测,无需大型VLM即可达LIBERO前沿
用持久的世界状态寄存器让多智能体视频世界模型保持跨视角一致性
键盘可控、单卡实时的视频世界模型,可连续推演数十小时
把离线扩散渲染器蒸馏成4步自回归流式模型,实现30FPS实时交互渲染。
基于15B扩散Transformer的交互式长时程世界模型,蒸馏至4步实现低延迟生成
用像素空间掩码轨迹作为视频模型动作接口,单模型兼顾正/逆世界模型。
开放模式驱动角色与世界在长程文学互动中持续协同演化
开源2000小时手机采集的第一人称操作数据集及端到端工具链
首个将视频物理推理锚定到物理定律并分阶段诊断的基准
用世界模型预测动作后果,在执行前拦截移动端高风险操作。
用世界模型预测数据操作效果,智能体训练加速14倍、推理加速3-6倍
首个无需语言监督、直接在视觉空间学习异构推理任务并配套 VR-X 基准的框架
统一语言推理与视觉想象,单模型端到端生成具身规划