把长期情景记忆编译成语言-视觉计划,用固定上下文执行长时程记忆依赖操作
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
基于世界模型的自动研究智能体规模化训练
👍 444用世界模型替代昂贵的沙箱执行训练研究智能体,在线去偏去噪,训练加速3-4倍且性能更优。
可编程世界模型
👍 94用可执行程序维护显式世界状态,把视频模型降级为纯粹的生成式渲染器
用视觉校准片段教会动作条件世界模型零样本适应未见环境
加希腊语容易,证明有效难:五类常用指标全部失灵,需以构造性对照与多种子复现重建可信结论。
把浏览器当作网页代码的世界模型,用可执行验证证书取代VLM自我评判来筛选训练监督
将物理世界表示为可执行代码,用智能体闭环发现世界并为VLM提供可扩展物理监督
把游戏开发变成“引擎检查+人类验收”的可验证奖励环境,驱动世界模型自我改进
PAWBench:概率对齐世界建模评测基准
👍 140视频模型能生成合理的单条未来,却难以复现同一条件下可能未来的正确分布。
代码世界模型:以编程智能体为世界大脑
👍 34编程智能体用代码维护世界状态,代理视频驱动视频模型渲染高保真开放世界
以跨镜头音视频记忆、6-DoF轨迹控制与自展开蒸馏训练,把音视频生成扩展为持久故事与可交互世界
三系统架构+3.7万小时异构数据一阶段预训练,协同理解、预测与行动的具身基础模型。
构建G2WEngine数据引擎与免掩码GameCleaner,剥离游戏HUD提升世界模型数据质量
以相机意图为统一接口,边导航边联合生成720p视频、环境音与语音的可进入世界模型
以传统仿真器八项能力为标尺审计200篇文献,指出状态反馈与物理引擎是结构性缺口
响应耦合分区+探针残差重构,22–26%密度下免训练稀疏注意力加速视频生成1.48–2.61倍
提出六层级人类情境分类法,系统梳理基础模型时代以人为中心智能的方法、数据与评测。
以像素级动作流为共享接口,统一跨本体世界建模、开环策略评估与逆向机器人控制
高层子任务决策按需触发世界模型束搜索,用测试时算力换长程操作成功率。
分层智能体评测流水线把世界模型评分变成可审计的证据树,判断与人类高度一致