← 前一天
2026-08-25
后一天 → 今日

用环境扩展与智能体协作扩展两条路线,把推理模型变成能完成长周期复杂工作的系统。

Apodex Team, B. An, B. Li, B. Wang, B. Zhang, B. L. Wang, C. Feng, C. Wei,...
AgentOS 多智能体协作 强化学习 技术报告 智能体

以相机意图为统一接口,边导航边联合生成720p视频、环境音与语音的可进入世界模型

Songchun Zhang, Yaowei Li, Junhao Zhuang, Weiyang Jin, Haoyu Wang, Xin Lu,...
世界模型 交互式生成媒体 全模态生成 相机轨迹控制 自回归扩散

阿里开源的电商直播全模态理解模型,用音视频时间对齐与忠实强化微调实现多项直播任务开源最佳。

Yibo Hu, Yu Qian, Mao Gu, Yingfan Tao, Yuhao Chen, Yongdong Luo, Zhuoqun...
GRPO 全模态大模型 强化学习后训练 数据引擎 电商直播

开源长程智能体框架,以持久REPL与递归子智能体将ARC-AGI-3成绩从30%提升至95.5%

Seth Karten, Alex L. Zhang, Kevin Thomas, Sebastian Müller, Elie Bakouch,...
上下文管理 多智能体协作 智能体框架 递归语言模型 长程任务

把3D形状码的逐token自回归解码改为块间因果、块内并行去噪加置信度修正,提速5.15倍

Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu...
3D网格生成 块级扩散 文本到3D生成 离散去噪 自回归生成

按预期规划收益逐步决定想象深浅,让世界动作模型在质量与算力间自适应权衡。

Hongbo Lu, Liang Yao, Chenghao He, Hao Han, Fan Liu, Wenlong Liao, Tao He, Pai Peng
世界动作模型 反事实数据 端到端规划 自动驾驶 自适应计算

用窗口分离训练与位姿地标库,让交互式世界模型兼得精准控制、长时记忆与实时流式生成

Zhifei Chen, Luozhou Wang, Guibao Shen, Dongyu Yan, Shuai Yang, Tianshuo Xu,...
KV缓存压缩 交互式世界模型 扩散蒸馏 流式视频生成 相机控制

轻量适配器把冻结视觉-语言模型对齐到冻结人脸识别空间,提示词变语义锚点,无标注完成解释与审计。

Guray Ozgur, Mustafa Efe Tamyapar, Naser Damer, Fadi Boutros
事后对齐 人脸识别 可解释性 模型审计 视觉-语言模型