← 前一天
2026-05-27
后一天 → 今日

9.8B 激活参数的 MoE 大模型,通过 Agent 数据管线+Forge 强化学习系统+自我进化,在编码与办公 Agent 任务上比肩头部闭源模型

MiniMax, Aili Chen, Aonian Li, Baichuan Zhou, Bangwei Gong, Binyang Jiang,...
Agent MoE Speculative Decoding 代码生成 强化学习

把视频当码率流处理,codec-stream 在事件级定位上 +44.8。

Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui...
多模态大模型 感知智能 时序定位 视觉token压缩 视频理解

借鉴不完全信息博弈论,把多 agent 协调重写为「独立生成 + 结构化信念 + 受控暴露」,在六个推理基准上以最高 6.5 倍更少 token 达到 SOTA。

Yi Li, Songtao Wei, Dongming Jiang, Zhichun Guo, Qiannan Li, Bingzhe Li
Guardrail 不完全信息博弈 受控通信 多智能体 LLM 推理集成

系统研究VLM表征如何影响VLA初始化,提出能力-更新-动作三轴设计原则

Weifeng Lin, Siyuan Huang, Hao Li, Tingwei Chen, Ruichuan An, Xinyu Wei,...
LoRA VLA VLM 机器人 机器人学习

将英语对比偏好调优扩展到多语言场景,无需为每种语言单独标注偏好数据

Mike Zhang, Ali Basirat, Desmond Elliott
DPO 偏好调优 多语言学习 对比学习 自生成数据

用VAE潜在空间+RTR策略实现高频机器人平滑控制

Kunyun Wang, Yuhang Zheng, Yupeng Zheng, Jieru Zhao, Wenchao Ding
动作块 异步推理 机器人控制 模仿学习 潜在表示

现有证据不足以证明大语言模型具有强元认知监控能力

Shashwat Singh, Tal Linzen, Shauli Ravfogel
元认知 内省 可解释性 机制分析 行为实验

从NSF资助摘要中构建280万科学声明数据集,用于科学声明验证和提取研究

Delip Rao, Weiqiu You, Eric Wong, Chris Callison-Burch
大语言模型 数据集构建 科学声明提取 科学文献挖掘 资助摘要分析