找到 998 条结果

9.8B 激活参数的 MoE 大模型,通过 Agent 数据管线+Forge 强化学习系统+自我进化,在编码与办公 Agent 任务上比肩头部闭源模型

MiniMax, Aili Chen, Aonian Li, Baichuan Zhou, Bangwei Gong, Binyang Jiang,... 2026-05-27
Agent MoE Speculative Decoding 代码生成 强化学习

将长时程智能体的记忆管理建模为状态自适应问题,通过线索-页面架构实现意图驱动的记忆检索

Yuyang Hu, Hongjin Qian, Shuting Wang, Jiongnan Liu, Ziliang Zhao, Jiejun... 2026-05-27
强化学习 智能体 记忆管理 长时程推理

提出基于验证器失败诊断的智能体-环境协同共演化框架 SEAL,用同一诊断信号同时驱动训练接口进化与策略梯度更新。

Yihao Hu, Zhihao Wen, Xiujin Liu, Pan Wang, Xin Zhang, Wei Wu 2026-05-26
GRPO LLM智能体 失败诊断 工具调用 强化学习

提出 CMRP 新任务和 UniCharacter 框架,用极少样本让统一多模态模型同时学会角色的语言风格与视觉外观。

Chao Tang, Jianzong Wu, Qingyu Shi, Ye Tian, Aixi Zhang, Hao Jiang,... 2026-05-26
GRPO 个性化生成 多模态大模型 强化学习 文生图

用专用图像编辑器替代工具调用与统一多模态,让MLLM真正“用图像思考”。

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin 2026-05-25
GRPO LoRA微调 图像编辑 多模态大模型 强化学习