找到 979 条结果

面向全模态任务的多智能体编排框架与决策对齐强化学习方法。

Fan Zhang, Vireo Zhang, Shengju Qian, Haoxuan Li, Hao Wu, Jinyang Wu,... 2026-06-15
GRPO OmniGAIA ReAct 任务分解 全模态智能体

首个多智能体框架,通过规划-生成-批评流程赋予任意图像生成器交错生成能力

Dian Zheng, Harry Lee, Manyuan Zhang, Kaituo Feng, Zoey Guo, Ray Zhang, Hongsheng Li 2026-06-12
交错生成 图像生成 多智能体系统 强化学习 视觉语言模型

提出Z-Reward教师-学生框架,将推理增强的分数分布蒸馏到高效的学生奖励模型中

Xin Jin, Huanqia Cai, Zhen Li, Zechao Zhan, Dengyang Jiang, Aiming Hao,... 2026-06-11
奖励建模 强化学习 文本到图像生成 知识蒸馏 视觉语言模型