找到 232 条结果

面向全模态任务的多智能体编排框架与决策对齐强化学习方法。

Fan Zhang, Vireo Zhang, Shengju Qian, Haoxuan Li, Hao Wu, Jinyang Wu,... 2026-06-15
GRPO OmniGAIA ReAct 任务分解 全模态智能体

用冻结小模型为大模型 GRPO 生成探索性 rollout,渐进切入到自采样的 S2L-PO 框架

Yiming Ren, Yiran Xu, Zicheng Lin, Chufan Shi, Yukang Chen, Dingdong Wang,... 2026-06-15
GRPO 小模型利用 强化学习后训练 探索多样性 推理增强

自监督双代理任务(端到端重建+中间记忆召回)预训练LLM记忆能力。

Ziheng Li, Xingrun Xing, Haoqing Wang, Zhi-Hong Deng, Yehui Tang 2026-06-04
GRPO 上下文记忆智能体 多跳问答 强化学习 自监督预训练

提出基于验证器失败诊断的智能体-环境协同共演化框架 SEAL,用同一诊断信号同时驱动训练接口进化与策略梯度更新。

Yihao Hu, Zhihao Wen, Xiujin Liu, Pan Wang, Xin Zhang, Wei Wu 2026-05-26
GRPO LLM智能体 失败诊断 工具调用 强化学习

提出 CMRP 新任务和 UniCharacter 框架,用极少样本让统一多模态模型同时学会角色的语言风格与视觉外观。

Chao Tang, Jianzong Wu, Qingyu Shi, Ye Tian, Aixi Zhang, Hao Jiang,... 2026-05-26
GRPO 个性化生成 多模态大模型 强化学习 文生图

用专用图像编辑器替代工具调用与统一多模态,让MLLM真正“用图像思考”。

Beichen Zhang, Yuhong Liu, Jinsong Li, Yuhang Zang, Jiaqi Wang, Dahua Lin 2026-05-25
GRPO LoRA微调 图像编辑 多模态大模型 强化学习