找到 999 条结果

通过预填充自调优和意图漂移感知强化学习,训练无需外部数据的多轮越狱攻击模型

Mingqian Feng, Xiaodong Liu, Weiwei Yang, Jialin Song, Xuekai Zhu, Chenliang... 2026-02-09
LLM安全 多轮对话 强化学习 红队测试 越狱攻击

利用训练时特权信息蒸馏前沿模型,无需Chain-of-Thought

Emiliano Penaloza, Dheeraj Vattikonda, Nicolas Gontier, Alexandre Lacoste,... 2026-02-06
强化学习 智能体 特权信息 知识蒸馏 语言模型

用自监督 RL 训练 LLM 成为动作条件的世界模型,提升智能体决策能力

Xiao Yu, Baolin Peng, Ruize Xu, Yelong Shen, Pengcheng He, Suman Nath,... 2026-02-06
GRPO LLM智能体 世界模型 强化学习 自监督学习

通过蒸馏MCTS搜索树和蒙特卡洛评论家,让LLM智能体内化准确的前瞻推理能力

Yangbin Yu, Mingyu Yang, Junyou Li, Yiming Gao, Feiyu Liu, Yijun Yang,... 2026-02-06
大语言模型 强化学习 推理蒸馏 智能体 游戏AI

提出可学习的潜在记忆框架,通过角色感知的潜变量优化解决多智能体记忆同质化和信息过载问题

Muxin Fu, Guibin Zhang, Xiangyuan Xue, Yafu Li, Zefeng He, Siyuan Huang,... 2026-02-06
多智能体系统 大语言模型 强化学习 潜在表示 记忆机制

提出MT-GRPO算法,通过自适应任务加权和比例保持采样实现多任务推理的均衡优化

Shyam Sundhar Ramesh, Xiaotong Ji, Matthieu Zimmer, Sangwoong Yoon, Zhiyong... 2026-02-06
后训练 多任务学习 大语言模型 强化学习 推理能力

用 KL3 估计器替代 GRPO 中的对称裁剪,实现有理论保证的非对称近信赖域约束

Qingyuan Wu, Yuhui Wang, Simon Sinong Zhan, Yanning Dai, Shilong Deng, Sarra... 2026-02-06
GRPO 信赖域方法 大语言模型 强化学习 策略优化