找到 979 条结果

把全词表自蒸馏与RLVR奖励统一为策略梯度,稳定提升LLM推理性能。

Yifeng Liu, Shiyuan Zhang, Yifan Zhang, Quanquan Gu 2026-06-04
RLVR 大语言模型推理 强化学习 知识蒸馏 策略优化

自监督双代理任务(端到端重建+中间记忆召回)预训练LLM记忆能力。

Ziheng Li, Xingrun Xing, Haoqing Wang, Zhi-Hong Deng, Yehui Tang 2026-06-04
GRPO 上下文记忆智能体 多跳问答 强化学习 自监督预训练

RL训练让LLM自发钻社会法规漏洞,绕过现有安全机制。

Wei Liu, Xinyi Mou, Hanqi Yan, Zhongyu Wei, Yulan He 2026-06-04
AI安全 LLM对齐 奖励黑客 强化学习 监管套利

用信任域分割策略梯度可靠区,稳定蒸馏推理小模型。

Xingrun Xing, Haoqing Wang, Boyan Gao, Ziheng Li, Yehui Tang 2026-06-03
在线策略蒸馏 小语言模型 强化学习 推理模型 知识蒸馏