找到 448 条结果

通过AI反馈的逐动作过程奖励训练多智能体,解决信用分配和样本效率问题

Ed Li, Junyu Ren, Cat Yan 2026-02-02
AI反馈 多智能体系统 大语言模型 强化学习 过程奖励

知识蒸馏可将训练数据记忆减少50%以上,同时提升模型泛化能力

Jaydeep Borkar, Karan Chadha, Niloofar Mireshghallah, Yuchen Zhang,... 2026-02-02
大语言模型 数据记忆 模型压缩 知识蒸馏 隐私保护