← 前一天
2026-07-20
后一天 → 今日

用教师与基础模型的概率差作为蒸馏奖励,大幅提升推理蒸馏效果。

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han
后训练 在线策略蒸馏 大语言模型推理 奖励设计 强化学习替代

少量迭代优化任务专属提示级智能体框架,超越最强推理档并省最多60%成本。

Hyunin Lee, Jinglue Xu, Jeffrey Seely, Donghyun Lee, Matei Zaharia, Yujin Tang
LLM编程代理 多智能体系统 智能体框架优化 测试时计算 递归自我改进