找到 979 条结果

系统综述让代码智能体从软件反馈中持续自我进化的方法与分类框架

Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang 2026-08-06
LLM Agent 代码智能体 强化学习 综述 自我进化

逐步执行CAD操作并对比几何反馈,重建可编辑参数化程序

Soslan Kabisov, Gennadiy Savrasov, Maksim Elistratov, Antonio Rodriguez,... 2026-08-04
CAD逆向工程 三维重建 基准评测 强化学习 视觉语言模型

用弱模型的对数几率差合成代理教师,蒸馏出超越弱教师、逼近自身的强学生。

Fangxu Yu, Zinan Lin, Xiaodong Liu, Weijia Xu, Michael Xu, Tianyi Zhou, Jianfeng Gao 2026-08-03
同策略蒸馏 大语言模型推理 对数几率算术 弱到强学习 强化学习

提出SAF四阶段流水线融合GRPO与OPD优势,避免熵坍塌并稳定提升性能。

Yifan Ding, Xincheng Wei, Yoshua Y. Li, Ziheng Li, Yuquan Lu, Siyu Zhang,... 2026-08-03
GRPO RLVR 强化学习 熵坍塌 知识蒸馏

提出EVR奖励:多假设评估+视觉验证,强化学习优化多参考图像编辑。

Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu,... 2026-08-03
DiffusionNFT 图像编辑 多参考图像编辑 多模态大语言模型 奖励模型