找到 999 条结果

筛选少量高方差用户提示,让 RL 提示优化在异质推理任务上突破全量训练瓶颈。

Zhaolin Gao, Yu, Wang, Bo Liu, Thorsten Joachims, Kianté Brantley, Wen Sun 2026-04-13
大语言模型 奖励方差分析 强化学习 推理任务 提示优化

揭示多轮LLM Agent RL中推理表面多样但输入无关的「模板坍缩」,并提出MI诊断与SNR过滤。

Zihan Wang, Chi Gui, Xing Jin, Qineng Wang, Licheng Liu, Kangrui Wang, Shiqi... 2026-04-09
LLM智能体 PPO/GRPO 互信息 信噪比 强化学习

统一扩散大语言模型后训练与评估的开源框架,支持多种模型家族和RL算法

Jingyi Yang, Yuxian Jiang, Xuhao Hu, Shuang Cheng, Biqing Qi, Jing Shao 2026-04-08
强化学习 扩散语言模型 模型对齐 系统优化 统一框架

提出 SciTikZer 模型与 Dual Self-Consistency 强化学习框架,从图像生成可编译的 TikZ 代码,在 8B 体量上超越 Gemini-2.5-Pro 与 Qwen3-VL-235B。

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu,... 2026-04-08
TikZ/LaTeX 代码生成 图像到代码 多模态大模型 强化学习