THINC框架让代码本身成为推理主体,4B模型击败235B基线
Hyeon Hwang, Jiwoo Lee, Jaewoo Kang
2026-05-13
GRPO
代码生成
工具增强推理
强化学习
思维链
将前向KL与反向KL按token级信号混合,结合off-policy数据与轻量on-policy采样的统一蒸馏框架
Wenhong Zhu, Ruobing Xie, Rui Wang, Pengfei Liu
2026-04-24
代码生成
大语言模型
强化学习
推理
知识蒸馏
用强化学习让 7B 小模型端到端生成可部署的多页网站,匹敌 671B 模型。
Juyong Jiang, Chenglin Cai, Chansung Park, Jiasi Shen, Sunghun Kim, Jianguo...
2026-04-24
GRPO
Web 开发
代码生成
多模态奖励
强化学习
用结构化轨迹摘要+RTV+PDR,在长程智能体编码上系统提升测试时计算增益。
Joongwon Kim, Wannan Yang, Kelvin Niu, Hongming Zhang, Yun Zhu, Eryk...
2026-04-23
LLM
SWE-Bench
代码生成
推理扩展
智能体
多智能体机制感知系统,实现可解释的HTML5游戏迭代进化
Hongnan Ma, Han Wang, Shenglin Wang, Tieyue Yin, Yiwei Shi, Yucong Huang,...
2026-04-23
代理奖励
代码生成
创意AI
多智能体
游戏生成
构建 PlayEval 基准与 PlayTester 多模态测试代理,提出 PlayCoder 多智能体框架通过"视觉驱动测试+自动修复"闭环修复 GUI 代码的隐性逻辑缺陷。
Zhiyuan Peng, Wei Tao, Xin Yin, Chenhao Ying, Yuan Luo, Yiwen Guo
2026-04-22
GUI 应用
LLM Agent
代码生成
基准测试
多智能体系统
首个端到端网页游戏生成智能体框架,含Game Skill与GameCoder-27B。
Yilei Jiang, Jinyuan Hu, Qianyin Xiao, Yaozhi Zheng, Ruize Ma, Kaituo Feng,...
2026-04-21
LLM智能体
Phaser
代码生成
动态可玩性评估
执行反馈强化学习
首个覆盖生成/编辑/修复全生命周期并支持文/图/视频三模态的Web编程评测基准,提出Agent-as-a-Judge新范式。
Xinping Lei, Xinyu Che, Junqi Xiong, Chenchen Zhang, Yukai Huang, Chenyu...
2026-04-21
Web开发
代码生成
多模态评测
大语言模型基准
智能体评估
用师生交替生成解决推理模型SFT中的风格冲突问题
Zixian Huang, Kaichen Yang, Xu Huang, Feiyang Hao, Qiming Ge, Bowen Li, He...
2026-04-17
代码生成
师生协作
推理模型
数据合成
监督微调
DBCooker:基于LLM的数据库原生函数自动合成系统,三大模块协同覆盖声明解析、参考单元复用与自适应编排,在三大主流数据库上平均准确率提升34.55%。
Wei Zhou, Xuanhe Zhou, Qikang He, Guoliang Li, Bingsheng He, Quanqing Xu, Fan Wu
2026-04-10
代码生成
大语言模型
数据库系统
智能体
软件工程
通过留一法 AUC 评估测试质量,无需正确代码标签即可区分信息性与误导性测试。
Hui Sun, Yun-Ji Zhang, Zheng Xie, Ren-Biao Liu, Yali Du, Xin-Ye Li, Ming Li
2026-04-08
代码生成
噪声评估器
机器学习排序
测试质量评估
自我一致性
提出 SciTikZer 模型与 Dual Self-Consistency 强化学习框架,从图像生成可编译的 TikZ 代码,在 8B 体量上超越 Gemini-2.5-Pro 与 Qwen3-VL-235B。
Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu,...
2026-04-08
TikZ/LaTeX
代码生成
图像到代码
多模态大模型
强化学习
让代码模型学会模拟程序执行,通过自验证和自修复提升代码正确率
Gallil Maimon, Ori Yoran, Felix Kreuk, Michael Hassid, Gal Cohen, Pierre...
2026-04-07
代码生成
强化学习
程序执行模拟
竞技编程
自验证
提出不确定性感知多智能体框架,让 LLM 编码代理像人类开发者一样识别指令缺失并主动提问。
Nicholas Edwards, Sebastian Schuster
2026-04-03
LLM Agent
SWE-bench
不确定性估计
主动澄清
交互式评估
LLM仅通过训练自己的原始输出即可大幅改进代码生成能力
Ruixiang Zhang, Richard He Bai, Huangjie Zheng, Navdeep Jaitly, Ronan...
2026-04-02
LLM改进
代码生成
自蒸馏
解码策略
提出一个三层级、自动化评估的视觉网站开发基准,揭示当前多模态编码代理在长周期任务中的系统性不足
Zehai He, Wenyi Hong, Zhen Yang, Ziyang Pan, Mingdao Liu, Xiaotao Gu, Jie Tang
2026-04-02
代码生成
基准测试
多模态模型
网站开发
自动化评估
多LLM协作中第二遍提升主要来自强模型独立重解而非真正的修订效果
Jingjie Ning, Xueqi Li, Chengyu Yu
2026-04-02
LLM修订
代码生成
多LLM协作
推理任务
提示工程
通过仅优化初始循环状态实现零推理开销的高效模型微调方法
Jack Young
2026-04-02
代码生成
参数高效微调
循环状态
混合架构
零开销
允许LLM在代码生成过程中任意位置按需调用推理的新机制,实现自适应计算
Xue Jiang, Tianyu Zhang, Ge Li, Mengyang Liu, Taozhi Chen, Zhenhua Xu,...
2026-04-01
代码生成
大语言模型推理
强化学习
自适应计算
进化搜索+逐步训练框架实现GPU内核自动优化,超越Gemini-3.0-pro
He Du, Qiming Ge, Jiakai Hu, Aijun Yang, Zheng Cai, Zixian Huang, Sheng...
2026-03-31
GPU内核优化
Triton
代码生成
强化学习
进化算法