用标准化流在LLM中建模连续思维链,保持自回归接口并支持策略梯度优化
Guancheng Tu, Xiangjun Fu, Suhao Yu, Yao Tang, Haoqiang Kang, Lianhui Qin,...
2026-06-05
代码生成
大语言模型
思维链推理
标准化流
潜在表示
ADR框架通过原子分解重组生成高质量可验证代码任务,突破RLVR数据瓶颈
Jiasheng Zheng, Boxi Cao, Boxi Yu, Yuzhong Zhang, Jialun Cao, Yaojie Lu,...
2026-06-05
RLVR
代码生成
大语言模型
强化学习
数据合成
通过进化参考解决方案生成更难的编程任务,解决基准饱和问题
Yangzhen Wu, Aaron J. Li, Wenjie Ma, Li Cao, Ziheng Zhou, Mert Cemri, Shu...
2026-06-04
代码生成
合成数据
基准测试
自我改进
进化算法
通过源感知评分标准自动发现与蒸馏,提升异构中期训练数据的选择效率
Haowen Wang, Yaxin Du, Jian Yang, Jiajun Wu, Shukai Liu, Yuxuan Zhang,...
2026-06-03
LLM训练
中期训练
代码生成
数据选择
源感知学习
评测12个前沿VLM用Blender代码做过程化3D建模的智能体基准
Yipeng Gao, Lei Shu, Genzhi Ye, Xi Xiong, Ameesh Makadia, Meiqi Guo, Laurent...
2026-06-02
3D生成
Blender
VLM智能体
人类偏好
代码生成
12B参数MoE模型,仅激活2.5B参数,实现代码生成和工具调用的IDE部署级效率
Marko Kojic, Ivan Bondyrev, Aral de Moor, Joseph Shtok, Petr Borovlev,...
2026-06-01
Mixture-of-Experts
RLVR
代码生成
工具调用
投机解码
提出评估AI将自然语言编程意图转化为可信形式化规范能力的新基准和环境
Anmol Agarwal, Natalie Neamtu, Pranjal Aggarwal, Seungone Kim, Jannis...
2026-05-28
Agent评估
代码生成
形式化验证
自动形式化
规范生成
提出混合检索系统HST,结合向量搜索与Winnowing算法实现对LLM生成代码的高效来源追踪
Andrea Gurioli, Davide D'Ascenzo, Federico Pennino, Maurizio Gabbrielli,...
2026-05-28
LLM
代码生成
向量数据库
抄袭检测
来源追踪
9.8B 激活参数的 MoE 大模型,通过 Agent 数据管线+Forge 强化学习系统+自我进化,在编码与办公 Agent 任务上比肩头部闭源模型
MiniMax, Aili Chen, Aonian Li, Baichuan Zhou, Bangwei Gong, Binyang Jiang,...
2026-05-27
Agent
MoE
Speculative Decoding
代码生成
强化学习
无真值单元测试、无训练的测试时代码生成:代码与单元测试双向协作自博弈共同进化。
Zhangyi Hu, Chenhui Liu, Tian Huang, Jindong Li, Yang Yang, Jiemin Wu,...
2026-05-26
LLM推理
代码生成
单元测试
测试时计算
自我博弈
用代码智能体从自然语言生成可验证的 GUI 评测环境。
Guohong Liu, Jialei Ye, Pengzhi Gao, Wei Liu, Jian Luan, Yunxin Liu, Yuanchun Li
2026-05-26
GUI 智能体
代码生成
基准测试
环境合成
移动端
提出变分策略蒸馏(VPD)框架,通过EM算法让教师与学生协同进化,解决RLVR稀疏奖励问题
Yang Li, Erik Nijkamp, Semih Yavuz, Shafiq Joty
2026-05-21
代码生成
变分推断
大语言模型
强化学习
科学推理
提出SpecBench基准测试,量化AI编码代理的奖励黑客现象
Bingchen Zhao, Dhruv Srikanth, Yuxiang Wu, Zhengyao Jiang
2026-05-21
AI代理评估
代码生成
基准测试
奖励黑客
测试驱动开发
把文本技能升级为可执行状态-动作干预函数,全面提升 LLM 智能体表现
Hongjun Liu, Yifei Ming, Shafiq Joty, Chen Zhao
2026-05-20
LLM Agent
Post-Training
Program Synthesis
ReAct
Self-Improving Agent
提出 CGR 评估协议,量化可执行 Python 支架对小模型 MCQA 的影响与审计。
Prateek Biswas, Dhaval Patel, Vedant Khandelwal, Shuxin Lin, Amit Sheth
2026-05-20
代码生成
可执行推理
多选题
小语言模型
评估协议
提出「代码即智能体框架」视角,让代码成为智能体推理与行动的运行时底座。
Xuying Ning, Katherine Tieu, Dongqi Fu, Tianxin Wei, Zihao Li, Yuanchen Bei,...
2026-05-19
代码生成
多智能体协作
智能体框架
智能体系统
综述
用 MLLM 智能体分阶段生成 Blender 代码,从俯视图重建可执行 3D 房间。
Yixuan Yang, Zhen Luo, Wanshui Gan, Jinkun Hao, Junru Lu, Jinghao Yan,...
2026-05-19
3D场景生成
代码生成
多模态大模型
室内设计
智能体系统
冻结LLM权重,用四智能体+可训练知识图谱的闭环系统让代码生成越用越强。
Han Li, Jinyu Tian, Rili Feng, Yuqiao Du, Chong Zheng, Chenyu Wang, Chenchen...
2026-05-18
REINFORCE
代码生成
多智能体系统
强化学习
智能体
把失败轨迹转成修正样本,让模型同时学会做对与改对。
Mengjie Ren, Jie Lou, Boxi Cao, Xueru Wen, Hongyu Lin, Xianpei Han, Le Sun,...
2026-05-18
GRPO
RLVR
代码生成
失败利用
推理能力
用评估技能+六阶段流水线让 Claude 自动为任意 agent 生成可执行的评估代码
Kang Zhou, Sangmin Woo, Haibo Ding, Kiran Ramnath, Subramanian Chidambaram,...
2026-05-14
LLM 评估
代码生成
基准测试
工具使用
智能体评估