快手agentic coding模型,多基准接近最先进水平
Fengxiang Li, Han Zhang, Haoyang Huang, Jinghui Wang, Jinhua Hao, Kun Yuan,...
2026-03-31
AI agent
agentic coding
代码生成
强化学习
软件工程
首个基于真实数据的大规模图表到代码基准,揭示VLMs在复杂可视化任务上的显著不足
Jiajun Zhang, Yuying Li, Zhixun Li, Xingyu Guo, Jingzhuo Wu, Leqi Zheng,...
2026-03-30
VLM评估
代码生成
图表生成
多模态模型
数据可视化
Cursor发布专用编码智能体模型Composer 2,经继续预训练+强化学习训练
Cursor Research, Aaron Chan, Ahmed Shalaby, Alexander Wettig, Aman Sanger,...
2026-03-30
MoE模型
代码生成
大语言模型
强化学习
软件工程智能体
通过对比反思历史提交积累仓库特定技能,生成符合项目风格的代码
Mo Li, L. H. Xu, Qitai Tan, Ting Cao, Yunxin Liu
2026-03-30
LLM应用
代码生成
持续学习
智能体
软件工程
提出CAID框架,基于SWE原语实现多代理分支合并协作
Jiayi Geng, Graham Neubig
2026-03-24
代码生成
多智能体系统
异步协作
版本控制
软件工程
首个评估LLM Agent技能在软件工程中边际效用的基准,发现49个技能中39个无提升
Tingxu Han, Yi Zhang, Wei Song, Chunrong Fang, Zhenyu Chen, Youcheng Sun, Lijie Hu
2026-03-18
Agent技能
LLM评估
代码生成
技能注入
软件工程基准
提出POLCA框架,通过优先队列和语义过滤机制解决LLM优化中的随机性和参数空间爆炸问题。
Xuanfei Ren, Allen Nie, Tengyang Xie, Ching-An Cheng
2026-03-17
LLM优化
代码生成
提示工程
智能体优化
生成式优化
提出DeepCommit流水线和EvoClaw基准,揭示前沿模型在持续软件演化中的性能崩溃现象
Gangda Deng, Zhaoling Chen, Zhongming Yu, Haoyang Fan, Yuhong Liu, Yuxin...
2026-03-17
AI代理
代码生成
基准测试
持续集成
软件工程
通过对抗性协同进化优化代码和测试生成,消除对人工标注测试的依赖
Aozhe Wang, Yuchen Yan, Nan Zhou, Zhengxi Lu, Weiming Lu, Jun Xiao, Yueting...
2026-03-17
代码生成
协同进化
对抗学习
强化学习
测试生成
提出生成式视觉奖励模型Visual-ERM,通过细粒度图像对比为图表/表格/SVG转代码任务提供可靠RL奖励信号
Ziyu Liu, Shengyuan Ding, Xinyu Fang, Xuanlang Dai, Penghui Yang, Jianze...
2026-03-16
代码生成
多模态学习
奖励模型
强化学习
视觉理解
构建基于认知框架的代码创造力基准,发现扩展收敛现象并提出EvoRePE增强方法
Zi-Han Wang, Lam Nguyen, Zhengyang Zhao, Mengyue Yang, Chengwei Qin, Yujiu...
2026-03-16
代码生成
基准测试
机器创造力
演化算法
表示工程
用LLM编码代理自动翻译RL环境,4级验证保等价。
Seth Karten, Rahul Dev Appapogu, Chi Jin
2026-03-13
JAX加速
LLM Agent
代码生成
强化学习
环境工程
通过可执行代码作为感知媒介,系统性提升多模态大模型在STEM领域的视觉理解能力
Tongkun Guan, Zhibo Yang, Jianqiang Wan, Mingkun Yang, Zhengtao Guo, Zijian...
2026-03-12
STEM推理
代码生成
多模态学习
强化学习
视觉感知
首个评估LLM生成原则驱动、交互式HTML应用能力的基准测试框架
Zuhao Zhang, Chengyue Yu, Yuante Li, Chenyi Zhuang, Linjian Mo, Shuai Li
2026-03-11
LLM评估
Web开发
交互式应用
代理评估
代码生成
提出基于RL的自我反思-修正框架,将调试能力内化到模型权重,无需外部预言机
Juyong Jiang, Jiasi Shen, Sunghun Kim, Kang Min Yoo, Jeonghoon Kim, Sungju Kim
2026-03-11
代码生成
强化学习
程序调试
自我修正
自我反思
用可执行代码作为思维链中间表示,实现精确可控的文生图生成
Haodong Li, Chunmei Qing, Huanyu Zhang, Dongzhi Jiang, Yihang Zou, Hongbo...
2026-03-10
代码生成
图像编辑
思维链推理
文生图
统一多模态模型
MicroCoder 用难度感知数据筛选,让 4B 代码模型 300 步内获得 3 倍提升
Zongqian Li, Tengchao Lv, Shaohan Huang, Yixuan Su, Qinzheng Sun, Qiufeng...
2026-03-10
GRPO/DAPO
代码生成
基准测试
强化学习
数据筛选
MicroCoder-GRPO在LiveCodeBench v6最高相对涨17.6%。
Zongqian Li, Shaohan Huang, Zewen Chi, Yixuan Su, Lexin Zhou, Li Dong, Nigel...
2026-03-10
GRPO
代码大模型
代码生成
强化学习
训练算法
ODD:免训练、顺序正交投影,提升扩散语言模型Pass@k。
Sean Lamont, Christian Walder, Paul Montague, Amir Dezfouli, Michael Norrish
2026-03-10
Pass@k
代码生成
扩散语言模型
推理时多样性
数学推理
通过成对比较和联合训练统一生成与验证,提升并行推理性能
Harman Singh, Xiuyu Li, Kusha Sareen, Monishwaran Maheswaran, Sijun Tan,...
2026-03-05
代码生成
并行推理
强化学习
数学推理
测试时扩展