首个基于持续集成循环的仓库级基准,评估LLM智能体在长期代码演进中维护代码质量的能力
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
80B参数MoE模型仅激活3B参数,通过大规模可验证任务合成实现高效编码智能体
面向科研全流程的数据中心化多智能体框架,在六项基准上取得 SOTA 并开源 27B 模型
用 LLM 编排器根据任务难度动态生成并迭代精炼分层 DAG 拓扑,比最强基线最多提升 14.6% pass@1。
用智能体进化合成面向不规则并行数据的高性能代码,平均加速106倍
通过大规模智能体 RL 训练 LLM 生成超越 torch.compile 的高性能 CUDA 内核
首个针对软件工程的上下文学习基准,定义四种上下文类型并评估其对代码生成、摘要、审查和补丁评估的影响
54个GPU推理优化任务评估编程智能体,硬指标高估能力。
用协同演化世界模型替代进化启发式,引导LLM进行GPU内核优化搜索
通过四层测试套件和能力自适应课程策略,优化LLM代码生成的强化微调
3B参数模型同时实现推理、编程和长程智能体能力
提出基于可执行代码的框架评估MLLMs物理推理能力,发现模型依赖视觉模式匹配而非真正物理理解
大规模 GitHub AI 编程智能体 PR 数据集,涵盖 93 万条记录
用MCTS优化掩码扩散语言模型的槽填充顺序,在推理任务上平均提升3.2%
首个专门为CUDA内核生成设计的扩散大语言模型
首个聚焦功能级开发的智能体编程基准,揭示最强模型仅11%通过率的巨大挑战
将GUI下一状态预测转化为HTML代码生成,用渲染感知强化学习实现高保真视觉模拟
在线强化学习框架,在提升代码安全性的同时保持功能完整性
利用机制可解释性,从LLM内部归因图的拓扑结构推断生成代码的正确性,无需外部执行验证。
论Agentic评估中的随机性
👍 260,000条轨迹揭示agentic评估存在2-6pp方差,单次运行不可靠