将智能体群组作为进化单元,通过组内经验共享实现开放式自我改进
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出多轮强化学习框架解决内核生成中的奖励作弊和懒惰优化问题
用回译与强化学习在无配对数据下同步提升代码生成与文档生成能力。
预算感知MCTS+模块化构建+比较反思记忆,自动化MLE研究
COBALT方法通过上下文赌博机学习结合在线和离线RL,提升多轮代码生成性能。
将仓库规划图从静态生成蓝图扩展为双向统一表示,实现代码仓库的高效理解与重建
通过生成可渲染Web代码而非直接像素来建模移动GUI状态转换
基于频域滑动窗口引导dLLM实现结构到细节的解码策略
首个端到端统一文本OCR与视觉OCR的全场景方法,4B参数媲美70B模型。
提出TRACE基准,用对比分析提升LLM检测代码奖励黑客的能力
提出代码驱动的科学图像生成框架ImgCoder和评测基准SciGenBench,揭示精度-表现力权衡
揭示基准漏洞+统一评估框架,4B模型训练后超越GPT-4o
通过迭代优化实验提炼10条代码生成prompt改进指南,并验证其实际应用价值
通过块扩散持续预训练,使扩散语言模型在代码任务上超越自回归基线
大语言模型时代的自动内核生成综述
👍 19系统综述LLM和智能体驱动GPU内核自动生成的方法、数据与基准
224个真实后端任务基准,评估LLM智能体全生命周期开发能力
提出测试时工具演化范式,让智能体在推理过程中动态合成、验证和演化可执行工具,突破静态工具库的根本限制
受控自进化算法用于代码效率优化
👍 115通过多样化初始化、遗传进化和层级记忆三大机制,提升代码自进化搜索效率。
面向卓越长链式思维推理的分布对齐序列蒸馏
👍 64三项蒸馏改进技术将4B小模型推理能力提升至超越32B大模型水平
用完全合成数据训练7B代码模型,在竞赛编程基准上超越14B真实数据模型