四种受控对比模型实证表明整文件直接生成全面优于Diff迭代编辑,Diff仅在短局部编辑占优
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
让LLM智能体边顺序生成相关应用边维护共享组件库,在不损功能的前提下大幅削减代码冗余
RCCA把评分规则级功能反馈定位到代码片段,转化为GRPO的token级优化权重。
让冻结LLM把3D物体写成带类型化配合的程序化装配代码,无需3D训练
算法专家智能体接力协作,用公开测试反馈逐步修复竞赛代码
CRDT 共享工作区加显式协调层,抑制多智能体弃坑失败并提升质量
用144对物理突变任务检验智能体改代码自救的能力,揭示机制重设计而非参数推断是真瓶颈
用图表-表格-代码三表征一致性作为自监督信号协同优化多模态跨表征理解
用 sealor 把部分代码补全为可编译程序,让编译器在生成中途就反馈
面向智能体强化学习的单轮次异步优化
👍 15提出SAO方法,通过单轮次采样和双向token级剪裁稳定异步强化学习训练
研究编码 Agent 训练中的奖励信号设计问题,提出验证器与生成器协同进化的框架
系统综述多模态代码智能领域,提出以验证为核心的四方向研究议程
构建90个Nature论文任务的基准,测试AI代理在科学发现中的真实能力
将Python代码基准扩展到12种语言,揭示LLMs的Python过拟合和多语言性能差异
首个基于Godot游戏引擎的项目级游戏代码框架数据集与基准测试,揭示模型能力随项目规模急剧下降的现象
探索LLM在零资源语言上的代码生成性能并提出有效的改进方案
通过增益-成本分析揭示 PLT 循环次数选择在 R=2 达到最优
构建4,818个文档到仓库生成任务数据集,提升长视界代码生成能力
语法约束解码可使大语言模型生成恶意代码
👍 18揭示GCD可诱导LLM生成恶意代码,提出CodeShield防御方法
CapCode框架检测和防止编码代理作弊