以顺序干预定位失败责任智能体,再聚类抽象文本梯度以优化多智能体提示词
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
封堵SWE-Bench Pro的答案泄漏并修复题目缺陷,发布731题防作弊验证版基准
专家轨迹模仿在进化框架下令弱模型全面退步,在线策略单回合修正可保框架适配并持续增益
首个用 LLM 智能体贯通自动驾驶规划器场景测试全流程的统一对话式框架
把适应从智能体侧转向环境侧,用分阶段增强反馈破解长程RL奖励稀疏
生产级遥测揭示:LLM交易agent的行为由滑块、渲染与订单路径决定,而非模型推理。
模型只解释问题,确定性策略执行预写分析程序,答案与证据可复现
让LLM智能体边顺序生成相关应用边维护共享组件库,在不损功能的前提下大幅削减代码冗余
将轨迹级成败转化为动作级批评监督,让8B小模型的多试次可靠性超过120B大模型
首个评估LLM多轮维护可执行界面的基准:单轮通过率严重高估五轮全流程可靠性
将 3D/4D 场景映射为 2D 图集以解耦编辑与重建,LLM 调度 30+ 视觉工具实现对话式编辑
把执行轨迹建成状态图,定位首个偏离断点,仅对恢复段做局部监督的自蒸馏框架
智能体化工件创作:系统、评估、原则与机遇
👍 56以交付工件为分析单元,用状态化构建框架统揽259项智能体创作研究与评估
冻结模型权重,自动演化智能体框架,三大企业基准提升20-35个百分点
给LLM智能体自我修改配可验证撤销方案,分离寻址与表达力两类恢复瓶颈。
用统一数据对象 (E,q,τ,v) 与 ACE 框架把智能体数据生成重构为受限分布设计
让冻结LLM把3D物体写成带类型化配合的程序化装配代码,无需3D训练
用删除/替换/重排三个反事实探针在检索前校准技能图边置信度,让智能体拿到可执行的技能包
编码智能体中途换模需缴交接税:升级收不回一半质量差距且常不如重启,降档反而划算
将Harness优化建模为离线学习,用失败轨迹驱动诊断、修补与进化,产出持久更新