AutoDesign:面向长时程智能体设计的元 Harness 优化框架 AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design
让智能体递归优化自身设计Harness,40分钟自动产出人类偏好最高的学术海报
前置知识
Harness(模型脚手架)
围住固定模型搭建的整套运行系统,包括提示词、工具与技能、执行运行时、编排控制(循环次数、候选选择、回退)以及评估反馈模块,负责把模型的基础能力转化为稳定可用的产品行为。模型权重不变,仅修改 harness 就能显著改变系统的实际表现。
本文的核心主张是把设计 harness 本身当作可优化的对象,与模型后训练严格区分。不理解 harness 与模型权重的分层,就无法理解论文的优化目标 $H^\star=\arg\max_H J(H)$ 到底在优化什么。
递归自我改进(Recursive Self-Improvement)
系统利用自己运行产生的轨迹、评分与失败记录来改进自身(而非单个输出)的机制,形成"运行→评估→修改自身→再运行"的闭环。概念上可追溯到 Schmidhuber 的自指学习与 Gödel Machine,本文是其经验主义版本:用实测收益而非证明来决定是否接受自我修改。
AutoDesign 的外循环就是一个递归自改进过程:7 天里 224 个子代理、至少 123 次迭代、54 次被接受的 harness 更新全部来自运行证据,这是理解论文动机与方法的关键。
Rollout 与验收门(Acceptance Gate)
Rollout 指让当前系统在任务集上完整执行一遍并收集产物与评分;验收门则规定候选更新只有在训练集上性能提升、且在独立开发集上不退化时才被接受。开发集分数从不暴露给优化器,从机制上防止 harness 对训练任务过拟合。
这是外循环中唯一决定 harness 是否更新的机制,理解它才能理解为什么 AutoDesign 的改进是单调、可归因且可信的,这也是它与无门槛自我修改方法(如某些 Gödel Machine 变体)的本质区别。
Bradley–Terry 模型
经典的成对比较统计模型:为每个系统估计潜在强度 $\beta_i$,用 $\Pr(i\succ j)=\exp(\beta_i)/(\exp(\beta_i)+\exp(\beta_j))$ 把成对胜负记录换算成"击败随机抽取对手的概率",平局各计半胜,跳过不计。常用于人类偏好评估与 RLHF 奖励建模。
论文的系统盲测用该模型汇总 11 位评审 933 份有效判断,得到 AutoDesign 64.0% 的偏好估计(95% CI 55.2–77.8%),是自动评测结论可信度的独立人类验证。
VLM 视觉评论家与规则验证器
规则验证器用确定性脚本做阻塞式硬检查(资源缺失、出处链接断裂、文本溢出重叠、排版约束违反),失败即拦截;VLM 评论家把产物渲染成 PNG 后,用视觉语言模型从设计契约、布局、可读性、美感等角度给出可定位的修复建议。两者反馈合并成修复信号回传给设计者。
DesignHarness 的内循环完全建立在这两类反馈之上,是系统能做"局部化修订"而非整体重新生成的技术基础,也是 MLLM 相对纯文本 LLM 的额外修复信号来源。
论文转海报(Paper-to-Poster)
把几十页图文并茂的学术论文压缩成单页信息密集、视觉连贯且忠实原文的学术海报,要求同时做到证据保留(可溯源)、密集沟通(信息不丢)和渲染可用(导出后可直接用、可继续编辑),是典型的长时程多模态设计任务。
它是本文实例化并评测 AutoDesign 的具体任务,PosterBench 的七维评分与四类封顶门控全部为此设计;理解任务的三个约束才能读懂七维指标为何如此设置。
研究动机
把论文、报告等多模态来源变成海报、幻灯、网页等人类可用的成品,是典型的长时程设计任务,但现有系统大多停留在"静态流程"层面。生成—批评—修订式方法(如 Self-Refine)把每次人类反馈当作一次性信号,用完即弃;Reflexion、Voyager、ExpeL 等虽能跨任务积累反思或技能,却不会更新"生产产物的系统本身",无法像人类设计师那样从每次成败中沉淀可复用的设计知识。落到论文转海报这一具体任务上,手工流水线表现很差:在本文 100 篇论文的统一评测中,Paper2Poster 仅 44.61 分、Any2Poster 49.09 分、PosterGen 56.71 分,即使最强的裸编码智能体 Codex 也只有 73.37 分,且信息密度、视觉证据等维度普遍低于 6 分(10 分制)。而高质量海报的人工制作动辄数小时,常见缺陷包括反馈稀疏、阅读流断裂、版面填充不足。如何把多模态证据、结构约束、反馈与人类偏好转化为系统持久的、与设计先验对齐的生产能力,仍是悬而未决的问题。
本文的目标是本文目标有三层。第一,提出 AutoDesign 框架:把"与人类设计先验对齐的多模态设计生成"形式化为元 harness 优化问题——模型权重全程固定,由元级优化器引导代码智能体根据 rollout 反馈递归改进围住模型的设计 harness,使系统从每次成功与失败中持续积累持久的设计先验。第二,产出可执行的论文转海报系统 DesignHarness:自主摄取论文、生成可编辑的 HTML 海报、在规则验证器与 VLM 视觉评论家反馈下做局部化修订并定稿,达到可直接使用的会议海报质量。第三,建立 PosterBench 评测协议(100 篇五学科主赛道 + 10 篇 mini 子集、七维评分、四类封顶门控),并验证实用性:单次海报生成在 40 分钟内完成 253 次工具调用与 11 轮编辑、成本低于 3 美元,同时在系统盲测人类评估中获得最高偏好。
与已有工作不同的是,本文的独特切入在于"优化的对象":既不优化单个产物(Self-Refine 式响应级修订),也不微调模型参数,而是优化围住固定模型的整个运行系统。与 TextGrad、DSPy、GEPA 优化组件或声明式管线,以及 STOP、GPTSwarm、ADAS、AFlow 搜索代码或图表示工作流的做法不同,AutoDesign 从 rollout 轨迹与评估结果中归纳反复出现的失败模式,直接更新可执行 harness 的源码,把人类设计的参考产物、渲染诊断、评估器反馈统一转化为持久设计先验。方法上还有两个关键区隔:其一,优化期评估器 $R_{meta}$ 与最终评测协议 PosterBench 严格分离,且评估器在自主优化期间冻结,防止 reward hacking;其二,每次更新被限制在五个功能组件之一,并必须通过独立开发集验收门,保证信用分配可解释、改进单调可信。
核心方法
直觉上,AutoDesign 模仿人类设计师的复盘习惯:项目结束后不是只改这一稿,而是总结“为什么总在同样的地方翻车”,把结论固化进下一版生产流程。技术上它由两个嵌套循环构成。设计 harness $H$ 定义为 $y \sim H(\pi_\theta, x, c)$,其中 $\pi_\theta$ 是固定的 LLM/MLLM,$x$ 是多模态源,$c$ 是目标媒介与用户约束;系统质量为 $J(H)=\mathbb{E}[R_{meta}(y,x,c)]$,优化目标是 $H^\star=\arg\max_H J(H)$。内循环在固定 $H$ 下让设计者与评论家交替:$y_k=M_{design}(y_{k-1},f_{k-1};x,c)$,$f_k=M_{critic}(y_k;x,c)$,反复生成—评估—修订并记录执行轨迹 $\tau$。外循环跨任务运行:每次迭代做 rollout、用七维评估器打分、由优化器 $P$ 提议 $H'_{t+1}=P(H_t,\tau_t,s_t,\mathcal{L})$,再经验收门决定接受与否。
核心创新是“把设计能力持久化到 harness 中”的递归自改进机制。已有系统要么在响应层面修订单个输出,要么在固定流程内积累经验,都不会改写生产系统本身;AutoDesign 的外循环把每轮 rollout 的轨迹、评分、渲染诊断和优化记录 $\mathcal{L}$ 汇总为结构化的反复失败证据,驱动一个代码智能体提出并实施 harness 更新。更新被有意限制为“有界”:一次只允许修改五个功能组件(Context & Memory、Tools & Specs、Execution Runtime、Orchestration、Evaluation & Feedback)中的一个,使每次性能涨跌都能归因到单一干预。$\mathcal{L}$ 跨迭代持久保存 harness 快照、更新计划、代码改动与验收决定,支持比较、复现与回滚;验收门要求训练集提升且开发集不退化,开发集分数从不对优化器暴露,防止过拟合。可选人类引导通道 $g_t$ 注入 planner($H'_{t+1}=P(H_t,\tau_t,s_t,\mathcal{L},g_t)$),用于跳出自主搜索的局部最优。
方法步骤详情
Algorithm 1 的流程:先用人类标注的参考产物构建并冻结七维评估器 $R_{meta}$。每次迭代:(1) 当前 harness 在训练集上 rollout,收集产物与轨迹;(2) 评估打分;(3) 优化器 $P$ 派并行子代理归纳反复失败证据,制定更新计划并实施代码编辑,得候选 $H'_{t+1}$;(4) 候选在训练集与开发集上重评,仅当 $J_{train}$ 提升且 $J_{dev}$ 不降才接受;(5) 迭代记录与 checkpoint 追加进优化记录 $\mathcal{L}$。优化得到的 DesignHarness 分四阶段:摄取——提取元数据、大纲、关键段落与带出处的图表素材,构建全程内容简报;生成——编码智能体维护可编辑 HTML,修订即局部代码编辑;验证——规则阻塞检查(资产安全、出处链接、溢出重叠、排版约束)未过则交 VLM 评论家评审;定稿——最多 $K=12$ 次尝试,通过后做数学排版与资源内联输出成品;耗尽则按回退机制选最佳候选。
技术新颖性
技术新颖性可从四个坐标定位。第一,更新单元:Self-Refine 更新响应,Reflexion/Voyager/ExpeL 更新经验记忆,TextGrad/DSPy/GEPA 更新提示或声明式组件,STOP/GPTSwarm/ADAS/AFlow 搜索工作流图,而 AutoDesign 更新的是完整可执行 harness 的源码,属系统级进化。第二,学习信号与最终评测严格分离:优化用 $R_{meta}$,最终用冻结的 PosterBench,避免了"自己出题自己判"的循环论证,这在同类自改进智能体工作中并不常见(多数工作的评估提示与学习信号纠缠)。第三,结构化信用分配:五组件单点更新 + 独立开发集验收门 + 持久优化记录,使 54 次被接受的更新各自可归因、可回滚,且外循环维护单一活跃 harness、不做树搜索,与 Gödel Machine 式全局自重写的理想化设定形成对照。第四,领域落地:它是元 harness 优化思想在学术设计(源接地、可编辑、多媒介产物)上的首个完整实例,并配套了任务级评测协议与系统盲测验证。
实验结果
主赛道(100 篇):AutoDesign(Claude Code/Claude 4.8 配置)得 78.32 分,同配置超 Claude Design 7.45 分、超 OpenDesign 8.87 分。mini 集:配 Codex 81.46(原生 75.87)、Claude Code 74.56(原生 69.55)。消融:挂载 DesignHarness 使七个配置全部提升 5.01–19.56 分,平均 54.99→67.39,最弱的 DeepSeek V4 Pro 增益最大(+19.56)。优化轨迹:自主优化从 49.00 到 80.88 平台期,人类引导后达 88.39;全程 7 天、224 个子代理、≥123 次迭代、54 次被接受的更新。成本:LongCat-2.0 55.13 分仅 $0.27/张,Doubao 以 27% 成本拿到 GPT-5.5 88% 的分数,GPT-5.5 最高 81.46。人类盲测:11 名评审 933 份有效判断中,Bradley–Terry 下 AutoDesign 以 64.0% 偏好居四系统之首。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 论文转海报 · PosterBench 主赛道(100 篇) | PosterBench 总分(0-100) | 78.32(DesignHarness + Claude Code + Claude 4.8) | Claude Design 70.87(同配置);OpenDesign 69.45;最强裸编码智能体 Codex 73.37 | 较 Claude Design +7.45,较 OpenDesign +8.87,较最强裸编码智能体 +4.95 |
| 论文转海报 · PosterBench-mini(10 篇) | PosterBench 总分 | 81.46(Codex + GPT-5.5);74.56(Claude Code + Claude 4.8) | 原生 Codex 75.87;原生 Claude Code 69.55 | 分别 +5.59 与 +5.01 |
| 跨 7 组模型-编码智能体配置(mini 集) | 平均 PosterBench 分 | 67.39(挂载 DesignHarness 后) | 54.99(未挂载,七配置均值) | +12.40(约 +12.4%);单配置增益 5.01–19.56,最大为 DeepSeek V4 Pro +19.56 |
| 系统盲测人类偏好(100 篇) | Bradley–Terry 击败随机对手概率 | AutoDesign 64.0%(95% CI 55.2–77.8%) | Claude Code 51.7%;OpenDesign 43.4%;Claude Design 40.9% | 对 Claude Design 头对头 55% 胜 / 25% 平 / 20% 负(n=156) |
| 成本-性能权衡(mini 集,7 配置) | PosterBench 分 / 每张海报 API 成本 | GPT-5.5 81.46 分 @ $10.02;LongCat-2.0 55.13 分 @ $0.27 | —(帕累托前沿内对比) | Doubao Seed 2.1 Pro 以 27% 成本达到 GPT-5.5 88% 的分数(71.83 @ $2.75) |
局限与改进
作者承认的局限:PosterBench 只正式评测学术海报,幻灯、网页、视频产物仅为试点,缺乏各自的评测器与渲染门;优化期评估器 $R_{meta}$ 在自主阶段冻结,其系统性偏差只能靠人工发现并修订;外循环维护单一活跃 harness、不做树搜索,7 天自主优化在 80.88 分进入平台期,需人类引导才能再至 88.39;LongCat-2.0 的 $0.27 低成本部分依赖“缓存命中免费”的定价政策。我的补充观察:主赛道上视觉证据(5.97)与美感(5.59)显著低于忠实性(9.35)等文本维度,说明“选图、用好图”仍是短板;基准与人类偏好相关仅 $r=0.34$,0–3 分档人类一致率 51.9% 接近随机,20 分以内分差几乎无预测力,细排名解读需谨慎;mini 集仅 10 篇,控制赛道统计功效有限;评估依赖商业 VLM 与 OCR/渲染工具链,跨环境复现分数可能漂移;主赛道最佳成绩依赖闭源商业系统,全开源配置仍有 10 分以上差距(LongCat-2.0 仅 55.13)。
独立分析的弱点
弱点一:视觉能力受制于文本主导的修订循环。海报美感与视觉证据得分(5.59/5.97)远低于文本维度,因为 VLM 评论家只能“看图挑错”,缺少风格先验与构图知识。改进方向:引入参考海报风格库作 few-shot 锚点,或在 $R_{meta}$ 中加入专门美学评估模型并纳入外循环优化。弱点二:自主搜索易陷局部最优。80.88 平台期表明 planner 按“最显著失败”贪心选组件会饱和,7 天后仍需人类指点。改进方向:建立基于失败归因、不确定性与期望改进的组件选择器,或并行维护多个 harness 候选做小规模束搜索。弱点三:验收门代价高。每个候选更新都要在训练集+开发集完整 rollout,7 天 224 个子代理的开销只有资源充足团队能承受。改进方向:先在小代理集上早筛,仅对通过初筛的候选跑完整双集评估。弱点四:单媒介验证。所有正式结论限于海报,五组件分解与验收门在其他媒介上是否成立未知。改进方向:先在幻灯这类评测器最易迁移的媒介上复制整套“元优化+协议”流程,验证方法论而非仅复用产物。
未来方向
作者提出的方向:一是构建"多模态进、多模态出"的通用智能体设计系统(Figure 12),统一摄取论文、图表、代码、结构化数据与人类反馈,按传播场景选择海报、幻灯、网页或会议视频输出;二是强调每个新媒介都需要专属的源-产物数据、评估器、渲染校验门与沟通目标,幻灯/网页/视频目前仍是试点;三是元层面两个开放问题——更好的组件选择器(基于失败归因、不确定性、期望改进与组件交互)与评估器进化(必须版本化,并用冻结锚点任务、对抗探针与定期人工审计防止 reward hacking 一个移动靶);四是 harness 优化与模型后训练结合:长时程轨迹与修复结果作为执行时监督,与模型的推理/编码能力形成分工,联合训练时需在共享 held-out 目标上同时评估两层(与 HarnessX 的思路呼应)。基于本文成果可延伸:把五组件分解、验收门与优化记录机制推广到仪表盘、信息图、教学材料等其他长时程产物任务;用强化学习在"更新提议空间"上训练组件选择策略以突破贪心平台期;以及建立跨团队共享的 harness 更新库,让一次元优化的设计先验被多方复用。
复现评估
复现条件较好。代码在 GitHub(Yaxin9Luo/AutoDesign)开源,项目网站与在线演示(designanything.ai)支持交互式局部修订;PosterBench 的 100 篇主赛道与 10 篇 mini 子集、七维权重 $\alpha=(10,10,15,10,20,25,10)$、四类封顶门控与 P0=40 规则在附录 A.2/A.4 详述,人类盲测设计在 A.5 说明。算力上无需训练 GPU,全部为 API 调用:生成一张海报约 $0.27(LongCat-2.0)到 $10.02(GPT-5.5),需 Claude Code、Codex 等编码智能体及对应 MLLM 的 API 权限。完整元优化跑 7 天、224 个子代理、≥123 次迭代,预算有限者可直接复用已发布的 DesignHarness 跳过外循环,只复现推理与评测。难点在工程链条:渲染、OCR、空间审计、VLM 评判与规则验证器的环境依赖可能引入分数漂移;评估器 $R_{meta}$ 由智能体从参考产物构建,不同复现者得到的版本未必一致,建议以官方 checkpoint 为准。
论文图表
长期愿景架构:多模态输入(论文文档、图表、代码与结构化数据、人类反馈)经验证、规划、构建的设计循环,产出学术海报、演示幻灯、网页工件、会议视频等多格式输出及证据系统。
展示 AutoDesign 方法论(而非海报这一个实例)的泛化路线图,说明论文真正想卖的是"元 harness 优化"这一模式本身。
当前 DesignHarness 的试点产物:同一篇论文的输入证据被适配为幻灯、网页和会议视频等不同媒介输出,密度与叙事节奏随媒介改变,但共享证据与内容流。作者明确说明 PosterBench 只正式评测海报,这些媒介仍是试点。
一方面展示已有泛化能力的雏形,另一方面界定了当前评测边界——判断论文结论适用范围时必须参考此图。