← 返回 2026-08-14

AutoDesign:面向长时程智能体设计的元 Harness 优化框架 AutoDesign: Meta-Harness Optimization for Long-Horizon Agentic Design

Yaxin Luo, Haobin Jiang, Jialv Zou, Xu Huang, Wenhao Yan, Haodong Li, Zhengrong Yue, Jing Li, Xiaofu Chen, Xiaohan Zhao, Jiacheng Liu, Jiacheng Cui, Zhiqiang Shen, Xiaotong Li 📅 2026-08-13 👍 50 2026-08-19 18:30
代码智能体 元Harness优化 多模态设计 智能体自进化 论文转海报 评测基准

让智能体递归优化自身设计Harness,40分钟自动产出人类偏好最高的学术海报

前置知识

Harness(模型脚手架)

围住固定模型搭建的整套运行系统,包括提示词、工具与技能、执行运行时、编排控制(循环次数、候选选择、回退)以及评估反馈模块,负责把模型的基础能力转化为稳定可用的产品行为。模型权重不变,仅修改 harness 就能显著改变系统的实际表现。

本文的核心主张是把设计 harness 本身当作可优化的对象,与模型后训练严格区分。不理解 harness 与模型权重的分层,就无法理解论文的优化目标 $H^\star=\arg\max_H J(H)$ 到底在优化什么。

递归自我改进(Recursive Self-Improvement)

系统利用自己运行产生的轨迹、评分与失败记录来改进自身(而非单个输出)的机制,形成"运行→评估→修改自身→再运行"的闭环。概念上可追溯到 Schmidhuber 的自指学习与 Gödel Machine,本文是其经验主义版本:用实测收益而非证明来决定是否接受自我修改。

AutoDesign 的外循环就是一个递归自改进过程:7 天里 224 个子代理、至少 123 次迭代、54 次被接受的 harness 更新全部来自运行证据,这是理解论文动机与方法的关键。

Rollout 与验收门(Acceptance Gate)

Rollout 指让当前系统在任务集上完整执行一遍并收集产物与评分;验收门则规定候选更新只有在训练集上性能提升、且在独立开发集上不退化时才被接受。开发集分数从不暴露给优化器,从机制上防止 harness 对训练任务过拟合。

这是外循环中唯一决定 harness 是否更新的机制,理解它才能理解为什么 AutoDesign 的改进是单调、可归因且可信的,这也是它与无门槛自我修改方法(如某些 Gödel Machine 变体)的本质区别。

Bradley–Terry 模型

经典的成对比较统计模型:为每个系统估计潜在强度 $\beta_i$,用 $\Pr(i\succ j)=\exp(\beta_i)/(\exp(\beta_i)+\exp(\beta_j))$ 把成对胜负记录换算成"击败随机抽取对手的概率",平局各计半胜,跳过不计。常用于人类偏好评估与 RLHF 奖励建模。

论文的系统盲测用该模型汇总 11 位评审 933 份有效判断,得到 AutoDesign 64.0% 的偏好估计(95% CI 55.2–77.8%),是自动评测结论可信度的独立人类验证。

VLM 视觉评论家与规则验证器

规则验证器用确定性脚本做阻塞式硬检查(资源缺失、出处链接断裂、文本溢出重叠、排版约束违反),失败即拦截;VLM 评论家把产物渲染成 PNG 后,用视觉语言模型从设计契约、布局、可读性、美感等角度给出可定位的修复建议。两者反馈合并成修复信号回传给设计者。

DesignHarness 的内循环完全建立在这两类反馈之上,是系统能做"局部化修订"而非整体重新生成的技术基础,也是 MLLM 相对纯文本 LLM 的额外修复信号来源。

论文转海报(Paper-to-Poster)

把几十页图文并茂的学术论文压缩成单页信息密集、视觉连贯且忠实原文的学术海报,要求同时做到证据保留(可溯源)、密集沟通(信息不丢)和渲染可用(导出后可直接用、可继续编辑),是典型的长时程多模态设计任务。

它是本文实例化并评测 AutoDesign 的具体任务,PosterBench 的七维评分与四类封顶门控全部为此设计;理解任务的三个约束才能读懂七维指标为何如此设置。

研究动机

把论文、报告等多模态来源变成海报、幻灯、网页等人类可用的成品,是典型的长时程设计任务,但现有系统大多停留在"静态流程"层面。生成—批评—修订式方法(如 Self-Refine)把每次人类反馈当作一次性信号,用完即弃;Reflexion、Voyager、ExpeL 等虽能跨任务积累反思或技能,却不会更新"生产产物的系统本身",无法像人类设计师那样从每次成败中沉淀可复用的设计知识。落到论文转海报这一具体任务上,手工流水线表现很差:在本文 100 篇论文的统一评测中,Paper2Poster 仅 44.61 分、Any2Poster 49.09 分、PosterGen 56.71 分,即使最强的裸编码智能体 Codex 也只有 73.37 分,且信息密度、视觉证据等维度普遍低于 6 分(10 分制)。而高质量海报的人工制作动辄数小时,常见缺陷包括反馈稀疏、阅读流断裂、版面填充不足。如何把多模态证据、结构约束、反馈与人类偏好转化为系统持久的、与设计先验对齐的生产能力,仍是悬而未决的问题。

本文的目标是本文目标有三层。第一,提出 AutoDesign 框架:把"与人类设计先验对齐的多模态设计生成"形式化为元 harness 优化问题——模型权重全程固定,由元级优化器引导代码智能体根据 rollout 反馈递归改进围住模型的设计 harness,使系统从每次成功与失败中持续积累持久的设计先验。第二,产出可执行的论文转海报系统 DesignHarness:自主摄取论文、生成可编辑的 HTML 海报、在规则验证器与 VLM 视觉评论家反馈下做局部化修订并定稿,达到可直接使用的会议海报质量。第三,建立 PosterBench 评测协议(100 篇五学科主赛道 + 10 篇 mini 子集、七维评分、四类封顶门控),并验证实用性:单次海报生成在 40 分钟内完成 253 次工具调用与 11 轮编辑、成本低于 3 美元,同时在系统盲测人类评估中获得最高偏好。

与已有工作不同的是,本文的独特切入在于"优化的对象":既不优化单个产物(Self-Refine 式响应级修订),也不微调模型参数,而是优化围住固定模型的整个运行系统。与 TextGrad、DSPy、GEPA 优化组件或声明式管线,以及 STOP、GPTSwarm、ADAS、AFlow 搜索代码或图表示工作流的做法不同,AutoDesign 从 rollout 轨迹与评估结果中归纳反复出现的失败模式,直接更新可执行 harness 的源码,把人类设计的参考产物、渲染诊断、评估器反馈统一转化为持久设计先验。方法上还有两个关键区隔:其一,优化期评估器 $R_{meta}$ 与最终评测协议 PosterBench 严格分离,且评估器在自主优化期间冻结,防止 reward hacking;其二,每次更新被限制在五个功能组件之一,并必须通过独立开发集验收门,保证信用分配可解释、改进单调可信。

核心方法

直觉上,AutoDesign 模仿人类设计师的复盘习惯:项目结束后不是只改这一稿,而是总结“为什么总在同样的地方翻车”,把结论固化进下一版生产流程。技术上它由两个嵌套循环构成。设计 harness $H$ 定义为 $y \sim H(\pi_\theta, x, c)$,其中 $\pi_\theta$ 是固定的 LLM/MLLM,$x$ 是多模态源,$c$ 是目标媒介与用户约束;系统质量为 $J(H)=\mathbb{E}[R_{meta}(y,x,c)]$,优化目标是 $H^\star=\arg\max_H J(H)$。内循环在固定 $H$ 下让设计者与评论家交替:$y_k=M_{design}(y_{k-1},f_{k-1};x,c)$,$f_k=M_{critic}(y_k;x,c)$,反复生成—评估—修订并记录执行轨迹 $\tau$。外循环跨任务运行:每次迭代做 rollout、用七维评估器打分、由优化器 $P$ 提议 $H'_{t+1}=P(H_t,\tau_t,s_t,\mathcal{L})$,再经验收门决定接受与否。

核心创新是“把设计能力持久化到 harness 中”的递归自改进机制。已有系统要么在响应层面修订单个输出,要么在固定流程内积累经验,都不会改写生产系统本身;AutoDesign 的外循环把每轮 rollout 的轨迹、评分、渲染诊断和优化记录 $\mathcal{L}$ 汇总为结构化的反复失败证据,驱动一个代码智能体提出并实施 harness 更新。更新被有意限制为“有界”:一次只允许修改五个功能组件(Context & Memory、Tools & Specs、Execution Runtime、Orchestration、Evaluation & Feedback)中的一个,使每次性能涨跌都能归因到单一干预。$\mathcal{L}$ 跨迭代持久保存 harness 快照、更新计划、代码改动与验收决定,支持比较、复现与回滚;验收门要求训练集提升且开发集不退化,开发集分数从不对优化器暴露,防止过拟合。可选人类引导通道 $g_t$ 注入 planner($H'_{t+1}=P(H_t,\tau_t,s_t,\mathcal{L},g_t)$),用于跳出自主搜索的局部最优。

方法步骤详情

Algorithm 1 的流程:先用人类标注的参考产物构建并冻结七维评估器 $R_{meta}$。每次迭代:(1) 当前 harness 在训练集上 rollout,收集产物与轨迹;(2) 评估打分;(3) 优化器 $P$ 派并行子代理归纳反复失败证据,制定更新计划并实施代码编辑,得候选 $H'_{t+1}$;(4) 候选在训练集与开发集上重评,仅当 $J_{train}$ 提升且 $J_{dev}$ 不降才接受;(5) 迭代记录与 checkpoint 追加进优化记录 $\mathcal{L}$。优化得到的 DesignHarness 分四阶段:摄取——提取元数据、大纲、关键段落与带出处的图表素材,构建全程内容简报;生成——编码智能体维护可编辑 HTML,修订即局部代码编辑;验证——规则阻塞检查(资产安全、出处链接、溢出重叠、排版约束)未过则交 VLM 评论家评审;定稿——最多 $K=12$ 次尝试,通过后做数学排版与资源内联输出成品;耗尽则按回退机制选最佳候选。

技术新颖性

技术新颖性可从四个坐标定位。第一,更新单元:Self-Refine 更新响应,Reflexion/Voyager/ExpeL 更新经验记忆,TextGrad/DSPy/GEPA 更新提示或声明式组件,STOP/GPTSwarm/ADAS/AFlow 搜索工作流图,而 AutoDesign 更新的是完整可执行 harness 的源码,属系统级进化。第二,学习信号与最终评测严格分离:优化用 $R_{meta}$,最终用冻结的 PosterBench,避免了"自己出题自己判"的循环论证,这在同类自改进智能体工作中并不常见(多数工作的评估提示与学习信号纠缠)。第三,结构化信用分配:五组件单点更新 + 独立开发集验收门 + 持久优化记录,使 54 次被接受的更新各自可归因、可回滚,且外循环维护单一活跃 harness、不做树搜索,与 Gödel Machine 式全局自重写的理想化设定形成对照。第四,领域落地:它是元 harness 优化思想在学术设计(源接地、可编辑、多媒介产物)上的首个完整实例,并配套了任务级评测协议与系统盲测验证。

Overview of AutoDesign. The design harness iteratively generates and revises an artifact using critic feedback, thereby constituting the inner loop. The outer loop improves the design harness.
Figure 3: Overview of AutoDesign. The design harness iteratively generates and revises an artifact using critic feedback, thereby constituting the inner loop. The outer loop improves the design harness.
The inner and outer loops of the AutoDesign Framework.
Figure 4: The inner and outer loops of the AutoDesign Framework.
AutoDesign outer loop.
Figure 5: AutoDesign outer loop.
Overview of DesignHarness, optimized for human-facing artifact generation.
Figure 6: Overview of DesignHarness, optimized for human-facing artifact generation.

实验结果

主赛道(100 篇):AutoDesign(Claude Code/Claude 4.8 配置)得 78.32 分,同配置超 Claude Design 7.45 分、超 OpenDesign 8.87 分。mini 集:配 Codex 81.46(原生 75.87)、Claude Code 74.56(原生 69.55)。消融:挂载 DesignHarness 使七个配置全部提升 5.01–19.56 分,平均 54.99→67.39,最弱的 DeepSeek V4 Pro 增益最大(+19.56)。优化轨迹:自主优化从 49.00 到 80.88 平台期,人类引导后达 88.39;全程 7 天、224 个子代理、≥123 次迭代、54 次被接受的更新。成本:LongCat-2.0 55.13 分仅 $0.27/张,Doubao 以 27% 成本拿到 GPT-5.5 88% 的分数,GPT-5.5 最高 81.46。人类盲测:11 名评审 933 份有效判断中,Bradley–Terry 下 AutoDesign 以 64.0% 偏好居四系统之首。

PosterBench Score and dimension scores for the PosterBench Main Track on the 100-paper evaluation set.
Table 1: PosterBench Score and dimension scores for the PosterBench Main Track on the 100-paper evaluation set.
PosterBench Score and dimension scores for the PosterBench-mini Main Track on the original 10-paper subset.
Table 2: PosterBench Score and dimension scores for the PosterBench-mini Main Track on the original 10-paper subset.
Controlled track analysis on PosterBench-mini: (a) varies the design harness, (b) varies the coding harness, (c) varies the model.
Table 3: Controlled track analysis on PosterBench-mini: (a) varies the design harness, (b) varies the coding harness, (c) varies the model.
Effect of attaching DesignHarness while keeping the model and coding agent fixed.
Table 4: Effect of attaching DesignHarness while keeping the model and coding agent fixed.
AutoDesign progressively improves the design harness and the quality of the artifacts.
Figure 1: AutoDesign progressively improves the design harness and the quality of the artifacts.
AutoDesign for AutoDesign. A poster generated by AutoDesign for its own paper.
Figure 2: AutoDesign for AutoDesign. A poster generated by AutoDesign for its own paper.
PosterBench evaluation protocol.
Figure 7: PosterBench evaluation protocol.
Cost–performance trade-off across seven AutoDesign model configurations on PosterBench-mini.
Figure 8: Cost–performance trade-off across seven AutoDesign model configurations on PosterBench-mini.
System-blind human evaluation.
Figure 9: System-blind human evaluation.
PosterBench Score alignment with system-blind human preference.
Figure 10: PosterBench Score alignment with system-blind human preference.
Qualitative trajectory of a poster generation run.
Figure 11: Qualitative trajectory of a poster generation run.
查看结构化数据
任务指标本文基线提升
论文转海报 · PosterBench 主赛道(100 篇) PosterBench 总分(0-100) 78.32(DesignHarness + Claude Code + Claude 4.8) Claude Design 70.87(同配置);OpenDesign 69.45;最强裸编码智能体 Codex 73.37 较 Claude Design +7.45,较 OpenDesign +8.87,较最强裸编码智能体 +4.95
论文转海报 · PosterBench-mini(10 篇) PosterBench 总分 81.46(Codex + GPT-5.5);74.56(Claude Code + Claude 4.8) 原生 Codex 75.87;原生 Claude Code 69.55 分别 +5.59 与 +5.01
跨 7 组模型-编码智能体配置(mini 集) 平均 PosterBench 分 67.39(挂载 DesignHarness 后) 54.99(未挂载,七配置均值) +12.40(约 +12.4%);单配置增益 5.01–19.56,最大为 DeepSeek V4 Pro +19.56
系统盲测人类偏好(100 篇) Bradley–Terry 击败随机对手概率 AutoDesign 64.0%(95% CI 55.2–77.8%) Claude Code 51.7%;OpenDesign 43.4%;Claude Design 40.9% 对 Claude Design 头对头 55% 胜 / 25% 平 / 20% 负(n=156)
成本-性能权衡(mini 集,7 配置) PosterBench 分 / 每张海报 API 成本 GPT-5.5 81.46 分 @ $10.02;LongCat-2.0 55.13 分 @ $0.27 —(帕累托前沿内对比) Doubao Seed 2.1 Pro 以 27% 成本达到 GPT-5.5 88% 的分数(71.83 @ $2.75)

局限与改进

作者承认的局限:PosterBench 只正式评测学术海报,幻灯、网页、视频产物仅为试点,缺乏各自的评测器与渲染门;优化期评估器 $R_{meta}$ 在自主阶段冻结,其系统性偏差只能靠人工发现并修订;外循环维护单一活跃 harness、不做树搜索,7 天自主优化在 80.88 分进入平台期,需人类引导才能再至 88.39;LongCat-2.0 的 $0.27 低成本部分依赖“缓存命中免费”的定价政策。我的补充观察:主赛道上视觉证据(5.97)与美感(5.59)显著低于忠实性(9.35)等文本维度,说明“选图、用好图”仍是短板;基准与人类偏好相关仅 $r=0.34$,0–3 分档人类一致率 51.9% 接近随机,20 分以内分差几乎无预测力,细排名解读需谨慎;mini 集仅 10 篇,控制赛道统计功效有限;评估依赖商业 VLM 与 OCR/渲染工具链,跨环境复现分数可能漂移;主赛道最佳成绩依赖闭源商业系统,全开源配置仍有 10 分以上差距(LongCat-2.0 仅 55.13)。

独立分析的弱点

弱点一:视觉能力受制于文本主导的修订循环。海报美感与视觉证据得分(5.59/5.97)远低于文本维度,因为 VLM 评论家只能“看图挑错”,缺少风格先验与构图知识。改进方向:引入参考海报风格库作 few-shot 锚点,或在 $R_{meta}$ 中加入专门美学评估模型并纳入外循环优化。弱点二:自主搜索易陷局部最优。80.88 平台期表明 planner 按“最显著失败”贪心选组件会饱和,7 天后仍需人类指点。改进方向:建立基于失败归因、不确定性与期望改进的组件选择器,或并行维护多个 harness 候选做小规模束搜索。弱点三:验收门代价高。每个候选更新都要在训练集+开发集完整 rollout,7 天 224 个子代理的开销只有资源充足团队能承受。改进方向:先在小代理集上早筛,仅对通过初筛的候选跑完整双集评估。弱点四:单媒介验证。所有正式结论限于海报,五组件分解与验收门在其他媒介上是否成立未知。改进方向:先在幻灯这类评测器最易迁移的媒介上复制整套“元优化+协议”流程,验证方法论而非仅复用产物。

未来方向

作者提出的方向:一是构建"多模态进、多模态出"的通用智能体设计系统(Figure 12),统一摄取论文、图表、代码、结构化数据与人类反馈,按传播场景选择海报、幻灯、网页或会议视频输出;二是强调每个新媒介都需要专属的源-产物数据、评估器、渲染校验门与沟通目标,幻灯/网页/视频目前仍是试点;三是元层面两个开放问题——更好的组件选择器(基于失败归因、不确定性、期望改进与组件交互)与评估器进化(必须版本化,并用冻结锚点任务、对抗探针与定期人工审计防止 reward hacking 一个移动靶);四是 harness 优化与模型后训练结合:长时程轨迹与修复结果作为执行时监督,与模型的推理/编码能力形成分工,联合训练时需在共享 held-out 目标上同时评估两层(与 HarnessX 的思路呼应)。基于本文成果可延伸:把五组件分解、验收门与优化记录机制推广到仪表盘、信息图、教学材料等其他长时程产物任务;用强化学习在"更新提议空间"上训练组件选择策略以突破贪心平台期;以及建立跨团队共享的 harness 更新库,让一次元优化的设计先验被多方复用。

复现评估

复现条件较好。代码在 GitHub(Yaxin9Luo/AutoDesign)开源,项目网站与在线演示(designanything.ai)支持交互式局部修订;PosterBench 的 100 篇主赛道与 10 篇 mini 子集、七维权重 $\alpha=(10,10,15,10,20,25,10)$、四类封顶门控与 P0=40 规则在附录 A.2/A.4 详述,人类盲测设计在 A.5 说明。算力上无需训练 GPU,全部为 API 调用:生成一张海报约 $0.27(LongCat-2.0)到 $10.02(GPT-5.5),需 Claude Code、Codex 等编码智能体及对应 MLLM 的 API 权限。完整元优化跑 7 天、224 个子代理、≥123 次迭代,预算有限者可直接复用已发布的 DesignHarness 跳过外循环,只复现推理与评测。难点在工程链条:渲染、OCR、空间审计、VLM 评判与规则验证器的环境依赖可能引入分数漂移;评估器 $R_{meta}$ 由智能体从参考产物构建,不同复现者得到的版本未必一致,建议以官方 checkpoint 为准。