WebWorld:以浏览器为世界模型的网页代码自我改进 WebWorld: The Browser as a World Model for Self-Improving Web Code
把浏览器当作网页代码的世界模型,用可执行验证证书取代VLM自我评判来筛选训练监督
前置知识
世界模型(World Model)
指能模拟环境动力学、预测动作所导致状态变化的模型。本文的关键观察是不需要训练世界模型:浏览器本身就是网页代码的确定性、可执行模拟器——给定 HTML 产物和用户动作序列,它能唯一确定地产出新的页面状态。
论文的核心命题是“浏览器即世界模型”,理解这一定位才能明白为何浏览器重执行可以充当 VLM 无法欺骗的验证者,而非又一个渲染评分器。
提出者-评判者鸿沟(Proposer-Judge Gap)
当同一个 VLM 既提出修复又评判修复时,两个判断都发生在截图空间,评判标准退化为“视觉上是否更可信”而非“行为上是否真的工作”,获胜候选只是视觉赢家。更有效的提示词无法弥合这一鸿沟,因为闭合必须来自模型之外产生的证据。
这是论文要解决的结构性缺陷,Figure 1 的审计正测量的就是它;理解它才能理解为何需要引入外部对手方来闭合回路。
类型化谓词(Typed Predicates)
对可观察浏览器状态(DOM 元素、控制台输出、探针结果)的布尔声明,例如“点击 #submit 后出现 #result”。谓词可以被确定性检查,因此每次接受/拒绝都是类型化输入上的确定性函数,可离线精确复现。
交互契约、接受证书、保持集全部构建在谓词之上,是整个方法“可验证、可复现”性质的技术基石。
SFT 与轨迹监督
监督微调(SFT)用 (指令, 目标输出) 对微调模型。本文的监督单位不是最终 HTML 文件,而是经过证书验证的状态转移 $(x_t, c_t, r_t, x_{t+1}, e_t)$,包含触发修复的失败上下文 $o_t$、契约 $r_t$ 与证书证据 $e_t$。
理解 SFT 导出规则(仅 QUALITYSTEP 进入 $D_{SFT}$)才能明白质量棘轮如何把运行探索与训练监督分离开。
质量棘轮(Quality Ratchet)
单调能力记忆机制:已验证谓词集 $P_t$ 只通过认证证据增长($P_{t+1} = P_t \cup \text{VERIFIED}(e_t)$),任何破坏已验证能力的后续补丁会在下一轮被拒绝,使能力只进不退,回路成为棘轮而非装饰性过滤。
它解释了为何更深的认证轨迹拥有更高的单位监督密度(Table 4 深度诊断),也是保持检查消融的理论依据。
研究动机
现有 VLM 驱动的网页代码自我改进存在结构性缺陷:提出修复的模型与评判修复的模型是同一个 VLM,两者都活在截图空间里,于是“看起来更精致”成了获胜标准,而前端缺陷大多是行为性的——提交按钮无响应、游戏忽略键盘输入、一处修复悄悄弄坏先前正常的控件。作者审计发现,最接近朴素批评-重写循环的重实现(保留 VLM 批评与技能路由、只去掉浏览器签发的证书)在 HTMLBench 上相对 Raw 仅提升 0.4 点,不到完整 WebWorld 门控提升(+4.8)的十分之一;更糟的是,去掉证书的 9B 消融中 TC 通过率反而比 Raw 低 3.1 点(31.0 vs 34.1)——移除世界模型 oracle 不只是没有帮助,而是向系统最关心的下游行为维度注入了噪声监督。类型检查、单元测试和截图分数都发现不了这类回归,而更好的提示词也无法弥合这一鸿沟,因为闭环必须来自 VLM 之外产生的证据。
本文的目标是本文的目标是给 VLM 先验找一个它无法欺骗的对手方来闭合自我改进回路:浏览器——一个确定性、可执行的网页行为模拟器,“除了名字以外就是一个世界模型”。具体而言,要设计一套接口,让 VLM 只负责提出假设(结构化批评与候选修复),而接受与否完全由浏览器在契约下的真实重执行来证明:目标能力必须取得可验证进展($\text{TARGET}(r_t, x_{t+1})=1$),且所有先前已验证能力必须保持($p(x_{t+1})=1,\ \forall p \in P_t$)。最终产物是一个由 32,800 条证书认证转移构成的 SFT 语料,在相同主干(Qwen3.5 4B/9B/27B)、相同优化器与训练配方下,其训练效果显著优于等量原始 HTML 监督(Raw),并在交互式 HTML 生成上达到 Kimi-K2.6、GPT-5.4 一级的前沿水平。
与已有工作不同的是,本文的独特切入是视角转换:以往工作把浏览器当作导航环境(WebArena、WebVoyager)或渲染评分 oracle(ArtifactsBench、WebGen-Bench),本文则把它当作网页代码的世界模型,把监督单位从“最终截图或标量偏好”变为“经证书验证的状态转移”。与 MLLM-as-judge 用视觉评委扮演 oracle 不同,视觉评委继承了提出者的模态偏差,其失败模式正是本文审计测量的那一种;本文把 VLM 严格限制在假设生成,把 oracle 角色交给重执行。与 SWE-bench 依赖补丁无法改写的测试套件不同,网页缺陷多为视觉/交互性、缺少现成测试套件,本文用类型化交互契约让浏览器能逐条检查绑定声明。由此假设与证明在构造上分离:没有重执行证据,任何声明都进不了训练池。
核心方法
直觉是:与其让 VLM 自审截图,不如让浏览器重放用户交互来裁决修复。技术路线是把自我改进建模为世界模型验证的状态转移序列:第 $t$ 轮验证器 $V(q, x_t, r_t, \hat{x}_{t+1}, P_t) \to \{\text{REJECT}, \text{ACCEPT}(e_t)\}$ 对照请求 $q$、当前产物 $x_t$、修复契约 $r_t$、候选 $\hat{x}_{t+1}$ 与已验证谓词集 $P_t$ 做判断。运行流程:运行时在真实浏览器中渲染 $x_t$,用固定探针目录(点击、拖拽、键盘、表单填充)采集观察 $o_t$——截图、DOM 与控制台状态、探针结果、动作轨迹;VLM 读取 $o_t$ 发出命名问题族、给出证据的结构化批评;规划器把批评编译为类型化交互契约 $r_t$;路由器选择匹配的修复技能生成候选补丁;浏览器在契约下重执行候选,证书门控接受它或给出类型化拒绝(部分进展、纯视觉、保持风险、重放过期);被拒者留在路由流中但永不进入训练池。整条链路无人工介入,契约规划与证书门控都是类型化输入上的确定性策略。
核心创新是三个耦合工件。交互契约把自由文本批评编译为浏览器可查的绑定声明三元组:目标谓词(修复必须达成什么)、检查序列(锚定稳定选择器、可重放的浏览器动作)、保持集(继承自先前认证轮的谓词),并钉住影响范围使迁移到无关区域的编辑直接违约——这是系统的第一道过滤器,锚定宽泛容器或纯感知描述的批评在编译期即被拒。接受证书是候选成为新基线的唯一凭证:仅在 $\text{TARGET}(r_t, \hat{x}_{t+1})=1$ 且 $p(\hat{x}_{t+1})=1,\ \forall p\in P_t$ 时签发,内含目标重述、diff 摘要、获胜证明级别与证据包(截图、动作轨迹、探针结果)供离线复现。质量棘轮把运行进展与训练质量分离:ITERSTEP(重渲染、探针、部分修复、被拒候选)保持探索,QUALITYSTEP(证书认证的转移)才进入能力记忆 $P_{t+1}=P_t\cup\text{VERIFIED}(e_t)$ 与 SFT 导出。与已有方法的本质区别:假设与证明构造性分离,失败无法污染监督。
方法步骤详情
五步闭环。(1) 证据采集:输入当前产物 $x_t$,运行时在真实浏览器渲染并执行探针目录,输出观察 $o_t$(截图、DOM、控制台、探针结果、动作轨迹)。(2) VLM 批评:输入 $o_t$,输出结构化批评——问题族、证据、受影响区域、成功条件、须保持行为、建议技能;“让它更精致”这类无证据批评无效。(3) 契约编译与修复:规划器把批评编译为契约 $r_t$(目标谓词+检查序列+保持集+影响范围);类型化修复技能在影响范围内生成有界 diff,预执行过滤器剔除无法移动契约的候选。(4) 证书门控:按优先级尝试五级证明——同轨迹重放、能力增益、目标进展、局部视觉证据、静态结构修复,证书只记录获胜级别。(5) 棘轮更新:满足 $\text{TARGET}(r_t,\hat{x}_{t+1})=1$ 且 $p(\hat{x}_{t+1})=1$ 者成为新基线并更新 $P_t$;导出 $D_{SFT}=\{(q,o_t,c_t,r_t,x_{t+1},e_t)\mid \text{QUALITYSTEP}(z_t)=1\}$,训练单元是转移 $(x_t,c_t,r_t,x_{t+1},e_t)$ 而非最终 HTML 文件。
技术新颖性
新颖性有四层。其一,问题重构:不训练世界模型,而是认识到平台已完全指定了网页代码的世界模型(浏览器),真正的开放问题只是让 VLM 先验自主与之交互、并决定哪些交互成为监督的接口。其二,类型化声明:每条批评都归约为对可观察浏览器状态的谓词,系统不存在纯感知判断,每次接受/拒绝都是类型化输入的确定性函数,可离线精确复现。其三,单调能力记忆:$P_t$ 只经认证证据增长,任何破坏已验证元素的后续补丁在下一轮被拒,使回路成为棘轮而非装饰性过滤。其四,证明分级审计:证书记录五级证明中的获胜者(同轨迹重放 42.3%、能力增益 22.5%、目标进展 16.4%、局部视觉 11.5%、静态结构 7.3%),使后续审计可重放而非主观。相比 Self-Refine、Self-Debugging、CodeRL 等把执行/批评信号转为修订循环的工作,本文的区别在于批评必须经浏览器认证才能成为 SFT 数据。
实验结果
主结果(Table 1):同主干、同优化器、同提示模板、单种子(seed-42)下,WebWorld-27B 在 HTMLBench-400 得 52.7 分、TC 通过 43.2%,比 Raw-27B(47.4 分、33.5%)提升 5.3 分与 9.7 个 TC 点;MiniAppBench-Val 达 85.5(Raw 70.6,+14.9);作为基准语境比较超过 Kimi-K2.6(49.8)与 GPT-5.4(49.2)。提升集中在门控约束的行为维度,渲染/视觉/代码波动小于 1 分,且随规模扩大:4B +3.4、9B +4.8、27B +5.3。消融(Table 2/3):NoCertificate 仅 +0.4 且 TC 反降 3.1 点;NoPreserve +1.5;VLM-only +3.5;Score gate +3.6;完整门控 +4.8(40.6 TC、26.1 Func、66.3 MiniApp),部分替代落后 6.6–8.7 个 TC 点。深度诊断(Table 4):深度≥5 的 5,000 条即达全量 32,800 条的 0.5 分内(48.8 vs 49.3),≥8 后平台化。漏斗(Figure 3):约 60K 候选→42,860 认证→32,800 导出。Figure 7:控制台错误 41%→12%、游戏性失败 47%→21%、死控件 38%→15%,保持回归近零。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 交互式 HTML 生成(HTMLBench-400) | 综合分数(TC 通过率) | 52.7 分,TC 通过 43.2%(WebWorld-27B) | Raw-27B SFT 47.4 分 / TC 33.5%;前沿模型 Kimi-K2.6 49.8、GPT-5.4 49.2 | +5.3 分、TC +9.7 点;TC 通过超过两个前沿模型 |
| 小程序生成迁移(MiniAppBench-Val) | 平均分 | 85.5(WebWorld-27B) | Raw-27B 70.6;Kimi-K2.6 85.5、GPT-5.4 87.7 | +14.9 分;匹配 Kimi-K2.6、接近 GPT-5.4 |
| 9B 证书机制消融(HTMLBench-400) | 相对 Raw-9B 的分数提升 | 完整 WebWorld 门控 +4.8(49.3 vs 44.5) | NoCertificate 消融 +0.4(TC 通过反降 3.1 点至 31.0) | 完整门控提升是部分替代规则的 1.3–12 倍,TC 领先 6.6–8.7 点 |
| 深度诊断(等规模 5K 训练) | HTMLBench 分数 | 深度≥5 子集 48.8 | 深度≥1 子集 43.4;全量 32,800 条 49.3 | 5K 深度样本达到全量训练 0.5 分以内,单位样本监督密度显著更高 |
局限与改进
作者承认:目前只处理单文件交互式 HTML 产物,多文件或框架化项目会引入依赖重放、项目组织与 agent 脚手架等部署变量;假设-证明分离依赖浏览器是对相关属性的忠实 oracle,真正的感知性缺陷(审美品味、品牌识别、可访问性细节)没有可执行证书,只能退回 VLM 代理并继承其噪声;验证器降低假阳性但不能让批评万无一失——错误批评仍会浪费修复预算;动态应用仍需确定性重放。我的补充观察:其一,HTMLBench-400 仅 400 道题、6,000 个确定性测试用例,且与训练数据同为静态单文件场景,登录、异步加载、跨页状态等真实网站特征未验证;其二,每条候选都要完整浏览器重执行,论文未报告墙钟时间、浏览器会话与总算力成本;其三,五级证明中的局部视觉与静态结构两级仍含视觉/结构判断成分,可能残留提出者偏差;其四,前沿模型对比是基准语境而非受控同配方比较,跨家族结论需谨慎解读。
独立分析的弱点
弱点一:浏览器重执行是吞吐瓶颈——约 6 万候选各需至少一次完整渲染加探针运行,认证 42,860 条的算力与基础设施门槛高。改进:用轻量 DOM 模拟器预筛、只对临界候选调用完整浏览器,或引入页面快照与并行 headless 集群。弱点二:契约编译可能系统性丢弃纯视觉缺陷——编译期即拒收无截图可观察后果的 DOM 谓词与宽泛锚定批评,意味着审美类问题无法进入监督。改进:建立受约束的视觉谓词库(区域差分、布局不变量)并为其配套局部视觉证明级别。弱点三:保持集 $P_t$ 单调增长使长轨迹越来越难接受新修复,一条误报谓词可能永久阻塞后续候选。改进:谓词置信度评分与定期重验证,允许更强证据降级过时谓词。弱点四:每个 SFT 结果都是单种子(seed-42)运行,5 分量级的差异未附统计显著性检验。改进:多种子重复并报告置信区间。弱点五:证明级别优先级是人工设定的固定顺序,低效路径会浪费重执行预算。改进:训练证明级别预测器,按契约类型自适应选择尝试顺序。
未来方向
作者提出的方向:扩展到多文件与框架化项目(处理依赖重放、项目组织与 agent 脚手架);把框架推广到感知属性的可执行代理(可访问性规则、品牌一致性检查);为动态应用实现确定性重放。基于成果可延伸:其一,认证转移天然构成 RL 奖励——目标进展与保持检验可组合成稠密奖励信号,把当前 SFT 升级为在线强化学习;其二,把探针目录与契约编译接入真实网站爬取,形成持续自我改进的生产管线,并结合论文提到的安全扫描(私有凭证、外部端点、恶意脚本检测)做部署前审查;其三,扩展到 canvas/WebGL 游戏、WebAssembly 等更复杂运行时行为的世界模型验证;其四,训练批评质量预测模型预筛批评,降低错误批评的预算浪费;其五,把五级证明做成可学习组件,按契约类型自适应选择证明路径。
复现评估
复现难度中等偏高。论文未提供开源代码或数据集链接(正文与致谢均未提及发布计划);MiniAppBench 仅发布了验证集划分,HTMLBench-400 来自并发工作 HTMLCure(Wu et al., 2026b),需另行获取。完整复现需要:Qwen3.5 4B/9B/27B 主干及至少五次等预算全量 SFT(三条主规模 + 四条 9B 消融,每格单种子);一个可控的浏览器执行运行时(固定探针目录、DOM/控制台采集、锚定稳定选择器的动作重放);VLM 批评提示模板与技能/补丁通道清单(附录 G 列出清单但正文未给实现细节)。有利因素:方法不含任何训练出来的世界模型,接受/拒绝是类型化输入的确定性函数,证书打包了可离线复现的证据(截图、动作轨迹、探针结果),验证器行为理论上可精确复现。不利因素:32,800 条数据涉及大规模浏览器集群与多次 VLM 调用,成本远超中小团队预算;“方法不依赖具体探针/技能清单”的声明也意味着复现者需自行填充大量工程细节。
论文图表
概念对比图:VLM-only 闭环中 VLM 观察截图、发出批评、生成候选补丁(app.js),GUI 执行层执行点击/键盘/观察;当 VLM 以截图为准判断时,“看起来改进了”的编辑在浏览器重执行下被判为 false(失败),右侧展示加入 GUI 验证(任务可行、UI 完好、无报错)后的 WebWorld 回路与轨迹记忆。
一图点明全文动机:自我评判的结构性缺陷(提出者-评判者鸿沟),以及引入浏览器对手方的必要性,是理解问题定义的起点。