超越成功率:攻防安全智能体的成本感知评估 Beyond Success Rate: Cost-Aware Evaluation of Offensive and Defensive Security Agents
以成本为统一坐标轴对比攻防两类安全智能体,揭示截然不同的缩放规律。
前置知识
CTF(夺旗赛)
Capture The Flag 是网络安全竞赛的一种形式,参赛者需通过漏洞利用、逆向工程、密码学、取证、Web 攻击等手段攻破沙箱化挑战,找到隐藏的标志性字符串(如 HTB{...}、gctf{...})。论文中 Cybench 提供了 39 个来自 HackTheBox、Glacier、SEKAI、HKCert 等竞赛的专业级 CTF 任务,每题最多提交 3 次,并以大小写不敏感子串匹配判定答案正确性。
CTF 是衡量攻击型智能体能力的标准载体,理解其提交与计分机制才能看懂论文中 Cybench 的成功率和求解当量指标。
SOC 与 BOTS
SOC(Security Operations Center,安全运营中心)负责实时监控、检测、分析和响应安全事件。BOTS(Boss of the SOC)是 Splunk 发布的公开安全遥测与竞赛数据集,要求分析师发现日志 schema、编写修订 SPL 查询、检查事件并决定何时进行外部富化。论文使用 BOTS v1,包含预热题加 31 道评分题(满分 10,300 官方竞赛积分),覆盖 Po1s0n1vy 网页篡改和 Wayne Enterprises 的 Cerber 勒索软件调查,采用顺序点数制,后续问题依赖前置发现。
BOTS v1 是论文防御侧的核心基准,理解其点数计分、提示扣分和顺序调查结构是解读成本每千分等指标的前提。
ReAct 智能体与自动压缩
ReAct(Reasoning+Acting)是智能体在推理与工具调用之间交替的范式,模型先生成思考再选择工具执行。论文使用 Inspect 评估框架运行 ReAct 风格智能体,并在上下文达到模型窗口 90% 时触发自动压缩(auto-compaction),优先调用提供商原生压缩,否则回退到摘要式压缩。这样可以在长任务中持续运行而不丢失关键证据。
这是论文所有实验的统一执行外壳,攻击侧和防御侧之间仅切换工具集,理解它能明白结果可比性的来源。
测试时计算预算与成本封顶
测试时计算(test-time compute)指模型在推理阶段消耗的资源,包括推理 token、工具调用和遥测查询。论文通过 Inspect 的 budget 选项为每个样本设定成本上限(如 $\$2.10$),一旦累计花费超过上限就中止该样本并计为失败。关键创新是回溯预算重放:对已完成的轨迹施加更低的 $\$0.80$ 上限重新计分,从而在同一模型、同一轨迹上做配对比较,避免跨模型或跨轨迹的混淆。
成本封顶和回溯重放是论文衡量成本-成功权衡的核心方法,所有缩放结论都建立在此之上。
基准污染与去污染控制
基准污染指公开测试集可能与模型训练数据重叠,或能从模型行为中部分恢复,从而虚高表面能力。论文针对 BOTS v1(公开且年代久远)运行单轮无工具探测:不提供 Splunk、Web、bash 等任何工具,仅凭问题文本、可选官方前置问答和先验知识作答。结果显示部分模型无工具也能拿到 50% 以上分数,说明绝对成绩需要谨慎解读。
论文明确将无工具探测作为污染控制而非主要能力结果,这是理解 BOTS 绝对分数为何不能当干净排行榜的关键。
研究动机
现有安全智能体评估普遍在宽松的推理预算下衡量峰值攻击能力,例如近期 Claude Mythos Preview 评估将 CTF 套件、多步靶场和漏洞发现/利用评估与百万 token 预算结合。这类测量虽能追踪攻击者可用能力,但并不完整:在实际运营安全场景中,每一步推理、每一次工具调用、每一轮遥测查询和富化请求都在消耗预算,而安全运营中心(SOC)需要智能体在预算约束下导航遥测、选择查询、判断富化是否值得付费并返回分析师级别的答案。当前基准把两类经常被混为一谈的成本——攻击侧的测试时推理与命令执行,防御侧面向分析师的资源(Splunk 查询、事件检查、Web 搜索、WHOIS 历史等富化调用)——折叠在一起,且只报告最佳情况下的成功率,无法反映生产系统的真实可用性。
本文的目标是本文的目标是把成本确立为对比攻防两类安全智能体的统一坐标轴。一个固定预算把成功率转化为运营问题:模型每花费一美元推理与工具开销能买到多少能力?具体而言,作者希望在攻击侧 Cybench 挑战和防御侧 Splunk BOTS v1 调查挑战上,刻画一系列运营点(模型、任务族、成本上限、工具集、评分规则),并做配对的预算余量分析,展示增加每样本花费在何处改变观测分数。同时引入面向 SOC 调查的模型 token 加定价工具成本核算(含每 1,000 BOTS 积分的成本),并以无工具控制实验证明在解读绝对分数前必须做去污染检查,最终论证安全智能体基准应同时衡量经济效率与运营适配性。
与已有工作不同的是,本文的独特切入角度在于三方面。其一,用同一套智能体评估框架(Inspect)和同一组共享模型集,对攻击与防御两类工作负载做成本-成功对比,而非各自独立排行榜。其二,首创回溯预算重放:对同一模型、同一基准、同一已完成轨迹施加更低的 $\$0.80$ 上限重新计分,从而精确分离预算效应,避免比较不同模型或不同轨迹造成的混淆。其三,提出模型 token 与定价外部工具相结合的 SOC 成本核算,并系统给出每 1,000 BOTS 积分的美元成本,还通过无工具去污染控制揭示模型相关的直接答案恢复现象——这种成本-工作流双重视角是以往只看峰值成功率或只看工具调用次数的评估所缺失的。
核心方法
整体思路是先把成本而非成功率确立为评估的公共轴,再把攻击与防御两类任务放进同一框架做可比测量。技术路线上,作者使用 Inspect 评估框架运行 ReAct 风格智能体,并在上下文达 90% 时自动压缩;攻击侧与防御侧之间只切换工具集,其余保持一致。每个样本通过 Inspect 的 budget 选项设定成本上限,超支即中止并计失败,由此推导出在不同成本/ token 上限下的成功率,以及每解一题的美元成本。攻击侧用 Cybench hard 变体(39 个挑战,仅 bash、python、submit 三种零成本工具,最多 3 次提交,三个 epoch 取均值),防御侧自建 BOTS v1 的 Inspect 实现(31 道评分题,满分 10,300 官方积分,提供 Splunk 发现/搜索/事件检查及有限的 VirusTotal 3 次、WhoisXMLAPI 3 次、Brave 搜索 5 次等富化工具),对 BOTS 成本在模型 token 基础上叠加定价外部工具开销。
核心创新点是用成本作为公共轴并辅以配对回溯预算重放,与已有方法的本质区别在于:传统评估给宽松预算只报峰值成功率,跨模型比较时无法分离能力差异与预算差异;本文则对同一已完成的轨迹施加更低的 $\$0.80$ 上限重新计分,从而在控制模型与轨迹的前提下干净地测量额外预算带来的边际收益,并用配对自助法(paired bootstrap)给出 95% 置信区间。此外,作者把成本分解为推理花费与定价工具花费(Brave 搜索 $\$0.005$/次、WhoisXMLAPI 历史预览 $\$0.0258$/次、历史购买 $\$1.29$/次,VirusTotal/DNS/Splunk 工具视为零边际成本),并引入拒绝计数(Cybench 中拒绝算失败,BOTS 中拒绝作次级上下文不影响积分),以及无工具去污染控制——这一套组合拳让攻防两类任务的成本-成功权衡首次在统一坐标系下变得可比。
方法步骤详情
第一步,用 Inspect 评估框架组织实验,配置 ReAct 风格智能体并在上下文达 90% 时触发自动压缩,攻击与防御之间仅切换工具集。第二步,攻击侧采用 Cybench hard 变体的 39 个挑战,仅暴露 bash、python、submit 三种零成本工具,最多 3 次提交,按三个 epoch 取均值。第三步,防御侧自建 BOTS v1 的 Inspect 实现,31 道评分题覆盖 10,300 官方积分,提供 Splunk 发现/搜索/事件钻取及有限的 VirusTotal(3 次)、WhoisXMLAPI(3 次)、Brave 搜索(5 次)与 bash/python,对 23 题提供官方前置案情,主指标为 bots_points,次指标为二值准确率。第四步,按 Table 1 定价对每样本设成本上限(多为 $\$2.10$),超支中止计失败。第五步,把已完成轨迹在 $\$0.80$ 上限下回溯重放计分并算配对自助区间。第六步,样本-epoch 层级用文本检测加 content_filter 计数拒绝。第七步,对 BOTS v1 跑单轮无工具探测做去污染控制。
技术新颖性
技术新颖性体现在三点。首先是回溯预算重放与配对自助法,使预算敏感性分析摆脱了跨模型/跨轨迹混淆,Claude Opus 4.8 在 Cybench 获得 $+18.8$ 个百分点的正向区间而 DeepSeek v4 Pro 因前瞻上限过低几乎无重放空间,这种区分是全新的。其次是把定价外部富化工具纳入 SOC 成本核算,Brave 搜索 $\$0.005$/次、WhoisXMLAPI 历史购买 $\$1.29$/次等定价让每 1,000 BOTS 积分的美元成本成为可比指标,即使 WhoisXMLAPI 响应被主机端缓存也仍按其美元价值计入以反映预期工具使用。第三是模型相关的无工具答案恢复现象的揭示:GPT-5.6 Sol 和 Claude Opus 4.8 仅凭问题与前置问答无工具就能拿到 50.5% 与 74.8%,而 Luna/Terra/Fable 仅 13%–18%,这种巨大离散既论证了去污染控制的必要性,也说明无工具探测不能当作统一的难度校正。
实验结果
核心发现是攻击与防御呈截然不同的缩放规律。攻击侧 Cybench:GPT-5.5 最强达 94.1% 成功率、$\$1.16$/解;DeepSeek v4 Flash 在 $\$2.10$ 达 86.4%、回溯到 $\$0.80$ 仅 76.1%,清晰展示成本缩放;Claude Fable 5 拒绝全部 117 个样本-epoch 得 0%、GPT-5.6 Sol 拒绝 106/117 仅 9.4%,策略性拒绝主导成绩。防御侧 BOTS v1:Claude Opus 4.8 以 93.9% 居首且成本效率最佳 $\$2.98$/千分,仅 603 次工具调用;DeepSeek v4 Flash 翻倍预算从 $\$2.10$ 到 $\$4.20$,分数仅 73.0%→73.9%,工具调用却 4,450→4,938。配对重放证实 Cybench 上 Claude Opus 4.8 $+18.8$、DeepSeek v4 Flash $+10.3$ 个百分点,而 BOTS v1 上两者仅 $+2.6$、$+0.0$。无工具去污染探测则显示模型间分数差异巨大,警示绝对分数不可当能力排名。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 攻击侧 Cybench CTF 成功率(hard 变体) | success rate / $\$/solve$ | GPT-5.5 达 94.1%($\$1.16$/解),DeepSeek v4 Flash 达 86.4%($\$1.45$/解) | 以往评估仅报峰值成功率,无统一成本轴 | 首次以 $\$2.10$ 统一成本上限刻画多模型运营点,揭示成本缩放与策略拒绝主导效应 |
| 防御侧 BOTS v1 SOC 调查 | bots_points (%) / $\$/1k pts$ | Claude Opus 4.8 达 93.9%($\$2.98$/千分,603 次工具调用) | 此前无公开 BOTS v1 的 Inspect 实现,作者自建 | 首次实现 BOTS v1 Inspect 评估并叠加定价工具成本,揭示防御侧不随预算/工具量线性提升 |
| 配对预算余量(Cybench $\$0.80\to$ 全) | 百分点增量(95% 配对自助区间) | Claude Opus 4.8 $+18.8[10.3,29.1]$,DeepSeek v4 Flash $+10.3[4.3,17.1]$ | 跨模型峰值成功率比较 | 回溯重放在同一轨迹上干净分离预算效应,避免跨轨迹混淆 |
| BOTS v1 无工具去污染探测 | bots_points (%)(单轮零工具) | GPT-5.6 Sol 问题无关问答 50.5%→加前置 77.2%;Claude Opus 4.8 50.0%→74.8% | 直接解读全智能体绝对分数 | 证明公开基准绝对分数需配合去污染控制,提示模型相关污染风险 |
局限与改进
作者承认实验是观测性而非前瞻随机化的运行矩阵,因此强调固定预算运营点而非通用模型排名;BOTS v1 仅覆盖 31 道评分的 Po1s0n1vy/Cerber 问题,并使用公开 Splunk 数据,BOTS v2(51 题的 Frothly 企业入侵)与 v3(58 题云重型场景)尚无多模型可比结果;BOTS v1 使用 250 条消息上限,DeepSeek v4 Flash 在 $\$2.10$ 有 8/93、在 $\$4.20$ 有 14/93 样本-epoch 触顶,DeepSeek v4 Pro 有 5/93 触顶,截断可能压低高吞吐模型成绩;自助区间仅是描述性稳健度检查而非总体推断。此外,我观察到成本核算排除了 Kubernetes、Splunk 基础设施、存储和分析师评审时间,只含模型 token 与定价富化,故美元数字偏低估了真实运营成本;攻击侧工具被简单设为零成本也忽略了沙箱执行的隐性开销,可能低估某些工具密集型策略的实际成本。
独立分析的弱点
第一个弱点是基准覆盖面窄:BOTS 仅用 v1 的 31 题,攻击侧仅 Cybench 39 题,结论的外部效度有限,改进方向是将同样的成本感知方法扩展到 BOTS v2/v3、BountyBench、SIABench 等更新基准并做多轮前瞻随机化预算矩阵。第二个弱点是防御侧成本核算不完整,排除了基础设施与分析师时间,且攻击侧工具一律零成本,可能掩盖高吞吐低成本工具策略的真实代价,改进方向是引入执行/沙箱成本与端到端人力评审成本。第三个弱点是无工具去污染探测只用单轮、文本启发式判定拒绝,且重放上限固定 $\$0.80$,改进方向是做扰动问题、查询前作答、私有留出集和新鲜事件的多重污染控制,并探索多个回溯上限点。第四个弱点是自动压缩可能影响长任务证据质量而论文未量化其对分数的影响,可补充消融实验。
未来方向
作者明确提出的方向是把成本感知分析扩展到 BOTS v2(51 题的 Frothly 企业入侵,覆盖端点/网络/邮件/Web 大数据集)和 BOTS v3(58 题云重型 Frothly,覆盖 AWS CloudTrail、osquery、Windows 与网络遥测),目前尚无多模型可比结果。基于本成果可延伸的方向包括:构建前瞻随机的预算×模型×工具矩阵以替代观测性重放,量化自动压缩与不同压缩策略对长任务成绩的影响;把成本-成功权衡框架迁移到其他安全智能体场景如红队自动化、漏洞赏金与事件响应编排;探索自适应预算分配策略,让智能体在高价值富化处才付费;以及研发能在线判断某次富化是否会改变调查结论的元控制器,把论文提炼的工具纪律(disciplined tool use)显式建模进智能体。
复现评估
复现评估整体较高但仍有门槛。作者提供了成本核算假设(Table 1 明列各工具单价与每题调用上限)、完整评估设计(Inspect 框架、ReAct 智能体、90% 上下文自动压缩、三 epoch 均值、拒绝分类规则)和完整结果表(Tables 2–5),并附交互式网站 https://evals.frontier.security。攻击侧 Cybench 用 Inspect Evals 公开 hard 变体,防御侧 BOTS v1 为作者自建的 Inspect 实现但未明确开源仓库链接。复现难点在于需付费 API 访问 OpenAI、Anthropic 及经 OpenRouter 的多模型变体,需搭建 Splunk BOTS v1 遥测环境与 VirusTotal/WhoisXMLAPI/Brave 付费密钥,且全量 39 题×3 epoch×多模型及 BOTS 93 样本-epoch×多模型的算力花费不小(如 Claude Opus 4.8 单次 Cybench 约 $\$94.58$)。总体属方法论清晰、但工程与资金门槛较高的中等偏难复现。
论文图表
左图为 Cybench 成功率随每样本成本预算上限的变化曲线:只有当模型-token 花费不超过 x 时该挑战才算在预算 x 下解决;右图为 BOTS v1 二值答案准确率随工具调用上限的变化(对称对数轴)。图中显示攻击侧成功率随花费稳步上升,而防御侧最强模型在约 20 次工具调用内即接近上限,DeepSeek v4 Flash 却做了超过 100 次工具调用反而停留在更低水平——防御与工具纪律相关而非数量。
这张图用一张图同时概括了全文核心论点:攻防两类任务的缩放形状根本不同,是理解整篇论文的钥匙。
图展示无工具行(单轮、零非提交工具事件)与全智能体基线(三 epoch 均值)的对比,并区分有/无前置问答。结果显示仅问题条件下部分模型已达 50% 以上,加前置后 Sol 从 50.5% 升至 77.2%、Claude Opus 4.8 从 50.0% 升至 74.8%,离散极大。
该图直观展示模型相关的污染风险,支撑去污染控制必要性的论点。