SecRespond:针对真实攻陷后应急响应的AI智能体基准测试 SecRespond: Benchmarking AI Agents for Real-World Post-Compromise Incident Response
首个评估LLM智能体在主机被攻陷后进行取证调查与修复的基准
前置知识
攻陷后应急响应(Post-Compromise Incident Response)
指主机在遭受一次成功入侵之后,安全人员针对该主机进行的完整响应流程,包括调查取证、还原攻击链、评估基线配置与漏洞风险,并制定可执行的修复方案。它与攻击前(pre-compromise)的渗透测试或漏洞挖掘不同,必须面对攻击留下的真实痕迹:持久化机制、被部分清除的日志、嘈杂的并发合法活动等。本文要解决的就是评估AI智能体在这一真实场景下的能力。
理解这一概念是读懂全文动机的关键,因为作者反复强调现有基准只覆盖攻击前的场景,而攻陷后场景长期被忽视。
MITRE ATT&CK 框架
ATT&CK 是一套描述真实世界攻击者行为的知识库,用编号(如 T1190 表示对面向公众应用的利用、T1059 表示命令与脚本解释器)刻画攻击从初始访问、执行、持久化、提权到影响的全生命周期。本文的 10 个赛博靶场覆盖了 21 个 ATT&CK 技术和 4 类入口点,用来保证攻击场景的多样性与真实性。
论文用 ATT&CK 技术编号标注每个靶场的攻击链,是衡量场景复杂度和覆盖范围的核心维度,读懂编号有助于理解难度分层。
持久化机制(Persistence Mechanism)
持久化是攻击者为在重启或清理后仍能保持访问而安装的机制,例如 Linux 上的 cron 任务(PER-S01)、systemd 服务/计时器(PER-V01/PER-S02)、shell 初始化文件(PER-I01 的 bashrc/profile)、authorized_keys 篡改(PER-A01),Windows 上的计划任务(PER-S04)、WMI 事件订阅(PER-E02)等。这类痕迹通常没有活跃的进程或网络信号,需要主动枚举整个主机才能发现。
持久化机制检测是本文实验中所有模型表现最弱的能力维度(平均检测仅 58.8%),是理解论文核心瓶颈的关键概念。
LLM-as-a-Judge(LLM 作为评判者)
当任务输出是开放式报告而非固定答案时,无法用精确匹配或选择题准确率打分。LLM-as-a-Judge 方法将评分目标分解成可验证的单元(rubric/checkpoint),由多个强模型独立打分后取平均。本文用 Claude Opus 4.7、Gemini 3.1 Pro、GPT-5.4 Pro 三个不同厂商的模型作为独立评判,以降低单一偏见,并通过人工校准验证其与人类专家高度一致(Pearson 相关 0.96)。
本文的全部评测都依赖这一评分机制,理解它的可靠性论证(如评判间一致性 ρ=0.86–0.87)才能信任后续的所有实验结论。
取证磁盘快照(Forensic Disk Snapshot)
取证快照是对被攻陷主机磁盘在攻击完成后的只读冻结副本,包含日志、配置变更、残留恶意文件等真实入侵痕迹。智能体可以像取证分析师一样读取快照中的所有目录与文件,将其作为主要的取证证据来源。本文的每个赛博靶场都由真实云主机经端到端攻击后冻结而成,而非合成的日志或文本。
这是本文与 ExCyTIn-Bench 等只基于日志推理的基准的根本区别,也是 Real Filesystem 这一对比维度的核心。
研究动机
现有的网络安全基准几乎都聚焦在攻击前(pre-compromise)的理想化环境:要么让智能体在干净环境中做 CTF 挑战(CyBench、NYU CTF Bench)、漏洞挖掘(CyberGym、CVE-Bench)或补丁生成(AutoPatchBench),要么让 LLM 对孤立的告警(CyberSOCEval)、系统日志(ExCyTIn-Bench)或事件报告做推理。这些工作都没有复现攻击成功后在真实主机上留下的取证痕迹,例如持久化机制、被刻意擦除的痕迹、嘈杂的并发合法活动等。而攻陷后响应恰恰覆盖了从调查入侵、还原攻击链到修复系统的完整应急响应周期,是衡量智能体能否在真实生产环境辅助安全运营的前提。作者对 372 台真实被攻陷云主机的告警、漏洞与基线数据做了关联分析,发现这一空白亟待填补。
本文的目标是本文的目标是构建首个针对攻陷后应急响应流程的基准 SECRESPOND,系统评估 LLM 智能体在以下完整能力上的表现:给定一台被攻陷主机的取证磁盘快照,以及主机安全产品上报的告警、漏洞扫描和基线检查结果,智能体需要主动调查主机、还原事件经过,并产出一份进度文件和四份报告——入侵报告(还原入口点、横向移动、持久化与最终影响)、漏洞报告(验证主机上实际存在的弱点)、基线报告(对照安全基线评估配置)以及带推荐命令的修复计划。为了让评测既贴近真实又可量化,作者还设计了五维能力分类法(CAP taxonomy)和层次化的检查点评分体系。
与已有工作不同的是,本文的独特切入角度体现在三点:第一,所有靶场都是基于真实、完整实例化的云主机,通过真实网络协议发起端到端攻击后冻结的磁盘快照,而非合成日志或文本,这是 Table 1 中所有对比基准都不具备的 Real Filesystem 特性;第二,任务要求多步骤、跨文件的取证分析(Multi-Step + Cross-File Analysis),并把告警驱动的浅层分析与磁盘深处的隐蔽证据区分开(30%–40% 的攻击动作触发告警,60%–70% 留下静默文件痕迹);第三,提出可跨靶场比较的层次化评分框架——把 280 个检查点映射到 52 个能力项、5 个维度,使异构靶场的结果能聚合成能力画像。
核心方法
SECRESPOND 的整体思路是:先构造能复现真实入侵的赛博靶场,再定义智能体应当具备的能力分类,最后用层次化检查点把能力与具体取证证据绑定,从而既贴近真实又可量化评测。技术路线上,每个靶场是一个冻结的只读取证磁盘快照,附带主机安全产品的告警、漏洞扫描和基线检查三类安全分析数据。智能体(统一使用 OpenCode 智能体框架)拿到这些输入后,需要在命令行环境中调查磁盘、读文件、关联线索,最终产出进度文件与四份报告。评测时,每个靶场被分解成细粒度的检查点(checkpoint),每个检查点沿检测(detection)和规划(planning)两个轴打分,检测轴满分 $M_{det}=3$、规划轴满分 $M_{plan}=2$,对应归一化公式 $\mathrm{CHK\text{-}score}_a^c = s_a^c / M_a \in [0,1]$,其中 $a \in \{det, plan\}$。
核心创新是把“能力”这一抽象目标,通过层次化检查点双向锚定到“具体取证证据”上,从而让开放式报告变得可量化、可跨靶场比较。与已有方法的本质区别在于:以往基准要么依赖确定性的固定答案(CTF flag 匹配、选择题准确率),要么对孤立告警/日志做推理,无法处理开放式取证报告;而 SECRESPOND 设计了五维能力分类法(入侵实体 ENT、持久化 PER、基线风险 BAS、漏洞风险 VUL、调查与响应质量 Q),把 280 个检查点手工映射到 52 个能力项上,每个能力项的得分定义为映射到它的所有检查点的平均:$\mathrm{CAP\text{-}score}_a = \frac{1}{|C_a^{CAP}|}\sum_{c\in C_a^{CAP}} \mathrm{CHK\text{-}score}_a^c \times 100\%$。这样不同靶场、不同模型的检查点结果就变成了可比的能力画像。
方法步骤详情
整个方法包含构造与评测两条主线。靶场构造遵循 12 阶段流水线(图2):蓝图设计、攻击脚本开发、受害实例策展、受害环境部署、受害就绪验证、攻击前干净快照、攻击环境部署、攻击执行、攻击验证、安全数据采集、修复验证、攻击后快照;其中安全专家在攻击链合理性、代码质量、告警覆盖、靶场完整性等关键步骤审计。每个靶场被设计成三层:蓝图层(评估目标、攻击链的 ATT&CK 编号、能力覆盖)、实例层(在真实漏洞/CVE 与真实网络协议下落地)、检查点层(把产物转化为带通过/失败判据、证据来源、能力映射的检查点)。评测时:给定快照与三类安全分析,智能体产出报告;三个不同厂商的强模型作为独立评判,各自给每个检查点的检测轴与规划轴打分;检查点得分先在三个评判间取平均,再按公式聚合成靶场级 $\mathrm{CHK\text{-}score}_a^r = \frac{1}{|C_a^r|}\sum_{c\in C_a^r}\mathrm{CHK\text{-}score}_a^c \times 100\%$ 和能力级 CAP-score,用于靶场内分析与跨靶场比较。
技术新颖性
技术新颖性主要体现在四方面。第一,首个面向攻陷后应急响应全流程的基准:10 个靶场覆盖 4 类入口点(弱口令、已知 CVE、供应链、业务代码)、21 个 ATT&CK 技术、5 种操作系统(CentOS、Ubuntu、Windows Server 等),这是 Table 1 中所有对比基准都不具备的完整 Post-Compromise + Real Filesystem + Multi-Step + Cross-File + Rubric + CLI 组合。第二,层次化 LLM-as-a-Judge 框架:把任务分解为安全专家手工设计的 280 个细粒度检查点,并沿检测与规划双轴打分,再映射到 52 个能力项与 5 个维度。第三,能力级聚合:通过 CAP 分类法使异构靶场结果可比,支持单能力诊断与跨靶场分析。第四,多评判去偏:用三个不同厂商的强模型独立打分取平均,并通过人工校准(Pearson 0.96、二次加权 κ=0.94、MAE 0.15)和评判间一致性(ρ=0.86–0.87)双重验证可靠性,并确认无自我偏好偏见。
实验结果
作者在 OpenCode 智能体框架上评测 8 个系列、23 个前沿 LLM,得到五条核心发现。其一,检测恒优于规划,规划是全靶场瓶颈:GPT-5.5 检测 70.7% 但规划仅 36.0%,差距高达 34.7%,即便差距最小的 Claude Sonnet 4.5 也有 8.5%,原因多为修复不完整(杀进程后忽略凭证轮换、外连阻断、业务恢复确认)。其二,模型差异巨大:Claude Opus 4.7 以 79.0%/65.7% 居首,其后是 Opus 4.6(78.2%/58.0%)、GLM-5.1(76.3%/59.2%)、Qwen3.7 Plus(75.6%/58.8%),且开源模型整体超越 GPT/Gemini 系列。其三,版本演进总体提升但不普适:Opus 从 4.5 的 69.5%/56.4% 升到 4.7 的 79.0%/65.7%,但 Kimi K2.6 规划分反低于 K2.5(43.0% vs 50.7%)。其四,靶场难度随攻击链变长变宽而上升,Log4j-RCE 最易、Shiro-Fastjson 等最难,无任何模型能在单个靶场上完成完整检测与修复。其五,能力级极度不均衡:检测在 ENT 上平均 75.4%、PER 仅 58.8%;规划在 BAS 上 55.3%、Q 仅 31.8%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 靶场级检测(Log4j-RCE,最易靶场) | 检测 CHK-score(越高越好) | GPT-5.5 检测 96.5%,多模型 80%+ | 传统无代理扫描基线(仅检测,不修复) | 智能体在 ENT/VUL 上显著超越无代理扫描(PER 上 58.8% vs 2.1%) |
| 靶场级规划(GPT-5.5) | 规划 CHK-score | 36.0% | 其检测分 70.7% | 揭示检测-规划差距高达 34.7 个百分点 |
| 能力级持久化检测(PER) | 平均检测 CAP-score | Qwen3.7 Max 79.0%(最强) | 传统无代理扫描 2.1% | 智能体把持久化检测从近乎 0 提升到 58.8% 均值 |
| 注入技能后规划提升(GPT-5.4) | SSH-Miner 规划 CHK-score | 26% → 83% | 无技能 26% | 过程化先验使规划分提升 57 个百分点 |
| Claude Opus 4.7 持久化(注入技能) | PER CAP-score(检测/规划) | 检测 68%→88%,规划 49%→75% | 无技能 68%/49% | 检测 +20pp,规划 +26pp |
局限与改进
作者明确承认的局限包括:Claude Opus 4.7 在 NPM-Worm 靶场上每次都返回安全拒绝(safety refusal)而无任何报告,其总分因此只能用其余 9 个靶场平均,这暗示最强模型在供应链攻击等场景上可能因安全策略而完全失效;过程化先验(技能)虽能显著提升规划,但在 Shiro-Fastjson、Docker-Escape 等广覆盖靶场上反使 GLM-5.1 检测下降 12%/11%,因为模型会在技能枚举的边界处停下而不继续探索长尾痕迹;技能只能缓解、不能消除失败。我额外观察到三点:其一,评测仅固定使用 OpenCode 一个智能体框架,未横向比较不同框架(如 OpenClaw)对结果的影响,框架差异可能改变绝对排名;其二,靶场虽覆盖 5 种操作系统,但 Windows 只有 2 个靶场、Linux 类占主导,跨 OS 的能力均衡性可能被低估;其三,三评判虽一致性高,但 GPT 评判系统性偏严,若改用其他评判组合,模型间细微排序可能在中间梯队发生波动。
独立分析的弱点
第一,智能体普遍缺乏主动枚举整机的调查纪律——它们倾向于“跟着告警走”而非系统性扫描,导致静默入侵与隐蔽持久化被遗漏,改进方向是设计强制全盘枚举的探查策略或代理内置的检查清单引导。第二,修复规划普遍“半途而废”:能给出第一个明显修复(杀进程/删文件),却忽略凭证轮换、外连阻断、业务健康确认等收尾步骤,改进方向是引入修复完整性的自检闭环与“修复后验证”模板。第三,跨服务/跨运行时取证关联能力弱,导致攻击链还原不全,改进方向是多步证据图与因果推理。第四,当前固定单一智能体框架(OpenCode)评测,框架选型可能系统性影响结果,建议未来横向比较多框架。第五,过程化先验技能在广覆盖靶场上反而降低检测(如 GLM-5.1 在 Shiro-Fastjson 上 -12%),说明硬编码流程会限制探索,改进方向是让智能体从自身调查结果中学习并自适应扩展检查边界,而非执行预定义例程。
未来方向
作者明确指出的方向:当前过程化先验只能达到性能上界的一部分,真正填补检测-规划鸿沟需要智能体“从自身调查结果中学习”,而非执行预定义例程,这被作者称为“本任务潜在的下一步”。基于本文成果可延伸的方向包括:扩展靶场与操作系统多样性(增加 Windows 与云原生场景),覆盖更复杂的横向移动与域内提权;横向比较多个智能体框架(OpenClaw 等)以解耦模型能力与框架效应;研究如何把能力画像(CAP-score)反向用于指导模型微调或检索增强,针对性补齐 PER 与 Q 维度;探索端到端可执行的修复验证(不仅产出修复建议,还在沙箱中实际执行并验证),把“规划”从建议升级为“可验证的自动修复”。
复现评估
复现评估较好。论文声明基准与数据公开在 https://github.com/Alibaba-NLP/qqr/tree/main/data/secrespond ,靶场为可冻结复现的只读快照,检查点判据、能力映射表(Table 6 的 280 个检查点)与 LLM-as-a-Judge 提示词(附录 C)均给出,三个评判模型(Claude Opus 4.7、Gemini 3.1 Pro、GPT-5.4 Pro)与评估 harness(OpenCode)明确。挑战主要在三方面:其一,需要访问 23 个前沿模型的 API(含 Opus 4.7、GPT-5.5 等闭源付费模型)与 3 个评判模型,算力与 API 成本不低;其二,每个靶场是完整的真实云主机取证快照,运行与存储开销较大;其三,攻击链与持久化涉及敏感安全内容,复现者需严格遵守防御性研究用途限制。整体属于中等偏高的复现难度,但方法学与评测框架本身高度可复用。
论文图表