← 返回 2026-07-31

深度研究可靠吗?误导性知识诱发虚假结论 Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

Pengyu Zhu, Lijun Li, Longju Yang, Sen Su 📅 2026-07-23 👍 3 2026-08-05 19:06
Deep Research Agent LLM Agent RAG鲁棒性 可靠性评估 红队测试 误导性知识

构建误导知识评测框架MisKnow-Agent,单篇假文档即令54.7%的研究报告采信虚假结论。

前置知识

Deep Research Agent(深度研究代理)

一类基于大语言模型的自主系统,它把用户的长程信息查询分解成子问题,反复执行“规划—检索—阅读—分析—综合—生成报告”的循环(动作集合为 $\{\text{Plan, Search, Read, Analyze, Synthesize}\}$),最终产出一份长文研究报告。代表系统包括 OpenAI Deep Research、Google Gemini Deep Research、字节跳动的 DeerFlow 以及 WebThinker 等。它与短程 RAG 的本质区别在于检索到的证据会被压缩进“研究状态”并在后续步骤中反复复用。

本文评估的就是这类长程工作流在面对误导信息时的可靠性,必须先理解它的多步、多状态结构才能理解“证据在中间状态被固化”这一核心失效模式。

FCAR(False-Conclusion Adoption Rate,虚假结论采纳率)

论文提出的核心评测指标,定义为在某一条件下“采纳了目标虚假结论的有效完成报告”占有效报告总数的百分比。判定标准很严格:只有当报告把虚假结论当成自己的最终结论/推荐时才算采纳;仅仅引用、转述、归因、表示存疑或反驳都不算。文章用 DeepSeek-V4 Pro 作判官模型,与人类标注的原始一致率达 99.7%、Cohen's $\kappa=0.993$。

整个实验的所有结论(权限、风格、时机、框架、模型、防御)都围绕 FCAR 展开,理解它的严格定义才能正确解读 54.7%、85.5% 等关键数字。

RAG 与检索增强中的知识冲突

检索增强生成(RAG)让模型在回答前先从外部取回证据以增强事实性,但当检索到的证据与模型内部知识或其它证据冲突时,模型可能被外部证据“带偏”。已有工作(PoisonedRAG、ClashEval、Astute RAG、HoH 等)研究了短问答或事实核查场景下,反事实、过时或被投毒的上下文如何覆盖模型知识。本文把这一思路推广到长程 Deep Research 工作流。

论文的研究问题和威胁模型直接建立在“知识冲突”之上,是判断本文与既有工作差异的基础。

Prompt Injection 与 Threat Model(提示注入与威胁模型)

提示注入指攻击者在被检索的数据中嵌入恶意指令,劫持模型行为(如“忽略之前的指令”)。本文的威胁模型明确排除了指令级攻击:不改模型参数、不改系统提示、不改工具实现、不改原始证据环境 $E_q$,只在检索池里插入“内容级”误导文档,构成 $\tilde{E}_q = E_q \cup M_q$。它研究的是“环境可靠性风险”而非主动对抗。

区分内容级误导与指令级攻击,是理解本文实验设定边界、以及为何不能简单套用反注入防御的关键。

MER 与 ECAR 分解(暴露范围 × 条件采纳率)

为区分框架差异来自“检索到假文档的概率”还是“检索到后采纳的概率”,论文定义误导证据触达率 $\text{MER}=\frac{1}{N}\sum_{i=1}^{N} e_i$ 和条件采纳率 $\text{ECAR}=\frac{\sum_i e_i a_i}{\sum_i e_i}$,其中 $e_i$ 表示是否检索到至少一篇注入文档,$a_i$ 表示是否采纳。两者满足 $\text{FCAR} = \text{MER} \times \text{ECAR}$。

这是把框架间差异定位到工作流不同阶段(检索 vs 综合采纳)的核心工具,也是 Table 3 拆解 DeerFlow–WebThinker 差距的依据。

研究动机

Deep Research 代理正被越来越多地用于科学发现、跨学科文献综合、金融与技术尽调等知识密集型任务(例如 Boiko et al. 2023 用 LLM 做自主化学研究、Zhang et al. 2025 把 LLM 嵌入科学方法流程),其报告会被下游决策者当作可信依据。然而开放网络信息本身天然不可靠——可能是过时的、支撑薄弱的、捏造的或误导性的(Lazer et al. 2018 关于假新闻的科学综述、Vosoughi et al. 2018 发现虚假新闻在线传播比真新闻快且广)。更棘手的是,Deep Research 工作流会把检索到的证据压缩进中间“研究状态”,并在多步之后于最终综合阶段再次复用,而中间步骤往往没有显式的事实核查(Chen et al. 2025 的“Deep Research Brings Deeper Harm”已警示这一风险)。于是出现一个尖锐问题:一旦看似可信实则虚假的知识进入这条流水线,代理能否在最终报告里拒绝它,还是会被一路带到结论里?这是部署这类系统前必须回答的可靠性问题。

本文的目标是本文的目标是建立一套可控、可复现的评测框架,系统刻画 Deep Research 代理在面对“外表可信、实则虚假”的误导性知识时,是否以及何种条件下会把虚假结论写进最终报告。具体而言:作者要构造任务相关的误导文档语料、设计严格的采纳判定指标 FCAR,并在 DeerFlow、WebThinker 两个开源框架(各配三种骨干 LLM)以及 Gemini Deep Research 这一闭源系统上,量化“来源权威度、呈现风格、暴露数量、检索排名、暴露时机、框架设计、骨干模型”七大因素对 FCAR 的影响;最后还要验证“事前增强验证提示”与“事后逐条核实修订”两类防御能否压低 FCAR,并定位其失败原因。整套目标是把模糊的“代理可不可靠”变成可度量的、可控变量下的实验科学问题。

与已有工作不同的是,既有工作的盲区在于:研究误导检索的工作(Hong et al. 2024 的反事实噪声、Wu et al. 2024 的 ClashEval、Xu et al. 2024 的知识冲突综述、Zou et al. 2025 的 PoisonedRAG、Ouyang et al. 2025 的 HoH、Wang et al. 2025 的 Astute RAG)几乎都聚焦短问答或事实核查,且多假设存在一个主动攻击者去投毒语料或操纵检索;而评估 Deep Research 的工作(DeepResearch Bench、DeepResearchGym、DeepFact)只测报告质量与引用正确性,并不系统隔离“误导知识如何在工作流内部传播”。本文的独特切入是:不模拟主动对抗,而是评估“环境可靠性风险”——即误导知识已经存在于信息环境中,且是在内容层面(而非指令注入)进入;同时把来源权威度、呈现风格、暴露时机、框架、模型这五个正交维度联合刻画,并给出 MER/ECAR 这种把差异定位到具体阶段的拆解工具。这是首个把“长程综合阶段的证据复用”作为失效根源来系统研究的工作。

核心方法

整体思路是“先造可控的假知识,再插进真实代理的检索池,最后严格判定报告是否被带偏”。直觉上:与其等真实网络出现误导,不如主动构造一批外表像顶级机构论文/新闻/博客/帖子、内容却支持同一条人工审核过的虚假结论的文档,作为可控探针注入代理的检索环境,从而把“是否被误导”这个概率变成可重复测量的 FCAR。技术上分三大模块:(1)蓝图构建——为每个任务定义一条规范化的虚假结论 $cf_i$、按权威度分层的机构池 $H_i=\{H_{i,\ell}\}_{\ell\in L}$($L=\{\text{High, Medium, Low}\}$)以及采纳判定规则 $\psi_i$;(2)受控实例生成——在风格空间 $S=\{\text{Paper, News, Blog, Post}\}$ 与权威度的笛卡尔积下批量生成文档;(3)检索引导精炼与交叉模型过滤——用 5 个搜索增强判官(GLM-5、Kimi 2.6、DeepSeek-V4 Pro、Qwen3.5-397B、Intern-S1-Pro)联合判定,仅当全部判官都判为 Mis 才保留,再人工复审,最终得到 5,933 条实例。评测时把文档注入 DeerFlow/WebThinker 的隔离检索池,用 DeepSeek-V4 Pro 作 FCAR 判官,并设计事前/事后两种防御。

最核心的创新是“外表可信但事实虚假”这一可控概念的可操作化,以及把它与指令注入严格切割。已有鲁棒性研究要么假设攻击者直接投毒语料(PoisonedRAG)、要么把误导写进给定上下文(短问答),都改变不了“攻击者存在”这一前提。本文改为研究环境性、内容级的风险:文档只通过正常的检索动作被代理读到,不夹带任何“忽略指令”之类的内容;同时把权威度和呈现风格解耦成两个正交旋钮,并在生成阶段强制“不同权威度的文档写作质量必须一致”,确保 FCAR 的差异只能归因于来源信号本身而非文字质量。第二个关键创新是把误导知识进入工作流的“时机”作为一阶变量(冷启动/研究中期/综合前夕),并通过 MER/ECAR 分解证明:真正致命的不是检索到,而是综合阶段把中间状态固化为结论——这把失效定位到了工作流结构而非模型本身。

方法步骤详情

完整流程如下。第一步蓝图构建:对任务 $q_i$ 生成 $b_i=(cf_i, H_i, \psi_i)$,其中 $cf_i$ 是量化、可复用的虚假结论(必须含数字/百分比/年份等可评分要素),$H_i$ 按 High/Medium/Low 三层各生成 5 个合成机构档案,$\psi_i$ 是 FCAR 判定说明。第二步受控生成:对每个 $\ell\in L$、每个 $s\in S$、每个机构 $h_{i,\ell,k}$,文档生成器产出 $m_{i,\ell,s,k}=G_{doc}(q_i, cf_i, h_{i,\ell,k}, s)$,初始候选集 $M^0_{q_i}=\{m_{i,\ell,s,k}\}$;生成时强制同一任务保留同一 $cf_i$、提及 2–4 个关键词、URL 走机构专属域名族、snippet 已能暗示假结论。第三步检索引导精炼:用 $J$ 个搜索增强判官各自给出 $V_j(m)\in\{\text{Real, Mis}\}$,交叉决策 $V_{cross}(m)=(\text{Retain if }\bigwedge V_j=\text{Mis},\ \text{Refine if }\bigvee V_j=\text{Real})$;被判 Real 的候选按 $m^{(t+1)}=G_{ref}(m^{(t)},V_{cross}(m^{(t)});\ldots)$ 迭代精炼,直到全判 Mis 或耗尽预算。第四步人工复审,得 5,933 条实例 $M=\bigcup_i M_{q_i}$,全部由五位判官一致判 Mis。第五步评测:构造增强证据环境 $\tilde{E}_q=E_q\cup M_q$ 注入代理检索池,温度设 0、Serper 取 top-10、默认 High 权威 + Paper 风格 + 预算 $b=3$,跑完后由 DeepSeek-V4 Pro 判 FCAR。第六步防御:事前防御 $r=A(q\oplus p_{ver})$ 把验证提示拼到查询后;事后防御 $r_{post}=A_{ref}(r,\tilde{E}_q)$ 用同骨干的搜索增强代理逐条核实修订(IdentifyMaterialClaims→Retrieve→Assess→Correct/QualifyOrRemove→PreserveStructure)。

技术新颖性

技术新颖性体现在四点。其一,构造方法新颖:MisKnow-Agent 把“可信外观”拆成权威度(机构名/URL/出版类型)与呈现风格(论文/新闻/博客/帖子)两个独立维度,并通过 prompt 约束强制各层写作质量一致,从而能干净地做因果归因——这是已有评测数据集没有的。其二,验证机制新颖:用五个异构搜索增强判官做交叉一致判定 + 检索引导精炼 + 100% 人工审核目标结论,保证每条实例确实“事实虚假但外表可信”,避免评测集自身被污染。其三,评测维度新颖:首次把暴露时机(冷启动/中期/综合前夕)作为一阶因素,发现 pre-Synthesis 阶段 FCAR 飙到 77–94%;并用 MER/ECAR 把框架差异拆成“检索触达”与“触达后采纳”两部分。其四,威胁建模新颖:显式排除指令注入、不污染真实网络,只测内容级环境可靠性,使结论更贴近真实部署中“代理无意读到一篇像样的假论文”的场景。

Overview of our methodology.
Figure 2: Overview of our methodology.

实验结果

六个开源配置(DeerFlow/WebThinker × DeepSeek-V4 Pro/Qwen3.5-397B/Intern-S1-Pro)+ Gemini Deep Research 的实验得到一组高度一致的发现。(1)注入即失守:无注入对照 $b=0$ 时 FCAR 为 0%(系统不会自发编出指定的假结论),但仅注入一篇文档就把平均 FCAR 拉到 54.7%。(2)检索排名几乎无效:front/spread/back 三种位置下 FCAR 分别为 66.2%、65.5%、64.5%,最大差仅 1.7 个百分点,说明代理靠相关性而非列表位置取舍证据。(3)暴露时机决定性:Cold start 40.5%、mid-Research 44.2%,而 pre-Synthesis 飙到 85.5%(比前者高 45.0 个点),各配置 pre-Synthesis 范围 77–94%,证明综合前夕是致命窗口。(4)权威度有方向但不严格单调:High 61.0% > Medium 57.7% > Low 46.2%,跨配置高低差 14.8 个点,但 6 个配置里只有 4 个严格单调。(5)呈现风格更强势且一致:Paper 61.0% > Blog 53.0% > News 44.0% > Post 37.5%,paper–post 差 23.5 个点大于权威度差,6 个配置里 5 个保持该排序,说明“长得像论文”是最强说服线索。(6)剂量饱和:$b=1$ 已达 54.7%,$b=3$ 峰值 61.0%,$b=4/5$ 不再上升(60.3%/58.3%),单篇足够、多无增益。(7)框架与模型交织:DeerFlow 平均 67.0% 高于 WebThinker 55.0%,但差距随 Intelligence Index 上升而收窄(Intern 21 点 → Qwen 10 点 → DeepSeek 5 点),且绝对 FCAR 并不随 Index 单调——Intern-S1-Pro 在 DeerFlow 下最高 76%,而 DeepSeek-V4 Pro 在 WebThinker 下最高 60%;Table 3 拆解显示 Intern 的差距 17.3/21.0 点来自 MER(检索触达),Qwen 的差距则来自 ECAR(触达后采纳)。(8)闭源同样中招:Gemini Deep Research 在 High/Med/Low 权威下 FCAR 为 54%/46%/8%,风格 54%/41%/34%/28%,但剂量曲线不同——从 1 篇 27% 升到 3 篇 54% 后平台。(9)防御有用但不彻底:事前防御 FCAR 区间 37–57%、事后 20–58%、组合 15–62%;组合对 DeepSeek-V4 Pro 与 Qwen3.5-397B 最佳,但对 Intern-S1-Pro 反而 62% 高于任一单独防御(57%/58%),因为事后精炼与原代理跑在同一混合检索环境里、误导证据可能被重新检索回来。

Qualitative observations from the manual comparison of candidate document-generation models.
Table 1: Qualitative observations from the manual comparison of candidate document-generation models.
Representative task blueprint for Query 9.
Table 2: Representative task blueprint for Query 9.
Framework–LLM outcomes and decomposition of the DeerFlow-WebThinker FCAR gap.
Table 3: Framework–LLM outcomes and decomposition of the DeerFlow-WebThinker FCAR gap.
Effects of misleading-knowledge position and timing on FCAR across frameworks and LLMs.
Figure 3: Effects of misleading-knowledge position and timing on FCAR across frameworks and LLMs.
Effects of source cues on false-conclusion adoption.
Figure 4: Effects of source cues on false-conclusion adoption.
Effect of the misleading-knowledge budget on FCAR across framework–LLM configurations.
Figure 5: Effect of the misleading-knowledge budget on FCAR across framework–LLM configurations.
Framework–LLM configurations in FCAR under the matched high-authority, paper-style setting.
Figure 6: Framework–LLM configurations in FCAR under the matched high-authority, paper-style setting.
Closed-source generalization and defense effectiveness.
Figure 7: Closed-source generalization and defense effectiveness.
查看结构化数据
任务指标本文基线提升
无注入对照 vs 单篇注入(6 开源配置平均) FCAR 0% → 54.7% 0%(无注入) +54.7 个百分点,证明采纳完全由注入诱发
暴露时机:pre-Synthesis vs Cold start FCAR 85.5%(pre-Synthesis,范围 77–94%) 40.5%(Cold start)/ 44.2%(mid-Research) +45.0 / +41.3 个百分点,定位综合前夕为致命窗口
呈现风格 Paper vs Post FCAR 61.0%(Paper) 37.5%(Post) +23.5 个点,强于权威度差异
权威度 High vs Low FCAR 61.0%(High) 46.2%(Low) +14.8 个点,方向一致但不严格单调
框架对比 DeerFlow vs WebThinker(高权威论文设置) FCAR 67.0%(DeerFlow 平均) 55.0%(WebThinker 平均) +12.0 个点,但随 Intelligence Index 收窄
组合防御 vs 无防御(DeerFlow 默认设置) FCAR 15–62%(组合) 60–76%(无防御) 显著降低但不能消除,Intern-S1-Pro 下组合反而最差
判官一致性 DeepSeek-V4 Pro 与人类标注 99.7% 原始一致 / Cohen's κ=0.993 300 份人工 adjudicated 参考 近完美一致,支撑自动化评测有效性

局限与改进

作者自己承认的局限有三点。其一,闭源泛化只测了 Gemini Deep Research 一家,没有覆盖 OpenAI Deep Research、Claude 等其它主流系统;其二,事后精炼代理与原代理共用同一骨干模型、同一增强检索环境,导致它可能把已被事前防御挡掉的误导证据又检索回来,Intern-S1-Pro 下组合防御反而更差就暴露了这点;其三,威胁模型刻意排除指令注入与对真实网络的污染,因此结论只适用于“内容级环境风险”,不能直接外推到对抗者主动投毒或 prompt 注入的实战红队场景。我自己再补充几点观察:一是 FCAR 判官由 DeepSeek-V4 Pro 单一模型担任,虽然 κ=0.993 很高,但判官与被测系统共享同族模型可能存在同源偏差,缺少跨族判官交叉验证;二是“采纳”是二值判定,没有刻画部分采纳/弱化表述这类灰色地带;三是实验固定温度 0、固定 Serper top-10,没有报告随机种子或多次运行的方差,pre-Synthesis 这类高风险结论的置信区间未给出;四是 100 个任务全部来自 DeepResearch Bench,领域与难度分布可能影响外部效度。

独立分析的弱点

第一,防御的“同源检索”漏洞:事后精炼代理 $A_{ref}$ 在 $\tilde{E}_q$ 里检索,等于让审核员在同一片可能被污染的池子里取证——Intern-S1-Pro 组合防御 FCAR 反升至 62% 就是直接证据。改进方向是给精炼代理一个干净的、不含 $M_q$ 的对照检索环境,或强制要求多源独立交叉印证后才采纳修订。第二,pre-Synthesis 85.5% 的窗口未被针对性防御:现有两种防御一个在入口、一个在出口,唯独没有在“证据进入中间研究状态”这一最危险环节设置连续核查。改进方向是把核实做成工作流内的常驻模块——每当代理要把一条证据从 observation 写进 research state 时触发轻量级交叉验证。第三,闭源覆盖单薄:只测了 Gemini,无法判断 GPT/Claude Deep Research 是否同样脆弱。改进方向是用各家的 local-source/上传文档接口扩展到更多闭源系统。第四,单点判官风险:DeepSeek-V4 Pro 既当运动员(部分被测配置)又当裁判,建议引入跨族判官集成(如 GPT/Claude/Gemini 投票)并对分歧样本做人工裁定。第五,二值 FCAR 丢失信息:建议补一条“采纳强度”连续量表(完全采纳/弱化采纳/存疑/反驳),并把 matched_claim_ids 已有的细粒度信号做成维度级指标。

未来方向

作者明确点出的方向是“连续验证”——只要证据被纳入中间研究状态或最终综合,就应触发验证,而非仅在入口/出口防御一次。基于本文成果可延伸的方向包括:(1)把 MER/ECAR 拆解框架推广到更多 Deep Research 系统(OpenAI、Claude、Kimi Research 等),验证“框架–LLM 交互”是否普适;(2)研究主动对抗版本——当攻击者能选择注入时机(如专门卡 pre-Synthesis)和权威度时的最坏情况 FCAR,并设计相应鲁棒训练;(3)用本文的 5,933 条实例做监督或 RLHF 数据,训练模型对“外表可信但事实可疑”的检索内容产生校准的不信任;(4)探索检索端的防御——例如在检索阶段就要求多源独立印证、对单一来源的量化主张降权,从源头压低 MER;(5)把工作流结构本身作为干预变量,例如强制要求综合阶段重做一次独立检索与证据-结论对齐检查,验证能否把 pre-Synthesis 的 85.5% 压下来;(6)扩到多模态 Deep Research(图表、数据集中的误导)以及多智能体协作场景下的谣言传播。

复现评估

复现性是本文的强项。作者公开了代码(github.com/whfeLingYu/MisKnow-Agent)与数据集(huggingface.co/datasets/whfeLingYu/Misleading_Knowledge),并附完整 prompt 模板(蓝图生成、文档生成、搜索引导验证、FCAR 判定的 system/user prompt 全文见附录 I)、机构权威度与风格配置 JSON(附录 I.3)、事后精炼伪代码(Algorithm 1)、防御提示全文(附录 D)以及代表性蓝图实例(Table 2、附录 F)。目标虚假结论做到 100% 任务覆盖的人工审核(附录 C),判官一致性在 300 份样本上量化为 κ=0.993(附录 B),生成模型选择有定性对比与理由(附录 A、Table 1)。实验配置明确:100 个 DeepResearch Bench 任务、温度 0、Serper top-10、默认 High/Paper/$b=3$。主要复现成本在算力——跑 6 个开源配置 + Gemini × 多种条件需要可观的 API 与 GPU 开销,但所有关键超参与流程都已披露,熟悉 DeerFlow/WebThinker 的研究者可在中等规模集群上复现核心表格。难度评估:中等偏上,门槛主要在工程搭建而非方法理解。