FinanceComplexQA:面向工业级金融文档的智能体推理基准测试 FinanceComplexQA: Benchmarking Agentic Reasoning on Industrial-grade Financial Documents
面向工业级金融文档的双语智能体推理基准,揭示当前系统的推理与布局短板。
前置知识
检索增强生成(RAG)
RAG 把外部检索与生成耦合:先用查询从知识库取回相关片段,再把片段拼进提示让 LLM 生成答案,从而缓解幻觉并引入最新知识。Self-RAG、CRAG、Adaptive-RAG、IRCoT、ITER-RETGEN 等进一步把检索与反思或推理交替执行。
本文评测的 LightRAG 与 PageIndex 都属 RAG 范式,是金融 QA 的工程默认选项,读懂 RAG 才能理解为何布局感知检索会成为强基线。
Agentic Reasoning(智能体推理)
智能体推理指 LLM 在循环里自主完成规划、工具调用、检查中间证据并修订答案的过程,背后是 Chain-of-Thought、ReAct、Reflexion、Tree-of-Thoughts、Plan-and-Solve 等思路,代表框架有 AutoGen、Voyager、Claude Code、OpenAI Codex。
本文核心就是评测 Codex 式与 Claude Code 式智能体在工业级金融文档上的推理能力,并揭示它们在数值漂移、证据遗漏等失败模式上的短板。
Model Context Protocol(MCP)
MCP 是为 LLM 提供标准化外部工具与数据源接入的协议,让模型在生成中动态调用计算、检索、Web 搜索等能力,把检索、工具调用与多阶段规划统一进生成循环。
论文把 MCP 工具列为现代金融系统的关键能力,并在数据验证环节用 Web/MCP 式工具核验稳定公开事实,理解 MCP 才能看懂评测对象与质检机制。
多跳推理(Multi-hop Reasoning)
多跳推理要求模型把若干分散证据串成推理链才能得到答案,例如先从 A 段取公司、再去 B 表对时期、再做计算比较;与之相关的还有隐式推理(依赖领域概念/公式)、显式推理与多跳判断。
本文把 MR(中文多跳)、MJ(英文多跳判断)、IR、ER 作为任务标签,多跳推理正是金融研究中最常见也最容易暴露「找到证据却推错结论」的环节。
布局感知文档解析(Layout-aware Parsing)
金融文档高度依赖版面:同一数字的意义取决于行标签、列时期、单位、合并实体或业务分部。布局感知解析会把文档拆成保留页序、章节边界、段落、表格行列头、图注与邻近解释的层级证据单元,而非把一切压成独立 chunk。
FinanceComplexQA 的灵魂是跨布局推理,PageIndex 之所以比 LightRAG 强 9.73 分正因保留页结构与表邻上下文,读懂版面解析才能理解其评测设计。
Agent-as-a-Judge(智能体评审)
Agent-as-a-Judge 用 LLM 作为评审者按给定维度对开放式答案打分,以兼顾可扩展性与人工难以量化的语义/数值/覆盖率判断。本文用它从准确性、数值正确性、证据覆盖、忠实度、完整性、成本六个维度评分。
开放式金融分析答案难以用单一 EM/F1 评分,本文用 Judge 输出 ACC、ROU、FS、Cov 四类指标,是理解结果表 5–7 与失败模式分析的关键。
研究动机
现有金融问答基准大多聚焦狭窄任务:FinQA(2789 页/1147 QA)、ConvFinQA(434 页/1568 QA)、TAT-QA(1655 QA/275 片段)只做多步算术或表+文抽取;FinanceBench 仅 150 上下文/150 QA;DocFinQA、OfficeQA 等虽支持长文档与 PDF 解析但仍以单文档推理为主。它们很少触及真实金融研究的复杂过程——分析师必须在跨文档、跨表格、跨图表间综合证据并结合领域知识。同时许多基准依赖合成问题或模板构造,限制了真实性与推理深度。如表 1 所示,绝大多数基准只覆盖英文、不解析完整 PDF、不支持长文档、不支持跨布局推理,评测指标也单一(多为 ACC、EM/F1 或 ROUGE),无法同时衡量语义正确性、数值精度与推理完整性。这种「现实工作负载」与「评测覆盖」的鸿沟,使业界难以判断现代 RAG、MCP 与 Agentic 系统在工业级金融推理中到底有多可靠,而金融对数值精度、专家知识与事实可靠性要求极高,微小事实或推理错误都可能带来错误的投资决策或风险评估。
本文的目标是本文目标是为金融文档上的开放式复杂问答提供一个大规模、双语、贴近真实分析师工作流的基准——FinanceComplexQA。它含 2026 个专家级深度研究任务,建立在 1009 份真实世界金融富文本文档之上,覆盖 8 个金融子领域与 9 类研究任务(数值比较、多跳推理、隐式推理、行业比较、跨布局综合、规划等),中英文各 1013 题。每个问题都同时要求显式文档证据与隐式金融领域知识,迫使系统既要检索又要推理。作者还希望提供可扩展的基准构造路径:先提出 Finance-LaTeX SKILL 这一多智能体框架,用于大规模合成高质量金融文档与 QA 对(生成 2000 份文档与 6000 个 QA),作为压力测试、提示迭代、消融与未来扩展的开发源;正式评测基准仍基于经精修、稳定可核验的真实金融文档,以保证长期可用性。整体目标是判断现代 LLM 系统的文档理解、深度推理与分析综合能否接近专业金融分析师的水平。
与已有工作不同的是,本文的独特切入在于两个互补设计:双上下文推理(dual-context reasoning)与跨布局证据聚合(cross-layout evidence aggregation)。在普通文档问答中,相关句子往往已含大部分答案;而在金融研究中,一个句子只有在通过会计定义、市场结构、风险逻辑或监管背景解释后才变得有意义——例如表格显示营收增长而经营现金流下降,答案不仅需提取两个数字,还要解释这种背离为何重要。跨布局推理则要求系统同时理解段落、表格、表单、图表与图注,并把行标签、列时期、单位、实体范围与邻近叙述绑定为完整上下文。这恰好击中「把文档展平成独立 chunk」的检索系统与「找对表格却读错行」的智能体的共同盲点。此外,作者把合成数据与 held-out 评测基准严格分离,避免合成噪声污染评测,这是与现有「边生成边评测」基准的本质区别,也使评测具备可复现的稳定参考答案。
核心方法
整体思路是「先造数据生成引擎,再造评测基准」。直觉上,要评测金融智能体,必须先有足够复杂、布局丰富、可验证的金融文档与对应问题。技术路线分两层:第一层是 Finance-LaTeX SKILL,一个多智能体文档生成引擎,把专家金融知识、证据规划、布局感知 LaTeX 写作与多阶段验证组合起来,合成接近真实分析师工作量的文档与 QA 对;这些合成数据用作开发、消融与未来扩展的来源,但严格不混入正式评测集。第二层是 FinanceComplexQA 评测流水线:基于真实金融语料(财报、投资策略、市场趋势、银行报表、客服记录、合规审计、政府财政公告等),解析为布局感知的证据单元,由专家撰写稳定可核验的开放式问题与参考答案,最后通过 Agent-as-a-Judge 协议对系统的检索、推理、综合与成本做多维度评测。两层共同形成「数据生成—评测—诊断」闭环,使基准既可大规模扩展又保持工业级真实度。
核心创新点是把「布局依赖」显式内建到数据生成的每一环,而非依赖事后解析来发现。Finance-LaTeX SKILL 会故意制造跨布局依赖:同一条经营策略变更可能在段落里描述、在表格里给出对应营收与利润率、在注释里界定合并范围,正确答案必须连接这三处而非依赖单一句子。这与「先写纯文本、再切 chunk」的传统合成方式本质不同——后者无法保证跨布局依赖真实存在。证据规划阶段还对证据按推理功能分类(直接查找、数值比较、多跳推断、摘要证据、规划约束),让生成文档既适合测试显式检索也适合隐式金融推理。QA 生成环节主动拒绝「单 span 即可抄答案」「依赖易变外部事实」「要求无依据投机」的问题,并通过 LLM 自检、Web/MCP 工具核验稳定公开事实、harness 测试复现证据-答案关系三道闸口,任何一项失败都回到 check-and-correct 阶段。这是把「可解性」作为一等约束来设计数据,而非事后筛选。
方法步骤详情
完整步骤分五步。第一步语料收集与专家知识获取:对每个候选文档,由 agent 采样金融领域、目标读者、文档类型、术语约束与推理目标,选用稳定会计关系、监管术语、市场分析概念与业务流程事实等不易过期的概念。第二步证据规划:明确哪些事实进段落、哪些数字进表格、哪些假设写进图注/注释、哪些证据支撑后续问题,并按推理功能分类。第三步布局感知 LaTeX 生成:把证据计划转换为含章节、段落、表格、特殊布局块、公式、图注与表邻描述的 LaTeX 文档,数字单元格同时生成行标签、列标签、时期、单位与实体范围。第四步 QA 对生成与验证:从规划证据生成候选 QA 对,每个问题绑定必要证据单元、参考答案与推理笔记;问题生成器拒绝可单 span 抄答/依赖易变事实/无依据投机的问题,答案生成器写含结论、证据、计算与注意事项的分析性回答,再经 LLM 自检、Web/MCP 工具核验、harness 复现测试三道检查。第五步质量控制:文档级剔除布局破损/表头缺失/财务关系不一致者,QA 级剔除证据歧义/计算不可复现/参考答案不完整/推理深度不足者,并维持难度平衡。
技术新颖性
技术新颖性体现在三点。第一,把 LaTeX 作为金融文档的中间表示:与直接生成 PDF 或纯文本不同,LaTeX 天然编码章节层级、表格结构、公式与图注,使跨布局依赖可被显式设计与机器校验,这是 Finance-LaTeX SKILL 区别于通用文档生成工具之处。第二,三重验证机制(LLM 自检 + Web/MCP 工具 + 可复现 harness 测试)将「答案可解、证据对齐、计算可复现」三者耦合,形成远超模板化合成数据的质量保证。第三,评测协议的「任务自适应加权」:数值比较/显式推理任务对精确量值与单位加权更高,规划/摘要任务对覆盖率与忠实度加权更高,并用 ACC、ROUGE 风格重叠(ROU)、忠实度(FS)、覆盖率(Cov)四类指标交叉诊断,使「流畅但不完整」或「高词重叠但时期/单位错」的答案都能被分别识别。这种「生成—验证—评测」一体化、双语、跨布局的设计在表 1 对比中是独一份——其他基准最多同时命中 PDF 解析/长文档/跨布局/开放式中的少数几项。
实验结果
在主流闭源与开源 LLM(GPT-5.x、Claude-5-Sonnet、Qwen3.x、DeepSeek-v4 等)与 LightRAG、PageIndex、Codex 式、Claude Code 式四类系统上得到四大结论。其一,布局感知检索是强基线:PageIndex 中文 OA 比 LightRAG 高 9.73 分、英文高 6.98 分,投资策略报告单场景跃升 +23.32。其二,Agentic 常获最强结果但最优配置随视角而变:Claude Code+Sonnet 5 场景级中英 OA 双最高,Codex+GPT-5.5 闭源任务级最优、Codex+DeepSeek 开源最强。其三,无系统通吃所有任务:PageIndex 在知识查询、多跳与规划精度上强,Codex 式在隐式与显式推理上强。其四,质量须与成本权衡:Agentic 的 token 与时延约为检索基线的 2.5–5 倍。失败模式分析揭示数值漂移、证据遗漏、布局混淆、过度综合、规划薄弱五类错误,多发生在已找到部分证据之后——答案流畅却可能反向推导投资含义;且词法重叠只是辅助诊断,忠实并不等于覆盖完整。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 中文场景级综合准确率(OA) | Agent-as-a-Judge 准确率(ACC, 0–100) | Claude Code + Sonnet 5 达 76.01(中文 OA 最高) | LightRAG + GPT-5.5 中文 OA 62.42 | PageIndex 相对 LightRAG +9.73(72.15 vs 62.42),最强 Agentic 进一步领先约 13.6 分 |
| 英文场景级综合准确率(OA) | Agent-as-a-Judge 准确率(ACC, 0–100) | Claude Code + Sonnet 5 达 69.39(英文 OA 最高) | LightRAG + GPT-5.5 英文 OA 59.92 | PageIndex +6.98(66.90 vs 59.92),最强 Agentic 相对 LightRAG 约 +9.5 分 |
| 中文投资策略报告(IS)跨布局推理 | 场景级 ACC | PageIndex + GPT-5.4 达 64.78 | LightRAG + GPT-5.5 仅 41.46 | +23.32,是表 5 中两系统间最大的场景级跃升 |
| 中文任务级聚合平均(闭源) | 任务级 ACC 聚合 | Codex + GPT-5.5 中文 60.63(闭源最优) | LightRAG + GPT-5.5 中文 53.52 | +7.11;其中隐式推理 IR 达 73.33 |
| 英文任务级聚合平均(开源) | 任务级 ACC 聚合 | Codex + DeepSeek-V4-Flash 英文 61.55(开源最强) | Codex + Qwen3.5-plus 英文 55.53 | +6.02;开源配置逼近闭源最优水平 |
| 成本效率 | 平均 token / 单题耗时 | Agentic 31.4k–45.8k tokens、22.8–50.6 秒 | LightRAG 12.8k/8.6s、PageIndex 15.6k/11.9s | 质量提升伴随约 2.5–3.5 倍 token 与 2–5 倍时延代价,催生成本感知路由 |
局限与改进
作者明确承认三类局限:FinanceComplexQA 聚焦文档锚定的金融推理,不覆盖实盘交易、实时市场预测与个性化投资建议;虽是双语但当前只强调中英文,未测试更广泛的多语言迁移;Agent-as-a-Judge 提升可扩展性却可能继承评审者偏差,未来需更强人工校准与对抗式 judge 检查;Finance-LaTeX 合成数据仅供开发,不进入正式评测。我观察到的额外局限:表 5 中 PageIndex 与 LightRAG 用不同核心模型(GPT-5.4 vs GPT-5.5),作者也承认无法把场景提升因果归因到「仅索引方式」,使「布局感知带来提升」的结论带噪声;全部评测由 GPT-5-mini 单一 judge 完成,无 judge 一致性与交叉 judge 报告;参考答案虽称稳定但金融事实会随财报修订与监管更新漂移;human evaluation 仅 6 组、覆盖域不均(Participant 6 在较短英文 GFB 上得 0.0),统计代表性偏弱。
独立分析的弱点
独立分析看存在若干可改进弱点。其一,索引归因不可控:表 5 中 LightRAG 用 GPT-5.5、PageIndex 用 GPT-5.4,建议固定同一核心模型做配对实验,把场景级提升拆解为「布局增益」与「模型增益」两个分量。其二,单一 judge 风险:建议引入多 judge 投票与人工校准子集,输出 judge 间一致率并发布对抗样本,测试 judge 是否被「流畅但不完整」答案欺骗。其三,成本-质量缺自动路由:可在基准上训练轻量分类器,把简单知识查询路由到 LightRAG、布局敏感题路由到 PageIndex、需分解/计算/跨布局综合题路由到完整 agent loop,论文只提方向未实现。其四,时效性缺维护机制:建议为每题标注「事实有效期」与「数据源版本哈希」,定期重跑核验脚本自动标记漂移样本。其五,跨布局证据关系标注目前只用于评测分析未用于训练 retriever,可探索作弱监督训练布局感知检索器。其六,缺对抗鲁棒性测试(如扰动单位/时期看系统是否崩),可在失败模式上做对抗扩展。
未来方向
作者明确提出:未来金融 agent 应包含显式证据计划(生成答案前先列必要证据类型并逐项核验是否已检索、独立验证计算)、布局保留检索(把表结构、图注、注释、页级上下文一起索引)、指标感知自检(规划/摘要自检覆盖与忠实度、数值任务自检单位/符号/时期),并采用成本感知路由;还列出四类消融——去布局元数据只索引纯文本 chunk、禁用工具纯靠上下文作答、对比一次性生成与 plan-then-answer、对比完整 agent loop 与成本感知路由。基于成果可延伸的方向有:把 layoutCoT 这类「如何从某段/表/表单得到 X」的导航链作为可解释监督训练专门 retriever;用 Finance-LaTeX 合成数据做对抗与课程学习;把基准扩展到多语言、实时市场与多文档投资组合决策;探索 judge 校准的元学习方法;并把表 8 的 Numeric drift 等五类失败模式转化为针对性微调目标,分别提升数值绑定、证据完整、版面对齐与计划落地能力。
复现评估
复现评估整体中等偏上。论文公开了完整方法学:8 大场景与 9 类任务的标注 schema、解析为层级证据单元的流程、Agent-as-a-Judge 六维评分标准(表 4)以及附录 A 的全套提示模板(A1–A5 文档生成、A7 问题改写、A8 复杂问题合成、A9 合并问题求解、A10 答案-段落一致性校验),对复现合成流水线极有帮助;真实语料元数据来自 ConvFinQA、FinanceBench-test、OfficeQA-Pro、BizFinBench v2 与工业知识库,可追溯。主要不确定项有三:评测系统的具体检索器配置、工具清单与 agent loop 提示未完全公开,且核心模型多为未来版本(GPT-5.4/5.5、Claude-5-Sonnet、Qwen3.x),第三方难 1:1 复现绝对分数;全部评测由单一 GPT-5-mini judge 完成无一致率报告;1009 份评测文档与 2026 题未随文发布。算力上单题最高约 45.8k tokens/50.6s,完整跑对 API 预算中等,子集个人可负担。综合看方法流程可复现,绝对排行榜应以相对趋势解读。
论文图表