FinIndices:面向长期财务报表的 LLM 金融推理可信度评测基准 Are the Financial Reasoning from LLMs Credible? A Real World Test over Long-Horizon Statements
用全长度财务报表测出 LLM 金融推理的知识与结构两大瓶颈
前置知识
三大财务报表(资产负债表 / 利润表 / 现金流量表)
财务分析的三大基础数据源。资产负债表(Balance Sheet)是某一时点的存量快照,记录资产、负债与所有者权益;利润表(Income Statement)按时期累计,记录收入、成本与利润;现金流量表(Cash Flow Statement)同样按时期累计,分为经营、投资、筹资三类活动。三者之间存在勾稽关系,本文要求模型在长达约 3.3 万 token 的未裁剪报表中跨表抽取与对齐数据。
几乎所有指标计算都需要跨这三种报表抽取数据并校准时点/时期属性,是读懂全文口径对齐挑战的前提。
存量与流量(Stock vs Flow)
存量是某一时点的瞬时值(如期末存货、总资产),流量是一段时间内的累计值(如营业收入、现金净流入)。两者不能直接相除,否则产生量纲错配——这就是计算周转率、ROA 时必须用期初与期末的平均余额作分母的原因。本文专门设置口径对齐任务,测试模型能否正确区分并校准这两类变量。
论文揭示的最致命错误之一就是模型把时点存量当流量直接除,导致周转率、ROA 等指标系统性失真,是理解口径瓶颈的关键。
滚动窗口与累计指标(TTM / YTD 与时间去累计)
TTM(Trailing Twelve Months,滚动十二个月)指截止某日的过去连续 12 个月数据。由于中国季报只披露 YTD(Year-to-Date,本年累计)而非滚动数据,模型须自行推导 $\text{TTM} = \text{Current YTD} + \text{Previous Annual} - \text{Previous YTD}$。时间去累计(temporal de-cumulation)指从年度累计反推单季度值,例如单季 $Q_4 = \text{年度累计} - Q_3\text{累计}$,需跨多个不连续报告期做逻辑推理。
时间推理是本文核心能力轴之一,TTM 与单季去累计是模型崩塌重灾区,理解它们才能看懂时间语义混淆与认知过载两类失败。
统计口径(Caliber)
统计口径指同一经济量在不同标准下的定义与单位差异,例如母公司 vs 合并报表、名义值 vs 实际值(PPP)、存量 vs 流量、人民币 vs 美元,或 NBS vs World Bank vs IMF 等宏观统计来源差异。跨口径比较前必须先做口径统一(caliber unification),否则数字不可比。
纯口径对齐是本文四条能力轴之一,也是 Table-Index 制表任务最难的一环,理解它才能读懂模型为何在生成 2D 表格时反复错配列。
监督微调(SFT)与精确匹配全有或全无评估
监督微调(SFT)指用带标注的推理轨迹数据对预训练模型做有监督训练以习得某项结构化能力;本文用 6,301 条 Gemini 蒸馏轨迹微调 Qwen3.5-35B。精确匹配(exact-match)要求输出与标准答案逐字符(或数学等价)完全一致才算对;对 Table-Index,本文用更严格的全有或全无打分 $S = \prod_{g \in V_{gt}} \mathbb{1}(\exists d \in V_{pred} \, s.t. \, d \approx g)$,即所有目标值都对才记 1 分。
理解 SFT 和严格全有或全无评估,才能看懂可学习性结论,以及为何领先模型也只能拿 70% 左右——漏一个值即整题归零。
研究动机
现有金融 LLM 基准测试存在系统性盲区。它们要么是基于专业知识考试的选择题(如 FinEval、CFinBench、FinEval-KR),要么是在裁剪好的短表格片段上做单跳 QA——FinQA 平均上下文仅 1,003.8 token、TAT-QA 仅 590.7 token——几乎无法反映真实分析师的工作流。真实场景里,分析师要从市场行情、财报、宏观库等异构来源收集数据,在不同统计口径(母公司 vs 合并、名义 vs PPP、存量 vs 流量)、不同报告频率(月度/季度/年初累计 YTD/滚动十二个月 TTM)、不同单位币种之间做对齐,最后产出一张审计级的多行多列表格而非单个数字。更关键的是,端到端(E2E)智能体流水线的失败往往不是因为高层推理有缺陷,而是中间数据抽取、对齐、计算环节的级联错误。既有基准既不测时间去累计等时间语义,也不测中国会计准则(CAS)特有的科目分类,更不要求生成结构化多值输出,因此无法暴露模型在工业级数据可靠性上的真实短板。
本文的目标是本文要构建一个能真实模拟金融分析师工作流的评测基准。具体目标包括:第一,使用未裁剪的全长度财务报表(平均 16,202 token,最大 33,126 token,硬上限 32,768 token),逼真复现长上下文噪声环境;第二,覆盖三大报表,含 829 家上市公司、384 个财务指标、28 个报告期;第三,设计两种任务范式——单指标计算(Single-Index)和统一口径多指标制表(Table-Index,平均 7.75 个目标值,最多 20 个),以及四条正交能力轴(纯领域理解、纯口径对齐、时间+口径、时间+领域);第四,通过对抗性陷阱(信息缺失要主动拒绝、干扰期要忽略)测试模型是真推理还是模式匹配;最终用三位专家多数投票验证保证标准答案绝对准确,借此量化知识瓶颈与结构瓶颈的严重程度。
与已有工作不同的是,本文的独特切入点是:不去泛泛争论模型推理能力强不强,而是聚焦被既有基准普遍忽视的中间数据处理可靠性——这才是端到端金融智能体真正崩塌的环节。已有工作要么把财务文本当普通文本测语义,要么只测工具调用或视觉感知,却几乎没人系统测试模型在长表格里能否对齐口径、能否正确反推单季度值、能否在信息不足时主动拒绝。更进一步,本文通过有/无公式提示与单值/制表两组受控对照,精确定位了两种不同失败根源——知识缺失与结构认知过载——而不是笼统地说模型不行。这种把会算单题与能撑住制表拆开诊断的视角,是判断 LLM 是否具备真正结构化推理的关键。
核心方法
可以把 FinIndices 的构造想象成一条自动化出题加人类监考的流水线。直觉上:先把真实上市公司年报里的三大报表精准抠出来,再按出题意图把不同时期的数据拼成上下文、埋下干扰和陷阱,最后套用教科书公式用代码算出绝对正确的标准答案。技术上分三阶段。第一阶段财务报表抽取:用正则从原始报告里隔离出三大报表的 LaTeX 表格块,随机转换成纯文本网格、JSON、元组列表等多种形态以训练结构泛化。第二阶段上下文构造与指标对齐:按查询类型检索所需报告期、动态采样 4 至 9 个连续时期拼接、注入干扰期和信息缺失陷阱、并强制上下文不超过 32,768 token。第三阶段指令与问答对生成:从经典金融教材和会计准则而非第三方网页提取规范公式,用程序化执行生成标准答案,再套用多样化人工模板与随机约束(单位换算、精度要求)。
本文最本质的创新不在某个算法,而在评测设计哲学——用两个正交的受控对照把 LLM 的伪推理逼出原形。第一个对照是有/无公式提示:同一道题,给公式时 Gemini-3.1-Pro 制表能到 70.70%,拿掉公式就暴跌到 38.22%,证明模型只是在上下文里模式匹配公式,并不真正掌握会计逻辑。第二个对照是单值 vs 制表:同一个指标,单独问时模型推理完美(如净资产 YoY 增长算出 6.19% 全对),一旦塞进多指标 2D 表格就退化成抓相邻错误列、用字面算术替代深会计调整的浅层启发式(如净资产 YoY 算成 -3.25% 而真值是 -4.22%)。这种同一认知任务、不同结构负载的指标级消融(Tables 15、16)首次清晰证明:失败不是因为缺知识,而是因为维持严格的结构输出主动抽干了推理资源——这是一种零和的认知机制。已有方法从未把会算和能制表拆开诊断。
方法步骤详情
完整流程分五步。第一步,从 829 家上市公司原始报告中用正则切出财务报表章节,提取三大报表的 LaTeX 表格块,过滤残缺表,并随机改写成纯文本网格/JSON/元组列表四种格式以训练结构泛化。第二步,按查询类型做时间映射——单指标题检索精确报告期组合(如 YoY 需本期与上年同期),制表题动态采样 4 到 9 个连续时期拼接;同时注入两类对抗陷阱:干扰期注入(只需 Q2、Q3 却塞入 Q1)和信息缺失(故意漏掉前置报告,逼模型输出 Insufficient information)。第三步,从教材和会计准则提取规范公式(覆盖 300 余指标,约 58% 来自财务报告分析框架、35% 来自中国会计准则),用程序化执行从报表提取源科目算出标准答案。第四步,套用人工模板生成提问,随机注入单位换算与精度约束并动态缩放标准答案。第五步,三位领域专家多数投票审核,精简出 640 条测试集。评测用正则提取预测值,再用全有或全无打分 $S = \prod_{g \in V_{gt}} \mathbb{1}(\exists d \in V_{pred} \, s.t. \, d \approx g)$ 判分。
技术新颖性
技术新颖性体现在三处。第一是长表格加对抗陷阱的组合:与 FinQA/TAT-QA 在裁剪片段上做浅层运算不同,FinIndices 用未裁剪全报表(均值 16,202 token,是 FinQA 的约 16 倍)逼模型在海量无关指标中做抽取,并用信息缺失要拒绝、干扰期要忽略两类陷阱测真理解。第二是制表任务范式:要求模型生成严格 HTML/JSON/元组列表的 2D 矩阵(平均 7.75 个值、最多 20 个),并配以全有或全无打分,直接对标审计级交付物,这在中文金融评测里几乎空白。第三是诊断方法论:通过有/无提示和单值/制表双对照做指标级消融,首次把知识瓶颈与结构瓶颈分离——这是与以往只报总分的基准的本质区别。配合覆盖中国会计准则 CAS 的 384 个指标,整个基准填补了中文长上下文表格可靠性的评测空白。
实验结果
在 13,299 条平衡子集上的评估暴露两大脆弱。首先是知识瓶颈:拿掉公式提示后所有模型集体崩塌。Gemini-3.1-Pro 制表从 70.70% 暴跌到 38.22%,Claude-Opus-4.8 仅 38.85%,Qwen3.7-Max 从 72.82% 跌到 33.97%;GPT-5.4 制表领域理解从 72.73% 崩到 18.18%,证明通用大模型只做上下文模式匹配而无内化会计逻辑。其次是结构瓶颈:从单值到 2D 矩阵,给提示的最强 Gemini-3.1-Pro 也从 79.61% 降到 70.07%;指标级消融显示,同一营业净利润/总利润指标单独问时模型完美执行 CAS 减值调整(104.0%),塞进表格就退化成 (Revenue-Cost)/Profit 字面捷径(真值 94.06% 却得 129.82%)。第三,金融专用 LLM 反而更差:DianJin-R1-32B 单值带提示 41.29%、制表仅 11.41%,Fin-R1、Llama-Fin-8B 制表接近 0%,说明非结构化语料上的领域预训练无效。第四,SFT 有效:用 6,301 条 Gemini 蒸馏轨迹微调 Qwen3.5-35B,无提示下单值 +8.54%、制表 +3.82%,且无灾难性遗忘。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 制表任务(Table-Index)公式提示消融 | 精确匹配准确率 | Gemini-3.1-Pro 无提示 38.22% | 同模型带提示 70.70% | 移除显式公式后暴跌 32.48 个百分点,证实知识瓶颈 |
| Table-Index(带提示)跨模型对比 | 精确匹配准确率 | Qwen3.7-Max 72.82% / Gemini-3.1-Pro 70.70% | 金融专用 Llama-Fin-8B 0%、Fin-R1 0% | 通用旗舰模型大幅碾压金融专用模型,揭穿领域预训练无效 |
| 单值到制表的结构负载消融 | 精确匹配(带提示) | Gemini-3.1-Pro 单值 79.61% → 制表 70.07% | — | 制表结构认知过载导致下降约 9.54 个百分点 |
| SFT 微调 Qwen3.5-35B-A3B(无提示) | 精确匹配准确率 | 单值 56.46% / 制表 19.11% | 基座单值 47.92% / 制表 15.29% | 单值 +8.54、制表 +3.82 个百分点且无灾难性遗忘 |
| Table-Index 能力轴·领域理解(去提示) | 精确匹配准确率 | GPT-5.4 18.18% | GPT-5.4 带提示 72.73% | 去公式后崩塌约 54.55 个百分点,证明无内化会计知识 |
局限与改进
作者承认两个局限。一是数据模态受限:当前只覆盖三大核心报表(资产负债表、利润表、现金流量表),未集成高频行情数据(成交量、实时价格)、宏观经济时序(利率、GDP 增速)或企业内部运营数据(分产品销量、供应链指标)。二是应用场景因此受限,重基本面会计分析,未覆盖盈利电话会情感分析、跨资产相关性建模等定性任务,作者建议未来引入多模态多源金融数据。我自己观察到三点额外局限:首先,测试集仅 640 条且全部来自中文 A 股语境,统计置信度有限(标准差多为 0.3% 至 2%),跨语言与跨市场泛化未验证;其次,制表全有或全无打分过于严苛,单个单元格错即整题归零,可能低估模型真实部分能力,也使分数对少数难题高度敏感;第三,SFT 改进仅在一个 35B 模型上验证且蒸馏源就是 Gemini,存在近亲繁殖风险,能否迁移到更大或更小规模、效果能否持续均未论证。
独立分析的弱点
弱点一,评测规模与多样性不足。640 条测试集虽经三专家验证质量极高,但每个能力轴×任务范式子单元往往只剩几十甚至十几条样本(如制表纯口径对齐 86 条、制表领域 22 条),单条噪声对结论影响过大。改进方向:扩大专家标注规模、引入分层抽样与置信区间报告,并补充英文年报与美股/港股市场以验证 CAS 之外的泛化。弱点二,制表全有或全无打分掩盖了局部能力。一道制表题平均 7.75 个值,错一个就归零,无法区分 9 对 1 错与全错,不利于定位真实短板。改进方向:引入单元格级部分得分或错误传播评分,区分是计算错还是格式/解析错。弱点三,SFT 实验仅用 Gemini 自蒸馏微调 35B,未做系统对照(不同蒸馏源、不同规模、是否过拟合模板)。改进方向:用多教师蒸馏加课程学习,并混入真实会计专家轨迹训练。弱点四,论文只诊断不治疗,未提供缓解结构瓶颈的提示工程或工具增强方案。改进方向:可探索先分步计算再结构化输出,或让模型调用 Python/计算器来卸载结构负载。
未来方向
作者明确提出要把基准扩展到多模态、多源金融数据,纳入高频行情、宏观时序和内部运营数据,覆盖盈利电话会情感分析、跨资产相关性等更宽场景。基于本成果可延伸的方向有:第一,把指标级消融方法论推广到法律、医疗等同样有长文档加严格结构输出需求的领域,验证结构瓶颈是否是 LLM 的普适缺陷。第二,针对知识瓶颈系统研究如何在 SFT 或 RLHF 中注入可验证的会计规则知识,而非仅靠蒸馏模仿。第三,研究推理负载卸载——通过让模型调用外部计算器/Python 执行器或采用思维链加显式中间表范式,直接消除制表时的结构认知过载。第四,把对抗陷阱(信息缺失拒答、语义锚陷阱)做成可组合的压力测试套件,持续跟踪金融 LLM 稳健性演进。第五,探索从约 38% 制表准确率到生产级(>95%)所需的规模与数据量曲线。
复现评估
复现评估:基准本身(数据集与评测脚本)承诺开源,托管在 HuggingFace(Findata/Finindice),数据合成流水线三阶段(报表抽取、上下文构造、问答生成)描述相当详细,384 个指标映射到 300 余公式来源(Table 17),具备较高可复现性。测试集 640 条经三位专家多数投票验证,标签质量极高。算力需求方面,评测需调用多个闭源 API(Gemini-3.1-Pro、Claude-Opus-4.8、GPT-5.5)及开源大模型(Qwen3.7-Max、DeepSeek-V4-Pro 等数百 B 参数),单题上下文最长 33,126 token 且需跑 3 次取标准差,API 成本与 GPU 资源消耗较大;SFT 部分需要 6,301 条蒸馏轨迹和训练 35B 模型的算力。主要复现难点:闭源模型版本(论文用 Gemini-3.1-Pro 等未来版本号)普通研究者难以完全对齐;对抗陷阱和指标级消融的完整脚本是否随数据一并发布需确认。整体难度中等偏高,适合有充足 API/GPU 预算的研究团队复现,普通开发者可直接用发布测试集做轻量评估。
论文图表
展示三种典型金融分析工作流——比亚迪/特斯拉/理想汽车跨主体估值对比、贵州茅台 2019 至 2023 纵向漂移检测、中国 GDP 在 NBS/世行/IMF-PPP 三口径下的宏观对账,统一遵循输入报表→结构化推理→表格输出的管线,并对比朴素流水线的失败模式与结构化表格推理的保证。
这张图定义了全文研究动机——真实金融交付物是多行多列审计级表格而非单值,并点出三大核心挑战(口径统一、时间语义消歧、跨指标对齐),是理解为何要设计 Single-Index 与 Table-Index 两种范式的基础。