FinanceHarness:面向金融深度研究的自主智能体框架 FinanceHarness: Autonomous Financial Deep Research Framework
金融深度研究基准FinanceGym+框架FinanceHarness,时点隔离分离前后截止评测
前置知识
点对时(Point-in-Time, PIT)评测
点对时评测指在评估一个研究系统时,强制约束它只能访问某一截止日期(cutoff date)之前发布的信息,任何在此之后的数据都视为未来泄漏(future leakage)。在金融研究中这一点至关重要,因为分析师写报告时只能依据当时已公开的信息,而事后回看的市场结果总是已知的,若不切断就会让模型作弊。PIT 通常通过对检索语料按发布日期过滤、给每道题设置独立截止时间来落地。
本文的核心贡献 FinanceGym 正是建立在严格 PIT 协议之上:前截止日期(pre-cutoff)评分测证据检索,后截止日期(post-cutoff)评分测前瞻推理。理解 PIT 才能明白这套基准为何比通用深度研究基准更难、也更贴近真实分析师任务。
深度研究智能体(Deep Research Agent)
深度研究智能体是围绕大语言模型构建的多步自动化系统,通过反复调用搜索、阅读、引用和综合等工具,自动完成提出问题—检索证据—撰写长篇报告的全流程。它有别于单轮问答:需要多跳推理、跨来源交叉验证、生成长文并标注引用。典型实现有 ReAct 风格的脚本化支架(如 STORM、GPT-Researcher)和把研究流程内化进权重的微调模型(如 Tongyi-DeepResearch)。
论文把现有深度研究系统分为微调开源模型、带 ReAct 搜索工具的基础模型、工程化智能体搜索系统三类基线,并在统一 PIT 语料上公平比较。理解这套分类才能看懂 17 个基线的横向对比与工具分布漂移分析。
评分细则(Rubric)评测
Rubric 评测不靠单一标准答案,而是为每道题人工撰写一组可逐条核对的评分点,每点用 0–4 的五档锚定量表判定:0(未涉及)、1(提及)、2(部分)、3(实质)、4(完全有据)。报告的总分定义为各评分点得分的均值归一化到满分 4。其优势是可解释、可分维度拆解,且能分离证据检索与前瞻推理两类能力。
FinanceGym 用 2464 条专家标注 rubric 评分,主指标 Outcome = $\frac{1}{|Q|}\sum_{q}\frac{\sum_{c\in R(q)}\text{score}(q,c)/4}{|R(q)|}$。理解 rubric 机制才能理解为何所有模型都卡在 40% 以下、以及前后截止日期分数为何差距悬殊。
分组相对策略优化(GRPO)
GRPO 是一种强化学习微调方法:对同一道题采样一组(group)回答,用组内相对优势作为基线来估计策略梯度,从而无需额外的价值网络即可稳定训练。相比 PPO,GRPO 显著降低了显存与工程开销,是当前开源推理模型(如 DeepSeek-R1)常用的训练范式。
FinanceHarness 在同一环境内用 GRPO 做环境内训练(in-environment training),把 rubric 评分当作奖励信号,验证了评测与训练共享同一套工具/奖励契约的设计理念。
FAISS 向量检索与 IVF-SQ8 索引
FAISS 是 Facebook 开源的高维向量近邻检索库。IVF(倒排文件)先把向量空间聚类成若干 cell,查询时只搜索最近的若干 cell 以加速;SQ8(8 位标量量化)把每个浮点维度压缩成 8 位整数,大幅降低内存占用、轻微牺牲精度。两者结合(IVF-SQ8)可在亿级语料上做亚秒级稠密检索。
FinanceGym 的搜索沙盒用 Qwen3-Embedding-4B 对 1 亿+ 篇网页做向量编码,再用 FAISS IVF-SQ8 建索引,所有 17 个基线共享这一检索器,保证了横向对比的公平性。
研究动机
通用深度研究系统写的是面向大众的报告,无法胜任金融领域的分析师式研究。金融研究要求分析师连接实体关系、行业脉络、数值证据与前瞻风险:例如半导体分析师既要翻历史财报、判断竞争格局,又要预测未来需求与宏观环境才能给出评级,通用搜索代理缺乏财报分析与事件推演的专业工具。更关键的是评测缺失:现有深度研究基准(如 BrowseComp、DeepResearch Bench、ResearchRubrics)要么依赖实时网络、要么只用单一全局快照,没有按题设置发布日期截止线,无法防止未来信息泄漏;而金融 NLP 基准(FinanceBench 等)只测情绪、命名实体、申报文件问答等孤立能力,无法衡量连接实体—行业—事件—时间的长篇研究报告质量。金融研究真正需要的是前瞻(post-cutoff)推理,而现有基准恰恰缺这一维度。
本文的目标是本文的目标是补齐金融深度研究在环境与评测两端的空白。具体有三:第一,构建一个可强制点对时访问控制的金融搜索沙盒,让代理既能高效定位金融知识,又无法越过每道题的截止日期;第二,在该沙盒上构造一个大规模、专家验证的金融深度研究基准 FinanceGym,用投资论点驱动的研究问题配对前截止证据检索 + 后截止结果预判双层 rubric;第三,提出一个专家知识引导的智能体框架 FinanceHarness,自动化完成环境/数据构建、代理执行循环和奖励建模,使评测与训练共享同一套工具与评分契约,从而能端到端地产出专业金融研究报告。
与已有工作不同的是,本文的独特切入角度是时点隔离 + 双层 rubric。与 BrowseComp-Plus、DeepResearchGym 等可复现但无截止线基准,以及 DeepResearch Bench II、ResearchRubrics 等 rubric 丰富但不区分前后截止基准相比,FinanceGym 是首个同时满足金融领域 + 长篇报告 + 可复现语料 + 严格 PIT + 双层可验证 rubric 的基准(见论文 Table 1)。同时,它把评测—工具—训练统一在同一 PIT 环境里:微调模型训练时用什么工具,评测时就用同一套检索器与评分器,避免了业内常见的训练用一套工具栈、评测换另一套导致的工具分布漂移问题。
核心方法
整体思路是先建环境、再造数据、最后建框架。环境层是点对时搜索沙盒:从数千个公开域名爬网页,用 htmldate 抽发布日期、trafilatura 清洗文本,得 1 亿+ 篇带真实日期文章;用 Qwen3-Embedding-4B 编码成归一化向量,再用 FAISS IVF-SQ8 建索引,API 只允许检索发布日期 ≤ 截止日期的文档。数据层是 FinanceGym:从语料抽 437 万条实体关系边、111 万实体建金融实体图,挖掘跨类链接/时序叙事/极性分歧三类情境,按 $\text{score}(d)=z(v(d))(1+e(d))(1+r(d))$ 选截止日期,再让 LLM 不预设主题生成问题—论点—双层 rubric,经质量过滤得 2078 题、ILP 选 500 题、专家标注留 400 题、2464 条 rubric。框架层 FinanceHarness 是分层执行栈,用 tiered tool surface 把核心检索/阅读/引用/报告工具常驻、把估值/可比/风险延迟加载,支持 research/analytical/automatic 三种模式。
核心创新点是用同一个点对时环境贯穿评测与优化,并用双层 rubric 把证据检索与前瞻推理显式解耦。与已有方法的本质区别有三:其一,通用深度研究把评测和训练放在不同工具栈上,FinanceHarness 让模型在 rollout 与评测时面对完全相同的检索 API、文档抓取契约、引用要求和 rubric 信号——换骨干模型只改可学习的那一层;其二,传统基准用单一全局快照或实时网络,FinanceGym 为每道题设独立截止日期并由 FAISS 服务强制 PIT 过滤,一旦检测到未来泄漏即判整次运行无效;其三,rubric 拆成前截止(pre-cutoff,测可找到的历史事实)与后截止(post-cutoff,测只能事后验证的结果预判),让检索强但前瞻弱这类隐性问题可被量化定位——结果证明所有模型前截止分数都数倍于后截止。
方法步骤详情
分六步。①语料索引:爬网页、htmldate 抽日期、trafilatura 清洗、Qwen3-Embedding-4B 编码、FAISS IVF-SQ8 建库。②实体图:用 Gemini-3.5-Flash 在结构化 JSON 下抽实体—关系三元组,产 574 万原始边、过滤留 437 万边、111 万实体、来自 120 万源文章。③情境挖掘与截止选择:三模式(跨类链接/时序叙事/极性分歧)设实体预算防大盘股垄断;按 $\text{score}(d)=z(v(d))(1+e(d))(1+r(d))$($v$ 事件量、$e$ 多样性、$r$ 关系熵)选日期。④问题生成:喂 (情境, 截止) 对不预设主题,输出问题+论点+双层 rubric,从 29669 条生成经质量门筛到 2078 题,ILP 选 500 题。⑤专家标注:每题约 1.2 小时,411/500 题通过(82%),平衡到 9 主题/9 行业/6 推理/12 月度桶共 400 题。⑥执行评分:骨干在分层工具上跑有界循环做 PIT 搜索—读源—编号引用—报告定稿;LLM judge 按 0–4 五档逐条评 rubric。
技术新颖性
技术新颖性体现在四个层面。环境层:首次构建可强制 PIT 访问控制的亿级金融搜索沙盒,把发布日期做成一等公民的检索约束。数据层:首次用金融实体图 + motif 挖掘 + 投资论点驱动的自底向上分类法生成研究题,避免人为强加主题模板,并首创前/后截止双层 rubric。框架层:tiered tool surface 把常驻工具最小化以压低首 prompt、把金融专业工具延迟加载,并用 prompt-variant 模式在统一工具注册表上切换 research/analytical/automatic,避免模式切换后工具失踪导致轨迹中断。训练层:把评测用的 rubric judge 直接当 GRPO 奖励的一部分(0.6 rubric + 0.4 LLM 一致性/接地性/轨迹质量),实现评测—工具—训练同一契约。消融还揭示 URL 预取护栏把访问错误率从 39.4% 降到 2.1%,是工程鲁棒性的关键。
实验结果
在统一 PIT 检索器上评测 17 个基线 + FinanceHarness,核心结论有六。①基准极难:所有系统总分(归一化 rubric 均值)都低于 40%,最强私有 Claude-Opus-4.7 仅 34.1%,开源最优 GLM-5 为 30.4%。②FinanceHarness(Qwen3.6-27B)以 32.4% 领跑所有开源,略胜智能体 TTD-DR(31.5%)、GPT-Researcher(30.4%)、微调最优 Tongyi-DR(28.2%),仅逊于 Claude-Opus-4.7(34.1%)与 Gemini-3.1-Pro(33.2%)。③固定骨干消融阶梯提升:Vanilla 25.3%→朴素 29.6%→完整 32.4%→GRPO 后 32.8%,分层工具与工作流是主增益,GRPO 仅 +0.4 点。④换骨干比换脚手架影响更大:同一 ReAct 包装换 9 骨干跨度大于围绕 Gemini-3-Flash 换脚手架的跨度。⑤前后截止分数数倍悬殊(45.7% vs 11.8%),前瞻推理而非检索才是瓶颈。⑥其以 27B 逼近私有前沿,处规模—性能图左上高效区。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 金融深度研究报告生成(FinanceGym 400 题,2464 rubric) | 总体归一化 rubric 均值(%) | FinanceHarness(Qwen3.6-27B)32.4% | 开源最优 GLM-5 30.4% / 微调最优 Tongyi-DR 28.2% / 仅搜索 Vanilla 25.3% | 相比同骨干 Vanilla +7.1 点;领先开源最优 +2.0 点;GRPO 后 32.8% |
| 前截止证据检索子分 | 归一化 rubric 均值(%) | FinanceHarness 45.7% | Vanilla 36.1% / 朴素 harness 41.8% / GLM-5 44.7% | 比 Vanilla +9.6 点,证实分层工具显著提升证据检索 |
| 后截止前瞻推理子分 | 归一化 rubric 均值(%) | FinanceHarness 11.8%(GRPO 后 12.1%) | Vanilla 8.7% / Claude-Opus-4.7 9.9% / Gemini-3.1-Pro 12.8% | 所有系统后截止均 <13%,前瞻推理是跨系统共同瓶颈 |
| 专家标注质量门 | 专业标注通过率 | 82%(411/500 题通过) | — | 证明基准题目高质量、可标注、可评分 |
| 护栏消融:URL 预取 | 访问错误率 | 2.1%(开启护栏) | 39.4%(关闭护栏) | 错误率降 18 倍,虽最终分几乎不变但显著降低成本 |
局限与改进
作者明确承认两点局限。其一,语料范围:点对时沙盒基于 2025 年自采英文网页语料,对非英文来源、付费专业数据(如 Bloomberg 终端数据)和结构化申报文件(如 SEC EDGAR 的 10-K/10-Q)覆盖有限,而真实分析师恰恰高度依赖这些付费/结构化数据。其二,工具分布漂移:微调开源模型(Tongyi-DR、MiroThinker)原本在 Serper/Jina 等实时网络工具栈上训练,本文却用 FAISS+PIT/SQLite 的语料替代品评测它们,导致这些分数应被理解为受控 PIT 接口下的迁移结果,而非其真实能力。笔者额外观察:GRPO 仅 +0.4 点增益微弱,说明 rubric 奖励信号可能不够稠密或 172 条训练样本太少;82% 通过率虽高,但每题 1.2 小时的专家标注成本使基准扩展昂贵;后截止分数普遍 <13%,提示基准的前瞻维度或许对当前 LLM 几乎不可解,需警惕天花板效应。
独立分析的弱点
独立分析有四个弱点。第一,语料自建且仅限 2025 年英文网页,缺乏付费/结构化数据——改进方向是接入 SEC EDGAR、Wind/Bloomberg API、交易所行情等多模态结构化源,并把语料扩展到多语言与更长时间窗。第二,rubric judge 用 LLM 打 0–4 五档,存在主观性且只能判定是否提及/有据,难以判断数值推理是否正确——改进方向是引入可执行的计算型 rubric(如对预测涨跌幅、估值倍数做自动数值核对)与人工抽检校准。第三,GRPO 仅在 172 条机选样本上训练、增益仅 +0.4 点,奖励信号偏稀疏——改进方向是用更大训练集、更稠密的过程奖励(如每步检索召回率、引用准确率)或多阶段课程学习。第四,截止日期自动选择公式 $\text{score}(d)=z(v(d))(1+e(d))(1+r(d))$ 偏统计启发式,可能选到事件密集但与题无关的日期——改进方向是结合语义相关性重排序。此外,Figure 5 显示开源模型与私有前沿仍有约 1.7 点差距,提示骨干规模仍是瓶颈。
未来方向
作者明确指出的方向:把 GRPO 训练做更全面的策略扫描(论文明确说留待未来工作),因为本次只验证了单点配置。基于成果可延伸的方向:其一,把同一 PIT + 双层 rubric 范式迁移到其他高时序敏感性领域(宏观经济、大宗商品、地缘政治、临床试验、政策法规预测),检验范式的通用性。其二,把 rubric judge 升级为可自动核对数值的计算型评分器,并把未来结果用真实市场行情/财报数据自动回测,减少对 LLM judge 的依赖。其三,探索多智能体分工(如行业分析师 + 宏观分析师 + 风险分析师 + 综合编辑)的金融深度研究框架。其四,研究如何把后截止前瞻推理能力通过推理时计算(test-time scaling)或工具增强(如蒙特卡洛情景模拟)实质提升,因为这是当前所有系统的共同短板。其五,构建动态 PIT 语料,使基准随时间滚动更新以避免过拟合。
复现评估
复现性评估整体中等偏上但存在门槛。开源方面:作者承诺开源代码(GitHub: Yijia-Xiao/FinanceHarness)和 400 道研究问题,但明确不公开底层 1 亿+ 篇语料与私有 rubric(为保评分完整性,rubric 通过私有 leaderboard 评分)。数据方面:由于不公开语料,第三方难以完整重建 FAISS+PIT 检索器,需自行提供替代公开语料跑通 pipeline(作者声明 pipeline 支持任意公开语料输入)。算力方面:评测 17 个基线 + 多个 27B/235B 骨干、运行 500 题全量推理,对单卡用户成本高昂;GRPO 训练 27B 模型更需多卡。基准质量方面:400 题、2464 rubric、9 主题/9 行业/6 推理/12 月度桶的平衡设计很扎实,82% 专家通过率可信。难度方面:分层 harness、tiered tool、skill 注册、PIT FAISS 服务、rubric judge 都需较多工程搭建。综上,代码可复现 pipeline 与对比表,但完全复制评测分数需要原始语料或等价替代,门槛较高。
论文图表