谁在说话才重要:意大利议会会议记录上的权威感知多视图 RAG Who Speaks Matters: Authority-Aware Multi-View RAG over Italian Parliamentary Proceedings
用查询依赖的权威建模与逐字引用约束,让 RAG 平衡总结意大利十个议会党团立场
前置知识
RAG(检索增强生成)
检索增强生成是一种让大模型在回答前先从外部语料检索相关文档的架构:用户查询先经过检索器(通常是向量相似度搜索)找到最相关的文本片段,再把这些片段作为上下文连同问题一起交给生成模型,从而把回答约束在真实语料上、降低幻觉,并让语料更新无需重训模型。它将“知道什么”与“如何表达”解耦,是当前知识密集型应用的主流范式。
本文整个系统就是一条议会领域的 RAG 管线,其全部创新点都在对检索与生成环节的架构级改造上,不理解 RAG 的工作方式就无法理解这些改动的动机与收益。
知识图谱与属性图(Neo4j)
知识图谱以节点表示实体、边表示关系;属性图进一步允许节点和边都携带键值属性,例如议会中议员与党团之间的 MEMBER_OF_GROUP 边可以带 start_date/end_date,从而支持“任意时点的党团归属”这类时序查询。Neo4j 是主流属性图数据库,原生支持图遍历、全文索引和向量索引,可在同一查询里混合结构遍历与语义搜索。
论文把全部议会数据建模为单一 Neo4j 图(232,755 节点、488,487 关系),双通道检索、权威计算、跨党团检测和引用定位全部依赖图查询,图模型是理解本文方法的地基。
稠密检索与文本嵌入
稠密检索把文本编码为高维向量(本文用 text-embedding-3-small 的 1,536 维),通过余弦相似度寻找语义相近的内容,能匹配措辞不同的同义表述,弥补关键词检索的词汇鸿沟。工程上通常为向量建立 HNSW 等近似最近邻索引,以在大规模语料上实现低延迟查询。
议会发言被切成 151,073 个 chunk 并逐个嵌入,稠密通道是候选证据的首要来源;论文后续的“覆盖受检索制约”“权威不决定检索”等讨论都建立在对稠密检索能力边界的理解上。
专家发现(Expert Finding)
信息检索中的专家发现任务是从文本与元数据中识别某个主题的权威人物,传统上分为 profile-based(基于人物档案描述匹配)与 document-based(基于其产出的文档证据)两类。基于链接分析的排序(如 PageRank)给出的是与查询无关的全局权威分,无法反映“某人在某议题上是否专家”。
本文的核心创新正是把专家发现做成查询依赖的:同一议员在不同议题上权威分不同,且来自职业、教育、委员会、立法活动等可解释信号,理解这一任务背景才能看出其与已有方法的本质区别。
引用忠实性(Quotation Faithfulness)
指生成文本中的引文必须逐字对应来源文档的原文。常见的 RAG 归因校验(如 RARR、后置验证)仍允许生成器自由措辞,引文可能被意译或改写而失真。构造性的做法是让模型只输出带字符偏移的占位符,再由程序从原文确定性抽取文本,从机制上杜绝篡改。
论文在政治敏感文本上追求 QF=1.00 的完美忠实性,这是它与 NotebookLM(0.95)拉开差距的关键机制,也是“架构保证优于提示约束”这一论点的核心证据。
公平感知排序与多样性
公平感知排序在结果中为受保护群体(如少数党团)保留配额或施加约束;MMR 等多样化方法则在相关性与冗余之间权衡,避免结果被高频、高相似内容主导。这类技术常用于搜索去重与推荐多样性,但很少被集成进面向政治场景的 RAG 管线。
本文把党团覆盖作为一等约束:重排公式含 coverage 与 diversity 项、生成阶段按党团分层各写一节。理解公平与多样性排序的思路,才能明白这些设计为何是“结构约束”而非“事后修补”。
研究动机
议会辩论是民主审议的一手记录,但其体量与碎片化使多视角访问极其困难。以意大利众议院第十九届立法机构(2022 年 10 月起)为例,截至 2026 年 2 月已产生 608 次全体会议、6,010 场辩论和 40,416 篇个人发言,人工通读成本过高;机构关键词检索门户只返回孤立文档而非综合性答案,且一位议员对某议题的立场往往分散在多次会议、多场辩论中,难以重建。直接把 LLM/RAG 用于政治文本存在三类具体风险:一是语料分布不对称,最活跃的发言者支配答案,小党团声音被淹没;二是检索把所有说话者按内容相似度扁平化,无法区分议题专家与边缘评论者,忽视了职业、委员会成员等丰富元数据;三是引文幻觉与错误归因率虽低(如 NotebookLM 约 5% 引文并非逐字),但对新闻与机构用途而言是致命的信誉损伤。
本文的目标是本文要构建 ParliamentRAG:面向意大利众议院全部十个议会党团的 RAG 系统,为公民、记者、研究者就任意政策议题生成忠实、多视图、平衡的立场总结,已部署于 parliamentrag.it。目标可拆成三条可操作原则:其一,多视图代表(multi-view representation),让每个党团在答案中都有专属章节和被引用的发言人,而不是被高频发言者覆盖;其二,权威感知(authority awareness),按当前查询动态估计每位议员的议题权威分,让真正的议题专家浮现,同时权威只“影响”而不“决定”证据选择,以保住政治平衡;其三,引用可追溯(quotation traceability),每条引文都必须是官方速记记录的逐字片段,可回溯到原始发言的精确字符位置。作者用自动化指标加六位领域专家盲测,与 Google NotebookLM 对照,检验这些原则是否真正兑现。
与已有工作不同的是,现有研究各缺一角:议会 NLP 语料(ParlaMINT、意大利 IPSA)支持立场检测、主题建模和发言人画像,但不支持逐查询检索与多视图合成;议会知识图谱项目(LinkedEP、ParliamentSampo、dati.camera.it 的 OCD 本体)主要用于结构化查询与数据集成,不做查询相关的推理与生成;专家发现与链接排序给出查询无关的权威,而 RAG 中的来源可靠性估计假设存在单一正确事实,与多方合法立场并存的议会辩论不符;公平感知排序与 MMR 多样化尚未进入政治 RAG 管线;RARR 等归因框架允许生成器意译,无法保证逐字引用。本文的独特切入是把结构化议会图谱、查询依赖的权威建模与多视图分层生成首次整合进统一 RAG 架构,把三大原则做成架构级保证而非提示词层面的软约束。
核心方法
直觉上,系统把“说了什么”与“谁在说”联合建模:证据不仅按语义相关性检索,还按发言人的议题权威、党团覆盖与内容显著性重排,最终按党团分层生成、以程序化方式落引。技术路线是一条检索—重排—生成管线,全部数据驻留单一 Neo4j 属性图:包含 387 位众议员、64 位政府成员、10 个党团、80 个委员会、608 次会议、6,010 场辩论、40,416 篇发言和 27,576 项立法法案,共 232,755 个节点、488,487 条关系;发言被切成 151,073 个 chunk,每个存储 1,536 维嵌入(text-embedding-3-small)、在发言中的顺序位置以及指向原始文本的字符偏移,相邻 chunk 以 NEXT 边相连(110,657 条)以支持上下文扩展。查询经改写与嵌入后进入并行的稠密通道与图通道,合并去重后按加权公式重排,随后计算查询依赖权威分并为每个党团选出专家代表,最后走 Analyze–Generate–Integrate–Cite 四阶段生成结构化多视图答案。后端 LLM 为 GPT-4o,前端为 Next.js + FastAPI。
核心创新是查询依赖的权威模型与引用的结构性保证。与以往把权威做成查询无关的全局量不同,这里每位议员的权威随查询变化:$\mathrm{authority}(s,q) = \sum_i w_i\, c_i(s,q)$,分量融合职业与教育嵌入和查询嵌入的余弦相似度、带时间衰减的立法签署与发言次数、委员会身份及机构角色先验,权重为 $w_{\text{committee}}=0.25$、$w_{\text{speech}}=0.25$、$w_{\text{acts}}=0.20$、$w_{\text{profession}}=0.15$、$w_{\text{education}}=0.10$、$w_{\text{role}}=0.05$,且只统计发言人在当前党团期间的活动,防止历史换党污染当下估计。引用方面,LLM 从不生成引文文本,只插入带字符偏移的占位符,由程序从原始速记确定性替换,使 Quotation Faithfulness=1.00 成为构造性保证;而 NotebookLM 依靠提示词约束也只能达到 0.95。这体现全文中心论点:可靠性来自架构而非模型自觉。
方法步骤详情
第一步,查询改写与嵌入:把用户查询规范化并向量化。第二步,双通道检索:稠密通道在 151,073 个 chunk 向量上做相似度搜索;图通道先用词法+语义混合匹配相关法案,再沿 PRIMARY_SIGNATORY(27,373 条)与 CO_SIGNATORY(103,959 条)边遍历到签署议员及其发言 chunk,查询命中委员会关键词时还会优待相关委员会成员的发言。第三步,合并重排:按 chunk 去重取高分,计算 $\mathrm{score}(e) = w_r r(e) + w_d d(e) + w_v v(e) + w_a\,\mathrm{authority}(s_e,q) + w_\sigma \sigma(e)$,其中相关性 $w_r=0.35$、覆盖 $w_v=0.20$、显著性 $w_\sigma=0.25$、多样性 $w_d=0.15$、权威 $w_a=0.05$——权威权重故意最小,以免压过相关性、把小党团的实质贡献者挤出证据池。第四步,专家计算:为每个党团从证据池选出权威分最高的发言人作为代表。第五步,四阶段生成:Analyze 拆分原子论断并绑定各组证据;Generate 按权威分排序为每组产出章节,无证据则明说;Integrate 融合成连贯叙述并保留占位符;Cite 用字符偏移从原文确定性抽取逐字引文。
技术新颖性
技术新颖性体现在四个方面。其一,权威是查询依赖且可解释的:分量来自职业、教育、委员会、立法活动、发言次数、机构角色等可观察特征,权重经验设定、便于审查调整,而传统专家发现(如链接排序)是查询无关的黑箱式全局排名。其二,双通道检索把法案签署关系作为发言内容之外的议题参与信号:联署过相关法案的议员对议题的投入在纯向量检索中完全不可见,图谱通道补上了这一盲区,并支持发言时党团与当前党团不一致的跨党团检测。其三,分层生成把多视图从愿望变成结构约束——每个党团一节、按权威排序引用,使党团引用覆盖率达到 0.97,这超出了 GraphRAG 等只利用文档结构却不强制预定义群体覆盖的方法。其四,偏移式引文占位符机制在政治敏感文本上首次实现 QF=1.00 的构造性保证。与 NotebookLM 式的提示约束相比,这些性质不依赖模型自觉,也不随基座模型更换而失效。
实验结果
自动评估在 15 个政策议题上进行(51 个候选议题经 17 位公民调查筛选而来)。ParliamentRAG 的引用党团覆盖率 GQ=0.97(NotebookLM 0.95),章节完整性 0.99(对方 1.00),引用忠实性 QF=1.00(对方 0.95,约 5% 引文并非逐字),被引用发言人平均权威分 0.53(对方 0.52)。GQ 未到 1.0 是因为覆盖受检索制约:若某党团无 chunk 被检索到,它就无法出现。人工盲测由 6 位与作者无关的领域专家(议会记者、助理、政策分析师,平均从业 7.2 年)完成,共 N=67 组配对评估。NotebookLM 在文笔类维度占优:回答质量 4.30 vs 4.04、清晰度 4.51 vs 4.27;ParliamentRAG 在来源类维度全面领先:来源相关性 4.07 vs 3.84(偏好 33% vs 19%)、来源权威 4.21 vs 4.00(30% vs 13%)、来源覆盖 4.64 vs 4.39(25% vs 5%),平衡感知 4.66 vs 4.48。整体满意度相当(4.24 vs 4.27)。经 Wilcoxon 加 Holm–Bonferroni 校正后无单项显著,但 Cohen's d 呈一致模式:来源相关与覆盖 d=0.35、来源权威 d=0.28,回答质量 d=-0.31。72% 的专家愿意推荐此类系统。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 多视图党团覆盖(15 议题自动评估) | Groups with Quotation (GQ) | 0.97 | NotebookLM 0.95 | +0.02 |
| 引用忠实性 | Quotation Faithfulness (QF) | 1.00 | NotebookLM 0.95 | +0.05,逐字引用率 100% |
| 章节完整性 | Completeness | 0.99 | NotebookLM 1.00 | −0.01(略低) |
| 引用发言人权威 | Mean Authority (MA) | 0.53 | NotebookLM 0.52 | +0.01 |
| 人工盲测:来源覆盖 | 成对偏好率(N=67) | 25%(Likert 4.64) | NotebookLM 5%(4.39) | 约 5.7:1,Cohen's d=0.35 |
| 人工盲测:回答质量 | Likert 1–5 均值 | 4.04 | NotebookLM 4.30 | −0.26,基线在文笔类维度占优 |
局限与改进
作者承认的局限:基准仅 15 个议题,N=67 的配对评估统计功效有限,校正后无任何差异达到显著;缺少系统内部消融实验,无法量化权威项、双通道、分层生成各自的贡献;与 NotebookLM 的对比中,后者使用人工精选的约 150 个相关 chunk 加 150 个干扰 chunk 的 curated context,而非在全语料上端到端检索,因此这是“同等精选条件下回答质量”的比较,不是端到端检索能力的比较。我的补充观察:给 NotebookLM 的相关 chunk 本身来自 ParliamentRAG 自己的检索管线并经权威重排,天然偏向本文系统的检索偏好,可能低估其独立潜力;QF=1.00 是机制保证而非内容更准确的证据,不能推广为“事实更可靠”;评测模板固定为“党团对 X 的立场是什么”单一问句,未覆盖追问、跨议题比较等真实交互;权威分与排名权重均为经验设定,无敏感性分析;系统仅覆盖众议院第十九届立法机构,参议院与历史立法机构未验证。
独立分析的弱点
弱点一:权威模型权重(committee 0.25、speech 0.25、acts 0.20 等)完全凭专家经验设定,既无学习也无消融验证,不同议题可能需要不同配比;可用专家标注或引用行为做弱监督学习权重,或按议题 macro-area 自适应调节。弱点二:覆盖率受检索制约,GQ=0.97 意味着仍有一小部分提问中某党团完全缺席,语料最少的小党团最易被牺牲;可引入党团配额感知的检索目标或对缺席党团做针对性扩展检索。弱点三:人工评估中平衡类维度平局率高达 72%–78%,盲测对“平衡”差异不敏感,且六位专家的信息需求未必等同普通公民,结论外推存疑;可补充普通用户众包评测。弱点四:仅与 NotebookLM 单一商业基线比较,两者基座不同(GPT-4o vs Gemini 3)、检索条件不对等,缺少与开源议会 RAG 或 GraphRAG 的对照。弱点五:引文逐字但“引文选择是否公允”未被度量——系统仍可能选择性引用对某党团有利或有害的片段,QF 高不代表叙述公允;可引入引文立场分布审计作为新指标。
未来方向
作者提出的方向包括:结合用户偏好的个性化排序、议会领域专用嵌入模型(替换通用 text-embedding-3-small)、扩展到意大利参议院与更早立法机构、向欧洲其他国家议会家族做跨国泛化。基于本文成果可以进一步延伸:把查询依赖权威从经验权重升级为可学习的排序模型,并利用真实用户点击作为反馈信号持续校准;在权威模型中引入显式立场与时间维度,支持“某党团在某议题上立场如何漂移”的时间线分析;把多视图分层生成推广到其他多利益相关方场景,如听证会记录、公共卫生争议或企业内多方评审;构建引文选择公平性审计,度量各党团引文的正负面分布,弥补 QF 只管“真”不管“公”的缺口;利用 KG 结构向用户展示可解释的证据链——“为什么引用这位议员而不是那位”;以及通过扩大议题数量与专家样本来验证统计显著性,当前 0.28–0.35 的 Cohen's d 效应在更大样本下有望变得显著。
复现评估
复现条件较好。源代码以 Apache-2.0 许可开源(github.com/Emeierkeio/thesis-ParliamentRAG),在线系统 parliamentrag.it 可直接体验;知识图谱可从意大利众议院公开 RDF 数据(dati.camera.it 的 OCD 本体)重建,论文给出完整 schema(13 种节点标签、15 种关系类型、232,755 节点、488,487 关系、151,073 个 chunk)与关键超参数:全部检索与权威权重、嵌入模型 text-embedding-3-small、委员会-议题映射 YAML 路径,NotebookLM 提示词也公开在仓库中。主要成本在于:需要 Neo4j 实例并维护约 15 万条向量索引,嵌入与生成需调用商业 API(OpenAI);管线是常规 Next.js + FastAPI 单进程栈,无需特殊算力。人工评估环节(6 位议会领域专家、N=67 配对盲测)对个人研究者最难复制。总体难度中等偏低:数据全部公开、架构文档清晰,从零重建预计一到两周可跑通核心检索与生成流程,完整复现专家评估则需额外资源。
论文图表
以“司法改革”议题为例展示系统实际输出的界面截图:顶部是用户查询与时间戳,正文先给出导语(51 名议员参与、78 次发言,时间跨度 2022-10-25 至 2026-02-03,涉及第 4、28、39、67、68 次会议),随后依次呈现政府立场(司法部长 Nordio 的引文)、多数党团立场(意大利兄弟党宣布投赞成票、联盟党反对检法职业分离并附 Bisa 的原话引文)、反对党立场(民主党 Gianassi 的批评引文)等章节,所有逐字引文用« »符号界定。原文为意大利语,发表时翻译为英语。
这是全文唯一一张展示最终产品形态的图,让读者一眼看到三大原则如何落地成界面:每个党团有独立章节(多视图)、引文带书名号且可溯源(可追溯性)、发言人由权威模型挑选(权威感知)。理解了这张图,后文所有设计与评估指标都有了直观锚点。