← 返回 2026-09-01

面向大语言模型情感检测的跨语言功能向量 Cross-lingual Functional Vectors for Emotion Detection in Large Language Models

Jieying Xue, Phuong Minh Nguyen, Minh Le Nguyen, Shogo Okada 📅 2026-08-30 👍 2 2026-09-01 18:30
上下文学习 功能向量 可解释性 多标签情感分类 激活干预 跨语言迁移

从单一语言提取的功能向量可跨语言迁移,零样本操控多语言情感分类行为

前置知识

功能向量(Function Vectors, FVs)

FV 是从 LLM 处理 few-shot 演示时的内部激活中提取的一个紧凑潜在向量,代表'当前任务是什么'的方向信息。提取方式是:对若干注意力头在 clean 提示上的激活取平均并投影到残差流,推理时把该向量加到中间层即可在零样本条件下诱导模型执行该任务,相当于把演示学到的任务表征'压缩打包'后直接注入。

本文的全部研究对象就是 FV:作者检验从一种语言提取的 FV 能否迁移到另一种语言操控情感分类行为,不理解 FV 的提取与注入机制就无法理解论文的实验设计与结论。

因果中介分析 / 激活修补(Activation Patching)

一种机制可解释性技术:构造信息性提示(clean)与标签被打乱的损坏提示(corrupted),把某个内部组件(如注意力头)的激活替换为 clean 条件下的平均激活,观察模型能否在损坏提示上恢复正确预测。能恢复说明该组件因果地携带任务信息;对每个头计算平均间接效应(AIE)即可对头排序并选出关键的 FV 头集合。

FV 头的定位完全依赖该技术,方法第一步骤(AIE 打分选 top-k 头)就是激活修补的直接应用,是理解方法步骤的前置知识。

残差流(Residual Stream)

Transformer 各层之间传递信息的主干通道。每一层的输出可分解为 MLP 分支 $m^\ell$ 与注意力分支 $a^\ell$,二者都读写这条流。FV 注入正是把向量直接加到残差流上:$h^\ell = h^{\ell-1} + m^\ell + a^\ell + v_k^g$,相当于在信息通路中人为叠加一个任务方向。

论文的注入公式建立在对残差流结构的理解上,'多层注入优于单层'这一关键发现也是在残差流的信息传播视角下才能解释。

上下文学习(In-Context Learning, ICL)与归纳头

ICL 指模型仅凭提示中的少量演示样本就完成新任务而不更新参数。归纳头(induction heads)是一类负责复制/延续提示中已出现模式的注意力头,被认为在 ICL 中传播任务信息;已有工作证明只有一小部分注意力头负责从演示中携带任务信息,且这些头在不同任务间固定共享。

本文把 FV 定位为 ICL 的替代与补充:few-shot 实验中将 FV 注入归纳头,并论证 FV 能部分复现 ICL 的任务操控效果,需要读者理解 ICL 的内部机制假说。

多标签分类与 Macro-F1

多标签分类中一条样本可同时属于零或多个类别(本文一句话可标注 0–6 种情感)。评估采用宏平均 F1:$F1_{macro} = \frac{1}{C}\sum_{c=1}^{C} F1_c$,先对每个类别算 F1 再取平均,对类别不平衡敏感。生成式模型做此任务时需按演示格式输出一个情感标签列表。

SemEval-2025 Task 11 基准就是多标签情感识别,论文所有表格中的 Macro-F1 数值、以及混淆矩阵分析里的 TP/FP/FN 变化,都建立在这个任务形式与指标之上。

研究动机

大规模语言模型依靠上下文学习(ICL)就能在新任务上表现优异,但标准 ICL 在推理时必须携带若干演示样本,导致输入变长、计算与显存开销显著,且演示选择会明显影响结果。功能向量(FVs)被提出作为轻量替代:把演示诱导出的任务方向压缩成一个向量并注入中间层,即可零样本操控模型行为。然而已有 FV 研究几乎都停留在结构化、模式清晰的受限任务上,如简单分类、检索与事实归纳;Todd 等人(2024)的报告显示,在情感分析、同义词预测这类任务边界模糊、需要语义理解的复杂任务上 FV 效果有限。与此同时,真实世界的语义任务大多是多语言的:以 SemEval-2025 Task 11 为例,多语言多标签情感识别覆盖 28 种语言、6 类情感(joy、sadness、fear、anger、surprise、disgust),一句话可同时标注零到多个情感,需要隐含意图理解和对细微情感表达的跨语言消歧。FV 在这类语义复杂的多语言任务上是否依然有效、从一种语言提取的 FV 能否迁移到另一种语言,此前完全未被探索。

本文的目标是本文的核心目标是回答一个机制层面的问题:FV 编码的究竟是语言特定的行为,还是跨语言可泛化的任务级表征?作者设计了系统的实验协议:以 SemEval-2025 Task 11 中类型学差异较大的 5 种语言(英语 EN、德语 DE、中文 ZH、西班牙语 ES、俄语 RU)为基准,只从单一源语言 $g_1$ 的随机 5-shot 演示中提取 FV,然后在目标语言 $g_2$ 上推理。评估覆盖三种场景:(1)clean zero-shot,比较无 FV 基线与 zero-shot + FV,检验 FV 能否编码任务方向并在单语($g_1 = g_2$)与跨语($g_1 \neq g_2$)设置下操控行为;(2)perturbed zero-shot,在提示中混入颜色、国家等干扰标签以削弱显式任务线索,检验 FV 能否在被误导的语境下独立恢复任务行为;(3)multilingual few-shot,把 FV 注入 LLM 的归纳头并与标准 few-shot 提示叠加,检验 FV 是否与 ICL 互补。此外还系统分析注意力头选择在不同语言间的稳定性,为 FV 的实际多语言部署给出配置建议。

与已有工作不同的是,本文的独特切入角度有三点。第一,任务域的跨越:此前 FV 的负面结果集中在语义复杂任务(如情感分析、同义词预测),作者怀疑这并非 FV 本身的固有限制,而是注入策略(单层注入)与评估域太窄所致,于是首次把 FV 系统地搬到多语言多标签情感识别上验证。第二,跨语言视角:关于多语言 LLM 内部表征,已有'共享语言无关潜空间'与'英语中心偏置'两种对立假说,但都停留在语言层面或整体推理层面;本文首次在任务级潜表征层面提问——不同语言提取的 FV 是否指向同一功能方向?并通过跨语言 FV 的两两余弦相似度(Qwen3-8B 上高达 0.94–0.96)给出肯定证据,直接连接了可解释性与多语言 NLP 两条研究线。第三,工程层面的再发现:作者发现把 FV 头分布在多个层上注入远好于单层注入,且每个 LLM 存在一个跨语言稳定的最佳头数范围(Qwen3-8B 约为 top-20、Llama-3.1-8B 约为 top-5),这为 FV 在复杂语义任务上的可用性提供了此前缺失的可操作配置策略。

核心方法

直觉上,few-shot 演示的作用是在模型内部激活空间里'指出'一个任务方向;如果能把这个方向压缩成一个向量,就能在不提供任何演示的情况下直接'拨动'模型行为。FV 方法正是这种直觉的工程化:任务信息在 Transformer 中由一小部分注意力头负责携带,把这些头在处理演示时的激活取平均、投影到残差流上就得到 FV;推理时把 FV 加到残差流上,等价于把演示才能学到的任务方向直接写入信息通路。本文的技术路线分三步:(1)FV 头定位——借鉴 Todd 等人的因果中介分析,用简单抽取式任务 Concept_V_Object_5 构造 clean/corrupted 提示对,通过平均间接效应(AIE)给每个注意力头打分,选出 top-$k$ 个头组成 FV 头集合 $A$;(2)任务 FV 构造——在多标签情感分类的 clean 提示集上计算 $A$ 中各头的平均激活并求和得到 $v_k$,对每种源语言 $g$ 用该语言的提示重新计算得到 $v_k^g$;(3)注入与评估——推理时按 $h^\ell = h^{\ell-1} + m^\ell + a^\ell + v_k^g$ 把 FV 加入选定层的残差流,在 clean zero-shot、perturbed zero-shot 与 few-shot 三种设置下评估跨语言迁移,模型为 Qwen3-8B 与 Llama-3.1-8B-Instruct,所有实验重复 5 个随机种子。

核心创新在于把 FV 从'单语言、结构化任务'推广到'跨语言、语义复杂任务',并给出机制层面的证据。与 Todd 等人(2024)的本质区别有三。其一,头定位与任务构造解耦:FV 头集合 $A$ 用一个与情感无关的简单任务(Concept_V_Object_5)通过激活修补找出,并被证明跨任务固定共享;情感分类的 FV 只需在选定头上聚合该任务的平均激活,避免了在高噪声语义任务上直接做昂贵且不稳定的因果搜索。其二,跨语言迁移假设:作者假设 FV 捕获的是语言无关的任务信号而非词汇模式,并实测不同源语言提取的 FV 余弦相似度高达 0.94–0.96(Qwen3-8B),从表征几何上解释了为什么英语的 FV 能引导中文的推理——这与多语言 LLM'共享潜空间 vs 英语中心偏置'的争论形成直接对话。其三,多层分布注入:之前工作发现单层 FV 注入对情感分析这类语义复杂任务几乎无效,本文证实当 top-$k$ 头跨越多个层分布时性能大幅超过单层注入,说明任务表征需要沿模型深度传播才能稳定操控行为,这是对原方法关键的一次工程修正。

方法步骤详情

方法步骤如下。第一步,FV 头定位:对每个演示样本构造信息性提示 $p=[(x_1,y_1),\dots,(x_N,y_N),x_q]$ 与损坏提示 $\tilde{p}$(随机打乱标签);在 clean 提示集 $\mathcal{P}$ 上缓存每个注意力头在最后 token 位置的平均激活 $\bar{a}_{\ell j}=\frac{1}{|\mathcal{P}|}\sum_{p\in\mathcal{P}}a_{\ell j}(p)$;再用平均间接效应 $\text{AIE}_{\ell j}=\frac{1}{|\tilde{\mathcal{P}}|}\sum_{\tilde{p}\in\tilde{\mathcal{P}}}\big(f(\tilde{p}\mid a_{\ell j}=\bar{a}_{\ell j})[y_q]-f(\tilde{p})[y_q]\big)$ 对所有头排序,取 AIE 最高的 top-$k$ 组成集合 $A$;此步基于 Concept_V_Object_5 任务完成。第二步,构造情感分类 FV:在目标任务的 clean 提示集 $\mathcal{P}^e$ 上计算 $A$ 中各头的平均激活 $\bar{a}^e_{\ell j}=\frac{1}{|\mathcal{P}^e|}\sum_{p\in\mathcal{P}^e}a_{\ell j}(p)$,求和得 $v_k=\sum_{\ell j\in A}\bar{a}^e_{\ell j}$;对每种源语言 $g$ 用对应语言的提示重建并计算 $v_k^g$。第三步,注入:推理时在选定层执行 $h^\ell=h^{\ell-1}+m^\ell+a^\ell+v_k^g$,把 FV 直接加到残差流。第四步,评估:clean zero-shot 提示只含任务指令与候选情感标签;perturbed zero-shot 额外混入颜色、国家等干扰标签(如德语模板先列出'Colors: yellow, red, blue or none'与'Nation: China, USA, ...'再给出情感列表);few-shot 设置使用标准 5-shot 演示并注入 FV。zero-shot 用贪心解码只读取第一个生成 token,few-shot 最多生成 10 个 token,报告 5 个种子的 Macro-F1 均值±标准差。

技术新颖性

技术新颖性体现在四个层面。问题层面:这是第一个系统研究跨语言 FV 的工作,把 FV 的适用边界从 Todd 等人报告的'语义复杂任务上效果有限'推进到需要隐含意图理解的多语言情感识别,并证明之前的失败更多源于注入策略而非 FV 本身。实证发现层面:作者发现每个 LLM 存在相对稳定的最佳 FV 头数范围——Qwen3-8B 在约 6 个头之后收益进入平台期(实验统一取 top-20),Llama-3.1-8B 取 top-5——且最优头选择模式跨语言高度一致,意味着一次调参即可服务多语言部署;同时'跨多层注入显著优于单层注入'(单层提升非常有限)是对原方法的重要修正。机制解释层面:通过跨语言 FV 两两余弦相似度(Qwen3-8B 为 0.94–0.96,Llama-3.1-8B 为 0.85–0.93,且种子间方差极小)证明不同语言提取的功能向量占据几乎相同的表征方向,为'FV 编码语言无关任务信号'提供了直接的几何证据。实用价值层面:FV 注入是推理时的前向干预,无需参数更新、无需目标语言演示,能部分复现 few-shot ICL 的操控效果,且与 ICL 叠加时带来一致增益(如 ES→RU 的 78.4 超过俄语单语 few-shot 的 73.9),展示了轻量级多语言任务适配的可行路径。

Pairwise similarity scores of FV construction across different source languages (Qwen3-8B, 5-shot, head=20)
Figure 1: Pairwise similarity scores of FV construction across different source languages (Qwen3-8B, 5-shot, head=20)
Effect of the top-k attention heads used to construct FVs on performance under perturbed zero-shot prompts (Qwen3-8B)
Figure 2: Effect of the top-k attention heads used to construct FVs on performance under perturbed zero-shot prompts (Qwen3-8B)
Effect of top-k attention heads used for constructing FVs under monolingual and cross-lingual settings in Llama-3.1-8B-Instruct
Figure 5: Effect of top-k attention heads used for constructing FVs under monolingual and cross-lingual settings in Llama-3.1-8B-Instruct
Pairwise similarity scores of FV construction across different source languages (Llama-3.1-8B-Instruct, 5-shot, head=5)
Figure 7: Pairwise similarity scores of FV construction across different source languages (Llama-3.1-8B-Instruct, 5-shot, head=5)

实验结果

核心发现按实验逐一梳理。其一,clean zero-shot(Table 2,Qwen3-8B,|A|=20):无 FV 基线 Macro-F1 仅为 EN 36.4、DE 16.9、ZH 18.4、ES 41.4、RU 52.5,注入 FV 后全面跃升:EN 源→EN 53.7±1.4(+17.3),RU 源→RU 74.5±1.2,ES 源→ES 62.8±1.5;跨语言与单语差距很小,EN、ZH、DE 上跨语言甚至略优于单语。其二,perturbed zero-shot(Table 3):基线在误导提示下接近随机(EN 0.6、DE 0.5、ZH 0.0、ES 8.0、RU 1.8),注入 FV 后 EN 升至 50.2±0.9(ES 源)、ZH 升至 42.7±0.9(RU 源)、RU 升至 64.6±2.7(RU 源);Table 4 案例显示模型输出从无关词('My heart dropped'一句输出'yellow'、'I slammed my fist'输出'The man')被纠正为正确情感(fear;anger),证明 FV 能独立诱导任务行为。其三,few-shot + FV(Table 5):所有语言组合一致超越标准 few-shot(Table 6:EN 66.6、DE 64.1、ZH 54.1、ES 71.6、RU 73.9),其中 ES→RU 达 78.4±0.5 为俄语最佳、超过俄语单语 few-shot;对比 SemEval-2025 Task 11 强系统——基于 Qwen 32B 微调集成的 PAI(EN 82.3、RU 88.2)与 JNLP(EN 80.4、RU 89.1),本文仅用 8B 模型推理时干预即取得 EN 67.6、ES 76.0、RU 78.4。其四,机制分析(Figure 1/7):跨语言 FV 余弦相似度 Qwen3-8B 为 0.94–0.96、Llama 为 0.85–0.93。其五,配置消融(Figure 2/5):Qwen3 约 6 头后收益进入平台期,最优头数跨语言稳定但模型间不同;单层注入提升非常有限,跨多层分布注入才能大幅提升。其六,混淆矩阵(Figure 4):anger 与 disgust 的 TP、TN 同升而 FP、FN 同降;joy 的 TP 从 1742 增至 1861(+6.8%)、FN 从 757 降至 638(-15.7%)但 FP 增 8.1%;fear 的 FP 从 539 降至 304(-43.6%)、surprise 的 FP 从 942 降至 630(-33.1%),说明模型对易混淆情感变得更谨慎可靠。其七,鲁棒性(Table 7):用 5-shot 至 9-shot 提取 FV 均稳定有效。Llama-3.1-8B 趋势一致(Table 11/12,如 perturbed RU 从 35.5 升至 59.0±2.1)但方差更大(最高 ±5.6)。

Statistics of the multilingual emotion classification datasets used in our experiments
Table 1: Statistics of the multilingual emotion classification datasets used in our experiments
Macro-F1 scores (%) of Qwen3-8B on the cross-lingual emotion classification task with standard clean zero-shot prompts
Table 2: Macro-F1 scores (%) of Qwen3-8B on the cross-lingual emotion classification task with standard clean zero-shot prompts
Macro-F1 scores (%) of Qwen3-8B on the cross-lingual emotion classification task with perturbed zero-shot prompts
Table 3: Macro-F1 scores (%) of Qwen3-8B on the cross-lingual emotion classification task with perturbed zero-shot prompts
Case studies comparing perturbed zero-shot inference with and without cross-lingual FV injection
Table 4: Case studies comparing perturbed zero-shot inference with and without cross-lingual FV injection
Macro-F1 scores (%) of Qwen3-8B on the cross-lingual emotion classification task with few-shot prompts
Table 5: Macro-F1 scores (%) of Qwen3-8B on the cross-lingual emotion classification task with few-shot prompts
Macro-F1 scores (%) of Qwen3-8B with standard 5-shot prompts without FV injection
Table 6: Macro-F1 scores (%) of Qwen3-8B with standard 5-shot prompts without FV injection
Macro-F1 scores (%) of Qwen3-8B with standard clean zero-shot prompts (FVs from 5-shot to 9-shot demonstrations)
Table 7: Macro-F1 scores (%) of Qwen3-8B with standard clean zero-shot prompts (FVs from 5-shot to 9-shot demonstrations)
Macro-F1 scores (%) of Llama-3.1-8B-Instruct on the cross-lingual emotion classification task with perturbed zero-shot prompts (top-5 heads)
Table 11: Macro-F1 scores (%) of Llama-3.1-8B-Instruct on the cross-lingual emotion classification task with perturbed zero-shot prompts (top-5 heads)
Macro-F1 scores (%) of Llama-3.1-8B-Instruct on the cross-lingual emotion classification task with standard clean zero-shot prompts (top-5 heads)
Table 12: Macro-F1 scores (%) of Llama-3.1-8B-Instruct on the cross-lingual emotion classification task with standard clean zero-shot prompts (top-5 heads)
Performance of FV-enhanced few-shot prompting across different Top-k head selections on Qwen3-8B
Figure 3: Performance of FV-enhanced few-shot prompting across different Top-k head selections on Qwen3-8B
Confusion matrix across different emotion categories, where each emotion category combines results from all languages
Figure 4: Confusion matrix across different emotion categories, where each emotion category combines results from all languages
Performance of FV-enhanced few-shot prompting across different Top-k FV head selections on Qwen3-8B (esp/deu source)
Figure 6: Performance of FV-enhanced few-shot prompting across different Top-k FV head selections on Qwen3-8B (esp/deu source)
查看结构化数据
任务指标本文基线提升
多语言多标签情感分类 · clean zero-shot(英语目标,Qwen3-8B) Macro-F1 (%) 53.7±1.4(EN 源 FV,top-20 头) 36.4(无 FV) +17.3
clean zero-shot(俄语目标,Qwen3-8B) Macro-F1 (%) 74.5±1.2(RU 源 FV) 52.5(无 FV) +22.0
perturbed zero-shot(英语目标,Qwen3-8B) Macro-F1 (%) 50.2±0.9(ES 源 FV) 0.6(无 FV) +49.6
perturbed zero-shot(中文目标,Qwen3-8B) Macro-F1 (%) 42.7±0.9(RU 源 FV) 0.0(无 FV) +42.7
5-shot + FV(西班牙语→俄语跨语言迁移,Qwen3-8B) Macro-F1 (%) 78.4±0.5(ES 源 FV) 73.9(标准俄语 5-shot,无 FV) +4.5(且为俄语所有设置中最佳)
5-shot + FV(英语目标)vs SemEval-2025 Task 11 冠军系统 Macro-F1 (%) 67.6±0.3(8B 模型,推理时干预,免训练) 82.3(PAI:Qwen 32B 微调大模型集成) -14.7(模型小 4 倍且零训练成本,资源效率占优)
perturbed zero-shot(俄语目标,Llama-3.1-8B-Instruct) Macro-F1 (%) 59.0±2.1(RU 源 FV,top-5 头) 35.5(无 FV) +23.5

局限与改进

作者在 Limitations 中承认三点:研究聚焦任务级跨语言迁移而非标签依赖建模,未显式研究 FV 如何捕捉多标签场景中共现情感标签之间的相关性;研究把情感识别视为(多标签)分类问题,跨语言可迁移性是否推广到其他多语言推理或生成任务(如机器翻译)仍不清楚;尤其对涉及长输出序列的生成任务,全程持续注入 FV 可能过度操控、腐蚀模型潜空间并损害生成质量。我的补充观察:第一,语言覆盖仅 5 种且全为高资源语言,头提取所用的 Concept_V_Object_5 又是英语中心的概念关系任务,对低资源或类型学上更远语言的泛化未经检验;第二,perturbed 设置通过混入颜色/国家标签人为地彻底削弱任务线索,使基线接近 0(EN 0.6、ZH 0.0),提升幅度在观感上被显著放大,而现实中更常见的是温和的分布偏移;第三,与 SemEval 系统的比较不完全公平——PAI/JNLP 是在训练集上微调的 32B 集成模型,本方法免训练,两者反映不同的资源预算,差距(如 RU 78.4 vs 89.1)说明免训练方法上限仍明显更低;第四,两个模型需要不同的 top-k(20 vs 5)等配置,跨模型调参不可避免;第五,Llama 上的结果方差明显更大(±5.6),对随机种子较敏感;第六,zero-shot 只读取第一个生成 token、多标签输出最多 10 个 token,可能低估或截断模型的多标签判断能力。

独立分析的弱点

独立分析的主要弱点及改进方向:其一,FV 头定位依赖昂贵的激活修补(需在损坏提示上对候选头逐一做修补实验),且锚定于单一的英语抽取式任务 Concept_V_Object_5,若目标领域与该任务差异大,头集合可能失配;改进方向是研究任务自适应或无监督的头选择(如按激活范数、注意力模式聚类直接筛选),或用目标任务的轻量因果探针替代。其二,多标签依赖被完全忽略:六个情感类别存在强共现结构(如 fear 常与 surprise 同现),本文把 FV 当作对各标签方向的无差别聚合向量,无法表达标签间关系;改进方向是在 FV 中显式编码标签共现结构,或为每个情感构建独立向量并按输入动态组合注入。其三,生成任务中的过 steering 风险:作者也承认持续注入可能腐蚀潜空间;改进方向是引入门控机制或随解码步数衰减的注入强度,只在任务相关信息流的关键层与位置注入。其四,鲁棒性证据有限:perturbed 提示只是标签空间干扰,模型还可能面临指令改写、格式变化、语码切换等自然扰动,FV 在这些偏移下的稳定性未知;改进方向是构造更贴近真实分布的扰动基准做系统评估。其五,跨语言增益的解释仍偏相关而非因果:高余弦相似度说明向量方向接近,但未直接证明共享头因果地传递任务信息;改进方向是结合电路级分析(信息流追踪、头级消融)定位跨语言共享的具体计算路径。其六,与微调 SOTA 仍有约 10 分以上差距(RU 78.4 vs 89.1),可将 FV 与 LoRA 等轻量微调或自一致性解码组合以缩小差距。

未来方向

作者明确提出以及基于本文成果可自然延伸的方向包括:第一,把跨语言 FV 评估扩展到情感识别之外的多语言推理与生成任务(翻译、摘要、问答),并研究长序列生成中避免过 steering 的注入策略,例如衰减式或门控式注入;第二,显式建模多标签共现依赖,让 FV 携带标签间相关性信息。进一步延伸:理论上,可用机制可解释性工具(归纳头电路、信息流分析)解释为什么 FV 头集合跨语言稳定、为什么 0.94 以上的相似度足以支撑迁移,甚至检验'共享任务方向'是否位于与语言中线(language midpoint)相关的子空间;方法上,把 FV 与其他 steering 技术(in-context vectors、CLAS、task arithmetic)在统一基准上系统比较,探索 FV 的组合运算(多任务向量加减、情感强度的连续调节);应用上,利用 FV 免训练、开销低的特性构建轻量多语言适配层——为每个任务-模型对缓存一组 FV、运行时按需切换,这对无法微调的 API 模型与端侧部署特别有吸引力;此外,把扰动评估从标签干扰扩展到真实世界偏移(方言、语码切换、低资源语言),以及量化 FV 注入对模型幻觉率和校准度的副作用,都是值得跟进的问题。

复现评估

复现条件总体良好。代码已在 GitHub 开源(https://github.com/yingjie7/cross_lingual_fvs),数据集为公开的 SemEval-2025 Task 11(Muhammad et al., 2025,28 种语言,本文使用其中 EN/DE/ZH/ES/RU 五种,各语言训练集约 2000–2800 句,测试集约 1000–2700 句),模型为两个开源权重(Qwen3-8B 与 Llama-3.1-8B-Instruct),8B 模型 fp16 约需 16GB 显存,单张 24GB 消费级显卡或单张 A100 即可完成全部实验,无需任何训练;主要算力开销在 FV 头定位阶段的激活修补实验。关键超参数交代清楚:头提取任务为 Concept_V_Object_5,Qwen3-8B 取 top-20 头、Llama-3.1-8B 取 top-5 头,默认 5-shot 演示,全部实验跑 5 个随机种子并报告均值±标准差,zero-shot 贪心解码只取首 token、few-shot 最多生成 10 个新 token,指标为 Macro-F1。复现难度中等:提示模板(附录 Table 8–10)与干扰标签构造描述完整,主要工作量在于正确实现 AIE 修补实验与多层残差流注入(可借助 TransformerLens 等库);论文未逐语言公布注入层的具体索引列表,需根据 top-k 头的层分布自行确定,附录 C–F 的部分 Llama 结果与图表细节也建议对照原论文与代码核对。