ChronoLens:跨时间、语言与语言学维度的语言变化度量框架 ChronoLens: Measuring Language Change Across Time, Languages, and Linguistic Levels
用跨编码器对齐五种议会语言,量化两百年语言变化的幅度与方向
前置知识
Sparse Autoencoder (SAE) 稀疏自编码器
一种把语言模型稠密激活分解为一组稀疏、更具选择性的特征的无监督方法。它通过重构损失加上稀疏约束(如 L1 或 BatchTopK)训练,把分布式编码的信息重组为可解释的原子单位;典型实现设置词典大小为隐藏维度的若干倍,并限制每次激活的特征数量。
理解本文必须先理解 SAE 的局限——独立训练的词典之间特征不规范(feature j 在不同词典里没有对应关系),这正是作者引入 crosscoder 来做对齐的根本动机。
Crosscoder 跨编码器
SAE 的一种扩展,输入是来自多个条件(不同模型层、不同检查点,本文中是不同语言/时期)的匹配激活元组,学到一个共享的稀疏特征索引加上每个条件各自的 encoder/decoder。特征身份跨条件对齐,而 decoder 强度可以条件特定,从而支持把同一抽象概念放在统一坐标系里比较。
这是 ChronoLens 把多种语言、多个时期、多个语言学层面放进同一分析空间的核心机制,理解它才能看懂为什么池化 SAE 不能解决问题而 crosscoder 可以。
Diachronic Linguistics 历时语言学
研究语言随时间演变规律的分支,关注形态、句法、语义、语用等层面的历史变化。计算历时研究通常用词嵌入、依存距离、词形分布等指标比较不同时期文本,但这些指标往往互不兼容,难以跨层面比较。
本文要解决的根本问题就是历时语言学里"四个层面是否同步变化"这一基本问题,理解该领域现状才能体会作者构造统一表征框架的价值。
Post-hoc Linguistic Attribution 后验语言学归因
一种"先无监督学特征、再事后解释"的策略:特征学习阶段完全不使用语言学标签,训练完成后才通过逐特征消融 + 线性探针,把每个特征归到使探针预测概率下降最大的语言学层面。这种分离保证了语言学解释不会反向塑形学到的特征清单。
这是本文与探针驱动工作的本质区别,也是作者声称特征对齐结果"没有标签泄露"的关键证据,需要重点理解。
Linguistic Levels 语言学层面
传统语言学把语言分为形态(词的内部结构)、句法(句子结构)、语义(意义)、语用(语境中的使用功能)四个层面。本文用 23 个句子级任务做操作化:5 个形态(时态、语态等)、6 个句法(依存距离、子句嵌套等)、6 个语义(论元类型、抽象性等)、6 个语用(指示、立场、言语行为等)。
四个层面是本文分析的纵轴,理解每层用哪些探针任务度量,才能正确解读 Figure 3 的热力图和跨语言方向一致性结果。
研究动机
历史语言变化同时作用于形态、句法、语义和语用四个层面,但已有计算研究几乎都只用各自不兼容的表征来分析其中一个层面:词汇语义研究用静态或上下文嵌入、最优运输(Kishino 等, 2025);句法研究用依存距离与结构复杂度(Liu 等, 2022);形态研究用词形分布标注;语用研究则建模言语行为(Reinig 等, 2024)。由于这些方向使用不同的数据集、表征和度量单位,它们的历时轨迹无法直接比较,使一个基本问题无法回答:形态、句法、语义、语用是否同步变化,还是各自遵循不同的历史轨迹?多语言大模型虽然把多种语言投射到共同的稠密空间,但其维度并不对应稳定的语言学特征,因为信息是分布式编码、单一维度可能参与多种无关计算(Bricken 等, 2023);稀疏自编码器(SAE)能解耦出更有选择性的特征,但独立训练得到的词典之间并不规范——一个词典里的特征 $j$ 与另一个词典里的特征 $j$ 没有保证的对应关系(Leask 等, 2025)。据作者所知,还没有工作把多种人类语言、多个历史时期、多个语言学层面同时放进一个特征对齐的表示框架。
本文的目标是本文目标是构造一个统一的分析空间,在其中可以同时、可比较地度量五种语言(英、德、意、波、土)、200 多年(1803–2026)、四个语言学层面的历史变化,并使用同一组冻结多语言大模型和同一套匹配句子采样,避免因语料、tokenizer、采样策略差异造成的虚假差异。更具体地,作者希望得到的稀疏特征满足四点可量化标准:在 held-out 上重构残差(Fraction of Variance Unexplained, FVU)更低、轨迹稳定性(自举余弦)更高、与独立的语言学统计(如时态、子句嵌套、政策主题、言语行为分布)的 Spearman 相关性 $\rho$ 显著高于稠密嵌入和池化 SAE、以及语言学特异性(一个特征的消融效应集中在最影响层面的比例)更高。在此基础上验证两个核心假设:语言内的四个层面是否以相近幅度变化,以及不同语言是否沿相同方向变化。
与已有工作不同的是,本文最独特的切入点是"特征对齐 + 后验语言学归因"的组合。传统 SAE 跨语言比较的瓶颈在于特征字典不规范,而 crosscoder 原本只用于跨模型层或跨预训练检查点比较(Lindsey 等, 2024;Bayazit 等, 2026);作者把它改造到跨人类语言和跨历史时期场景,让同一索引 $j$ 在不同条件下对应同一抽象特征,再用条件特定的 decoder 允许该特征在每个语言/时期里以不同强度被激活。更关键的是,整个特征学习过程不使用任何语言学标签——23 个语言学探针任务只在训练完成后,通过逐特征消融与探针概率下降来事后归因到形态、句法、语义或语用。这种"先无监督学特征、再事后解释"的分离阻止了语言学标签污染学到的特征清单,是把四个层面放在同一坐标系里的根本保障,也是与探针驱动工作最本质的区别。
核心方法
直觉上,ChronoLens 就像一组针对不同语言和不同历史时期同时打开的"显微镜":它们共享同一套稀疏"原子"刻度,使你能直接读出"哪种变化、在哪个语言、哪个年代、哪一层面上发生"。技术上,整个流水线分四步:(a) 把每个句子用冻结多语言大模型编码成上下文表示;(b) 按照词长和政见框架匹配句子,构造跨语言或跨时期的"元组";(c) 训练 crosscoder 学到一个共享的稀疏特征索引 + 每个条件各自的 decoder;(d) 训练后用 23 个探针任务的逐特征消融,事后把每个特征归到形态/句法/语义/语用之一。最终用每个语言-层面-十年的平均激活向量来度量历史位移的幅度与方向。整套流程在 44.98M 篇文档、约 17.2B token、5 种语言、200 多年的语料上运行,并用 4 个不同家族的 8–9B 多语言模型独立重复测量以排除单一模型训练流程的偶然性。
核心创新是"特征对齐 crosscoder + 后验语言学归因"。设输入元组为 $\{x_c\}_{c=1}^C$($c$ 索引语言或时期),crosscoder 学到的稀疏表示为 $f = \mathrm{BatchTopK}(\mathrm{ReLU}(\sum_c x_c W_{\mathrm{enc}}^c + b_{\mathrm{enc}}))$,再用条件特定 decoder 重构 $\hat{x}_c = f W_{\mathrm{dec}}^c + b_{\mathrm{dec}}^c$。关键是特征索引 $j$ 跨所有条件共享,从而保证 feature $j$ 在英语里和 feature $j$ 在土耳其语里指同一抽象概念;条件特定 decoder 则允许同一特征在不同语言/时期有不同激活强度。这与已有 SAE 工作有本质区别:独立训练的 SAE 特征不规范,即使像池化 SAE 那样共享字典也只是 decoder 共享、仍无法对齐特征身份——Table 2 显示其 $\rho$ 仅 0.28,和原始嵌入的 0.29 几乎一样。与已有 crosscoder 工作的差异在于:作者把 crosscoder 从"跨模型层/检查点"扩展到"跨人类语言 + 跨历史时期",并加入通过消融归因语言学层面的步骤,这是首个把多语言、多时期、多层面同时放在一个对齐框架里的工作。
方法步骤详情
完整流程:(1) **语料构建**:整合 22 个开放数据源到统一 16 字段 schema,得到 44.98M 篇文档、约 17.2B token,覆盖英德意波土和 1803–2026 的议会文本;OCR 语料用 ABBYY 字符置信度过滤约 8% 最古老页面,born-digital 用字符 n-gram gibberish 检测过滤约 0.5%。(2) **匹配元组采样**:按词长和政见框架分层,每语言每十年采 2 万个元组,10% 留验证;长度匹配防止 crosscoder 把句子长度而非语言学内容当作区分信号。(3) **上下文表示**:用 4 个冻结多语言大模型(Qwen3-8B 选 L9、Llama-3.1-8B 选 L16、Mistral-Nemo-2407 选 L20、EuroLLM-9B-2512 选 L10)抽取选定层 mean-pooled 残差流,目标概念 token 排除在池化之外。(4) **Crosscoder 训练**:词典大小 $2d$,目标活跃比例 0.10,用 BatchTopK 而非 L1 以免特征在不同条件下不均匀收缩,条件激活先做 z-score 标准化。(5) **后验语言学归因**:为每个语言-任务对拟合线性探针,对比 permuted-label 控制;逐个消融 held-out 句子的特征并重算 23 个任务的正确标签概率,归到使聚合概率下降最大、且满足绝对阈值 0.01 和相对分离 1.2 的层面。(6) **历时度量**:以层面特征平均激活 $u_\lambda(\ell,t)$ 为语言表示,幅度 $\mathrm{Magnitude}_\lambda(\ell,t) = \|u_\lambda(\ell,t) - u_\lambda(\ell,t_0)\|_2 / \|u_\lambda(\ell,t_0)\|_2$,方向为位移向量余弦 $\mathrm{Direction}_\lambda(\ell,\ell')$。
技术新颖性
新颖性体现在三点。(1) **特征对齐的对象扩展**:crosscoder 此前用于跨模型层(Lindsey 等, 2024)、跨架构(Jiralerspong & Bricken, 2026)或跨预训练检查点(Bayazit 等, 2026);本文首次把它用到"跨人类语言 $\times$ 跨历史时期 $\times$ 跨语言学层面"的三元对齐。(2) **后验归因防止标签泄露**:与把语言学标签直接当作训练信号的探针类工作不同,本文先无监督学特征、再用 23 个任务的逐特征消融事后归因,确保语言学解释不会反过来塑形特征清单;这与直接训练分类器解释表示的工作形成方法论对照。(3) **幅度与方向的解耦度量**:以往历时研究多只报告幅度或主题迁移,本文明确把 $\mathrm{Magnitude}$(位移距离)与 $\mathrm{Direction}$(位移方向的余弦)分开,从而能区分"变化多少"和"往哪变",并揭示了"相同幅度可以掩盖不同方向"这一非平凡现象,这是单看幅度绝对无法发现的结构。
实验结果
核心发现分三层。**第一,crosscoder 显著更贴合语言学**(Table 2):与稠密嵌入、池化 SAE 相比,语言学一致性 $\rho$ 从 0.29/0.28 跃升到 0.72,语言学特异性从 0.74/0.73 升到 0.89,held-out 重构 FVU 从 0.07 降到 0.04,而轨迹稳定性三者接近(0.90–0.92)。这说明优势来自把信号组织成更贴合语言学变化的特征——池化 SAE 几乎没改善,证明"共享字典"还不够,必须配合"共享特征索引 + 条件 decoder"。**第二,语言内四层面幅度可比,但语言间差异显著**(Figure 2、3):德语在自己全记录上达最大终态幅度 0.89(约 1980 年起陡升),英语渐进到 0.62,波兰从 1980 年的 0.53 回落到 0.45,意大利/土耳其终止于 0.53;在共同 1950–2020 窗口里土耳其平均幅度最高(0.61),其次德语(0.43),英语/意大利(0.35)、波兰(0.34),幅度排名强烈依赖所选时间窗。**第三,幅度与方向解耦**(Figure 4):意大利与土耳其终态幅度同为 0.53 但方向不同;德语与土耳其幅度悬殊(0.89 vs 0.53)却方向相近。跨语言方向一致性与层面强相关:语用均值余弦高达 0.92(10/10 语言对置信区间不跨零,主要由人称指示语在 4 种语言显著上升驱动),而句法均值仅 0.00。90 个可观测趋势里 37 个显著。Table 3 的特征 5236 捕捉 P2 书面质询句式 *asked the Minister whether*,跨多种政策内容,证明"时期特异性 $\neq$ 主题特异性"。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 语言学一致性(时态/子句/政策主题/言语行为分布变化) | Spearman ρ↑ | 0.72 | 0.29(稠密嵌入)/ 0.28(池化 SAE) | +0.43–0.44,本文核心证据 |
| 语言学特异性(特征消融在最影响层面的集中度) | specificity↑ | 0.89 | 0.74(嵌入)/ 0.73(池化 SAE) | +0.15–0.16 |
| held-out 重构残差 | FVU↓ | 0.04 | 0.07(池化 SAE) | -0.03 |
| 轨迹稳定性(位移向量的自举余弦) | bootstrap cosine↑ | 0.92 | 0.90(嵌入)/ 0.91(池化 SAE) | +0.01–0.02,三者接近 |
局限与改进
作者明确承认五点局限:(1) 形态/句法/语义/语用四分法是分析简化,并非互斥,硬性单层面归因会掩盖真正跨层面的特征;(2) 仅覆盖 5 种语言的议会语体,历史覆盖长度不均;(3) 早期 OCR 残留误差可能被误判为语言变化;(4) 冻结多语言 LM 是不完美的测量工具,其 tokenizer、预训练数据、语言覆盖都会影响恢复出的轨迹;(5) 特征消融只建立与探针预测的相关性,不能识别变化的政治/文化/制度因果。我自己的观察还包括:5 种语言里 4 种是欧洲语言,难以严肃检验语系相关性结论(作者也承认这些只是描述性的);23 个探针的选择性差异巨大——speech act 探针 selectivity 仅 0.05–0.21(多数类占比高达 0.84–0.96),意味着其"语用"层面的轨迹其实是任务操作化,而非对语用的完整测量;归因到语用的特征过少(仅 0.4–0.6%),导致 Figure 3/4 的语用列其实缺少直接特征支撑;冻结 LM 的训练截止本身带有时间偏差,可能在编码 21 世纪文本时系统性不同于 19 世纪文本。
独立分析的弱点
**弱点一:语料面太窄**。仅在议会语体、5 种(主要欧洲)语言上做,跨语言方向性结论只有 5 个点,统计上几乎是描述性的,作者本人也承认。改进:扩展到虚构文学、新闻、社交媒体,纳入更多语系(汉藏、闪含、班图),每语言至少 15 个才能跑严肃的语系相关性检验。**弱点二:探针质量不均**。speech act 探针 selectivity 仅 0.05–0.21(多数类占比 0.84–0.96),语用归因可信度低于形态/句法;归因到语用的特征占比仅 0.4–0.6%,Figure 3 的语用列缺少直接特征支撑。改进:用更强的语用标注(多模态、对话行为、显式立场标注)替代弱监督规则。**弱点三:硬性单层面归因**。跨层面特征(如既体现句法嵌套又体现语用框架的质询句)会被强行归到一个层面,丢失交叉信息。改进:改成软性归属或多标签分布,报告每个特征在四层面的归因强度谱。**弱点四:冻结 LM 的时间偏差**。模型预训练于近期数据,可能对古旧语言形式编码不稳,且 4 个 backbone 都来自相近时代,难以分离"语言变化"和"模型时代偏差"。改进:用按时代分片的预训练模型做敏感性分析。
未来方向
作者明确提出:检验这些模式是否能推广到议会语体之外、更广的语言、语言学度量和历史语料。基于成果可延伸的方向包括:(1) 把 crosscoder 与按时间分片的预训练检查点结合(参考 Bayazit 等, 2026),把"语言变化"和"模型自身随训练时间的变化"耦合分析,从而分离两种时间效应;(2) 引入历史事件(战争、政权更迭、语言改革如土耳其 1928 字母改革、德国正字法改革)作为外生变量,检验方向性聚合能否被制度变迁解释,把本文的相关性结论推进到因果性;(3) 把 Magnitude/Direction 解耦框架迁移到社会语言学其他问题,如代际语言变化、移民社区语言融合、网络语言的快速演化;(4) 扩展到形态更丰富的语言(土耳其语之外的芬兰-乌戈尔、班图语系),检验 tokenizer 差异对幅度估计的影响并发展 tokenizer-鲁棒的度量;(5) 探索把 crosscoder 特征直接当作可解释的历时语言学指标,供数字人文研究者作为新型"显微镜"使用,与传统的词频、依存距离指标互补。
复现评估
复现门槛中等偏高。**开源方面**:作者承诺释放统一 schema 的语料记录、概念词表、多语言词典、探针与代码;4 个 backbone(Qwen3-8B、Llama-3.1-8B、Mistral-Nemo-2407、EuroLLM-9B-2512)全部开放权重;22 个数据源都是开放官方/研究资源(UK Hansard、ParlaMint、GermaParl、PPC、ItaParl、TBMM 等)。**数据准备**:部分源(OCR 的 Reichstag、historic Hansard)需要重跑 OCR 质量过滤;统一 schema 含 16 字段、用 Parquet 存储。**算力需求**:需对 44.98M 文档、约 17.2B token 做 4 个 8–9B 模型的 forward pass(fp16、单层 mean-pool)+ 5 语言 $\times$ 多十年 $\times$ 多概念的 crosscoder 训练 + 23 探针 $\times$ 5 语言 $\times$ 4 backbone 的逐特征消融,估计需多卡 A100/H100 数天到数周。**方法完整性**:附录 C 给出采样、标准化、BatchTopK 目标、共享/特定判别(decoder 范数比阈值 4)、潜变量缩放检查、阈值敏感性($\tau_{\mathrm{abs}}\in\{0.005,0.01,0.02\}$、$\tau_{\mathrm{rel}}\in\{1.1,1.2,1.5\}$)等细节,核心结论($\rho=0.72$ vs 0.29)应可复现;但作者只用 LLM 做代码生成,端到端 pipeline 的工程胶水代码仍需读者补全。
论文图表
用 Llama-3 tokenizer 计算的每 decade token 数(对数轴)。英语从 1803 起覆盖最完整,波兰 1919 起、土耳其 1950 起,反映了 22 个数据源拼接后各语言的时间密度分布。
说明了为什么跨语言比较要选共同的 1950–2020 窗口——更早的时段并非所有语言都有连续覆盖,是理解实验设计选择的必要背景。