AstroPT 对星系的认知:LLM 可解释性的天文校准测试床 What AstroPT knows about galaxies, and what that can teach us about LLMs
用有标准答案的星系基础模型校准 LLM 可解释性:概念按物理难度依次涌现,探针几何复原已知物理关系
前置知识
线性探针(Linear Probe)
冻结预训练模型的隐藏态,在其上训练一个线性映射(本文用岭回归 ridge)来预测某个目标属性,用留出集的决定系数 $R^2$ 衡量可解码性。$R^2$ 高说明该属性以线性可及的方式组织在表示中,但并不证明模型在计算中真的使用了它。
本文的全部证据都来自逐 checkpoint、逐层的线性探针 $R^2$ 曲线与探针方向的几何分析,不理解探针的含义与边界就无法正确理解论文结论。
patch-token 化与 LLM-like 训练
AstroPT 把星系图像切成有序小块,像 LLM 处理文本 token 一样把 patch 当作序列输入 transformer,用 GPT 式自回归(AR,重建下一个 patch)或 BERT 式掩码自编码(MAE,重建被遮 patch)目标做自监督预训练。
全文立论依赖『AstroPT 学得像 LLM』这一点,patch-token 化与重建式目标正是它有资格成为 LLM 可解释性校准测试床的架构前提。
星系属性的难度阶梯
r 波段星等 $\mathrm{mag}_r$ 几乎就是星系在 r 波段的积分流量,可直接从像素求和得到;测光红移 z 需要综合多个波段甚至光谱信息;比恒星形成率 $\mathrm{sSFR}=\mathrm{SFR}/M_\star$ 是推断量、最间接。三者构成先验难度阶梯。
『属性可解码顺序是否匹配这个先验阶梯』是论文最核心的可证伪命题,也是 Fig. 2 的判分标准。
星系标度关系与 Malmquist 效应
恒星形成主序 $\log \mathrm{SFR}=\alpha\log M_\star+\beta$(斜率 $\alpha<1$,Speagle et al. 2014)使 sSFR 与质量弱反相关;光度与恒星质量强相关;流量限制巡样的 Malmquist 选择效应使高红移星系只有更亮更大质量才会入选,导致红移与质量正相关。
这些先验已知的关系符号构成验证探针几何的 ground truth,是论文用来给 Fig. 3 的方向对齐『对答案』的物理依据。
固定光度下的质量残差
定义 $\ell_r=-0.4M_r$(r 波段对数光度),残差 $\epsilon_{M|\ell_r}=\log M_\star-(a\ell_r+b)$ 是光度预测不了的那部分质量。若模型只学『质量=光度』捷径,其残差探针方向应与光度方向对齐;实测近正交说明模型把残差当作独立因子。
这是论文最精细的表示几何检验,用于区分『捷径学习』与『因子化表示』两种对立假设。
研究动机
对 LLM 的可解释性研究越来越关心两个问题:概念在训练的第几步涌现、线性探针找到的方向是否对应真实结构。但在语言模型上这些主张极难验证:语言数据杂乱、没有公认的概念难度排序,概念之间的真实关系也不明确。例如探针在模型中发现一个与『真伪』相关的方向,我们无法判断它是真实的内部概念、标签伪影还是数据集偏差——语言域缺乏 ground truth,使涌现时序分析与探针结论都处于『盲测』状态:方法好坏无从校准,也无法区分『方法有效』与『方法碰巧给出好看的图』。
本文的目标是本文想为机制可解释性方法提供一个有『标准答案』的受控考场:利用 AstroPT——一个在数百万张星系图像上以 LLM 方式训练的 transformer——作为校准测试床。具体目标有三:一是检验线性探针能否在冻结表示中恢复已知的天文物理结构;二是检验星系属性的可解码顺序是否跟踪已知的物理难度,并沿训练时间与网络深度两个轴对齐比较;三是检验探针方向的几何是否保留星系属性间的已知关系,以及这些信号在更换训练目标(AR vs MAE)和模型规模({1M, 21M, 100M})后是否稳健。
与已有工作不同的是,以往『天文学+机器学习』多把模型当工具(预测测光红移、做形态分类),本文把方向反过来:把天文学当答案本,把 LLM-like 模型当考生。独特之处在于天文学提供三重先验 ground truth:一是难度阶梯——从像素直接可读的 $\mathrm{mag}_r$,到多波段/光谱的 redshift,再到推断量 sSFR;二是一批符号已知的物理关系(光度–质量正相关、sSFR–质量反相关、红移–质量的 Malmquist 正相关);三是 Pythia 式的实验设计——密集保存 checkpoint、扫规模、换目标,使『涌现顺序』第一次成为可系统证伪的命题,而不是事后叙事。
核心方法
直觉是:如果我们的可解释性工具真的有效,它们应当在一个『我们知道答案』的领域里把答案找回来。技术路线:将 DESI Legacy Survey 的 8.7M 张星系 postage stamp(HF 数据集 Smith42/galaxies)切成有序 patch 当作 token;参照 Pythia 的做法训练 {1M, 21M, 100M} 三个规模,各用 GPT 式自回归(AR)与 BERT 式掩码自编码(MAE)两种目标,共六个 run,单 epoch 内密集保存 checkpoint;对每个冻结 checkpoint 的每一层提取隐藏态,拟合线性岭回归探针预测 $\mathrm{mag}_r$、redshift、$\log\mathrm{sSFR}$,报告留出集 $R^2$;最后对探针方向做余弦相似度等几何分析。
核心创新不是新算法,而是把『可解释性结论是否可信』本身变成可检验的问题。与在 LLM 上盲测不同,这里每个被探针发现的信号都有独立于模型的天文答案:涌现顺序应对应 $\mathrm{mag}_r\rightarrow z\rightarrow\mathrm{sSFR}$ 的难度阶梯,方向符号应对应已知标度关系。尤其关键的是 AR/MAE 双目标对照设计:若涌现顺序只是训练目标的伪影,换目标就应换序;实测六个 run 顺序完全一致,说明顺序来自学习问题本身(表示必须编码什么),而非训练配方。
方法步骤详情
第一步数据准备:取 8.7M 张 DESI Legacy Survey 星系图(Smith42/galaxies 数据集),切成有序 patch 序列作为输入。第二步预训练:按 {1M, 21M, 100M} 三个参数规模 × AR/MAE 两种目标训练,单 epoch、密集保存 checkpoint,得到训练动力学的时间轴。第三步探针拟合:对每个冻结 checkpoint 的每层隐藏态,分别用线性 ridge 探针回归 $\mathrm{mag}_r$、redshift、$\log\mathrm{sSFR}$,输出留出 $R^2$ 随 $\log_{10}$(epoch) 与网络深度的曲面(即 Fig. 2)。第四步几何分析:计算属性探针方向之间的余弦相似度($\ell_r$–$M_\star$、sSFR–$M_\star$、z–$M_\star$),并检验残差方向 $\epsilon_{M|\ell_r}$ 与光度方向的夹角,全部附 bootstrap 置信区间(附录 A、B)。
技术新颖性
技术组件(ridge 探针、$R^2$ 曲线、方向余弦)全是现成工具,新颖性在于用法:第一次在有 ground truth 的域里对这些工具做『标定』。具体新贡献:把『概念涌现顺序』从叙事变成可证伪命题,并用 AR/MAE 双目标证伪『目标伪影』假说、用规模扫描证伪『顺序依赖容量』假说;提出残差质量 $\epsilon_{M|\ell_r}$ 正交性检验,把『模型是捷径学习还是因子化表示』的争论变成可测量量,并观察到正交性随规模增强;把 Pythia 式 checkpoint 动力学分析迁移到天文模态,使时间涌现与深度涌现能在同一难度阶梯下对齐比较。
实验结果
(1)涌现顺序固定且跟踪难度:留出 $R^2$ 曲线显示 $\mathrm{mag}_r$ 最先上升且峰值最高,redshift 随后且较弱,sSFR 在单 epoch 内始终弱、未稳健涌现;深度轴同序——$\mathrm{mag}_r$ 浅层即可解码且跨层广泛,redshift 靠近输入处弱、深层增强,sSFR 各深度皆弱。该顺序在 {1M, 21M, 100M} 全部规模上一致,容量只抬高 $R^2$ 幅度而不改变顺序。(2)目标不变性:AR 与 MAE 共六个 run 复现同一排序,说明顺序反映学习问题而非训练配方。(3)探针几何恢复物理:各规模下 $\ell_r$–$M_\star$ 强正对齐,sSFR–$M_\star$ 反对齐(由主序 $\log\mathrm{SFR}=\alpha\log M_\star+\beta$、$\alpha<1$ 推出),z–$M_\star$ 正对齐(Malmquist 效应);残差 $\epsilon_{M|\ell_r}$ 方向与光度方向近正交且模型越大越正交,说明『固定光度下的质量』被表示为独立因子而非光度捷径。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 概念涌现顺序(训练时间轴) | 留出 R² 出现顺序 | $\mathrm{mag}_r \rightarrow$ redshift $\rightarrow$ sSFR 的固定顺序,在全部 6 个 run(AR/MAE × 1M/21M/100M)中一致 | LLM 中无法验证(语言域没有 ground truth 难度排序) | 首次给出可证伪的涌现顺序检验,且实测排序与先验物理难度阶梯完全吻合 |
| 属性线性可解码性 | 留出 R²(峰值与深度分布) | mag_r 峰值最高、训练早期且浅层即达,跨层广泛可解码;redshift 次之、深层增强;sSFR 单 epoch 内 R² 持续偏低、未稳健涌现 | 天文学先验:像素可读量 < 多波段积分量 < 推断量 | 时间轴与深度轴双双复现难度阶梯,且容量(1M→100M)只抬高 R² 幅度、不改变顺序 |
| 表示几何(关系符号结构) | 探针方向余弦相似度 | $\ell_r$–$M_\star$ 强正对齐、sSFR–$M_\star$ 反对齐、z–$M_\star$ 正对齐;残差 $\epsilon$ 与 $\ell_r$ 近正交且随规模更正交 | 已知星系物理符号结构(光度–质量正相关、主序亚线性、Malmquist 效应) | 探针方向复原全部已知符号,并把『捷径 vs 因子化』判据落在残差正交性上 |
局限与改进
作者承认的局限:分析是相关性而非因果性——属性线性可解码不证明预训练使用了它;物理标签来自 catalog 推断而非真值;预训练仅一个 epoch,规模只有 {1M, 21M, 100M};线性探针只揭示线性可及信息。我的补充观察:一是单 epoch 下 sSFR『未涌现』可能只是欠训练,无法区分『本质更难』与『需要更多数据』;二是 catalog 标签(尤其经 SED 拟合的 sSFR)自带流程伪影,可能系统性压低其 $R^2$ 并与『更难』混淆;三是星系 patch 没有语言的组合语法,向 LLM 外推结论存在语义鸿沟;四是缺少干预实验(ablation/steering)证明模型计算确实依赖这些探针方向;五是 Malmquist 效应依赖巡样选择函数,换巡样的稳健性未测。
独立分析的弱点
一是因果性缺失:可解码不等于被使用,改进方向是在探针方向上做激活干预或定向消融,检验扰动是否按预期改变重建输出,把相关性升级为因果证据。二是标签循环风险:catalog 标签由传统管线推断,探针可能学的是管线伪影而非物理,改进方向是用宇宙学模拟(如 IllustrisTNG 或蓝图式模拟器)生成带精确真值的图像做交叉验证。三是训练不充分:单 epoch 截断了学习曲线,应训练多个 epoch 检验 sSFR 是否延迟涌现,补全难度到时间的完整映射。四是规模跨度仅两个数量级(1M→100M),『幅度变、顺序不变』在更大规模是否成立未知。五是工程成本:逐 checkpoint、逐层提取隐藏态的存储随规模快速增长,需要在线探针等更高效的分析管线。
未来方向
作者展望是把天文学建成机制可解释性的『答案本』(answer key),推动『astronomy for AI』方向,并计划在扩展工作中解决上述局限。基于成果可延伸:一是以仿真宇宙替代 catalog 标签,获得零循环的真值校准;二是引入干预式实验,检验探针方向的因果有效性,并测量模型输出对方向扰动的敏感度;三是多模态扩展,在图像+光谱联合训练时检验融合属性(如光谱红移)的涌现位置;四是把该测试床当作可解释性新方法(如稀疏自编码器 SAE)的评测基准,度量其对已知结构的召回率与假阳性率;五是反向应用:用可解释性工具审计天文基础模型是否学到与已知定律一致的物理,实现 AI 与天文学的双向校准。
复现评估
复现条件较好:数据完全公开(HF 数据集 Smith42/galaxies,源自 DESI Legacy Survey,Dey et al. 2019);AstroPT 预训练代码与模型已在 Smith et al. 2024 开源;探针部分是标准 ridge 回归加 bootstrap,CPU 即可完成。算力方面,最大模型仅 100M 参数、单 epoch、8.7M 张图,单张消费级 GPU 数天量级可复现核心曲线;难点在完整 sweep(3 规模 × 2 目标 × 密集 checkpoint)的存储与逐层隐藏态提取的工程量。论文附录 A、B 给出了标签空间关系推导、探针构造与 bootstrap 置信区间细节,透明度较高;但正文未列每个 run 的精确超参表,需要回溯 AstroPT 原仓库配置。总体复现难度中等,适合有一个 GPU 的实验室。
论文图表