← 返回 2026-07-28

基于市场状态感知的多模态社交情绪与技术特征融合的比特币价格方向预测 Bitcoin Price Direction Prediction via Regime-Aware Multi-Modal Fusion of Social Sentiment and Technical Features

Muhammad Abdullah Haroon 📅 2026-07-25 👍 4 2026-08-02 18:30
BiLSTM FinBERT 加密货币 多模态融合 市场状态检测 时间序列分类 比特币价格预测 社交情绪分析 自适应门控 行为金融学

用波动率门控自适应融合情绪与技术特征预测比特币涨跌。

前置知识

BiLSTM 双向长短期记忆网络

LSTM 是处理序列的循环神经网络,通过输入门、遗忘门、输出门控制信息流以缓解梯度消失。双向 LSTM (BiLSTM) 同时从左到右和从右到左两个方向编码序列,把两个方向的隐藏状态拼接,从而同时利用过去与未来上下文。本文价格与情绪两分支均用 2 层 BiLSTM,每方向隐藏维度 $d=64$,拼接得 $2d=128$ 维隐藏态,再投影到 32 维嵌入。

两条编码分支都建立在 2 层 BiLSTM 上,理解它如何把 24 小时窗口压缩成定长嵌入,是读懂后续融合机制的前提。

FinBERT 金融领域 BERT

FinBERT 是在通用 BERT 基础上于金融语料(财报、新闻、分析师报告)继续预训练或微调的 BERT 变体,专做金融文本情感分类。ProsusAI/FinBERT 版本把文本分为 positive/neutral/negative 三类并输出三个概率。本文用它对 Reddit /r/Bitcoin 帖子打分,聚合得到每小时的平均复合分、平均看涨概率、平均看跌概率、情感强度与帖子数量。

情绪分支全部输入特征都来自 FinBERT 打分。理解它是捕捉上下文语义的金融语言模型而非通用情感词典 (VADER),才能理解作者为何相信这些特征比传统词典更可靠。

市场状态检测 (Market Regime Detection)

市场状态指市场所处的不同动力学模式(稳定趋势、高波动、危机等),同一资产在不同状态下往往需要不同预测策略。本文采用最简方案:用 24 小时滚动波动率 $\sigma_t$ 与训练集全局中位数比较,大于中位数为 volatile 态($r_t=1$),否则 stable 态($r_t=0$)。相比 HMM、k-means 等隐状态方法,中位数切分确定可复现、可解释,且天然产生接近平衡的状态分布。

整个 RAML 的核心创新就是用市场状态门控融合权重。不理解状态如何定义,就无法理解门控的逻辑与消融实验中状态门的贡献。

自适应融合门控 (Adaptive Fusion Gate)

多模态融合指把不同信息源(此处价格与情绪)的表示组合成统一特征。静态拼接把两个向量直接相连,对所有时刻施加相同权重。自适应门控则用单一可学习标量 $\theta_r$ 通过 sigmoid 按状态标签产生连续权重 $w_t=\sigma(\theta_r\cdot r_t)$,再以 $e^{(fused)}_t = w_t\cdot e^{(s)}_t + (1-w_t)\cdot e^{(p)}_t$ 做凸组合。volatile 态 $w_t>0.5$ 上调情绪权重,stable 态 $w_t=0.5$ 让更强的价格信号主导。

这是论文唯一的核心创新点。理解门控如何在两种状态间切换信任来源,是理解全部实验结论(尤其 A3 拼接变体在 6 小时灾难性崩溃)的钥匙。

OHLCV 与技术指标

OHLCV 指每根 K 线的开盘价 Open、最高价 High、最低价 Low、收盘价 Close、成交量 Volume。技术指标是从价格序列衍生的统计量:对数收益率 $r_t=(c_t-c_{t-1})/c_{t-1}$、24 小时滚动波动率 $\sigma_t$、相对强弱指标 RSI(14)、长短窗口移动平均 MA(7)/MA(30)。本文价格特征向量 $x^{(p)}_t\in\mathbb{R}^{10}$ 含原始 OHLCV 加这 5 个工程特征。

价格分支的输入就是这 10 维特征。理解技术指标含义才能看懂相关性热力图中价格水平近乎完全共线、波动率与状态标签高度正相关($r=+0.74$)等现象。

AUC、F1 与概率校准

F1 是精确率与召回率的调和平均,对类别不平衡稳健,是本文主排序指标。AUC 是 ROC 曲线下面积,衡量模型预测概率的排序质量(是否给真正正例更高分),而非 0.5 阈值下的硬分类表现。一个 F1 高但 AUC<0.5 的模型往往是猜多数类的退化策略——预测概率排序与真实结果反相关,在风险加权交易中很危险。

论文反复强调必须同时看 F1 和 AUC 才能识破退化策略。情绪模型 B2 的 F1=0.6579 看似最高但 AUC=0.4938<0.5 说明它是退化策略,这是理解全文实验解读的核心判据。

噪声交易者假说 (Noise Trader Hypothesis)

DeLong 等(1990)提出的金融理论,认为市场存在一类非理性噪声交易者,受情绪驱动形成羊群效应、通过社交网络传播情绪,在机构套利纠正偏差前的数小时内能集体推动价格。Baker-Wurgler 等后续实证表明投资者情绪在高波动、高不确定性时期对收益预测力最强,在平静趋势期基本无效。

RAML 的设计动机完全建立在这个假说上——情绪信号在波动期更可信、在稳定期是噪声。如果接受不了这个行为金融学前提,就难以认同门控方向(波动期上调情绪权重)的合理性。

研究动机

比特币小时级价格方向预测是计算金融中最困难的开放问题之一。比特币收益呈尖峰厚尾分布,存在非平稳动力学、由宏观与监管事件触发的结构性断裂,其价格发现机制显著受 Reddit 和 Twitter 等社交平台讨论影响。现有主流方法把 OHLCV 技术特征与情感得分通过静态拼接(static concatenation)融合,对所有时刻施加相同融合权重。这种设计与行为金融学的实证结论直接矛盾:Baker-Wurgler 证明散户群体情绪在高波动和危机阶段预测力最强、在平静趋势期基本是噪声,Tetlock 对股票市场新闻情绪得到类似结论。因此在稳定期与波动期施加相同权重,会把情绪是信号的条件与情绪是噪声的条件混为一谈,同时损害校准与方向准确率;在小时级这个近乎有效市场的时间尺度上,这种错误尤其致命。

本文的目标是本文目标是构建一个在小时间隔(3 小时与 6 小时)上预测比特币涨跌方向的多模态学习框架,能根据当前市场状态动态调节社交情绪与技术价格特征的相对贡献——高波动期更信任群体情绪、稳定期让价格动力学主导——从而在严格的样本外、分布外测试中获得同时优于随机基线 0.50 的 F1 与 AUC。同时通过系统的三变体消融实验证明每个组件(情绪分支、状态门、自适应加权)都必要且不可冗余,并为小时级比特币预测建立一个诚实的性能天花板基准,避免文献中常见的、由数据泄漏或样本内评估造成的虚高 F1。

与已有工作不同的是,与以往工作相比,本文的独特切入点在于用一个可解释的极简门控创新同时满足五个性质。Wei 等(2023)虽做状态切换但切换的是整个模型而非连续调节融合门,且在日级评估;He 等(2023)虽用多头注意力融合情绪与价格,但无显式状态条件且在日级;Yang 等虽用跨模态注意力但无状态监督。据作者所知,此前没有工作同时具备:小时级预测粒度、显式二值状态条件、端到端可训练自适应融合门、通过金融语言模型整合社交情绪、以及系统消融研究这五点。本文仅增加 1 个可训练参数 $\theta_r$、零额外标注数据,以最大简约的方案填补了这一空白。

核心方法

RAML 的整体直觉是市场状态决定该信谁。价格信号与情绪信号在不同状态下信噪比不同,模型不应固定权重把它们焊死,而应根据一个低成本、可解释的状态标签动态切换信任来源。技术路线上,模型有两条对称的双分支编码器:价格分支吃 24 小时×10 维 OHLCV 技术特征窗口,情绪分支吃同样 24 小时×5 维 FinBERT 情绪聚合特征窗口,各自用结构相同的 2 层 BiLSTM 编码到 32 维嵌入。两条嵌入通过一个由市场状态驱动的自适应门控做凸组合,再喂给前馈分类头输出涨跌概率。整个过程端到端用二元交叉熵联合训练,让分类损失的梯度同时塑造 $\theta_r$ 与两个分支的表示。

核心创新是市场状态条件的自适应融合门控 $w_t=\sigma(\theta_r\cdot r_t)$ 与 $e^{(fused)}_t=w_t\cdot e^{(s)}_t+(1-w_t)\cdot e^{(p)}_t$。它与已有方法的本质区别有三:其一,门控权重是状态条件化的连续值而非全局常数,volatile 期 $w_t>0.5$ 上调情绪、stable 期 $w_t=\sigma(0)=0.5$ 默认等权让价格主导;其二,只引入 1 个可训练标量 $\theta_r$、零额外标注数据,是静态融合基线的最大简约扩展;其三,训练得到的 $\theta_r>0$,正向验证了行为金融学情绪在波动期更可信的假设,提供了可解释的门控方向。门控对两分支赋予等量表示容量,确保驱动模态相对贡献的是门控本身而非容量失衡。

方法步骤详情

(1) 数据对齐:yfinance 拉小时 OHLCV(最长 730 天),与 Kaggle 上 Reddit /r/Bitcoin 的 ProsusAI/FinBERT 逐帖打分按 UTC 小时内连接,得 2024.7-2025.9 共 3,491 条观测;情绪聚合为 5 维(复合分、看涨/看跌概率、情感强度、帖子数)。(2) 特征工程:派生 $r_t$、$\sigma_t$、RSI(14)、MA(7)、MA(30),加 OHLCV 构 10 维 $x^{(p)}_t$。(3) 状态标注:$\sigma_t$ 与训练集中位数比较得二值 $r_t$。(4) 目标 $y^{(h)}_t=\mathbb{1}[c_{t+h}>c_t]$,$h\in\{3,6\}$。(5) 双分支:价格与情绪各经 2 层 BiLSTM($d=64$,dropout 0.3)得 128 维隐藏态,再 ReLU 投影到 32 维 $e^{(p)}_t$、$e^{(s)}_t$。(6) 门控融合 $w_t=\sigma(\theta_r\cdot r_t)$,$e^{(fused)}_t=w_t e^{(s)}_t+(1-w_t)e^{(p)}_t$。(7) 分类头 $\hat y_t=\sigma(w_2^\top\text{ReLU}(W_1 e^{(fused)}_t+b_1)+b_2)$,0.5 阈值。(8) 端到端训练:Adam $\eta=10^{-3}$、batch=32、30 轮,最小化 $\mathcal{L}=-\frac1N\sum_t[y_t\log\hat y_t+(1-y_t)\log(1-\hat y_t)]$,梯度同时更新 $\theta_r$ 与分支参数,单变体约 45 秒。

技术新颖性

技术新颖性在于把通用多模态文献中可学习门控(Lu 等)的原则结合显式状态监督,迁移到金融时间序列。与 HMM/k-means 等隐状态方法相比,本文用确定性的中位数波动率切分,保证可复现、可解释、训练集上天然平衡;与注意力跨模态融合相比,本文不依赖隐式注意力分配,而用单一标量 $\theta_r$ 显式编码状态到信任来源的映射。最关键的新颖性是同时满足五性质的最小化设计:仅 1 个额外参数、零额外标注、零额外推理延迟,却能在 6 小时任务上把 F1 从拼接变体 A3 的 0.1418 提升到 0.5513。消融实验证明 RAML 不是过工程的变体,而是一个连贯且必要的整体——三组件各自独立、非冗余地贡献性能。

End-to-end data construction and feature engineering pipeline.
Fig. 1: End-to-end data construction and feature engineering pipeline.
Dual-branch Regime-Aware Multi-Modal Learning architecture.
Fig. 6: Dual-branch Regime-Aware Multi-Modal Learning architecture.
Adaptive Fusion Gate behaviour across market regimes.
Fig. 7: Adaptive Fusion Gate behaviour across market regimes.

实验结果

核心发现四块。其一,基线对比(表 IV):RAML 在 3h F1=0.5474、AUC=0.5084、6h F1=0.5513,是唯一在 3h 任务上 F1 与 AUC 同时高于随机基线 0.50 的模型。B1 纯价格在 6h 召回崩溃(recall=0.0916, F1=0.1563);B2 纯情绪 3h F1=0.6579 但 AUC 仅 0.4938<0.5,是猜多数类的退化策略(recall=0.9067);B3 静态拼接 3h F1=0.4366 甚至低于 B2,说明无引导叠加价格特征引入冲突信号。其二,混淆矩阵(图 12):RAML 预测最对称,正确识别 686 真涨中的 396 个(recall 57.7%)与 659 真跌中的 294 个,而 B2/B3 偏向全猜涨/全猜跌。其三,消融(表 V):去情绪 A1 在 6h F1 暴跌至 0.3099;去状态门 A2 在 3h F1 虚高至 0.6180 但 AUC 降至 0.4841 属退化;去自适应加权改拼接 A3 在 6h 灾难性崩溃(F1=0.1418, recall=0.0828)。其四,组件贡献排序为自适应加权($\Delta$F1=-0.4095)>情绪分支>状态门,三者独立非冗余;RAML 双任务 AUC 最高意味着概率校准最好,对风险加权仓位管理实战可用。

Comparison of Related Work Across Key Dimensions.
Table I: Comparison of Related Work Across Key Dimensions.
Final Aligned Dataset Statistics.
Table II: Final Aligned Dataset Statistics.
RAML Hyperparameter Configuration.
Table III: RAML Hyperparameter Configuration.
Baseline and Proposed Model Performance on 3-Hour and 6-Hour Horizons.
Table IV: Baseline and Proposed Model Performance on 3-Hour and 6-Hour Horizons.
Metric comparison across all four models on the 3-hour prediction horizon.
Fig. 8: Metric comparison across all four models on the 3-hour prediction horizon.
Metric comparison on the 6-hour prediction horizon.
Fig. 9: Metric comparison on the 6-hour prediction horizon.
Confusion matrices for all four models on the 3-hour horizon (n=1345).
Fig. 12: Confusion matrices for all four models on the 3-hour horizon (n=1345).
Radar chart comparing all four models across five metrics (3-hour).
Fig. 13: Radar chart comparing all four models across five metrics (3-hour).
Ablation metric profiles on the 6-hour horizon.
Fig. 15: Ablation metric profiles on the 6-hour horizon.
查看结构化数据
任务指标本文基线提升
3 小时比特币涨跌方向二分类 Macro-F1 (要求同时 AUC>0.5 才算非退化) RAML F1=0.5474, AUC=0.5084,为唯一 F1 与 AUC 同时高于随机基线的模型 B2 Sentiment-only F1=0.6579 但 AUC=0.4938 属退化策略;B3 Static Concat F1=0.4366 相对静态拼接 B3 F1 提升 +0.1108,且是唯一校准有效模型
6 小时比特币涨跌方向二分类 Macro-F1 RAML F1=0.5513, recall=0.6090 B1 Price-only F1=0.1563 (recall 崩溃至 0.0916);B3 Static Concat F1=0.5844 但 recall 失衡 相对纯价格 B1 F1 提升 +0.3950;在 recall>0.5 的校准模型中 F1 最优
6 小时消融:自适应加权 vs 拼接 Macro-F1 RAML 全模型 F1=0.5513 A3 去自适应加权(直接拼接 64 维) F1=0.1418, recall=0.0828 +0.4095,证明加权方式是双分支设计中最关键的架构决策
3 小时消融:状态门对校准的贡献 AUC RAML AUC=0.5084 A2 去状态门(固定 w=0.5) AUC=0.4841,F1 虚高至 0.6180 但属退化 AUC +0.0243,状态门把虚高的退化 F1 转化为真正校准的预测

局限与改进

作者承认与笔者观察到的局限并存。其一,训练量有限:有效训练集仅 2,146 条小时观测,受 yfinance 730 天限制与 Reddit 数据重叠窗口约束,限制了双 BiLSTM 在 6 小时长 horizon 上的泛化。其二,状态表示过粗:二值状态把市场压成一个比特,三态(趋势/均值回复/危机)或连续波动率嵌入会更丰富。其三,单资产范围:只在 BTC-USD 验证,ETH/SOL/BNB 及跨资产(股币联动)未验证。其四,小时内情绪时序丢失:按算术平均聚合各小时帖子,丢弃帖子发表先后(分钟 2 与分钟 58 权重相同)。其五,无外生事件特征:FOMC、监管、交易所事故等已知驱动因素未纳入。笔者补充:绝对性能偏低(AUC 仅 0.5084),作者自承这与小时级比特币近乎有效市场一致;状态阈值用训练集全局中位数,但测试期波动率分布右偏(测试期 59.4% 为 volatile),说明该阈值对未来分布漂移不够稳健;情绪未覆盖中文社区、Telegram 等渠道,可能遗漏重要群体。

独立分析的弱点

独立分析的弱点及改进方向。其一,绝对预测力接近随机——3 小时 AUC=0.5084 在 1,345 样本上统计显著性有限,扣掉手续费与滑点后边际利润可能为负。改进方向:引入订单簿深度、链上数据(活跃地址、巨鲸转账)、新闻头条流等多模态,并把 horizon 往 15 分钟至 2 小时更细粒度延展以捕获微观结构。其二,状态门过于简化——单一中位数阈值加二值标签无法区分温和趋势与暴涨暴跌,且训练中位数在测试期分布漂移。改进方向:用三态 HMM 或连续波动率嵌入替代,并做滚动窗口重估阈值以适应漂移。其三,情绪表示过浅——算术平均丢失帖内时序与作者权威度,5 维特征容量有限。改进方向:引入帖内注意力或 Transformer 直接编码帖子序列,区分高影响力 KOL 与噪声用户。其四,单资产验证——未在 ETH/SOL 等验证泛化,也未做跨资产联动。改进方向:多资产联合训练加资产嵌入。其五,评估偏单一时期——测试期(2025 年 7-9 月修正阶段)状态分布偏 volatile,缺乏牛市/震荡市平衡评估。改进方向:滚动窗口多时期评估以稳健化结论。

未来方向

作者明确提出的方向:扩展数据管线到完整 2017-2025 Reddit 窗口并接入 Twitter/X、Telegram;用连续或多态状态表示(三态 HMM 或学习型连续波动率嵌入)替换二值阈值;验证在其他加密资产(ETH、SOL、BNB)及跨资产设置的迁移性。基于成果可延伸的方向:把自适应门控推广为多头、多状态的稀疏门控(MoE 式),让模型在不同状态激活不同专家;引入在线学习/持续学习以应对加密市场的强非平稳;把框架从分类扩展到期望收益与波动率的联合预测,直接服务于组合优化;探索门控参数 $\theta_r$ 随时间变化的在线更新,以追踪状态-情绪耦合关系的演化;将概率校准进一步用 Platt scaling 或 isotonic regression 精修,提升实战风险加权决策的可用性。

复现评估

复现评估较友好。硬件门槛低:作者在 Lenovo Legion 5 笔记本(Intel i7-14700HX, 16GB 内存, RTX 5060 8GB)上单变体 30 轮仅需约 45 秒,7 个变体独立训练总耗时几分钟,无需大规模算力。数据全部来自公开源:yfinance(免费)、Kaggle 上的 Reddit /r/Bitcoin FinBERT 数据集、Kaggle 上的 Bitcoin/Treasury/Google News CryptoBERT 数据集;特征工程公式(Eq.2-7)与超参数(表 III)全部给出,状态阈值用训练集中位数,模型总参数约 218,000 属轻量级。但论文未明确说明是否开源代码与权重,Kaggle 数据集的具体 URL/版本号也未完全给出;yfinance 的 730 天限制使他人复现时窗口会随时间漂移;样本外测试窗口随时间推移也会变化。综合评估:方法层面高复现性,工程层面中等(缺代码仓库与数据快照链接),整体可在一台消费级 GPU 笔记本上半天内复现核心实验。