← 返回 2026-09-10

WearableQA:基于真实世界可穿戴数据的健康推理评测基准 WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data

Ji Soo Lee, Xilun Chen, Pierce Chuang, Ashish Shenoy, Jason Wei, Dohwan Ko, Hyunwoo J. Kim, Benoit Corda 📅 2026-09-04 👍 37 2026-09-12 18:30
医疗健康AI 大语言模型 数据集构建 时间序列推理 评测基准

用200名真实用户500天可穿戴数据出4084道10选1题,14个大模型最高仅72.9%

前置知识

可穿戴生理时序数据

指智能手表等设备每日连续采集的生理与行为指标。本文覆盖16项日级指标、分四域:心肺(静息心率RHR、心率变异性HRV、VO2max)、活动能耗(步数、活动卡路里等)、睡眠(时长、效率、深睡/REM占比、就寝规律性)与压力。每位用户有多达500天的日级记录,天然含设备噪声与个体差异。

本文所有题目都从这类真实纵向数据中确定性生成,理解数据形态(噪声、缺失、个体基线差异)是理解基准构建动机与模型失败原因的前提。

双重接地

论文的出题框架:每道题的答案依据要么来自同行评审文献(文献接地,Nature Medicine、PNAS等11篇锚点研究,需至少两项同方向独立研究支持),要么来自经统计验证的人群生理模式(人群接地,需过效应量、鲁棒性、真实性三重门控)。答案最终由确定性程序在该用户数据上算出,而非出题人主观认定。

这是本文方法的核心创新,是与简单模板造题的本质区别,也是理解题目可靠性与抗记忆性设计的关键。

错误发现率(FDR)

多重假设检验中被错误拒绝的零假设占全部拒绝结果的比例。论文在人群接地环节用跨用户零检验估计:把统计量故意错配到无关用户上重算,以零假设下的出现率与真实出现率之比作为经验FDR,只保留 $\text{FDR} \leq 0.20$(即阳性预测值 $\geq 80\%$)的模式,防止把噪声当生理规律。

它量化了人群接地题目的真实性底线,是评价该基准题目质量与理解其统计门控设计的关键指标。

思维链与直答提示

思维链(CoT)让模型先写推理过程、最后一行输出Answer: X;直答(DA)只输出选项字母。两条件上下文完全相同、仅结尾指令不同,准确率差异可完全归因于推理方式。CoT对专有模型提升显著:Claude-Opus-4.6整体+19.6个百分点、单信号最高+27,还能抑制小模型的位置偏差。

论文大量消融围绕CoT展开,理解该设置才能读懂Table 7与Figure 7的对比结论。

10选1多选题与位置偏差

WearableQA全部4,084题为10选项(A–J)单选题,随机基线10%,金标在各位置均匀分布。小模型在直答下会强烈偏向固定字母——Llama-3.2-3B有51.5%的回答选同一字母,说明其在押答案而非读数据;专有模型也有轻微偏好(如Claude-Opus-4.6偏A)。

位置偏差分析(Figure 8)是论文论证模型必须真正读取数据才能得分的重要证据链一环。

研究动机

医疗类评测基准虽多,却几乎都测不到针对具体个人的纵向生理数据做推理这件事。MedQA、MedMCQA、PubMedQA以考试题和文献问答为主,HealthBench扩展到真实健康对话但仍是纯文本;ECG-QA引入了心电波形,但对单段波形的推理与对数百天多信号记录的聚合完全不同。近年出现的可穿戴评测也有硬伤:PHIA主要基于模拟用户轨迹,且侧重检索与聚合;TimeSeriesExam等时序基准用程序合成信号,既不含真实噪声与个体基线差异,也无法考察生理学解释,且通常只看可穿戴信号本身、不联合血液指标。与此同时,基于LLM的个人健康助手正在快速落地(如Google的PHIA等),它们面对的是真实用户数百天的噪声数据。模型到底能否从真实纵向记录中算出趋势、异常与跨信号关系,并给出有临床意义的解读,此前缺乏系统性、诊断性的评测手段。

本文的目标是本文要构建一个既保留真实世界数据复杂性、又能细粒度诊断模型能力的可穿戴健康推理基准WearableQA。具体目标包括:从200名真实用户(每人多达500天、16项日级指标)的可穿戴记录、17项血液生物标志物与人口学信息出发,构造4,084道10选1多选题,随机基线10%;按数据推理vs健康推理、单信号vs跨信号两个正交轴组织16种题型,使模型失败可分别归因于纵向计算、生理学解读或跨信号整合;提出双重接地构造框架,保证答案既有生理学或统计学依据、又能从原始测量中确定性复现;最后对14个专有与开源LLM统一协议评测(CoT为主、直答对照),以95% Wilson置信区间报告,刻画当前能力边界。

与已有工作不同的是,本文的独特切入有三点。第一,数据真实性:它是首个以真实用户纵向可穿戴记录为主体、并联合血液生物标志物与人口学信息的评测,保留设备噪声与个体间差异,而非合成信号或模拟轨迹。第二,双重接地:现有工作要么人工写题(易引入先验捷径),要么模板生成(缺乏生理依据);本文把11篇文献锚点与经统计门控验证的人群模式结合,答案永远从具体用户的原始数据重新计算,既忠实于目标人群又抗记忆。第三,诊断性分类学:把从数据算出答案与基于数据做生理学解读、单信号与跨信号整合分开考察,能精确定位模型短板——例如数据推理与跨信号整合两大弱项正是靠这套分类学暴露出来的,这是以往健康基准不具备的归因能力。

核心方法

直觉上,一道可靠的健康推理题需同时满足两点:答案有生理学或统计学依据,且能从该用户的真实数据中唯一、可复现地算出来。技术路线分四步。先备料:200名真实用户的多变量日级时序(最多500天、16项指标)、17项血液指标、人口学属性,以及来自更大队列的5项核心指标分位数参照。再找出题依据:文献接地整理11篇锚点研究(要求至少两项同方向独立研究支持);人群接地在大队列上挖掘28天窗口内的趋势、异常、恢复与跨信号耦合,并用三重统计门控筛选——效应量 $|\rho| \geq 0.5$ 且窗口前后半段符号一致、比较题胜项领先 $\geq 0.15$;鲁棒性要求30次自助重采样中至少80%复现且留一天仍稳健;真实性要求跨用户零检验下 $\text{FDR} \leq 0.20$。然后discover-then-label:把推理目标表达为可复用计算原语的组合,在用户数据上确定性求出金标。最后生成9个干扰项,并验证金标在10个选项中唯一满足判据。

核心创新是双重接地加确定性计算图标注的组合,本质区别在于答案的来源。传统医学QA的答案是出题人认定的;本文的金标答案永远由程序在原始测量上执行计算图得到,相同输入必得相同答案,完全可复现。文献接地只提供要考察什么关系,且刻意不搬用文献里的队列特定阈值,改用个性化基线(如静息心率升高定义为高于本人近28天均值 $\geq 1.5$ 个标准差);人群接地则覆盖文献未记载但统计上真实存在的模式。对数据不满足条件或答案模糊的用户直接丢弃而非近似,保证每道题对那个具体用户都是真命题。干扰项也由同一计算程序对全部10个选项求值验证,金标必须唯一成立;健康推理题的干扰项则是临床合理但与该用户数据不符的替代解读。

方法步骤详情

第一步数据准备:每位用户含16项日级指标(心肺、能耗、睡眠、压力四域,最多500天)、17项血液生物标志物、年龄/性别/BMI/种族,以及5项核心指标的人群分位数参照。第二步出题依据:文献接地筛选11篇Nature Medicine、PNAS等锚点论文并生成带DOI/PMID的结构化卡片;人群接地在28天窗口挖掘候选模式并过三重统计门控。第三步discover-then-label:先由文献发现或模式挖掘确定推理目标,再用共享原语库(threshold_flags对HbA1c、HOMA-IR等做临床阈值标记,rolling_mean、lagged_correlation等)在用户轨迹上执行得出金标。第四步干扰项构造:数据推理题用相反趋势、相邻时间窗、同量错误幅度等类别,健康推理题用临床合理但与该用户数据不符的替代解读;程序对10个选项全部求值,仅保留金标唯一成立的题。第五步质检:去重、选项位置均衡、捷径审计(曾发现active burn与steps耦合过于可预测而修复),三个前沿模型审查加人工复核。最终4,084题:数据推理2.7k、健康推理1.4k,单信号1.7k、跨信号2.4k。

技术新颖性

新颖性体现在四个层面。构造层面:双重接地把文献证据与数据统计两条线索统一进确定性标注管线,此前没有可穿戴基准同时做到真实数据、生理依据与可复现金标三者兼备。统计层面:人群接地的三重门控(效应量 $|\rho| \geq 0.5$ 且窗口两半符号一致、比较题胜项领先 $\geq 0.15$;30次自助重采样复现率 $\geq 80\%$ 并做留一天与死区检验;跨用户零检验控制FDR $\leq 0.20$)为数据里的模式是否真实提供了可操作的量化标准,这本身是对基准构建方法学的贡献。评测层面:2×2诊断分类学把失败原因分离到算不准与解读不了、单信号弱与整合差。审计层面:作者主动披露并修复捷径漏洞(如active burn–steps可被先验猜中),并设计定义性vs经验性信号对实验来直接测量模型对先验知识的依赖程度。

Overall taxonomy of WearableQA.
Figure 3: Overall taxonomy of WearableQA.
Overall statistics of 200 real users from WearableQA.
Figure 4: Overall statistics of 200 real users from WearableQA.
Overview of WearableQA.
Figure 5: Overview of WearableQA.
The assembled evaluation prompt (row format, with CoT).
Figure 9: The assembled evaluation prompt (row format, with CoT).
Example question from WearableQA for data reasoning.
Figure 10: Example question from WearableQA for data reasoning.
Example question from WearableQA for health reasoning.
Figure 11: Example question from WearableQA for health reasoning.

实验结果

CoT协议下14个模型准确率从19.6%(Llama-3.2-3B)到72.9%(Gemini-3.1-Pro),随机基线10%,多数低于60%;开源最佳Gemma-4-26B-A4B(42.5%)超GPT-4o(34.7%)7.8个百分点。除Gemini-3.1-Pro(数据75.4% vs 健康67.8%)外,所有模型健康推理优于数据推理,如GPT-4o为53.5% vs 25.3%,说明从原始纵向测量直接计算是普遍短板;跨信号也难于单信号(如GPT-5.4:45.7% vs 59.1%)。分题型,最强信号对与恢复时间最难(Gemini-3.1-Pro分别仅68.3%与35.9%,而偏移计数达94.4%),跨信号预测最差:从Llama-3.1-8B的8.3%到Claude-Opus-4.6的40.5%。CoT对专有模型提升大(最高+19.6),开源平均仅+2~3。先验依赖显著:定义性vs经验性信号对差Gemini-2.5-Pro +51.5、GPT-5.4 +48.2。输入表示影响有限(CSV 51.5最佳),Python工具使GPT-5.4达71.3(+20.1);去全部时序使整体从60.2%跌至17.3%。

Comparative Performance of proprietary and open-source models on WearableQA.
Table 1: Comparative Performance of proprietary and open-source models on WearableQA.
Definitional vs. empirical signal pairs.
Table 2: Definitional vs. empirical signal pairs.
Ablation of time-series inputs.
Table 4: Ablation of time-series inputs.
The only prompt difference between conditions (CoT vs. no-CoT trailing directive).
Table 5: The only prompt difference between conditions (CoT vs. no-CoT trailing directive).
Per-question-type performance on WearableQA (16 question types).
Table 6: Per-question-type performance on WearableQA (16 question types).
Comparison of chain-of-thought (CoT) and direct-answer (DA) prompting.
Table 7: Comparison of chain-of-thought (CoT) and direct-answer (DA) prompting.
Overall accuracy by model (CoT, 95% CI).
Figure 2: Overall accuracy by model (CoT, 95% CI).
Accuracy along the two taxonomy axes (CoT).
Figure 6: Accuracy along the two taxonomy axes (CoT).
Direct-answer vs. chain-of-thought across signal complexity.
Figure 7: Direct-answer vs. chain-of-thought across signal complexity.
Answer-letter pick-rate vs. uniform ground truth (DA left, CoT right).
Figure 8: Answer-letter pick-rate vs. uniform ground truth (DA left, CoT right).
查看结构化数据
任务指标本文基线提升
WearableQA 总体(16题型,10选1,CoT) Accuracy(95% Wilson CI) 基准上最佳模型 Gemini-3.1-Pro 72.9% 随机基线 10%;最弱模型 Llama-3.2-3B 19.6% 领先随机基线 62.9 个百分点
数据推理(最强 vs 典型模型) Accuracy Gemini-3.1-Pro 75.4%(唯一数据>健康的模型) GPT-4o 数据 25.3% vs 健康 53.5% 比 GPT-4o 数据推理高 50.1 个百分点
跨信号推理 Accuracy Gemini-3.1-Pro 73.2%(与单信号72.4%持平) GPT-5.4 45.7%、Claude-Sonnet-4 48.5% 跨信号预测题型全体最高仅 40.5%(Claude-Opus-4.6)
开源最佳 vs 专有模型 Overall Accuracy Gemma-4-26B-A4B 42.5% GPT-4o 34.7%;Gemini-3.1-Pro 72.9% 超 GPT-4o 7.8 个百分点,仍落后最强专有 30.4 个百分点
Python 工具增强(GPT-5.4, agentic fixed-repr) Overall Accuracy 71.3%(数据推理 72.9%) row 文本表示 51.2% +20.1 个百分点,超过所有纯文本模型
思维链 vs 直答(Claude-Opus-4.6) Overall Accuracy CoT 60.2%(单信号子集最高+27) 直答 DA 40.6% +19.6 个百分点(GPT-5.4 +17.7,开源平均仅+2~3)

局限与改进

作者承认的局限包括:基准远未解决(多数模型低于60%,最强也仅72.9%);模型大量依赖先验知识而非读数(定义性信号对领先经验性对最高51.5分);小模型位置偏差严重;跨信号预测题型即使最强模型也只有40.5%,recovery time连Gemini-3.1-Pro都只有35.9%。我的补充观察:其一,10选1选择题与真实健康助手的开放式对话有差距,答对选择题不代表能生成可靠建议;其二,血液指标是单次测量而非纵向,与每日可穿戴流的时变特性不对称;其三,人群接地门控允许FDR $\leq 0.20$,即约两成保留模式可能是虚假关联;其四,为排除歧义而丢弃不满足确定性判据的用户,使题目偏向模式清晰的个体,存在选择偏差;其五,200名用户来自单一队列,人群外推性与隐私合规正文未详述;其六,数据集在GitHub与HuggingFace公开,存在训练污染风险,作者未报告污染检测;其七,10选项格式与其他基准不可直接对比。

独立分析的弱点

第一,选择题范式窄化能力评估:真实助手需自由生成、引用具体数据并给出行动建议,应增加开放式子集,用确定性计算程序对自由回答自动评分。第二,跨信号题型近乎全军覆没(8.3%–40.5%),暴露长上下文多序列关系计算失败;改进方向是把计算原语做成工具接口——论文agentic实验已给出 +20.1 的证据,或训练模型显式调用统计函数。第三,FDR $\leq 0.20$ 的门控偏宽松,可收紧至 $\leq 0.10$ 并要求跨时间窗复制,避免把噪声当生理规律。第四,用户丢弃策略造成选择偏差,应报告被丢弃人群画像,并构造允许回答'数据不足'的题型。第五,图像输入全面劣于文本(34.1–36.6 vs 51.2),说明多模态模型读图表能力弱,值得专门优化图表理解而非放弃视觉通道。第六,先验依赖差距巨大(Gemini-2.5-Pro +51.5)暴露模型认关系强于算关系;且经验性对样本仅29题、定义性对102题,样本偏小,结论的置信区间较宽($\pm 11.4$ 级别),可用对抗性构造的新颖信号对扩充。

未来方向

作者方向:把agentic评估系统化——让模型组合Python工具、选择表示并多步推理,比较不同工具集与计算预算;向干预类问题(如何调整运动以改善HRV)与开放式健康摘要扩展。可延伸方向:其一,纵向血液指标与可穿戴流联合建模,考察生理状态随时间演化;其二,改造成私有排行榜加隐藏测试集以抵御污染,并加入污染探针;其三,多语言与跨设备(不同厂商传感器口径)泛化评测;其四,利用人群分位数参照研究个性化解读与人群规范的张力;其五,把16类计算原语开放为可调用环境用于强化学习训练(如RLVR),让模型学会读数—计算—解读的完整链条;其六,研究CoT对小模型的去偏机制(Llama-3.2-3B最大选字母率从51.5%降到13.5%),把位置偏差作为训练诊断信号;其七,结合可解释性方法定位模型在长序列上计算失败的具体环节。

复现评估

复现条件相当好。数据与题目在GitHub(facebookresearch/WearableQA)与HuggingFace(facebook/WearableQA)公开;答案由确定性计算程序生成,相同输入必得相同金标,天然可复检。专有模型部分需要GPT-4o、GPT-5.4、Gemini-2.5/3.1-Pro、Claude-Sonnet-4/Opus-4.6的API权限,温度0单次作答,主要成本是4,084题乘以每人最多500天记录的长上下文token开销,估计数百美元量级;开源部分(Llama-3.x、Gemma-3/4、Mistral-Small-3.1)单卡到多卡A100即可复现。附录给出完整提示模板(Figure 9、Table 5)、四种文本序列化示例与答案解析规则,报告95% Wilson置信区间,细节充分。未完全公开的是出题用的人群大队列、计算原语库代码与文献锚点卡片全文,若要复刻人群接地管线需额外工程量,总体难度中等。