WearableQA:基于真实世界可穿戴数据的健康推理评测基准 WearableQA: A Benchmark for Health Reasoning over Real-World Wearable Data
用200名真实用户500天可穿戴数据出4084道10选1题,14个大模型最高仅72.9%
前置知识
可穿戴生理时序数据
指智能手表等设备每日连续采集的生理与行为指标。本文覆盖16项日级指标、分四域:心肺(静息心率RHR、心率变异性HRV、VO2max)、活动能耗(步数、活动卡路里等)、睡眠(时长、效率、深睡/REM占比、就寝规律性)与压力。每位用户有多达500天的日级记录,天然含设备噪声与个体差异。
本文所有题目都从这类真实纵向数据中确定性生成,理解数据形态(噪声、缺失、个体基线差异)是理解基准构建动机与模型失败原因的前提。
双重接地
论文的出题框架:每道题的答案依据要么来自同行评审文献(文献接地,Nature Medicine、PNAS等11篇锚点研究,需至少两项同方向独立研究支持),要么来自经统计验证的人群生理模式(人群接地,需过效应量、鲁棒性、真实性三重门控)。答案最终由确定性程序在该用户数据上算出,而非出题人主观认定。
这是本文方法的核心创新,是与简单模板造题的本质区别,也是理解题目可靠性与抗记忆性设计的关键。
错误发现率(FDR)
多重假设检验中被错误拒绝的零假设占全部拒绝结果的比例。论文在人群接地环节用跨用户零检验估计:把统计量故意错配到无关用户上重算,以零假设下的出现率与真实出现率之比作为经验FDR,只保留 $\text{FDR} \leq 0.20$(即阳性预测值 $\geq 80\%$)的模式,防止把噪声当生理规律。
它量化了人群接地题目的真实性底线,是评价该基准题目质量与理解其统计门控设计的关键指标。
思维链与直答提示
思维链(CoT)让模型先写推理过程、最后一行输出Answer: X;直答(DA)只输出选项字母。两条件上下文完全相同、仅结尾指令不同,准确率差异可完全归因于推理方式。CoT对专有模型提升显著:Claude-Opus-4.6整体+19.6个百分点、单信号最高+27,还能抑制小模型的位置偏差。
论文大量消融围绕CoT展开,理解该设置才能读懂Table 7与Figure 7的对比结论。
10选1多选题与位置偏差
WearableQA全部4,084题为10选项(A–J)单选题,随机基线10%,金标在各位置均匀分布。小模型在直答下会强烈偏向固定字母——Llama-3.2-3B有51.5%的回答选同一字母,说明其在押答案而非读数据;专有模型也有轻微偏好(如Claude-Opus-4.6偏A)。
位置偏差分析(Figure 8)是论文论证模型必须真正读取数据才能得分的重要证据链一环。
研究动机
医疗类评测基准虽多,却几乎都测不到针对具体个人的纵向生理数据做推理这件事。MedQA、MedMCQA、PubMedQA以考试题和文献问答为主,HealthBench扩展到真实健康对话但仍是纯文本;ECG-QA引入了心电波形,但对单段波形的推理与对数百天多信号记录的聚合完全不同。近年出现的可穿戴评测也有硬伤:PHIA主要基于模拟用户轨迹,且侧重检索与聚合;TimeSeriesExam等时序基准用程序合成信号,既不含真实噪声与个体基线差异,也无法考察生理学解释,且通常只看可穿戴信号本身、不联合血液指标。与此同时,基于LLM的个人健康助手正在快速落地(如Google的PHIA等),它们面对的是真实用户数百天的噪声数据。模型到底能否从真实纵向记录中算出趋势、异常与跨信号关系,并给出有临床意义的解读,此前缺乏系统性、诊断性的评测手段。
本文的目标是本文要构建一个既保留真实世界数据复杂性、又能细粒度诊断模型能力的可穿戴健康推理基准WearableQA。具体目标包括:从200名真实用户(每人多达500天、16项日级指标)的可穿戴记录、17项血液生物标志物与人口学信息出发,构造4,084道10选1多选题,随机基线10%;按数据推理vs健康推理、单信号vs跨信号两个正交轴组织16种题型,使模型失败可分别归因于纵向计算、生理学解读或跨信号整合;提出双重接地构造框架,保证答案既有生理学或统计学依据、又能从原始测量中确定性复现;最后对14个专有与开源LLM统一协议评测(CoT为主、直答对照),以95% Wilson置信区间报告,刻画当前能力边界。
与已有工作不同的是,本文的独特切入有三点。第一,数据真实性:它是首个以真实用户纵向可穿戴记录为主体、并联合血液生物标志物与人口学信息的评测,保留设备噪声与个体间差异,而非合成信号或模拟轨迹。第二,双重接地:现有工作要么人工写题(易引入先验捷径),要么模板生成(缺乏生理依据);本文把11篇文献锚点与经统计门控验证的人群模式结合,答案永远从具体用户的原始数据重新计算,既忠实于目标人群又抗记忆。第三,诊断性分类学:把从数据算出答案与基于数据做生理学解读、单信号与跨信号整合分开考察,能精确定位模型短板——例如数据推理与跨信号整合两大弱项正是靠这套分类学暴露出来的,这是以往健康基准不具备的归因能力。
核心方法
直觉上,一道可靠的健康推理题需同时满足两点:答案有生理学或统计学依据,且能从该用户的真实数据中唯一、可复现地算出来。技术路线分四步。先备料:200名真实用户的多变量日级时序(最多500天、16项指标)、17项血液指标、人口学属性,以及来自更大队列的5项核心指标分位数参照。再找出题依据:文献接地整理11篇锚点研究(要求至少两项同方向独立研究支持);人群接地在大队列上挖掘28天窗口内的趋势、异常、恢复与跨信号耦合,并用三重统计门控筛选——效应量 $|\rho| \geq 0.5$ 且窗口前后半段符号一致、比较题胜项领先 $\geq 0.15$;鲁棒性要求30次自助重采样中至少80%复现且留一天仍稳健;真实性要求跨用户零检验下 $\text{FDR} \leq 0.20$。然后discover-then-label:把推理目标表达为可复用计算原语的组合,在用户数据上确定性求出金标。最后生成9个干扰项,并验证金标在10个选项中唯一满足判据。
核心创新是双重接地加确定性计算图标注的组合,本质区别在于答案的来源。传统医学QA的答案是出题人认定的;本文的金标答案永远由程序在原始测量上执行计算图得到,相同输入必得相同答案,完全可复现。文献接地只提供要考察什么关系,且刻意不搬用文献里的队列特定阈值,改用个性化基线(如静息心率升高定义为高于本人近28天均值 $\geq 1.5$ 个标准差);人群接地则覆盖文献未记载但统计上真实存在的模式。对数据不满足条件或答案模糊的用户直接丢弃而非近似,保证每道题对那个具体用户都是真命题。干扰项也由同一计算程序对全部10个选项求值验证,金标必须唯一成立;健康推理题的干扰项则是临床合理但与该用户数据不符的替代解读。
方法步骤详情
第一步数据准备:每位用户含16项日级指标(心肺、能耗、睡眠、压力四域,最多500天)、17项血液生物标志物、年龄/性别/BMI/种族,以及5项核心指标的人群分位数参照。第二步出题依据:文献接地筛选11篇Nature Medicine、PNAS等锚点论文并生成带DOI/PMID的结构化卡片;人群接地在28天窗口挖掘候选模式并过三重统计门控。第三步discover-then-label:先由文献发现或模式挖掘确定推理目标,再用共享原语库(threshold_flags对HbA1c、HOMA-IR等做临床阈值标记,rolling_mean、lagged_correlation等)在用户轨迹上执行得出金标。第四步干扰项构造:数据推理题用相反趋势、相邻时间窗、同量错误幅度等类别,健康推理题用临床合理但与该用户数据不符的替代解读;程序对10个选项全部求值,仅保留金标唯一成立的题。第五步质检:去重、选项位置均衡、捷径审计(曾发现active burn与steps耦合过于可预测而修复),三个前沿模型审查加人工复核。最终4,084题:数据推理2.7k、健康推理1.4k,单信号1.7k、跨信号2.4k。
技术新颖性
新颖性体现在四个层面。构造层面:双重接地把文献证据与数据统计两条线索统一进确定性标注管线,此前没有可穿戴基准同时做到真实数据、生理依据与可复现金标三者兼备。统计层面:人群接地的三重门控(效应量 $|\rho| \geq 0.5$ 且窗口两半符号一致、比较题胜项领先 $\geq 0.15$;30次自助重采样复现率 $\geq 80\%$ 并做留一天与死区检验;跨用户零检验控制FDR $\leq 0.20$)为数据里的模式是否真实提供了可操作的量化标准,这本身是对基准构建方法学的贡献。评测层面:2×2诊断分类学把失败原因分离到算不准与解读不了、单信号弱与整合差。审计层面:作者主动披露并修复捷径漏洞(如active burn–steps可被先验猜中),并设计定义性vs经验性信号对实验来直接测量模型对先验知识的依赖程度。
实验结果
CoT协议下14个模型准确率从19.6%(Llama-3.2-3B)到72.9%(Gemini-3.1-Pro),随机基线10%,多数低于60%;开源最佳Gemma-4-26B-A4B(42.5%)超GPT-4o(34.7%)7.8个百分点。除Gemini-3.1-Pro(数据75.4% vs 健康67.8%)外,所有模型健康推理优于数据推理,如GPT-4o为53.5% vs 25.3%,说明从原始纵向测量直接计算是普遍短板;跨信号也难于单信号(如GPT-5.4:45.7% vs 59.1%)。分题型,最强信号对与恢复时间最难(Gemini-3.1-Pro分别仅68.3%与35.9%,而偏移计数达94.4%),跨信号预测最差:从Llama-3.1-8B的8.3%到Claude-Opus-4.6的40.5%。CoT对专有模型提升大(最高+19.6),开源平均仅+2~3。先验依赖显著:定义性vs经验性信号对差Gemini-2.5-Pro +51.5、GPT-5.4 +48.2。输入表示影响有限(CSV 51.5最佳),Python工具使GPT-5.4达71.3(+20.1);去全部时序使整体从60.2%跌至17.3%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| WearableQA 总体(16题型,10选1,CoT) | Accuracy(95% Wilson CI) | 基准上最佳模型 Gemini-3.1-Pro 72.9% | 随机基线 10%;最弱模型 Llama-3.2-3B 19.6% | 领先随机基线 62.9 个百分点 |
| 数据推理(最强 vs 典型模型) | Accuracy | Gemini-3.1-Pro 75.4%(唯一数据>健康的模型) | GPT-4o 数据 25.3% vs 健康 53.5% | 比 GPT-4o 数据推理高 50.1 个百分点 |
| 跨信号推理 | Accuracy | Gemini-3.1-Pro 73.2%(与单信号72.4%持平) | GPT-5.4 45.7%、Claude-Sonnet-4 48.5% | 跨信号预测题型全体最高仅 40.5%(Claude-Opus-4.6) |
| 开源最佳 vs 专有模型 | Overall Accuracy | Gemma-4-26B-A4B 42.5% | GPT-4o 34.7%;Gemini-3.1-Pro 72.9% | 超 GPT-4o 7.8 个百分点,仍落后最强专有 30.4 个百分点 |
| Python 工具增强(GPT-5.4, agentic fixed-repr) | Overall Accuracy | 71.3%(数据推理 72.9%) | row 文本表示 51.2% | +20.1 个百分点,超过所有纯文本模型 |
| 思维链 vs 直答(Claude-Opus-4.6) | Overall Accuracy | CoT 60.2%(单信号子集最高+27) | 直答 DA 40.6% | +19.6 个百分点(GPT-5.4 +17.7,开源平均仅+2~3) |
局限与改进
作者承认的局限包括:基准远未解决(多数模型低于60%,最强也仅72.9%);模型大量依赖先验知识而非读数(定义性信号对领先经验性对最高51.5分);小模型位置偏差严重;跨信号预测题型即使最强模型也只有40.5%,recovery time连Gemini-3.1-Pro都只有35.9%。我的补充观察:其一,10选1选择题与真实健康助手的开放式对话有差距,答对选择题不代表能生成可靠建议;其二,血液指标是单次测量而非纵向,与每日可穿戴流的时变特性不对称;其三,人群接地门控允许FDR $\leq 0.20$,即约两成保留模式可能是虚假关联;其四,为排除歧义而丢弃不满足确定性判据的用户,使题目偏向模式清晰的个体,存在选择偏差;其五,200名用户来自单一队列,人群外推性与隐私合规正文未详述;其六,数据集在GitHub与HuggingFace公开,存在训练污染风险,作者未报告污染检测;其七,10选项格式与其他基准不可直接对比。
独立分析的弱点
第一,选择题范式窄化能力评估:真实助手需自由生成、引用具体数据并给出行动建议,应增加开放式子集,用确定性计算程序对自由回答自动评分。第二,跨信号题型近乎全军覆没(8.3%–40.5%),暴露长上下文多序列关系计算失败;改进方向是把计算原语做成工具接口——论文agentic实验已给出 +20.1 的证据,或训练模型显式调用统计函数。第三,FDR $\leq 0.20$ 的门控偏宽松,可收紧至 $\leq 0.10$ 并要求跨时间窗复制,避免把噪声当生理规律。第四,用户丢弃策略造成选择偏差,应报告被丢弃人群画像,并构造允许回答'数据不足'的题型。第五,图像输入全面劣于文本(34.1–36.6 vs 51.2),说明多模态模型读图表能力弱,值得专门优化图表理解而非放弃视觉通道。第六,先验依赖差距巨大(Gemini-2.5-Pro +51.5)暴露模型认关系强于算关系;且经验性对样本仅29题、定义性对102题,样本偏小,结论的置信区间较宽($\pm 11.4$ 级别),可用对抗性构造的新颖信号对扩充。
未来方向
作者方向:把agentic评估系统化——让模型组合Python工具、选择表示并多步推理,比较不同工具集与计算预算;向干预类问题(如何调整运动以改善HRV)与开放式健康摘要扩展。可延伸方向:其一,纵向血液指标与可穿戴流联合建模,考察生理状态随时间演化;其二,改造成私有排行榜加隐藏测试集以抵御污染,并加入污染探针;其三,多语言与跨设备(不同厂商传感器口径)泛化评测;其四,利用人群分位数参照研究个性化解读与人群规范的张力;其五,把16类计算原语开放为可调用环境用于强化学习训练(如RLVR),让模型学会读数—计算—解读的完整链条;其六,研究CoT对小模型的去偏机制(Llama-3.2-3B最大选字母率从51.5%降到13.5%),把位置偏差作为训练诊断信号;其七,结合可解释性方法定位模型在长序列上计算失败的具体环节。
复现评估
复现条件相当好。数据与题目在GitHub(facebookresearch/WearableQA)与HuggingFace(facebook/WearableQA)公开;答案由确定性计算程序生成,相同输入必得相同金标,天然可复检。专有模型部分需要GPT-4o、GPT-5.4、Gemini-2.5/3.1-Pro、Claude-Sonnet-4/Opus-4.6的API权限,温度0单次作答,主要成本是4,084题乘以每人最多500天记录的长上下文token开销,估计数百美元量级;开源部分(Llama-3.x、Gemma-3/4、Mistral-Small-3.1)单卡到多卡A100即可复现。附录给出完整提示模板(Figure 9、Table 5)、四种文本序列化示例与答案解析规则,报告95% Wilson置信区间,细节充分。未完全公开的是出题用的人群大队列、计算原语库代码与文献锚点卡片全文,若要复刻人群接地管线需额外工程量,总体难度中等。
论文图表
雷达图展示开源与专有模型在16种题型上的准确率轮廓。专有模型轮廓明显更大更规整,Gemini-3.1-Pro几乎包络其他所有模型;开源模型在数据推理类题型(如strongest pair、signed correlation)上大幅塌陷,接近随机基线。
一图总览16题型的能力地形,直观呈现模型间的差异化短板,是全文实验结果的视觉摘要。
GPT-5.4在不同输入表示下的成绩:row基线51.2,csv 51.5,markdown+stats 51.9,图像表示降至34.1–36.6,csv+chart 51.0;而agentic fixed-repr(Python工具)达71.3(数据推理72.9),multi-view 69.7无额外收益。
揭示表示方式的边际收益有限、而给模型计算工具才是质变,指向LLM时序推理的正确路径。