WearableQA:面向真实可穿戴数据健康推理的基准
- 关联论文:2609.05405
- 作者:flyP
- 更新:2026-09-10
一句话结论
WearableQA 是一个用 200 名真实用户、最长 500 天日常测量数据构建的 4,084 题健康推理基准,覆盖 16 种题型、沿「数据 vs 健康」「单信号 vs 跨信号」两轴划分,14 个 LLM 在 10% 随机基线下成绩跨度 19.6%–72.9%,多数模型低于 60%——它把 LLM 评估从「能不能看懂一道题」推进到「能不能在带噪声的真实长程记录上做生理推理」。
解决什么真问题
现有可穿戴推理基准普遍存在三类缺陷:
- 真实分布丢失:很多合成数据把设备噪声和个体差异打磨掉了,模型在干净数据上跑得动,落到真实信号上就崩。
- 题型单一:把推理压成单一能力,无法分辨「会算」与「会解释」,也分不清「单信号计算」与「多信号整合」。
- 静态快照:用一条记录或一张图就让模型回答,没有真正的纵向 reasoning,无法评估长程趋势。
WearableQA 直接攻这三件事:保留真实分布噪声、把能力拆成 16 种题型、用最多 500 天的纵向数据评估。换句话说,它想测的不是「AI 在可穿戴场景的奇技淫巧」,而是「AI 在连续真实生理数据上的推理稳定性」。
核心方法
1. 数据来源与构造
- 用户规模:200 名真实个体,每名最多 500 天日常测量。
- 数据通道:可穿戴时序 + 血液生物标志物 + 人口学。
- 题目规模:4,084 道 10 选 1 多选题(10% 随机基线)。
- 关键约束:保留设备噪声和个体间差异——不是清洗后再出题,而是让模型在「真实分布」上推理。
2. 题型设计:双轴 × 16 类
单信号 跨信号
数据 data/single data/cross
健康 health/single health/cross
- 数据 vs 健康推理:前者偏纵向测量计算(如「过去 30 天平均静息心率下降了多少」),后者偏生理学解读(如「这种趋势提示什么」)。
- 单信号 vs 跨信号:前者只看一条通道,后者要把多条通道整合(如心率 + 睡眠 + HRV 共同提示什么)。
16 类题型 = 2 轴 × 2 类别 × 多粒度细化(原文未明确给出 16 类的完整枚举,原文仅声明组织原则)。
3. 双锚定构造框架(dual-grounding)
这是题目生成的关键机制:
问题模板 ─┬─ 文献锚定(literature-grounded)
└─ 群体锚定(population-grounded)
↓
统计验证关系
↓
写入题目(每题带 10 个干扰项)
- 文献锚定:把生理学文献里的发现转成可测量的关系(候选问题)。
- 群体锚定:用统计方法在 200 人的真实数据里验证这些关系是否真的存在。
- 只有文献说「有这种关系」、数据也证实在这种关系的问题,才被保留。这样筛出来的问题既是「有意义」(不是随机扰动),又「真实存在」(不是文献脑补)。
4. 评估设计
- 评测对象:14 个专有与开源 LLM。
- 主指标:10 选 1 准确率。
- 跨度:19.6% 到 72.9%,多数模型低于 60%。
- 解读:benchmark 拉开了能力梯度,且「远未被解决」(far from solved)——这是论文的核心立标级断言。
关键实验与数据
| 维度 | 数值 | 出处 |
|---|---|---|
| 用户数 | 200 名真实个体 | abstract |
| 单用户最长测量天数 | 500 天 | abstract |
| 题目数 | 4,084 道 10 选 1 | abstract |
| 题型分类 | 16 类(双轴划分) | abstract |
| 评测模型数 | 14 个 LLM(专有 + 开源) | abstract |
| 成绩区间 | 19.6% – 72.9% | abstract |
| 随机基线 | 10%(10 选 1) | abstract |
| 多数模型水平 | 低于 60% | abstract |
⚠️ 数据准确性疑点:原文 abstract 未公布 16 类题型的逐类准确率、未给出顶级模型的具体名称、未公布个体间差异如何量化——这三项需查 PDF 主表核验,v1 摘要口径如此。
亮点与局限
亮点
- 真分布保留:把设备噪声当成「要面对的现实」而不是「要清洗掉的杂质」,这是评测立场的关键变化。
- 双轴题型:把推理能力从一维「准不准」拆成四象限,能定位失败模式(是单信号不行?还是跨信号不行?是算不行?还是解释不行?)。
- 双锚定:避免「文献说啥就考啥」和「数据上瞎设问题」两端陷阱,把题目质量拧到可验证区间。
- 拉差能力:14 个模型 19.6%–72.9% 的跨度证明它确实能区分能力,而不是大家都跑同一个底分。
局限
- 样本规模有限:200 用户、4,084 题,对「跨个体泛化」的统计力可能不够。
- 题型分布未知:16 类的具体覆盖与每类样本量 abstract 未声明,需核 PDF。
- 通道覆盖窄:依赖血液生物标志物 + 可穿戴时序,缺少影像、基因等更广生理维度。
- 域偏移未测:所有用户都来自同一研究队列(原文未明确)?不同人口学、设备的迁移能力未做评估。
- 静态基准风险:题目一旦公开就可能被训练集污染,需要持续更新。
对工程落地的启发
- 多通道对齐能力:在 LLM 应用层做健康助理时,跨通道推理是真正的工程难点,单通道精度再高也没用——这条启发直接对应 WearableQA 把跨信号题型独立出来的判断。
- 真实分布优于清洗分布:生产环境里设备噪声和个体差异是常态,不是边缘 case。训练/评测数据应该保留分布特征,不是越干净越好。
- 失败模式可定位:双轴题型给出的「失败象限」可以反过来指导提示工程,针对每象限调不同检索/工具增强策略。
- 可解释输出:健康推理必须可解释(不是黑盒预测),这对评测与部署同时提出要求——WearableQA 用题型拆分已经隐含这层。
与同方向工作的关系
WearableQA 站在 LLM 医学评测赛道上:
- vs MedQA / PubMedQA 类:后者偏文本知识问答,前者偏长程生理数据推理——互补,不是替代。
- vs EHRSQL / MIMIC 评测:后者偏结构化电子病历,前者偏消费级可穿戴信号——评测对象不同。
- vs LongHealth / DocDNA 类长文档推理:同样在做「长程真实记录」评测,但 WearableQA 锁定在生理时序通道,并加了噪声保留这一更激进的设计。
⚠️ 同方向其他基准的横向对照(具体名字/年份/准确率)原文 abstract 未提供,需查引言 §2 与 Table 1 核验。
适合谁读
- 做健康/医疗 LLM 应用的工程师:需要真实分布评测基准,而不是合成数据。
- 做 benchmark 设计的研究者:双锚定 + 双轴划分是可借鉴的方法学。
- 做可穿戴设备 + AI 跨界的产品经理:能快速看懂「AI 在连续生理信号上的真实能力边界」。
- 关注评测可信度的从业者:远未被解决 + 噪声保留这两点对立标级评测很重要。
§0 自检栏
- 机制:4 段(数据构造 / 题型双轴 / 双锚定 / 评估设计)
- 工程:1 段(评估落地的四点启发)
- ⚠️ 标注:3 处(数据准确性疑点 / 样本规模有限 / 同方向横向对照未核)
- 私域五维 SUM:0(未引用 ip/kp/rn/fp/oc 内部代号)
- CJK 字数:约 2,150
- 来源:paper_card 1303-2609-05405.md + arxiv abstract + 双锚定机制为原文描述
- 撞自己:未发现与历史解读撞名
- 边界:仅写本文件;数字均来自 abstract,未编造