WearableQA:面向真实可穿戴数据健康推理的基准

  • 关联论文:2609.05405
  • 作者:flyP
  • 更新:2026-09-10

一句话结论

WearableQA 是一个用 200 名真实用户、最长 500 天日常测量数据构建的 4,084 题健康推理基准,覆盖 16 种题型、沿「数据 vs 健康」「单信号 vs 跨信号」两轴划分,14 个 LLM 在 10% 随机基线下成绩跨度 19.6%–72.9%,多数模型低于 60%——它把 LLM 评估从「能不能看懂一道题」推进到「能不能在带噪声的真实长程记录上做生理推理」。

解决什么真问题

现有可穿戴推理基准普遍存在三类缺陷:

  1. 真实分布丢失:很多合成数据把设备噪声和个体差异打磨掉了,模型在干净数据上跑得动,落到真实信号上就崩。
  2. 题型单一:把推理压成单一能力,无法分辨「会算」与「会解释」,也分不清「单信号计算」与「多信号整合」。
  3. 静态快照:用一条记录或一张图就让模型回答,没有真正的纵向 reasoning,无法评估长程趋势。

WearableQA 直接攻这三件事:保留真实分布噪声、把能力拆成 16 种题型、用最多 500 天的纵向数据评估。换句话说,它想测的不是「AI 在可穿戴场景的奇技淫巧」,而是「AI 在连续真实生理数据上的推理稳定性」。

核心方法

1. 数据来源与构造

  • 用户规模:200 名真实个体,每名最多 500 天日常测量。
  • 数据通道:可穿戴时序 + 血液生物标志物 + 人口学。
  • 题目规模:4,084 道 10 选 1 多选题(10% 随机基线)。
  • 关键约束:保留设备噪声和个体间差异——不是清洗后再出题,而是让模型在「真实分布」上推理。

2. 题型设计:双轴 × 16 类

        单信号           跨信号
数据    data/single      data/cross
健康    health/single    health/cross
  • 数据 vs 健康推理:前者偏纵向测量计算(如「过去 30 天平均静息心率下降了多少」),后者偏生理学解读(如「这种趋势提示什么」)。
  • 单信号 vs 跨信号:前者只看一条通道,后者要把多条通道整合(如心率 + 睡眠 + HRV 共同提示什么)。

16 类题型 = 2 轴 × 2 类别 × 多粒度细化(原文未明确给出 16 类的完整枚举,原文仅声明组织原则)。

3. 双锚定构造框架(dual-grounding)

这是题目生成的关键机制:

问题模板 ─┬─ 文献锚定(literature-grounded)
          └─ 群体锚定(population-grounded)
                     ↓
             统计验证关系
                     ↓
             写入题目(每题带 10 个干扰项)
  • 文献锚定:把生理学文献里的发现转成可测量的关系(候选问题)。
  • 群体锚定:用统计方法在 200 人的真实数据里验证这些关系是否真的存在。
  • 只有文献说「有这种关系」、数据也证实在这种关系的问题,才被保留。这样筛出来的问题既是「有意义」(不是随机扰动),又「真实存在」(不是文献脑补)。

4. 评估设计

  • 评测对象:14 个专有与开源 LLM。
  • 主指标:10 选 1 准确率。
  • 跨度:19.6% 到 72.9%,多数模型低于 60%。
  • 解读:benchmark 拉开了能力梯度,且「远未被解决」(far from solved)——这是论文的核心立标级断言。

关键实验与数据

维度 数值 出处
用户数 200 名真实个体 abstract
单用户最长测量天数 500 天 abstract
题目数 4,084 道 10 选 1 abstract
题型分类 16 类(双轴划分) abstract
评测模型数 14 个 LLM(专有 + 开源) abstract
成绩区间 19.6% – 72.9% abstract
随机基线 10%(10 选 1) abstract
多数模型水平 低于 60% abstract

⚠️ 数据准确性疑点:原文 abstract 未公布 16 类题型的逐类准确率、未给出顶级模型的具体名称、未公布个体间差异如何量化——这三项需查 PDF 主表核验,v1 摘要口径如此。

亮点与局限

亮点

  1. 真分布保留:把设备噪声当成「要面对的现实」而不是「要清洗掉的杂质」,这是评测立场的关键变化。
  2. 双轴题型:把推理能力从一维「准不准」拆成四象限,能定位失败模式(是单信号不行?还是跨信号不行?是算不行?还是解释不行?)。
  3. 双锚定:避免「文献说啥就考啥」和「数据上瞎设问题」两端陷阱,把题目质量拧到可验证区间。
  4. 拉差能力:14 个模型 19.6%–72.9% 的跨度证明它确实能区分能力,而不是大家都跑同一个底分。

局限

  1. 样本规模有限:200 用户、4,084 题,对「跨个体泛化」的统计力可能不够。
  2. 题型分布未知:16 类的具体覆盖与每类样本量 abstract 未声明,需核 PDF。
  3. 通道覆盖窄:依赖血液生物标志物 + 可穿戴时序,缺少影像、基因等更广生理维度。
  4. 域偏移未测:所有用户都来自同一研究队列(原文未明确)?不同人口学、设备的迁移能力未做评估。
  5. 静态基准风险:题目一旦公开就可能被训练集污染,需要持续更新。

对工程落地的启发

  1. 多通道对齐能力:在 LLM 应用层做健康助理时,跨通道推理是真正的工程难点,单通道精度再高也没用——这条启发直接对应 WearableQA 把跨信号题型独立出来的判断。
  2. 真实分布优于清洗分布:生产环境里设备噪声和个体差异是常态,不是边缘 case。训练/评测数据应该保留分布特征,不是越干净越好。
  3. 失败模式可定位:双轴题型给出的「失败象限」可以反过来指导提示工程,针对每象限调不同检索/工具增强策略。
  4. 可解释输出:健康推理必须可解释(不是黑盒预测),这对评测与部署同时提出要求——WearableQA 用题型拆分已经隐含这层。

与同方向工作的关系

WearableQA 站在 LLM 医学评测赛道上:

  • vs MedQA / PubMedQA 类:后者偏文本知识问答,前者偏长程生理数据推理——互补,不是替代。
  • vs EHRSQL / MIMIC 评测:后者偏结构化电子病历,前者偏消费级可穿戴信号——评测对象不同。
  • vs LongHealth / DocDNA 类长文档推理:同样在做「长程真实记录」评测,但 WearableQA 锁定在生理时序通道,并加了噪声保留这一更激进的设计。

⚠️ 同方向其他基准的横向对照(具体名字/年份/准确率)原文 abstract 未提供,需查引言 §2 与 Table 1 核验。

适合谁读

  • 做健康/医疗 LLM 应用的工程师:需要真实分布评测基准,而不是合成数据。
  • 做 benchmark 设计的研究者:双锚定 + 双轴划分是可借鉴的方法学。
  • 做可穿戴设备 + AI 跨界的产品经理:能快速看懂「AI 在连续生理信号上的真实能力边界」。
  • 关注评测可信度的从业者:远未被解决 + 噪声保留这两点对立标级评测很重要。

§0 自检栏

  • 机制:4 段(数据构造 / 题型双轴 / 双锚定 / 评估设计)
  • 工程:1 段(评估落地的四点启发)
  • ⚠️ 标注:3 处(数据准确性疑点 / 样本规模有限 / 同方向横向对照未核)
  • 私域五维 SUM:0(未引用 ip/kp/rn/fp/oc 内部代号)
  • CJK 字数:约 2,150
  • 来源:paper_card 1303-2609-05405.md + arxiv abstract + 双锚定机制为原文描述
  • 撞自己:未发现与历史解读撞名
  • 边界:仅写本文件;数字均来自 abstract,未编造