Body Battery、Recovery、Readiness:10 个品牌的 14 种「准备度评分」,没有一个公开过公式

5 月,Google 推出了没有屏幕的手环 Fitbit Air,它最核心的数字就是「准备度」。Garmin、WHOOP、Oura、Polar、Coros 都有类似指数。2025 年的一项分析找到了 10 家厂商的 14 种此类评分:没有一家公开公式,拿出金标准对照验证的寥寥无几。不过,它们底层的部分原始数据测得还算相当准。

Body Battery、Recovery、Readiness:10 个品牌的 14 种「准备度评分」,没有一个公开过公式

2026 年 5 月 7 日,Google 推出了 Fitbit Air——一款售价 $99.99、没有屏幕的手环。连表带只重 12 克,本身什么都不显示,用户每天早上在 App 里看到的最重要的东西,是 Readiness Score,也就是对训练负荷的「准备度」。同样的思路也存在于 Garmin(Body Battery 和 Training Readiness)、WHOOP(Recovery)、Oura(Readiness)和 Polar(Nightly Recharge)。一个 0 到 100 的数字,决定你今天要不要跑间歇。

在据此调整训练计划之前,值得先问一个问题:这个数字到底是什么?有没有人验证过,它真的代表它所承诺的含义?

研究检验了什么

2025 年,Cathal Doherty 等人——其中包括 HRV4Training 应用的创建者 Marco Altini——在 Translational Exercise Biomedicine 上发表了首个针对这类指数的系统性分析。作者称之为综合健康评分(Composite Health Scores):由传感器的多种信号合成的一个数字。

方法简单,却很能说明问题。研究者收集了厂商自己公开的全部资料:技术白皮书、使用手册、App 界面,以及已有的科学论文。然后逐一查看每种评分是由什么构成的。

共找到 10 家厂商的 14 种评分:

  • Fitbit:Daily Readiness;
  • Garmin:Body Battery 和 Training Readiness;
  • Oura:Readiness 和 Resilience;
  • WHOOP:Strain、Recovery 和 Stress Monitor;
  • Polar:Nightly Recharge;
  • Samsung:Energy Score;
  • Suunto:Body Resources;
  • Ultrahuman:Dynamic Recovery;
  • Coros:Daily Stress;
  • Withings:Health Improvement Score。

评分里有什么

各家的构成大同小异:

  • 心率变异性(HRV)——14 种评分中有 12 种(86%);
  • 静息心率——14 种中有 11 种(79%);
  • 日间活动量——14 种中有 10 种(71%);
  • 睡眠时长——14 种中有 10 种(71%)。

接下来就开始分道扬镳了。数据采集窗口不同:有的评分只看前一晚,有的取多天平均,Garmin 的 Body Battery 更是会在一天中不断「消耗」。各组成部分的权重不同。计分规则也不同。

最关键的是:没有一家厂商公开确切的公式。能拿出实证验证或同行评审数据、证明评分准确且对健康或运动表现有意义的,寥寥无几。作者的结论是:这个思路很有前景,但这类指数的科学依据、透明度和临床适用性仍不明确。

这并不是说这些数字是随机的。而是说,外人无从判断它们有多可信

评分底层的原始数据呢?

这方面倒是有数据。同样在 2025 年,Michael Dial 等人(Physiological Reports)以心电图为参照,检验了五款设备测得的夜间静息心率和 HRV:13 名健康成年人(6 名女性)睡觉时同时佩戴金标准心电设备和多款穿戴设备,共计 536 晚

HRV——与心电图的一致性(Lin 一致性相关系数,CCC)和平均绝对误差:

  • Oura Gen 4——CCC 0.99,误差 5.96%
  • Oura Gen 3——0.97,7.15%
  • WHOOP 4.0——0.94,8.17%
  • Garmin Fenix 6——0.87,10.52%
  • Polar Grit X Pro——0.82,16.32%

静息心率测得更准:Oura 的误差为 1.67–1.94%,Polar 为 2.71%,WHOOP 为 3.00%。Garmin 因方法学上的差异被排除在静息心率分析之外。

这项研究局限性部分里有一句话值得转述:每款设备都有自己的算法,至于用户最终看到的「准备度」或「恢复」由哪些指标、以什么权重构成,几乎一无所知。而且算法还会定期更新。

为什么单一数字会误导人

三层不确定性叠加在一起。

  1. 传感器误差。 如果夜间 HRV 平均偏差 10–16%,那么早上显示的「比基线低 8%」可能只是仪器噪声,而不是疲劳。
  2. 睡眠算得比你以为的差。 追踪器识别睡眠还不错,识别清醒却很差:频繁醒来的一夜,看起来比实际更长、更好。而睡眠时长被纳入了 71% 的评分。
  3. 权重和窗口未知。 同一个人的两种评分完全可能合理地出现分歧,仅仅因为一种看的是前一晚,另一种看的是一周。

所以,在不同品牌之间比较「准备度」毫无意义;换了手表或升级固件之后,也最好不要把旧的历史数据视为可比。

怎么用

  • 看组成部分,而不是总分。 早晨的 HRV 和静息心率相对于你个人基线的变化——这是至少部分经过验证的东西。如何在不自欺欺人的前提下根据 HRV 安排训练,见关于 HRV 指导训练的文章
  • 一天是噪声,几天才是信号。 连续几个早晨 HRV 低于基线、静息心率偏高,比一个红色数字更有意义。
  • 用身体感觉去质疑评分。 「准备度」是红色,但热身很轻松,熟悉配速下的心率也正常——训练可以照常进行,或许适当减量。数字是绿色,但双腿沉重、主观用力感很高——那也不是硬冲的理由。
  • 同一台设备,同样的条件。 同一个设备、同一只手或同一根手指、夜间测量。不要把不同品牌的数字互相比较。
  • 如果为了 HRV 挑选设备——在 Dial 的验证中,Oura 戒指和 WHOOP 与心电图的一致性优于 Garmin 和 Polar 手表。至于间歇训练本身,测心率最准的仍然是胸带。
  • 按测试结果而不是「准备度」设定心率区间。 评分并不知道你的阈值——这件事交给根据测试结果计算的区间生成器

要点

  • 2025 年的分析找到了 10 家厂商的 14 种综合评分——Fitbit、Garmin、Oura、WHOOP、Polar、Samsung、Suunto、Ultrahuman、Coros、Withings。
  • 构成几乎总是 HRV(86%)、静息心率(79%)、活动量和睡眠(各 71%),但各家的窗口、权重和公式都不相同,且未公开;给出验证的寥寥无几。
  • 原始数据的准确度参差不齐:夜间 HRV 误差 Oura 为 6–7%,WHOOP 为 8%,Garmin Fenix 6 为 10.5%,Polar Grit X Pro 为 16%。
  • 依据几天内 HRV 和静息心率的趋势以及自己的感觉来判断,把「准备度」数字当作提醒你去看这些指标的信号,而不是决定。

来源:Doherty C., Baldwin M., Lambe R., Burke D., Altini M.「Readiness, recovery, and strain: an evaluation of composite health scores in consumer wearables」。Translational Exercise Biomedicine, 2025;2:128–144. DOI: 10.1515/teb-2025-0001 · Dial M.B., Hollander M.E., Vatne E.A., Emerson A.M., Edwards N.A., Hagen J.A.「Validation of nocturnal resting heart rate and heart rate variability in consumer wearables」。Physiological Reports, 2025;13(16):e70527. DOI: 10.14814/phy2.70527