App 开发者
先看“定位”“方法分类”“评估方法”。你需要先知道什么能做成产品,什么暂时只能留在研究里。
Field Guide
这页负责建立最小共同认知:月经预测到底在研究什么、怎样变成 AI 任务、哪些信号可用,以及为什么评估方法会直接改变结论。
先看“定位”“方法分类”“评估方法”。你需要先知道什么能做成产品,什么暂时只能留在研究里。
先看“周期基础”“医学问题如何变成 AI 任务”“评估方法”。重点是避免把生理变异误当作模型缺陷。
先看“医学问题如何变成 AI 任务”“方法分类”“穿戴信号”。重点是理解标签、特征和模型输出之间的关系。
如果你只是快速建立方向感,术语表可以先略读,先抓住任务定义、方法路线和评估逻辑。
这个领域混合了几种相关但不相同的任务:预测下次月经起点、估算排卵时机、判定受孕窗口、分类周期阶段。它们共享生理基础,但标签来源、评价方式和部署约束并不一样。
| 目标任务 | 典型标签来源 | 常见输出 | 主要难点 |
|---|---|---|---|
| 下次月经起点 | 自我追踪出血记录 | 下次日期或剩余天数 | 受卵泡期变异和记录质量影响大 |
| 排卵日 | 尿 LH、超声、孕酮或代理规则 | 单日估计或误差窗口 | 不同论文使用的操作性定义差异显著 |
| 受孕窗口 | 由排卵估计或生育感知规则推导 | 每日二分类概率或起止窗口 | 高度依赖定义,且常带临床敏感性 |
| 周期相位 | 日历规则、激素检测或潜在状态标签 | 每日相位类别 | 相位边界往往是操作性的,不是直接生物学真相 |
临床指南和大规模观察数据都否定了“固定 28 天周期”作为默认模板。更关键的是,变异并不是混乱噪声,而是有结构的:排卵是短事件,卵泡期通常是主要变异来源,黄体期通常更稳定 [1] [2]。
| 相位 | 发生了什么 | 相对稳定性 | 为什么建模者要关心 |
|---|---|---|---|
| 月经期 | 出血通常标志新周期第 1 天 | 可观测,但自我记录有噪声 | 最容易规模化收集的事件 |
| 卵泡期 | 排卵前的卵泡发育与激素准备 | 通常最具变异性 | 大量起点预测误差来自这里 |
| 排卵 | 卵子释放,常以 LH 事件作为参考锚点 | 短暂且难以直接观测 | 是倒计时式模型最关键的时间锚 |
| 黄体期 | 排卵后由孕酮主导 | 相对更稳定 | 解释了为什么排卵后预测月经更容易 |
产品不能把用户界面建立在固定周期模板上,否则风险提示、可解释性和用户预期都会失真。
很多误差并不来自算法弱,而来自卵泡期生理变异。基线设计必须体现这一点。
当 AI 研究者谈“error”时,其中一部分其实是在处理本来就存在的生理变异,而不是在假定一个病理问题。
医学语境里常说“预测月经”“识别排卵”“评估受孕窗口”;进入计算语境后,这些会被重写成回归、事件检测、序列标注或窗口分类问题。
什么时候来月经?什么时候排卵?哪几天最可能受孕?这个周期现在处于哪个阶段?
预测下一事件的时间、估计某个关键事件日、输出一段时间窗、或者对每日状态进行分类。
月经起点常来自自我报告,排卵常来自尿 LH 或其代理规则,相位有时来自潜在状态模型而不是直接检测。
同样一个临床概念,在不同论文里可能被操作化成完全不同的机器学习任务,因此不能只看标题判断是否可比。
例如预测“距离下次出血还有多少天”或“下一个事件发生的日期”。优点是直观,缺点是对标签噪声和个体差异敏感。
例如估计某天是否接近排卵。常与窗口型指标一起使用,但非常依赖标签定义。
对每天给出阶段标签,更适合表达周期动态,但相位边界常常是规则性或代理性的。
把问题定义成一段高风险时间窗,适合受孕窗口任务,但需要清楚说明窗口是怎样推导出来的。
你显示给用户的是“日期”“概率”还是“窗口”,不是纯展示层问题,而是任务定义本身的一部分。
任务定义必须与标签来源和部署时可用信息匹配,否则会把未来信息偷偷带进模型。
模型输出并不天然代表临床真值;它往往只是某种操作化标签的最佳估计。
| 方法族 | 典型输入 | 适合什么 | 主要局限 |
|---|---|---|---|
| 规则 / 日历基线 | 过去出血日期、平均周期长度 | 建立透明基线、低成本产品原型 | 对不规则周期和冷启动脆弱 |
| 表格模型 | 周期统计量、症状、依从性特征 | 小中规模数据、可解释 baseline | 时间结构表达有限 |
| RNN / LSTM / GRU | 逐日或逐周期序列 | 建模时序依赖与多步预测 | 数据需求更高,容易掩盖标签问题 |
| 潜在状态 / 生成模型 | 带缺失和噪声的长期追踪数据 | 处理缺失、依从性与隐含阶段 | 实现和解释门槛较高 |
体温、心率、HRV、睡眠和呼吸是当前最常见的被动信号。它们的重要性在于揭示周期相关的生理结构,但它们并不是直接等于排卵或受孕窗口的“真值”。
| 信号 | 它提供什么 | 常见风险 |
|---|---|---|
| 基础体温 / 皮肤温度 | 跨相位的温度变化模式 | 不同设备和测量部位不可直接互换 |
| 静息心率 / 睡眠心率 | 反映自主神经与代谢变化 | 受活动、睡眠和设备算法影响 |
| HRV | 补充心血管调节信息 | 信号质量和预处理差异很大 |
| 睡眠 / 呼吸 / 活动 | 提供行为背景与噪声控制 | 常被误当成主要生理因果信号 |
如果产品使用穿戴信号,就必须同时表达不确定性,而不是把它包装成“看见了排卵”。
信号选择和预处理与模型一样重要,尤其要注意设备差异和缺失模式。
这里的 wearable signal 更接近 proxy marker,而不是临床诊断中的标准化生物标志物。
这个领域里,一篇论文“看起来很强”常常不只是因为模型强,也可能因为标签更宽松、切分更轻松、人群更规律,或者使用了部署时不可用的信息。
| 评估问题 | 如果做错了会怎样 | 更稳妥的做法 |
|---|---|---|
| 随机切分 vs 按受试者切分 | 同一人的模式泄漏到训练和测试中 | 声称泛化时优先使用 subject-wise split |
| 未来信息泄露 | 离线结果虚高,部署时失效 | 明确声明预测时刻可用信息 |
| 只报告平均分 | 掩盖不规则人群中的失败 | 报告 subgroup 表现与失败模式 |
| 标签定义不透明 | 论文之间根本不可比 | 明确写清 LH onset、LH peak、peak+1 等规则 |
离线评估好看,不代表真实用户体验可靠。部署约束必须在实验阶段就进入设计。
如果 split、label、metric 没说清楚,性能数字本身几乎没有比较价值。
判断一篇 AI 论文是否可信,往往先看 cohort、标签和切分,而不是先看模型名。
很多研究仍把不规则周期当成一个总类,而没有拆分不同类型的不规则性。
我们知道可穿戴信号有时有帮助,但还不清楚“对谁、何时、在哪种任务里”最有帮助。
尤其在排卵相关任务上,操作性定义差异持续阻碍比较和复现。
很多实验仍没有在真实预测约束下定义问题。
长周期、高变异、偏移但稳定等模式不应被折叠成同一个建模目标。
重点不只是平均性能,而是对谁有效、在哪种任务里有效、在什么约束下有效。
排卵与受孕窗口的标签定义仍不统一,直接影响复现性与跨研究比较。
需要明确限制为预测时刻可用信息,避免把未来观测混入当前预测。
个性化需要明确触发条件、表示方式与目标人群,而不只是增加模型复杂度。
同时报告亚群结果、标签定义和部署约束,才能让结论在跨学科语境下可解释。