方案 A:先打牢透明基线
使用自我报告或历史周期数据,建立日历 / 历史基线,并把评估协议写得异常清楚。这通常比一个标签混乱的弱穿戴模型更站得住脚。
Data & Code
这页不是把资源平铺出来,而是帮助你快速判断:我现在最需要公开数据、starter code、baseline 案例,还是可重复性检查清单。
使用自我报告或历史周期数据,建立日历 / 历史基线,并把评估协议写得异常清楚。这通常比一个标签混乱的弱穿戴模型更站得住脚。
使用 mcPHASES 这样的开放数据集测试体温和心血管特征,但避免从小样本直接外推出强泛化结论。
如果能自己采集数据,一个标注清晰的中小规模 cohort 往往比一个大而弱标签的便利样本更有科学价值。
围绕 irregularity subgroup、指标标准化或标签定义比较的研究,本身就是当前领域非常实际的贡献。
| 数据集 | 适合谁 | 能回答什么 | 不适合回答什么 | 主要风险 |
|---|---|---|---|---|
| mcPHASES | 想做 wearable proof-of-concept 的 AI / DS 研究者 | 多模态生理信号与月经健康标签如何对齐 | 大规模产品级泛化能力 | 样本量有限,预处理门槛较高 |
| Kaggle 月经周期表格数据 | 想快速做 baseline 的开发者或数据科学新手 | 表格清洗、特征工程、grouped evaluation | 严格的临床或 wearable 结论 | 来源、标签与预处理质量需要额外核查 |
| Marquette Menstrual Cycle Data | 关注历史性周期结构和生育感知记录的研究者 | 非穿戴历史数据中的周期结构与规则 | 现代消费级 wearable 模型验证 | 历史数据语境和采集方式与现代 app 数据不同 |
公开访问不代表质量统一。每次使用数据集都应明确记录标签来源、缺失模式、群体过滤器,以及这些数据究竟更像真实部署环境还是受控研究环境。
一个低门槛 baseline 案例,帮助你看懂数据清洗、特征处理和 GroupKFold 评估在这个领域里为什么重要。
注:本仓库当前只保留案例说明页,原始 Notebook 与本地导出文件未随网站仓库一同打包。
这是更贴近 wearable 生理研究的路径,重点不在模型,而在如何对齐体温、HRV、激素相关事件和日历数据。
显式考虑依从性与缺失数据的生成模型。很适合理解真实世界 mHealth 数据的结构性问题。
链接使用 LSTM / GRU 进行周期长度预测,适合作为标准时间序列模型的 baseline 参考。
链接一个较直接的 RNN 多步预测实现,适合帮助医学背景读者看懂时序模型如何组织输入输出。
链接展示 Oura Ring 与 Natural Cycles 数据如何被用来探索跨相位的生理变化。
链接大规模 App 和消费级 wearable 研究塑造了这个领域,但它们背后的原始纵向数据通常不会公开下载。最常见原因是隐私、商业所有权、知情同意范围,以及生殖健康数据本身的高度敏感性。
对 App 开发者,这是功能可信度底线;对 AI / DS 研究者,这是实验有效性底线;对医学研究者,这是判断算法结论能否信的底线。