Skip to main content

epi-data-access

当用户需要获取流行病学与公共卫生数据、查找疾病负担或疫情公开数据源、下载 国际或中国的公卫统计与监测数据、评估某个数据源能不能用/怎么引用时使用。 同义场景:WHO 数据、GHDx/IHME 疾病负担、Our World in Data、ProMED 疫情快报、 国家卫健委疫情通报、中国 CDC 周报、China CDC Weekly、国家统计局人口数据、 CHNS 队列、发病率/死亡率数据去哪找、疫情数据下载、公卫数据源推荐、 个案数据去标识化、涉及人的数据要不要伦理审查、"帮我找找某地某病的数据"。

설치로 이동

소스 정보

저장소
MiniMax-AI/MiniMax-Code-Plugins
최근 소스 활동
2026년 8월 19일 12:10
감지된 SKILL.md 언어
중국어
스타
11
포크
10

설치 방법

기본적으로 소스를 먼저 확인하는 Prompt가 선택됩니다. 직접 명령으로 전환하거나 로컬 사본을 다운로드할 수도 있습니다.

소스 파일 검토

설치 여부를 결정하기 전에 SKILL.md와 SkillsMP에 표시된 보조 파일을 읽어 보세요.

SKILL.md 표시 중

SKILL.md
소스 지침 · 읽기 전용 미리보기
name
epi-data-access
description
当用户需要获取流行病学与公共卫生数据、查找疾病负担或疫情公开数据源、下载 国际或中国的公卫统计与监测数据、评估某个数据源能不能用/怎么引用时使用。 同义场景:WHO 数据、GHDx/IHME 疾病负担、Our World in Data、ProMED 疫情快报、 国家卫健委疫情通报、中国 CDC 周报、China CDC Weekly、国家统计局人口数据、 CHNS 队列、发病率/死亡率数据去哪找、疫情数据下载、公卫数据源推荐、 个案数据去标识化、涉及人的数据要不要伦理审查、"帮我找找某地某病的数据"。
argument-hint
[疾病/指标 + 地区 + 时间范围]
metadata
{"domains":["epidemiology","public-health"],"last_reviewed":"2026-08-18"}
# epi-data-access:公共卫生数据源获取规程 ## 目的 流行病学分析的第一公里是"数据从哪来、能不能用、怎么标注"。本技能给出常用 国际与中国公共卫生数据源的获取规程:每个数据源固定回答四件事——**入口、 格式、许可注意、来源标注标签**,并划定个案数据隐私红线与数据只读原则。 铁律(与包根 CLAUDE.md guardrails 一致,此处为域内具体化): 1. 凡写入产物的数据事实必须带来源标签;标签描述出处,不暗示置信度。 2. 数据文件落地即冻结:进 `data/` 后不改名、不编辑、不覆盖(原始数据只读 原则,见 research-workspace)。 3. 个案级数据先过隐私红线检查,再谈分析。 4. 拿不到的数据不编造:留 `[待补证据]` 占位并写明去哪补(evidence-or-silence)。 ## 前置检查 1. 明确需求三要素:**指标**(发病率/死亡率/患病率/疾病负担/病原学监测…)、 **地区**(全球/国家/省级/更小单元)、**时间范围**。三要素不全时先与用户 对齐,不要带着模糊需求逐个试数据源。 2. 确认需要的是**汇总数据**(已按地区/时间聚合的统计量)还是**个案数据** (逐病例记录)。两者走完全不同的合规路径:个案数据必须先完成第 4 节 的隐私与伦理检查。 3. 确认网络环境与访问权限:部分数据源需要注册、申请或机构权限(如 CHNS 需要注册并同意数据使用协议)。无权限的源直接标注"无权限",不要假装能取。 4. 确认工作区已初始化(`data/` 目录存在);未初始化时引导用户先运行 research-workspace。 ## 1 · 国际数据源 以下入口与条款为模型知识整理,**具体 URL 与许可条款可能已变化**:引用前 应打开页面确认当前条款,并把页面所见按 `[模型知识—待核实]` 与实际访问结果 并列呈现(guardrail 第 5 条)。 ### 1.1 WHO 数据(WHO Data / Global Health Observatory) - **入口**:WHO 官网数据页与 Global Health Observatory(GHO)主题指标库 [模型知识—待核实:入口页面近年有过改版]。 - **格式**:网页表格在线浏览;GHO 提供 API(OData 风格)与 CSV 下载 [模型知识—待核实]。 - **许可注意**:WHO 数据通常附带其使用条款,再分发与商用受限;报告中引用 需注明 "World Health Organization" 及获取日期 [模型知识—待核实]。 - **标注标签**:`[WHO-GHO]`(限本会话真实访问到的内容)。 ### 1.2 GHDx / IHME(全球疾病负担研究 GBD) - **入口**:Global Health Data Exchange(ghdx.healthdata.org),GBD 结果 工具(GBD Compare / GBD Results)[模型知识—待核实]。 - **格式**:在线可视化工具 + CSV 下载(需免费注册账号)。 - **许可注意**:IHME 数据免费但要求按指定格式引用 GBD 研究署名;下载时 页面会给出引用文本,照抄即可 [模型知识—待核实]。 - **标注标签**:`[GHDx]`。 - **提示**:GBD 的估计是**模型产出**而非直接观测,写作时应说明"估计值" 属性与不确定区间,不能与监测直报数字混用 [模型知识—待核实]。 ### 1.3 Our World in Data(OWID) - **入口**:ourworldindata.org 各主题页与 Grapher 图表的下载按钮 [模型知识—待核实]。 - **格式**:CSV / 图表导出;多数变量附元数据说明。 - **许可注意**:OWID 自身内容多为 CC-BY,但其**转引的底层数据**(如 WHO、 世界银行)仍受原始来源条款约束——引用时应回溯到底层来源,不能只引 OWID [模型知识—待核实]。 - **标注标签**:`[OWID]`,并同时标注底层来源(如 `[WHO-GHO]`)。 ### 1.4 ProMED 疫情快报 - **入口**:ProMED-mail(promedmail.org),按主题/地区检索疫情通报邮件 [模型知识—待核实]。 - **格式**:非结构化英文快报文本(邮件列表档案)。 - **许可注意**:ProMED 是**早期预警信号**而非核实数据,内容未经同行评议; 引用时必须注明其为未核实通报,并以官方通报复核 [模型知识—待核实]。 - **标注标签**:`[ProMED]`,产物中凡 ProMED 信息均需附"未经官方核实"限定语。 ## 2 · 中国数据源 ### 2.1 国家卫生健康委疫情通报 - **入口**:国家卫健委官网"疫情通报"/法定传染病疫情概况栏目(月度发布) [模型知识—待核实]。 - **格式**:网页文字通报(法定报告传染病分病种发病数、死亡数)。 - **许可注意**:政府公开信息,引用注明发布机构与发布日期;通报数字为 法定报告口径,存在报告延迟与漏报,解读时需说明口径 [模型知识—待核实]。 - **标注标签**:`[国家卫健委]`。 ### 2.2 中国 CDC 周报(China CDC Weekly) - **入口**:weekly.chinacdc.cn,英文周刊,含监测分析、暴发调查简报与方法 文章 [模型知识—待核实]。 - **格式**:网页全文 + PDF,开放获取。 - **许可注意**:开放获取但仍需完整引用(刊名、年卷期、DOI);其"Notes from the Field"类文章是快报性质,引用措辞与正式研究论文区分 [模型知识—待核实]。 - **标注标签**:`[China CDC Weekly]`。 ### 2.3 国家统计局人口数据 - **入口**:国家统计局官网年度统计公报、人口普查/抽样调查公报、国家数据 查询平台 [模型知识—待核实]。 - **格式**:网页表格、公报 PDF;查询平台可导出。 - **许可注意**:政府公开数据;人口分母(计算发病率、粗率必备)注意**口径 年份**——普查年与非普查年的估计方法不同,跨年比较需统一口径 [模型知识—待核实]。 - **标注标签**:`[国家统计局]`。 ### 2.4 CHNS 等队列数据 - **入口**:China Health and Nutrition Survey(CHNS)官网注册申请 [模型知识—待核实];其他常用队列(如 CHARLS、CFPS)各有申请门户 [模型知识—待核实]。 - **格式**:注册审核后下载 SAS/Stata/CSV 数据文件与问卷文档。 - **许可注意**:需签署数据使用协议,通常禁止再分发原始数据、要求按指定 格式致谢;**个案级数据,适用第 4 节全部隐私红线**。 - **标注标签**:`[CHNS]`(或对应队列名)。 ## 3 · 获取与登记规程 按顺序执行: 1. **定口径**:把需求三要素写成一行查询说明(例:"某省 2015–2024 年肺结核 报告发病率,分年度"),据此选择数据源,一次只取一个口径,不混用。 2. **获取**:人工下载或小量 API 调用。批量抓取、镜像整库属 guardrail 第 8 条危险操作(联网批量下载),必须先向用户说明并获确认。 3. **落盘冻结**:原始文件存入 `data/`(建议子目录按来源组织,如 `data/who-gho/`),落地后不再改动。 4. **登记 provenance**:用 provenance-record 登记,note 中 写明:数据源、获取日期(ISO 8601 带时区)、查询条件/URL、文件清单。 5. **记录口径备注**:在该数据的说明文件(如 `data/<源>/README.md`)写明 指标定义、分母来源、已知局限(报告延迟、口径变更),供下游引用。 ## 4 · 隐私红线与伦理审查 凡涉及**个案级数据**(病例一览表、问卷、队列个体记录),在数据进入分析 环境**之前**逐项检查: 1. **去标识化**:姓名、身份证号、电话、详细住址(精细到门牌/自然村)、 工作单位等直接标识符**不得进入分析环境**。确需保留的准标识符(年龄、 性别、乡镇级地区)评估再识别风险,必要时泛化(如年龄分组)。 2. **去标识化在源头做**:在数据整理阶段生成去标识副本,原始含标识符文件 按机构规定单独保管;分析脚本只接触去标识副本。 3. **伦理审查**:涉及人的数据(含回顾性病历、问卷、队列)先确认已有 IRB/伦理委员会批件或豁免证明;没有批件的项目停止数据处理,提醒用户 先办伦理手续。批件编号写入产物的方法学说明。 4. **数据出境**:向境外服务(含在线工具、境外云)传输个案数据前,核对 《数据安全法》《个人信息保护法》及机构数据管理要求与画像中的合规红线; 画像写明"不得出境"的一律拒绝并说明。 5. **最小够用**:只取分析所需的变量与时间范围,不囤数据。 ## 输出模板 获取完成后向用户输出数据源清单: ```markdown ## 数据源清单(<获取日期>) | 数据源 | 指标与口径 | 覆盖范围 | 文件 | 标注标签 | 许可/限制 | | --- | --- | --- | --- | --- | --- | | WHO GHO | 某病发病率(估计值) | 全球,2000–2021 | data/who-gho/xxx.csv | [WHO-GHO] | 需署名 WHO | | 国家卫健委 | 法定传染病报告发病数 | 全国,按月 | data/nhc/xxx.html | [国家卫健委] | 政府公开信息 | - provenance:已登记 .openscience/provenance.jsonl(<记录时间>) - 口径备注:<报告延迟/口径变更/估计值属性…> - 未获得:<指标>(原因:无权限/未发布),[待补证据:建议查 <途径>] - 隐私与伦理:本批为汇总数据,不涉及个案 / 个案数据已去标识化, 伦理批件 <编号>[用户提供] ``` ## 本技能不做什么 - **不做数据质量核验**:数据本身的准确性由发布方负责;本技能只保证来源 可溯、口径写明。发现明显异常时在产物中标注 `[待复核]`,不擅自"修正"。 - **不做批量抓取与镜像**:任何可能触发数据源风控的批量下载均属危险操作, 需用户明确确认(guardrail 第 8 条)。 - **不绕过访问控制**:需注册/申请/付费的数据,只引导用户走正规流程,不 代为伪造申请或共享账号。 - **不做分析**:本技能止于"数据可用且合规地躺在 `data/` 里";描述性分析 交给 outbreak-analysis,空间分析交给 spatial-epi。 - **不评估临床内容**:指标定义拿不准时标 `[模型知识—待核实]` 并建议查 原始文献或咨询领域专家,不编造定义。 ## 收尾与下一步 1. 汇总:取得几个数据源、覆盖哪些指标与年份、哪些需求未满足(含原因)。 2. 指向 `data/` 中的落盘文件与 provenance 记录。 3. 建议下一步: - 暴发/监测数据分析 → `outbreak-analysis`; - 分地区率比较与地图 → `spatial-epi`; - 需要人群分母做标化 → 提醒核对国家统计局口径年份后再进分析。
GitHub에서 보기