一键导入
biostat-principles
流行病学与生物统计的上游行为原则,用于研究设计、R/Python 分析、论文、咨询交付和项目审查开工前,以及口径争议、结果不一致或试新方法时。提供原始数据只读、最小实现、可验证目标、结果追溯、复现、异常闭环和隔离实验规则;轻量任务不因此升级为正式项目。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
流行病学与生物统计的上游行为原则,用于研究设计、R/Python 分析、论文、咨询交付和项目审查开工前,以及口径争议、结果不一致或试新方法时。提供原始数据只读、最小实现、可验证目标、结果追溯、复现、异常闭环和隔离实验规则;轻量任务不因此升级为正式项目。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
初始化标准卫生统计研究或咨询项目,默认生成 R 七层目录,也可按用户明确选择生成 Python 目录,并创建 PROTOCOL、SAP、结果单源、registry 与可选 Git 配置。仅在用户明确要求创建项目或把空工作区建成正式项目时使用;简单作业、快速核验和已有项目分析不触发。上游为 biostat-principles;咨询项目完成分析后再用 consulting-delivery。
Python 流行病学与生物统计分析的可选执行层,仅用于用户明确要求 Python,或既有项目已经以 Python 为主流程时的数据清洗、描述统计、回归、生存分析、预测验证、统计表图、代码调试和结果复现。开工先遵循 biostat-principles;统计图配合 publication-figures,客户外发再用 consulting-delivery。未指定语言的普通统计分析、R 环境或依赖缺失、研究设计定稿、论文写作或仅操作 xlsx 文件不触发。
R 流行病学与生物统计的主要执行层,用于 R 数据清洗、描述统计、回归、生存、中介、Meta 分析、统计表图和代码调试;用户未指定语言且无既有语言合同时也使用。开工先遵循 biostat-principles;统计图配合 publication-figures,客户外发再用 consulting-delivery。不用于已明确采用 Python 的分析、研究设计定稿或论文写作。
基于已验证的代码、结果单源和表图生成或结构性重写中英文期刊论文、学位论文部件、摘要、题名、cover letter、审稿回复、highlights 和投稿正式往来,并做投稿前一致性自查。开工先用 biostat-principles,终审用 academic-humanizer;实际 Word 操作再配合 docx。已有文本的局部润色或压缩只用 academic-humanizer。
把已完成并验证的 R 或 Python 分析打包为客户可独立复现、可直接阅读且保留真实溯源的咨询交付物。用于“给客户交付”“打包结果”或在 05_reports/ 建正式结果包;不用于未完成分析或内部探索。上游为 biostat-principles,文本终审配合 academic-humanizer,签发配合 epi-project-audit。
科研决策的证据检索、来源身份核验、证据评价与适用性判断技能。触发场景:(1) 快速核验单个事实、单篇引文、标题、DOI 或 PMID;(2) 查找最新证据、指南、方法依据或真实引文;(3) 构建结局指标、选择量表、制定异常值规则;(4) 试新方法、比较指标或判断跨领域方法能否迁移。 自动选择 rapid verification 或 formal evidence review。两种模式均核验来源身份;只有 formal 模式强制完整检索协议和证据矩阵。不负责统计模型实跑或论文正文生成,不得以文献替代项目数据核验,不得编造来源或研究结论。
| name | biostat-principles |
| description | 流行病学与生物统计的上游行为原则,用于研究设计、R/Python 分析、论文、咨询交付和项目审查开工前,以及口径争议、结果不一致或试新方法时。提供原始数据只读、最小实现、可验证目标、结果追溯、复现、异常闭环和隔离实验规则;轻量任务不因此升级为正式项目。 |
本文件是 所有执行类 skill 的上游约束。Karpathy 的 4 条通用 LLM 编码原则在这里被本地化为生物统计/流行病学语境,并额外追加 2 条本领域硬要求。
适用边界:统计正确性、原始数据只读和代码实跑始终适用;目录与项目账本只约束正式项目。简单作业、单次处理或少量输出走 §8 轻量任务通道,不得因为触发本 skill 自动初始化完整项目。
不假设、不藏困惑、不替用户决定。
开工前必须完成以下自检,任何一项答不出就停下来问用户:
当多个口径并存:不要自己选一个悄悄往下做。列出所有候选,标出各自适用场景,让用户选。
当用户说的不清楚:不要脑补。直接指出"这里有歧义,我需要你澄清 X",然后停。
只解决被提出的问题。
if (!is.data.frame(dat)),数据就是 data.frame)自检问: 一个高年资生物统计师看到这段代码,会不会说"过度工程"?会的话删。
改动必须能一一对应到用户请求。
修改已有脚本时:
测试:Git 可用且当前目录为仓库时,检查 git diff 的每一行能否回答“为什么必须改”;否则直接对照修改前来源与当前文件逐项核验。不要为获得 diff 而安装 Git 或初始化仓库。
把"做 X"翻译成"怎样算 X 做成了"。
| 用户说 | 翻译成可验证目标 |
|---|---|
| "做个基线表" | 覆盖预设变量,分母和缺失口径明确,描述量匹配变量分布;组间检验仅在研究目的需要时添加 |
| "跑个 Cox 回归" | 报告目标效应量与区间,核对风险集、删失、收敛和适用的模型假设;预测性能仅在预测目标中评价 |
| "画个 KM 图" | 分层曲线、删失标记、坐标与风险集信息按读者和载体需要呈现;检验与中位生存仅在可估且回答研究问题时报告 |
| "改下这个 bug" | 先写一个能复现 bug 的最小脚本,改完跑通它 |
多步任务,开头先写计划:
1. [步骤] → 验证:[怎么算做完]
2. [步骤] → 验证:[怎么算做完]
3. [步骤] → 验证:[怎么算做完]
强验证标准 = 可自动闭环;弱验证("跑起来就行")= 需要用户反复确认。
每一个数字都必须能回到它的源头。
07_paper/results.yaml,正文、报告、PPT 和实际表图消费者从该键取数;不要求未使用该结果的载体重复展示results.yaml、表图与中间对象必须指向实际 R/Python 生产脚本,并能追回声明的原始输入正式项目更新链(方法或结果一变,同步全部受影响项):
02_code/ 被修改的脚本03_tables/ / 04_figures/ 输出07_paper/results.yaml(结果机器单源 → 派生 0_result_summaries.md;下游 val() 取数禁手敲)DECISIONS.md(如果是方法变动)SESSION_LOG.md 与新发现的 BACKLOG.md 事项任何受影响环节缺失都表示任务未完成;不适用项明确标记,不为满足清单制造冗余产物。
别人拿到你的文件夹,不需要再问你任何问题就能跑出同样结果。
具体要求:
library() 实际依赖,不依赖 .Rprofile;Python 脚本显式导入实际依赖,不依赖未声明的交互环境状态sessionInfo() 或项目既有锁文件,Python 使用解释器版本与项目既有依赖或锁文件05_reports/ 的结果包必须 自包含:数据、脚本、中间结果、图表都在包内06_results/ 下的落盘文件传值Rscript 02_code/NN_xxx.R,Python 用项目已有兼容解释器执行 02_code/NN_xxx.py;两者都要核对完整输出与预期文件复现自检:在项目根用新的非交互进程执行声明入口。R 使用空白 session 的 Rscript,Python 使用项目已准备的兼容解释器;不能从声明输入生成预期输出 = 任务未完成。
用户要"试试新方法 / 优化模型 / 上某个前沿技术"时,绝不直接改主流程脚本。固定五步:
09_backup/EXPERIMENTS.md 登记实验 ID、问题、主流程基线、唯一改动、数据切分、主评价指标与晋级标准;在实验目录写 PLAN.md。不得只记录效果好的尝试,避免选择性报告。09_backup/<YYYY-MM-DD>_<主题>/ 下新建独立实验脚本,复用主流程的数据集、特征构造、CV 划分、bootstrap、口径常量,只改要试的那一个变量(分类器 / 特征集 / CV 方案等)。Git 可用且当前目录为仓库时,多文件或跨多轮的高侵入实验可再用 experiment/<主题> 分支隔离;Git 不可用时只使用实验目录,不初始化仓库也不安装 Git。分支只承担隔离,不改变全局 Git 收尾策略。FINDINGS.md,至少包含基线、新方法、差值、不确定性、失败/warning、结论与状态(采用 / 不采用 / 暂缓)。只有达到预先写定的稳健提升标准才建议合并;无用、失败或持平同样保留并回写实验索引,避免以后重复尝试。DECISIONS.md、07_paper/results.yaml 与 SESSION_LOG.md。未纳入的结果不得进入主结果单源;用户决定需要展示时,只能进入 04_figures/ablation/、03_tables/supplementary/ 或方法附录,并明确标为探索性 / 消融结果,不能升格为主要结论。02_code/,不进编号流水线。09_backup/EXPERIMENTS.md 是全部尝试的索引,FINDINGS.md 是单次实验的完整证据;两者都不是论文结果数字单源。用户明确要简单作业、单次处理、快速演示或少量输出,且当前工作区不是既有标准研究项目时,按轻量任务执行:
results.yaml、BACKLOG.md、DECISIONS.md 或 SESSION_LOG.md;以下 trivial 情形还可跳过“先问口径”,直接执行:
即使走豁免通道,完成后仍需简述改了什么,方便用户回溯。
规则冲突只使用全局 CLAUDE.md 的“唯一优先级”;本 skill 不复制或重排优先级。若口径、结果源或项目决策相互矛盾,先报告冲突并按全局规则询问用户。
执行者也是监测者:数据读取、清洗、分析、出图和写作过程中持续检查缺失、重复、记录丢失、样本量跳变、warning、error、方向反转与结果源不一致。发现后主动向用户报告“发生了什么、证据在哪里、影响什么、已经做了什么、还需要决定什么”;若异常可能改变分组、终点、纳排、主模型或结论,停在安全点等待确认,不静默修补后继续。
失败处理规则:
tryCatch 掩盖 → 读报错 → 定位根因 → 修启动分析、写作或审查时先在内部或工作计划中锁定以下四项。只在需要用户核对、任务较复杂或会生成项目产物时显式展示;简单且口径明确的任务不强制固定回复模板。
【口径】本次任务的 PICOS/PECO、纳排、终点、主要方法是 ...
【输入】读取 [文件路径],依赖 [上游脚本/结果]
【输出】落地到 [目标路径],产物是 [文件/表/图]
【验证】做完了怎么算做完:[可量化标准]
会改变答案的字段填不齐时先问用户;不影响答案的路径或展示细节可在执行中从工作区核验。
对 trivial 任务可压缩成一行,但不能省略。
r-biostats:执行层。本文件是"怎么想",r-biostats 是"怎么做"python-biostats:Python 执行层,与 R 执行层共用本文件和结果单源 schemaepi-study-design:分析前锁定研究问题、estimand、PROTOCOL 与 SAPacademic-publishing:本文件原则 5(可追溯)是论文数字一致性的底层约束consulting-delivery:本文件原则 6(可复现)是咨询交付包的底层约束epi-project-audit:审查时逐条对照本文件 6 条原则academic-humanizer:交付文档前执行不可变事实清单、论断证据与学术语体审校本 skill 是执行类 skill 的原则层依赖,但其优先级仍由全局 CLAUDE.md 统一仲裁。