Skip to main content

section-ml-ai

为本仓库新建、重写或审校机器学习与人工智能方法教程,包括分类、回归、聚类、特征工程、重采样、调参、校准、解释与部署前验证。适用于机器学习栏目及相关 Rmd/Qmd;先用 `tutorial-authoring`,涉及 R 代码时使用 `r-biostats`,统计图使用 `publication-figures`。不用于当前 AI 产品的操作指南,后者使用 `section-ai-tools`。

الانتقال إلى التثبيت

معلومات المصدر

المستودع
KangWang42/R_note_for_Epidemiology
آخر نشاط في المصدر
٣١ يوليو ٢٠٢٦ في ٠٥:٣١
لغة SKILL.md المكتشفة
الصينية
النجوم
١٧
التفرعات
٤

خيارات التثبيت

يُحدَّد Prompt الذي يراجع المصدر أولًا بشكل افتراضي. يمكنك التبديل إلى أمر مباشر أو تنزيل نسخة محلية.

مراجعة ملفات المصدر

اقرأ SKILL.md وأي ملفات مرافقة يعرضها SkillsMP قبل أن تقرر التثبيت.

مستكشف الملفات
4 ملفات

عرض SKILL.md

SKILL.md
تعليمات المصدر · معاينة للقراءة فقط
name
section-ml-ai
description
为本仓库新建、重写或审校机器学习与人工智能方法教程,包括分类、回归、聚类、特征工程、重采样、调参、校准、解释与部署前验证。适用于机器学习栏目及相关 Rmd/Qmd;先用 `tutorial-authoring`,涉及 R 代码时使用 `r-biostats`,统计图使用 `publication-figures`。不用于当前 AI 产品的操作指南,后者使用 `section-ai-tools`。
# 机器学习与人工智能教程 ## 开工 1. 先执行 `tutorial-authoring` 并读取 [content-structure.md](references/content-structure.md)。 2. 锁定任务类型、目标人群、预测时点、结局、观测单位、数据切分单位和主要评价指标。 3. 明确文章演示的是开发、内部验证、外部验证还是部署;不要把一次训练/测试切分写成普遍性能。 4. 核对框架、学习器和参数的当前官方文档。包接口、默认值、硬件支持和模型/API 功能不得凭记忆断言。 5. 按 [共同辨析合同](../tutorial-authoring/references/comparison-and-visuals.md) 检查预测与因果、训练与评价、内部与外部验证或候选模型族是否会在当前任务中混淆。只有可能造成数据泄漏或错误性能解释时,才在首次训练前完成定位。 ## 内容主线 文章围绕一个预测或学习问题展开,不强制固定行数、三个难度层级、多个指标、调参或 SHAP。完整教程通常覆盖:目标与数据、基线方案、无泄漏预处理、重采样、模型训练、预设指标、校准与误差分析、最终测试或外部验证,以及适用边界。 - 先给朴素、可解释的基线,再说明复杂模型增加了什么能力和成本。 - 特征选择、缺失处理、标准化和调参必须在每个重采样训练折内完成。 - 测试集只用于锁定流程后的最终评价,不反复查看后修改模型。 - 分类阈值与临床或业务代价相连;不默认以 0.5、准确率或 AUC 作为唯一标准。 - 聚类、降维和生成模型使用与任务相符的稳定性、重构、人工审查或外部效度标准,不套监督学习指标。 - 方法比较不只列算法名称,还要说明数据切分、目标函数、输出解释、验证层级、诊断和改用条件。 需要设计搜索空间时读取 [hyperparameter-guides.md](references/hyperparameter-guides.md)。 ## 代码与结果 - 使用项目既有框架;没有既有合同时按文章目的选择 tidymodels、mlr3 或底层包,不为“现代”而无依据替换。 - 所有随机数据划分、重采样和随机算法记录种子;需要分层、分组或时间顺序时在代码中显式实现。 - 输出至少包含目标指标及其不确定性或重采样分布,并根据任务检查校准、类别/亚组误差和失败案例。 - 比较模型时复用相同数据划分、预处理范围和指标。没有公平基准时不写“更优”“更快”。 - 示例性能只属于示例数据,不写成真实研究或部署效果。 ## 图件 读取 [visual-templates.md](references/visual-templates.md)。ROC、PR、校准、残差、学习曲线和重采样分布必须来自真实预测对象。算法或数据流示意图只有在能澄清训练与验证边界时才使用 `research-visuals`。 ## 验证与导航 1. 从空会话实跑数据准备、重采样、训练、评价和预测代码,检查泄漏与训练/测试样本变化。 2. 运行教程审计并扫描 warning、收敛、缺失预测和失败折。 3. 更新 `_quarto.yml` 后从 `doc/` 运行 `Rscript generate_sections.R`。 4. 只渲染目标文章、`sections/machine-learning.qmd` 和 `index.qmd`,检查最终 HTML 和图件。
عرض على GitHub