| name | author-methodology-analysis |
| description | 基于多篇作者、博主、公众号或品牌内容的正文,进行全面、可解释、可复核的数据分析,覆盖样本质量、发布节奏、选题结构、关键词概念、标题策略、篇章结构、论证方式、证据体系、案例实体、语言风格、情绪立场、读者收益、行动引导、视觉使用、时间演化和维度关联,并进一步提炼作者定位、内容资产、选题系统、分析框架、判断标准、表达模板、案例库、金句风格、内容机会和写作 SOP。默认生成本地 Markdown 报告、独立文案框架、HTML 看板并同步飞书;只有用户明确关闭时才跳过 HTML 或飞书。 |
作者内容方法论分析
输入契约
调用方应提供:
input_dir 或明确的文件列表/文档内容
output_dir
- 作者或账号名
- 可选的文章清单,最好包含标题、链接和发布时间
generate_html:默认 true
sync_lark:默认 true
输入不足时先寻找工作区内可发现的内容;仍无正文样本才询问用户。不得只看标题分析。
支持格式与处理边界:
- Markdown/TXT:使用内置解析器。
- DOCX:优先使用
python-docx;不可用时明确报错。
- 可提取文本的 PDF:优先使用
pypdf;扫描 PDF 无文本时标记需要 OCR,不伪造正文。
- 飞书文档:先按当前
lark-doc skill 读取,再把正文作为输入。
- 多种格式混合时统一转换为文章记录,但保留原始文件路径和来源类型。
输出契约
始终写入调用方提供的 output_dir:
<output_dir>/
<博主>-方法论报告.md
<博主>-文案框架.md
<博主>-分析数据.json
<博主>-文章特征.csv
<博主>-方法论看板.html # 默认生成的学习者视角看板
<博主>-飞书同步.json # 成功同步后生成
<博主>-竞品标题样本.json # 提供竞品样本时生成
所有根目录产物统一使用“<博主>-<功能>.<扩展名>”命名。<博主>-分析数据.json 和 <博主>-文章特征.csv 是可审计交付物,不是临时文件。报告、HTML 和飞书内容必须使用同一份分析数据。只有用户明确要求“不生成 HTML”或“不同步飞书”时才关闭对应步骤。
本 skill 自行根据 references/copywriting-framework-template.md 生成文案框架,不依赖名为 creator-copywriting-framework 的外部 skill。
工作流
1. 建立样本清单
-
运行确定性分析脚本:
python3 scripts/analyze_corpus.py \
--input "<input_dir>" \
--output "<output_dir>"
-
脚本负责格式解析、去重、图片引用保留、基础统计和文章级特征。
-
少于 5 篇时只做描述性分析并明确低稳定性;少于 3 篇时不得输出趋势、演化或稳定风格结论。
-
超过 50 篇时优先全量做基础统计;只有上下文或处理成本明显过高时才抽样,并披露抽样方法。
2. 预处理正文
- 删除导航、广告和版权尾注等噪声。
- 图片 Markdown 从纯文本分析副本中移除,但必须在文章记录中保留原始位置、相对路径和相邻文本,供视觉分析使用。
- 保留标题层级、列表、引用、案例、数据和结论段。
- 区分原文片段与模型归纳,保留证据到文章标题的映射。
3. 详细数据分析
先读取 <博主>-分析数据.json 和 <博主>-文章特征.csv,再按 references/data-analysis-framework.md 完成解释性分析。确定性指标不得由模型重新估算。默认覆盖:
- 样本质量与数据完整性
- 发布频率、周期、连续性和时间分布
- 篇幅、段落、句子、图片和结构复杂度
- 主题、母题、对象、场景、问题与内容类型分布
- 关键词、术语、概念组合和语义关联
- 标题长度、钩子、句式、对象、承诺和标题正文一致性
- 开头、正文、转折、结论、CTA 和常见叙事路径
- 观点、事实、因果、对比、反例、边界和建议等论证单元
- 数据、引用、实测、案例、权威来源和经验等证据类型
- 人物、公司、产品、技术、事件、行业、地点和模型等实体网络
- 强弱判断、确定性、时间尺度、风险态度和价值取向
- 词汇、句长、节奏、修辞、口语化、专业度和可读性
- 目标读者、使用场景、痛点、内容承诺和读者收益
- 评论、领取资料、购买等正文行动引导(仅作为写作结构观察)
- 图片密度、图文位置和视觉内容作用(数据可得时)
- 主题、表达和判断随时间的演化(发布时间可得时)
- 主题与标题、结构、证据、篇幅、CTA 等维度的交叉关系
- 异常样本、内容缺口、过度集中和可系列化机会
- 不分析平台后台的阅读、分享、点赞、收藏、关注或转化表现
- 标题方法拆解:整体统计数字具体、悬念问题、痛点冲突、热点时效、收益明确;代表标题解释公式、原因、仿写方法和适用条件
- 文章结构示范:用开头任务、中段任务、结尾任务解释节奏,并提供学习者可执行的练习
- 更新节奏怎么学:用发布日、星期分布、同日多篇和文章间隔观察作者的内容供给方式,再按学习者的时间、证据积累速度和创作阶段设计可持续节奏
- 竞品选题雷达:公开搜索同行标题并记录来源链接、选题类型和样本边界
数据和代表样本只用于解释作者的方法,不能把看板写成评分、自检、通过/不通过或改进作者的报告。平台后台表现指标不进入看板。其他不能计算的内容不得估算或编造。词频不能直接等同于作者态度;主题、金句、情绪和立场等主观标签必须说明分类规则与证据。
默认采用学习者视角输出,而不是只评价博主。每个核心模块都要说明:
- 这个博主具体怎么做;
- 为什么这种方法有效;
- 哪些能力值得学习;
- 学习者可以执行什么练习;
- 哪些依赖个人经历、资源或平台条件,不能直接照搬;
- 如何判断方法已经迁移成自己的能力,而不是只模仿表面风格。
主观标签需要写入 <博主>-分析数据.json 的 annotations,每条包含:
dimension,label,article_ids,evidence,rule,confidence
这样报告中的主题、立场、读者和金句结论可回溯到文章。
4. 提炼方法论
主报告使用 references/report-template.md。数据章节引用 <博主>-分析数据.json 中的指标和文章 ID,不重复制造第二套数字;方法论章节负责解释数据事实,至少包含:
报告“样本说明”必须写入 dataset_sha256,供一致性校验。
- 作者定位与内容人设
- 读者画像与内容收益
- 内容资产地图
- 选题系统
- 分析框架
- 判断标准
- 表达模板
- 案例库
- 金句风格
- 内容缺口与选题机会
- 可复用写作 SOP
- 风险与边界
- 样本清单
每个关键结论尽量引用 2-5 篇文章标题、短片段或案例。原文摘录保持必要且简短;抽象模板必须标注“抽象模板”,结构化示例必须标注“非作者原文”。
5. 生成独立文案框架
使用 references/copywriting-framework-template.md 生成 <博主>-文案框架.md。模板只规定结构,不预置任何作者风格句式;所有公式必须从样本证据归纳,包括:
- 选题脚手架
- 8-15 条标题公式
- 多类开头模板
- 至少 3 套正文结构
- 段落句式和转场句
- 金句句式生成器
- 结尾 CTA
- 1-2 个换主题、换案例、换措辞的结构化示例
- 发布前检查清单与禁用边界
只学习结构,不复刻作者独特表达,不冒充作者。
6. 自动生成 HTML
HTML 看板是本 skill 的标准交付物,不是可选的聊天附属内容。生成时必须读取
references/interactive-dashboard-template.md,并直接使用本 skill 内置的
scripts/generate_dashboard.py,不得临时改用另一套通用 BI 模板。
默认运行:
python3 scripts/generate_dashboard.py \
--data "<output_dir>/<博主>-分析数据.json" \
--output "<output_dir>/<博主>-方法论看板.html"
HTML 与 Markdown 必须共享 <博主>-分析数据.json 中的确定性统计。模型生成的方法论摘要可以作为附加数据写回 annotations,不得覆盖脚本计算字段。
看板必须保持以下固定结构:
- 一页看懂
- 定位与价值
- 内容地图
- 选题方法
- 文章写法
- 观点与证据
- 语言风格
- 值得学习
- 运营增长
- 学习与迁移
所有章节站在学习者视角,重点回答“我应该学习什么、我要怎么学”,不得改回作者自检、文章评分或平台表现分析。页面底部只保留简短的来源说明与免责声明,不设置独立的“数据与边界”章节。
生成后用浏览器检查控制台、主要交互和视觉可读性。
仅当用户明确要求不生成 HTML,即 generate_html=false 时跳过。
7. 自动同步飞书
先检查来源边界:
- 样本全部来自公开 URL 或公开文章归档:默认同步。
- 样本来自本地访谈、内部文档、私密飞书文档,或敏感扫描命中:暂停自动上传并请求用户确认。
确认可同步后加载 lark-doc:
- 先完成本地 Markdown。
- 若
<博主>-飞书同步.json 中已有可访问 doc_token,更新该文档;否则创建新文档。
- 按当前
lark-doc skill 的接口规范写入并读取校验。
- 将
doc_token、URL、标题、内容指纹和更新时间写入 <博主>-飞书同步.json。
- 校验关键章节存在后返回 URL。
飞书失败不得影响本地文件完成状态。
仅当用户明确要求不同步飞书,即 sync_lark=false 时跳过。
质量门槛
-
<博主>-分析数据.json 与 <博主>-文章特征.csv 必须由脚本生成。
-
结论基于正文并披露样本边界。
-
可观察统计与主观归纳明确区分。
-
数据分析尽量覆盖所有可计算维度,并明确不可得字段。
-
每项重要统计都说明口径、分母、分类规则或计算方式。
-
每个数据模块都连接到代表文章和方法论启发。
-
每个核心模块都有证据和可复用动作。
-
案例不足时明确写“未形成稳定案例库”。
-
不推断无法从样本支持的作者意图。
-
本地输出路径全部位于 output_dir。
-
HTML 和飞书默认完成;用户明确关闭时记录跳过原因。
-
HTML 导航必须为十个固定章节,底部必须包含来源说明和免责声明。
-
HTML 不得出现独立的“数据与边界”章节,不得出现“自检、评分、通过/不通过”等面向作者的评价模块。
-
最终运行:
python3 scripts/validate_outputs.py "<output_dir>"
参考资料
references/report-template.md:生成主报告时读取。
references/data-analysis-framework.md:执行详细数据分析时读取。
references/copywriting-framework-template.md:生成独立文案框架时读取。
references/interactive-dashboard-template.md:默认生成 HTML 时读取。
references/analysis-data.schema.json:共享分析数据结构。
scripts/analyze_corpus.py:解析语料并生成确定性特征数据。
scripts/generate_dashboard.py:从共享数据源生成离线 HTML。
scripts/validate_outputs.py:校验数据、报告、HTML 和同步元数据的一致性。