| name | workflow-collector |
| description | 自媒体与一人公司高质量工作流总控生产引擎。串联四大独立节点:1. 链接采集去重(Grok 6 组检索矩阵 + X 个人书签全量排重);2. 文章串行高保真下载(18 阶 DOM 滚动加载、评论区干货提取、100% 完整原标题);3. Baoyu 出版级精翻;4. 实战报告生成(4 维格式)与双索引自适应同步。 |
| version | 2.0.0 |
| metadata | {"openclaw":{"homepage":"https://github.com/yang0/workflow-collector","requires":{"anyBins":"[Truncated]"}}} |
Workflow Collector (工作流自动化总控生产 Skill)
专为自媒体增长与一人公司打造的工作流采集、清洗、精翻与报告生成总控流水线。
🏗️ 4 大核心工作节点
┌─────────────────────────────────────────────────────────────┐
│ 1. 链接采集与去重 (Grok 6 组矩阵 + X 书签 -> 过滤已有 84+ 篇) │
└──────────────────────────────┬──────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────────────────┐
│ 2. 文章串行高保真下载 (18 阶 DOM 滚动 + 评论区提取 + 无截断标题) │
└──────────────────────────────┬──────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────────────────┐
│ 3. Baoyu 出版级精翻 (无机翻腔、100% 代码/Prompt 与高清配图保留) │
└──────────────────────────────┬──────────────────────────────┘
│
▼
┌─────────────────────────────────────────────────────────────┐
│ 4. 实战报告生成 (4 维读者与流程) + 双索引自动同步 (INDEX/LATEST) │
└─────────────────────────────────────────────────────────────┘
⚡ 核心命令速查
| 功能用途 | CLI 命令 | 说明 |
|---|
| 全量串行运行 4 大节点 | node E:/projectHome/workflow-collector/scripts/collector.mjs --all | 自动完成采集 ➔ 下载 ➔ 精翻 ➔ 出报告全闭环 |
| 仅执行节点 1(采集与去重) | node E:/projectHome/workflow-collector/scripts/collector.mjs --stage 1 | 扫描 Grok 与 X 书签并暂存去重链接 |
| 仅执行节点 2(串行下载) | node E:/projectHome/workflow-collector/scripts/collector.mjs --stage 2 | 读取暂存链接逐篇高保真下载入库 |
| 仅执行节点 3(Baoyu 精翻) | node E:/projectHome/workflow-collector/scripts/collector.mjs --stage 3 | 自动扫描未审外文长文并转为出版级译文 |
| 仅执行节点 4(出报告与更新索引) | node E:/projectHome/workflow-collector/scripts/collector.mjs --stage 4 | 更新 INDEX.md、LATEST_100.md 与今日报告 |
| 仅采集个人书签 | node E:/projectHome/workflow-collector/scripts/collector.mjs --stage 1 --bookmarks-only | 仅读取并排重 X 个人书签分类 |
| 仅采集 Grok 检索矩阵 | node E:/projectHome/workflow-collector/scripts/collector.mjs --stage 1 --grok-only | 仅调度 Grok 6 组检索矩阵 |
| 测试模式(不写盘) | node E:/projectHome/workflow-collector/scripts/collector.mjs --dry-run | 仅打印采集诊断与排重数据 |
📋 阶段详细规范
1. 链接采集去重(Stage 1)
- 数据源:
- Grok 6 组检索矩阵(中/英/日 × 创作/变现);
- X 个人书签(
twitter bookmarks + twitter bookmarks folders 重点分类);
- 排重机制:
- 自动读取
workflows-doc/articles/(wf-01 ~ wf-84+)全部历史文档;
- 比对 URL、Article ID、Status ID,识别成对重复并输出
staged_candidates.json。
2. 串行下载(Stage 2)
- 浏览器自动化 (Chrome CDP 9221):
- 严格单线程串行模式,防止并发触发风控;
- 瞬时 evaluate 展开全部“显示原文”、“显示更多”、“显示此主题”;
- 18 阶渐进式滚动加载,触发全部虚拟 DOM;
- 提取作者在评论区的核心干货补充;
- 严禁标题截断:100% 保持完整未截断标题。
3. 出版级精翻(Stage 3)
- 遵循 Baoyu 精翻标准:逐段饱满厚度,消除机翻腔;
- 100% 保留所有代码块、Prompt、视频演示与高清配图;
- 统一更新文档状态与元数据。
4. 报告生成与索引维护(Stage 4)
- 自动更新分类全量索引
workflows-doc/INDEX.md 与最新 100 篇动态索引 workflows-doc/LATEST_100.md;
- 统一生成 4 维格式的《今日入库工作流实战报告》落盘至
today/workflow-daily-report.md:
🎯 目标读者
💡 解决痛点
📦 输出结果
🛠️ 核心实操流程(列表)。