doc-translator
将 PDF 格式或 Web Page 格式的源文档转换成保持原排版格式的 Markdown 格式精译中文文档。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
将 PDF 格式或 Web Page 格式的源文档转换成保持原排版格式的 Markdown 格式精译中文文档。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
用 negentropy-perceives 的 parse_pdf_to_markdown 经 Knowledge Base Documents Ingest 将 PDF 一比一还原为可渲染 Markdown(文字、段落顺序、高清原图、图片显示尺寸、目录、表格、数学公式、代码块、注释),大文件分批,逐页浏览器对比、发现一处修一处,直至完全一致。Use when ingesting/restoring a PDF into a Knowledge corpus with high fidelity.
将 Knowledge / Documents 文档的英文 Markdown 正文按段落分块高保真翻译为中文:代码块、行内代码、URL、图片路径、LaTeX 公式、HTML 标签、front-matter 键名逐字节保留不翻,Markdown 结构与原文一一对应,逐块翻译禁止合并/拆分/遗漏。Use when translating chunked Markdown documents (source/chunk_NNNN.md → translated/chunk_NNNN.md) in a translation workdir.
Manage large document processing by splitting into batches and coordinating the full translation workflow (extraction, translation, formatting). Use when handling documents larger than 30 pages, 60 paragraphs, or 6000 words.
对文档进行系统性 Review,包括但不限于:审计与熵减优化,确保架构正交、逻辑自洽、内容完整且直观。
仔细阅读并理解目标文档全文,输出一个对目标文档的理解摘要和读后感悟,将之保存到愫读文档中。
Format and optimize Markdown content, with special support for post-translation processing. Use when fixing Markdown syntax, adjusting layout, ensuring formatting consistency, or optimizing translated documents.
| name | doc-translator |
| description | 将 PDF 格式或 Web Page 格式的源文档转换成保持原排版格式的 Markdown 格式精译中文文档。 |
| allowed-tools | Skill, filesystem, data-extractor, zai-mcp-server, web-reader, web-search-prime, time |
按照下文 Workflow,协调各个子技能完成文档的完整翻译流程,包括内容提取、中文翻译、格式化和最终文档生成。
输入: 源文档路径或 URL
分析:
- 文档类型(PDF/Web)
- 文档大小(页数/字数)
- 处理复杂度评估
- 选择处理策略
创建目录结构:
/path/to/source/
├── translate/ # 翻译输出目录
│ ├── {doc_name}.md # 最终翻译文档
│ └── images/ # 图片资源
│ └── {doc_name}/ # 文档相关图片
└── temp/ # 临时文件目录
├── batch_*.md # 批次处理文件
└── progress.json # 进度跟踪文件
批次大小限制:
批次划分:
doc-translator (协调器)
├── 1. pdf-reader 或 web-translator (内容提取)
│ └── 输出: 原始 Markdown 内容
├── 2. zh-translator (中文翻译)
│ └── 输出: 中文 Markdown 内容
├── 3. markdown-formatter (格式优化)
│ └── 输出: 格式化的中文 Markdown
├── 4. 质量检查和修复
└── 5. 生成最终文档
doc-translator (协调器)
├── batch-processor (批次管理)
│ ├── 1. 创建批次计划
│ └── 2. 循环处理每个批次:
│ ├── pdf-reader/web-translator (提取)
│ ├── zh-translator (翻译)
│ ├── markdown-formatter (格式化)
│ ├── 质量检查
│ └── 追加到目标文档
├── 3. 合并所有批次结果
├── 4. 整体格式优化
└── 5. 生成最终文档和报告
FOR EACH batch:
1. 检查是否所有批次处理完成
2. 创建批次 Markdown 文档
3. 内容提取:
- PDF: pdf-reader
- Web: web-translator
4. 内容翻译:
- zh-translator
5. 格式化:
- markdown-formatter
6. 质量检查:
- 图片引用验证
- 格式一致性检查
- 翻译准确性检查
7. 追加到目标文档
8. 清理批次临时文件
END FOR
result = await Skill("pdf-reader", {
"file_path": "/path/to/document.pdf",
"page_range": [start, end], # 批次处理时使用
"options": {
"extract_images": True,
"extract_tables": True,
"extract_formulas": True,
"include_metadata": True
}
})
result = await Skill("web-translator", {
"url": "https://example.com/article",
"options": {
"extract_main_content": True,
"include_metadata": True,
"preserve_formatting": True
}
})
result = await Skill("zh-translator", {
"content": markdown_content,
"options": {
"preserve_code": True,
"preserve_formulas": True,
"terminology": terminology_dict
}
})
result = await Skill("markdown-formatter", {
"content": translated_content,
"options": {
"check_links": True,
"optimize_images": True,
"fix_tables": True
}
})
result = await Skill("batch-processor", {
"document": {
"type": "pdf", # or "web"
"path": "/path/to/document.pdf"
},
"batch_size": {
"max_pages": 30,
"max_paragraphs": 60,
"max_words": 6000
}
})
翻译这个 PDF 文档:/path/to/document.pdf
翻译这个网页:https://example.com/article
翻译这些文档:
- /path/to/doc1.pdf
- /path/to/doc2.pdf
- https://example.com/article1
翻译这个文档到指定目录:/path/to/document.pdf --output /custom/path/
继续翻译上次未完成的文档:/path/to/document.pdf --resume
{source_path}/translate/{doc_name}.md{source_path}/translate/{doc_name}_report.md{source_path}/images/{doc_name}/