整体跑一遍真实测试用例(refine_real,真 LLM),并对比前后产物——content_list.json、refine_report.json、full.md——输出回归报告。当用户想"整体跑一下测试用例并对比前后数据"、验证清洗效果有没有回归时使用。
发布新版本:根据上一个 tag 以来的提交自动推导下一个版本号(feat→minor,否则 patch),bump 三端版本、体检、commit、打 tag 推到 GitHub,由 CI 自动发布 crates.io/PyPI/npm。当用户说"发布一个版本"、"发版"、"release"时使用。不监听 CI 结果。
PDF/DOC/PPT/图片 进、干净 Markdown 出——比原生 MinerU 产物更可用。先用 MinerU 官方 API 解析成 content_list,再用 mineru-refine 后处理清洗(伪标题、跨页断句、跨页拆表、乱码表、OCR 形近字、页面家具…),全程机器校验保真、fail-open 不搞崩。当用户说"清洗这个 PDF"、"把这份文档转成干净 markdown"、"解析并清洗"、"用 mineru-prime/mineru-refine 处理"时使用。需要三个 key:MINERU_API_TOKEN / DEEPSEEK_APIKEY / QWEN_APIKEY。
整体跑一遍真实测试用例(refine_real,真 LLM),并对比前后产物——content_list.json、refine_report.json、full.md——输出回归报告。当用户想"整体跑一下测试用例并对比前后数据"、验证清洗效果有没有回归时使用。