一键导入
refine-regression
整体跑一遍真实测试用例(refine_real,真 LLM),并对比前后产物——content_list.json、refine_report.json、full.md——输出回归报告。当用户想"整体跑一下测试用例并对比前后数据"、验证清洗效果有没有回归时使用。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
整体跑一遍真实测试用例(refine_real,真 LLM),并对比前后产物——content_list.json、refine_report.json、full.md——输出回归报告。当用户想"整体跑一下测试用例并对比前后数据"、验证清洗效果有没有回归时使用。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
发布新版本:根据上一个 tag 以来的提交自动推导下一个版本号(feat→minor,否则 patch),bump 三端版本、体检、commit、打 tag 推到 GitHub,由 CI 自动发布 crates.io/PyPI/npm。当用户说"发布一个版本"、"发版"、"release"时使用。不监听 CI 结果。
PDF/DOC/PPT/图片 进、干净 Markdown 出——比原生 MinerU 产物更可用。先用 MinerU 官方 API 解析成 content_list,再用 mineru-refine 后处理清洗(伪标题、跨页断句、跨页拆表、乱码表、OCR 形近字、页面家具…),全程机器校验保真、fail-open 不搞崩。当用户说"清洗这个 PDF"、"把这份文档转成干净 markdown"、"解析并清洗"、"用 mineru-prime/mineru-refine 处理"时使用。需要三个 key:MINERU_API_TOKEN / DEEPSEEK_APIKEY / QWEN_APIKEY。
整体跑一遍真实测试用例(refine_real,真 LLM),并对比前后产物——content_list.json、refine_report.json、full.md——输出回归报告。当用户想"整体跑一下测试用例并对比前后数据"、验证清洗效果有没有回归时使用。
| name | refine-regression |
| description | 整体跑一遍真实测试用例(refine_real,真 LLM),并对比前后产物——content_list.json、refine_report.json、full.md——输出回归报告。当用户想"整体跑一下测试用例并对比前后数据"、验证清洗效果有没有回归时使用。 |
| model | opus |
把 test_data/mineru/<stem>(MinerU 原始产物)整体过一遍 refine(真 LLM),输出到
test_data/refined/<stem>,并做两层对比:
test_data/ 不进 git,"上次"只能靠文件系统快照(test_data/refined_prev/)。
.env 里要有 QWEN_APIKEY(refine_real 通过 dotenvy 加载;split_table / 视觉层都要用)。
缺了就停下来告诉用户,不要空跑。test_data/mineru/ 必须非空;为空提示先跑 just mineru-fetch。先跑 just test(全程 mock,不打网络)。红了就停:先修单测,别烧真 LLM 的钱。
rm -rf test_data/refined_prev
[ -d test_data/refined ] && cp -R test_data/refined test_data/refined_prev
没有 test_data/refined/(首跑)就跳过,后面只做"输入 vs 输出"对比。
just refine-real 2>&1 | tee /tmp/refine_real.log
run_in_background 跑,期间 tail 日志看进度。just refine-real <stem>(refine_real 只会重写该文档的输出目录,
其余文档保留上次结果,对比时也只看这个 stem)。REFINE_MAX_ITERATIONS=N、
REFINE_FIX_CONFUSION=1(OCR 混淆层)、REFINE_REWRITE_GARBLED=1(乱码表重转写层)。python3 .Codex/skills/refine-regression/summarize.py [stem]
逐文档打印:items 数量(输入/本次/上次)、refine_report 关键指标及上次对照 (iterations / opCounts / dismissed / violations / failOpen / removedSpans / tokens)、 full.md 与 content_list.json 的 diff 量级。
只对量级非零的"上次→本次"差异深入看 diff,full.md 很大,别整篇倒进上下文:
git diff --no-index test_data/refined_prev/<stem>/full.md test_data/refined/<stem>/full.md
逐 hunk 判断是改进(修掉了之前没修的)还是回归(之前修好的又坏了)。
content_list.json 的 diff 同理,必要时配合 refine_report.json 里的 removedSpans /
confusionFixes / tableRewrites 解释每处变化的来源。
注意:MinerU 原版 full.md 与其 content_list 本就有少量出入;refined 的 full.md 是从清洗后 items 确定性重渲染的,对比"输入→输出"时以 content_list 为准,full.md 的格式性差异 (如渲染风格)不算回归。
输出一份 markdown 总结,按文档分节:
最后给结论:本次代码状态相比上次快照是否安全。