aios-prompt-compare
内部 Prompt 测试工具。仅供开发者明确调用,用于 weak/basic/runtime 三栏评测、prompt 回归、Skill 沉淀价值判断和 AIOS 技能包验收。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
内部 Prompt 测试工具。仅供开发者明确调用,用于 weak/basic/runtime 三栏评测、prompt 回归、Skill 沉淀价值判断和 AIOS 技能包验收。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
SOC 직업 분류 기준
工程招投标通用入口。用于在未区分写作或审核时,按任务意图路由到 aios-tender-write 或 aios-tender-audit。
工程标书生成与改写工作流。用于基于招标文件、评分办法、企业历史素材、类似项目案例和用户初稿生成或优化技术标章节,并交回招投标审核 Skill 做响应性和风险门禁。
Deterministic architecture-health governance for repositories. Use when a project needs complexity, duplication, dependency, test, coverage, mutation, QA, performance, database, concurrency, or failure-injection evidence; evidence provenance and artifact digests; protected specification, test, quality-profile, or QA constraints; independent constraint-change approval; commit/weekly/milestone health runs; baseline ratchets and temporary debt budgets; JSON, Markdown, SARIF, or dependency-graph artifacts; or measured facts that must be handed to aios-arch for architectural interpretation. Also route legacy natural-language mentions of aios-architecture-health or archsight-architecture-health here.
架构评审工作流。用于评估系统架构、服务边界、技术取舍、数据/模型/Runtime 边界、平台演进、GraphRAG 架构、Agent 工作流治理和长期复杂度风险。
ArchSight AIOS 总路由入口。用户只说“请用 AIOS 技能包分析该文档”时,先识别资料类型,再路由到合同、招投标、日报、会议、变更签证、施工方案或其他对应 aios-* Skill。
ArchSight AIOS 总路由入口别名。用于“请用 ArchSight AIOS / AIOS 技能包分析该文档”的自然调用,规则等同于 aios。
| name | aios-prompt-compare |
| description | 内部 Prompt 测试工具。仅供开发者明确调用,用于 weak/basic/runtime 三栏评测、prompt 回归、Skill 沉淀价值判断和 AIOS 技能包验收。 |
以 Daedalus(AI 研发工程师)的方式组织 Prompt / Skill 效果对比,把同一输入下的弱提示词、便携强提示词和真实 Skill 触发结果拆成三栏评估,判断哪一类输出更稳定、更可复核、更值得沉淀为 Skill。
本 Skill 是内部评估和治理入口,不替代具体业务 Skill 执行,也不直接把评测结论当作生产可用性承诺。普通用户比较两份文档、两个版本或两个 AI 输出哪份更专业时,应使用 aios-compare,不要触发本 Skill。
aios-prompt-compare,并要做 Prompt / Skill 测试。weakPrompt、prompts/basic-prompt.md 和 $aios-* Skill 真实运行结果。prompts/evaluations/*fixtures.json、run pack、run results 和 scorecard。不适用:
aios-compare。优先收集:
prompts/evaluations/engineering-business-basic-fixtures.json。对比报告必须保留三类输出的原始正文,不能只写摘要。
最低要求:
Raw Output Map,列出 weak、portable、skill-runtime 三类输出是否已提供、来源文件或运行记录、是否经过脱敏。原始输出附录,分别放入 weak 原始输出、portable 原始输出、skill-runtime 原始输出。未提供原始输出,并在结论中说明本次对比证据不足。[客户A]、[项目A]、[地点A]、[金额A]、[日期A]、[源文件A],再放入附录。摘要、scorecard 和沉淀判断只能基于这些原始输出得出;不能凭记忆、推测或二次转述补写原始输出。
默认使用三类输出,不要混在一个结论里:
weak:弱提示词结果。通常来自 fixture 中的 weakPrompt,用于暴露随口问的失败模式。portable:便携强提示词结果。通常来自 skills/*/prompts/basic-prompt.md,用于验证无 Skill runtime 时的最低可用版本。skill-runtime:真实 Skill 结果。必须来自宿主工具按 $aios-* 或自动 Skill 触发机制执行后的输出,而不是简单把 SKILL.md 当普通 prompt 粘贴。如果当前只有 weak/basic 两类结果,明确标注 skill-runtime: 未提供,不要假装完成了 Skill 运行对比。
已有工程业务管理评测链路:
npm run validate:prompts
npm run validate:prompt-run-pack
npm run build:prompt-run-pack
npm run validate:public-advisory-run-pack
npm run build:public-advisory-run-pack
npm run validate:prompt-run-results
npm run analyze:prompt-run-results -- --file prompts/evaluations/<results>.json --out prompts/evaluations/<report>.md
这些脚本默认组织 weak / portable 对照。真实 skill-runtime 输出需要由宿主 Agent 实际触发对应 $aios-* Skill 后归档,再进入本 Skill 的三栏人工或半自动分析。
默认输出:
三栏摘要格式:
caseId:
输入:
weak:
portable:
skill-runtime:
关键差异:
Raw Output Map 格式:
caseId:
weak 原始输出:已提供 / 未提供
portable 原始输出:已提供 / 未提供
skill-runtime 原始输出:已提供 / 未提供
脱敏状态:
证据缺口:
Scorecard 条目格式:
维度:
weak:
portable:
skill-runtime:
证据:
判定:
沉淀判断格式:
是否应升级为 Skill:
原因:
需要进入 SKILL.md 的规则:
仍保留为 portable prompt 的内容:
需要补的 fixture / scorecard:
原始输出附录格式:
## 原始输出附录
### weak 原始输出
```text
粘贴 weak 模型原始输出;如缺失,写“未提供原始输出”。
```
### portable 原始输出
```text
粘贴 portable 模型原始输出;如缺失,写“未提供原始输出”。
```
### skill-runtime 原始输出
```text
粘贴真实 Skill 触发后的原始输出;如缺失,写“未提供原始输出”。
```
SKILL.md 文本粘贴运行的结果称为真实 Skill 结果。[源文件A] 或公开 fixture 相对路径替代。