aios-prompt-compare
内部 Prompt 测试工具。仅供开发者明确调用,用于 weak/basic/runtime 三栏评测、prompt 回归、Skill 沉淀价值判断和 AIOS 技能包验收。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
内部 Prompt 测试工具。仅供开发者明确调用,用于 weak/basic/runtime 三栏评测、prompt 回归、Skill 沉淀价值判断和 AIOS 技能包验收。
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
工程招投标通用入口。用于在未区分写作或审核时,按任务意图路由到 aios-tender-write 或 aios-tender-audit。
工程标书生成与改写工作流。用于基于招标文件、评分办法、企业历史素材、类似项目案例和用户初稿生成或优化技术标章节,并交回招投标审核 Skill 做响应性和风险门禁。
Deterministic architecture-health governance for repositories. Use when a project needs complexity, duplication, dependency, test, coverage, mutation, QA, performance, database, concurrency, or failure-injection evidence; evidence provenance and artifact digests; protected specification, test, quality-profile, or QA constraints; independent constraint-change approval; commit/weekly/milestone health runs; baseline ratchets and temporary debt budgets; JSON, Markdown, SARIF, or dependency-graph artifacts; or measured facts that must be handed to aios-arch for architectural interpretation. Also route legacy natural-language mentions of aios-architecture-health or archsight-architecture-health here.
架构评审工作流。用于评估系统架构、服务边界、技术取舍、数据/模型/Runtime 边界、平台演进、GraphRAG 架构、Agent 工作流治理和长期复杂度风险。
ArchSight AIOS 总路由入口。用户只说“请用 AIOS 技能包分析该文档”时,先识别资料类型,再路由到合同、招投标、日报、会议、变更签证、施工方案或其他对应 aios-* Skill。
ArchSight AIOS 总路由入口别名。用于“请用 ArchSight AIOS / AIOS 技能包分析该文档”的自然调用,规则等同于 aios。
استنادا إلى تصنيف SOC المهني
| name | aios-prompt-compare |
| description | 内部 Prompt 测试工具。仅供开发者明确调用,用于 weak/basic/runtime 三栏评测、prompt 回归、Skill 沉淀价值判断和 AIOS 技能包验收。 |
以 Daedalus(AI 研发工程师)的方式组织 Prompt / Skill 效果对比,把同一输入下的弱提示词、便携强提示词和真实 Skill 触发结果拆成三栏评估,判断哪一类输出更稳定、更可复核、更值得沉淀为 Skill。
本 Skill 是内部评估和治理入口,不替代具体业务 Skill 执行,也不直接把评测结论当作生产可用性承诺。普通用户比较两份文档、两个版本或两个 AI 输出哪份更专业时,应使用 aios-compare,不要触发本 Skill。
aios-prompt-compare,并要做 Prompt / Skill 测试。weakPrompt、prompts/basic-prompt.md 和 $aios-* Skill 真实运行结果。prompts/evaluations/*fixtures.json、run pack、run results 和 scorecard。不适用:
aios-compare。优先收集:
prompts/evaluations/engineering-business-basic-fixtures.json。对比报告必须保留三类输出的原始正文,不能只写摘要。
最低要求:
Raw Output Map,列出 weak、portable、skill-runtime 三类输出是否已提供、来源文件或运行记录、是否经过脱敏。原始输出附录,分别放入 weak 原始输出、portable 原始输出、skill-runtime 原始输出。未提供原始输出,并在结论中说明本次对比证据不足。[客户A]、[项目A]、[地点A]、[金额A]、[日期A]、[源文件A],再放入附录。摘要、scorecard 和沉淀判断只能基于这些原始输出得出;不能凭记忆、推测或二次转述补写原始输出。
默认使用三类输出,不要混在一个结论里:
weak:弱提示词结果。通常来自 fixture 中的 weakPrompt,用于暴露随口问的失败模式。portable:便携强提示词结果。通常来自 skills/*/prompts/basic-prompt.md,用于验证无 Skill runtime 时的最低可用版本。skill-runtime:真实 Skill 结果。必须来自宿主工具按 $aios-* 或自动 Skill 触发机制执行后的输出,而不是简单把 SKILL.md 当普通 prompt 粘贴。如果当前只有 weak/basic 两类结果,明确标注 skill-runtime: 未提供,不要假装完成了 Skill 运行对比。
已有工程业务管理评测链路:
npm run validate:prompts
npm run validate:prompt-run-pack
npm run build:prompt-run-pack
npm run validate:public-advisory-run-pack
npm run build:public-advisory-run-pack
npm run validate:prompt-run-results
npm run analyze:prompt-run-results -- --file prompts/evaluations/<results>.json --out prompts/evaluations/<report>.md
这些脚本默认组织 weak / portable 对照。真实 skill-runtime 输出需要由宿主 Agent 实际触发对应 $aios-* Skill 后归档,再进入本 Skill 的三栏人工或半自动分析。
默认输出:
三栏摘要格式:
caseId:
输入:
weak:
portable:
skill-runtime:
关键差异:
Raw Output Map 格式:
caseId:
weak 原始输出:已提供 / 未提供
portable 原始输出:已提供 / 未提供
skill-runtime 原始输出:已提供 / 未提供
脱敏状态:
证据缺口:
Scorecard 条目格式:
维度:
weak:
portable:
skill-runtime:
证据:
判定:
沉淀判断格式:
是否应升级为 Skill:
原因:
需要进入 SKILL.md 的规则:
仍保留为 portable prompt 的内容:
需要补的 fixture / scorecard:
原始输出附录格式:
## 原始输出附录
### weak 原始输出
```text
粘贴 weak 模型原始输出;如缺失,写“未提供原始输出”。
```
### portable 原始输出
```text
粘贴 portable 模型原始输出;如缺失,写“未提供原始输出”。
```
### skill-runtime 原始输出
```text
粘贴真实 Skill 触发后的原始输出;如缺失,写“未提供原始输出”。
```
SKILL.md 文本粘贴运行的结果称为真实 Skill 结果。[源文件A] 或公开 fixture 相对路径替代。