一键导入
web-flow-benchmark
web-flow 内部的独立多维评测阶段:按当前 stage rubric 先验 must-pass,再对主观质量评分,每轮只给一个 top_fix,最多两轮并输出可审计 Markdown。仅在 web-flow 主 Skill 明确调用时使用。不要因普通用户请求单独触发。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
web-flow 内部的独立多维评测阶段:按当前 stage rubric 先验 must-pass,再对主观质量评分,每轮只给一个 top_fix,最多两轮并输出可审计 Markdown。仅在 web-flow 主 Skill 明确调用时使用。不要因普通用户请求单独触发。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
在需要打包、签名、OTA、APK/IPA、GitHub Release、商店提交、部署、回滚或验活时使用;支持独立窄任务,也支持作为 app-flow 的当前行动。它核对具体渠道授权,可复用用户明确记录的项目级 preview OTA 持续授权并在验证通过后自动发布;未获授权只做预检。
把自然语言 App 需求、模块说明和参考截图一路推进到经验证的代码与当次授权交付;用于需要长时间自主开发、持续排障和跨上下文恢复的移动端或跨端 App 任务。它不固定技术栈、阶段或交付形式,也不会把无人值守理解为远端发布授权。
在需要与生产者分离的独立评审、复核、验收,或对 App 方案、UI、代码、体验或交付准备度做质量判断时使用;支持独立窄任务,也支持作为 app-flow 的当前行动。它只做只读评判并绑定真实证据,不创建或修改产物,也不做第一方定位根因或直接改代码。
在设计、开发或交付 App 时按需参考 Happy/Paws 经验,包括移动端架构、React Native/Expo 取舍、验证、OTA、安装包与 Release 边界。用于用户明确要求参考 Happy/Paws,或当前问题与这些真实工程经验高度匹配时;它只提供上下文,不是 App Workflow,也不强制复制 Happy 的技术栈。
在需要创建、修改、重构、修复 App 代码,或只读诊断崩溃、定位根因、给出候选补丁时使用;支持独立窄任务,也支持作为 app-flow 的当前行动。它不做产品调研、原型/设计、独立评审或打包发布,除非当前行动本身就是改代码。
作为 self-learning 的 HyperFrames 产出能力,自主学习本地教学音视频或公开视频链接,把教程讲授的方法、可观察动效和屏幕代码转成有证据、可恢复、可渲染的 HyperFrames Demo,并记录实际使用的内容、Skills、工具与可复用经验。仅在 self-learning 调用,或用户明确要求从教学素材制作 HyperFrames Demo 时使用;普通学习任务不要单独触发。
| name | web-flow-benchmark |
| description | web-flow 内部的独立多维评测阶段:按当前 stage rubric 先验 must-pass,再对主观质量评分,每轮只给一个 top_fix,最多两轮并输出可审计 Markdown。仅在 web-flow 主 Skill 明确调用时使用。不要因普通用户请求单独触发。 |
评分负责发现问题,不负责制造无限循环;memory 只接收经过根因验证的错误,不接收所有低分。
评审文档路径必须是 reviews/<stage>/attempt-<n>/round-<n>--<artifact-id>-r<revision>.md。事实门修复使用同目录的 must-pass recheck 版本路径,不占主观 round 1/2。
若本 Skill 的 memory/index.md 存在,只读取 rubric、硬校验、加权计算和停止规则相关的 1–3 条记忆。benchmark 自身发生且通过三项验证的错误写回自己的 memory/;产物阶段的错误候选必须交回对应阶段 Skill。
评分必须交给没有参与本阶段生成的独立 AI,或至少使用干净上下文。评测 Agent 不能用生成者的自我说明代替产物证据。
must-pass recheck 不占主观评分两轮。sum(score × weight) / sum(weight),保留两位小数。review record,绑定 reviewer、独立性、rubric ref/hash、review path/hash、artifact ref/hash、must-pass、分数和 decision。round 1 达阈值 → pass
round 1 未达阈值 → revise_once,只修 top_fix
round 2 → 停止主观评审循环
达阈值 → pass
未达阈值 → proceed_with_residual,不要求收敛
任意轮 must_pass 失败 → blocked,修复事实条件后重新验证
第二轮后的 residual 要保留,但不能自动写进 memory。
只有发现可能跨次复现的真实错误时才附候选,并分别回答:
actual_error:是否真的发生,而非审美偏好?root_cause_verified:根因是否有代码、测试、命令、数据或用户确认?likely_to_recur:同类任务未来是否可能再发生?三项同时为 true 才能交回发生错误的阶段 Skill,由该 Skill 在自己的 memory/ 中查重并写入;benchmark 自己不保存其他阶段的 memory。