一键导入
harness-thinking
长时任务的 Harness 思维框架——当任务复杂、质量要求高、需要多轮迭代时,自动应用生成器-评估器分离、上下文重置、契约驱动、并行探索等模式。触发词:复杂任务、高质量输出、反复优化、迭代提升、多 agent 协作、长时任务、超越默认结果。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
长时任务的 Harness 思维框架——当任务复杂、质量要求高、需要多轮迭代时,自动应用生成器-评估器分离、上下文重置、契约驱动、并行探索等模式。触发词:复杂任务、高质量输出、反复优化、迭代提升、多 agent 协作、长时任务、超越默认结果。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
Import and adapt skills from Claude Code style repositories into Codex. Use when Codex needs to inspect a third-party skills repo, identify folders that contain reusable SKILL.md-based workflows, copy compatible skills into `~/.codex/skills`, or warn about Claude-specific files and assumptions before porting.
Clarify vague requests, test raw ideas, and drive multi-round requirement discovery across users, business owners, product, design, and delivery teams. Use when a request is not yet clear, stakeholders disagree, an idea may or may not be valuable, or Codex needs to turn scattered discussion into a concrete goal, scope, and next-step plan.
Design, refine, and package Codex skills from a user goal, an existing workflow, or a source repository. Use when Codex needs to create a new skill, improve an existing skill, turn repeated work into a reusable process, or adapt an external skill idea into a Codex-native format.
将 Claude Code 风格的技能仓库检查、筛选并改造成 Codex 技能。适用于需要查看第三方技能仓库、识别其中可复用的 SKILL.md 工作流、把兼容技能复制到 `~/.codex/skills`,或在迁移前识别 Claude 专属假设与限制的场景。
通过多轮对话澄清模糊需求、判断点子价值,并推动用户、业务、产品、设计、交付等多方完成需求识别与收敛。适用于需求尚不明确、干系人存在分歧、一个想法是否值得做仍不确定,或需要把零散讨论整理成清晰目标、范围和下一步计划的场景。
根据用户目标、现有工作流或外部来源,设计、改造并打包 Codex 技能。适用于需要创建新技能、优化现有技能、把重复工作沉淀成可复用流程,或把外部技能思路改造成 Codex 原生技能的场景。
基于 SOC 职业分类
| name | harness-thinking |
| description | 长时任务的 Harness 思维框架——当任务复杂、质量要求高、需要多轮迭代时,自动应用生成器-评估器分离、上下文重置、契约驱动、并行探索等模式。触发词:复杂任务、高质量输出、反复优化、迭代提升、多 agent 协作、长时任务、超越默认结果。 |
面对任何需要超越"一次性输出"的任务时,主动应用以下行为模式。这些模式来自 Anthropic 工程实践,适用于所有领域。
单个 agent 做复杂任务有两个天花板:
解法:把"做事"和"批评"分给不同的 agent,用架构补偿模型的局限。
何时用: 输出质量难以客观判断,或容易陷入"差不多就行"的惰性时。
做法:
关键: Evaluator 的批评必须具体可操作。"很好但可以更好"是无效反馈。
何时用: 质量判断涉及主观感受(美感、流畅度、完整性)时。
做法:
例: "设计质量" → 连贯性 / 原创性 / 工艺 / 功能性,前两项权重更高以推动大胆选择。
何时用: 任务需要多轮迭代,且每轮都需要高水准表现时。
做法:
权衡: 压缩保留连续性但产生"上下文焦虑";重置编排更复杂但表现更稳定。
何时用: Generator 和 Evaluator 可能对"完成"的定义产生分歧时。
做法:
目的: 填补"高层目标"和"可验证实现"之间的鸿沟,防止双方错位。
何时用: 问题有多个合理解法,无法事先判断哪个更好时。
做法:
不是所有任务都需要完整 Harness。判断标准:
| 信号 | 建议模式 |
|---|---|
| 一次性简单任务 | 直接完成,无需 Harness |
| 质量要求高但方向明确 | 生成器 + 评估器循环(3-5轮) |
| 方向不确定 | 并行探索 + 收敛 |
| 任务极复杂、多模块 | 完整三 Agent(规划器 + 生成器 + 评估器)+ Sprint Contract |
随着模型能力提升,曾经必要的组件可能变成多余开销。定期问:
反直觉结论: 模型越强,Harness 不是变简单,而是演化到更高维度的编排空间。