원클릭으로
autoresearch
一套面向长程自主任务的协议框架。针对三个经实证观察到的失败模式——认知循环、停滞、运行时脆弱性——通过规定状态管理、停滞检测和看门狗机制来应对。已在多种任务类型上验证,包括论文写作(4 篇 ICLR 格式综述,在框架内自评 8.0-8.6/10)。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
一套面向长程自主任务的协议框架。针对三个经实证观察到的失败模式——认知循环、停滞、运行时脆弱性——通过规定状态管理、停滞检测和看门狗机制来应对。已在多种任务类型上验证,包括论文写作(4 篇 ICLR 格式综述,在框架内自评 8.0-8.6/10)。
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
SOC 직업 분류 기준
解释并编写 OpenAI Codex `/goal` 功能的有效指令——持久的自检代理循环(计划 → 执行 → 测试 → 复查 → 迭代)。当用户提到 Codex `/goal`、“goal loop”、“Ralph loop”,想启动一次长期运行的自主 Codex 任务,询问如何编写 goal 提示,或想草拟一段 goal 指令时使用。
在实现前对计划或设计做高强度决策访谈。用于用户要求 grill、grilling、压力测试方案,或希望逐项对齐产品与架构决策时。
运行极其严格的可维护性审查,重点检查抽象质量、超大文件、意大利面式条件增长、重复逻辑、低价值测试和有意义的清理机会。用于 thermo-nuclear code quality review、thermonuclear maintainability review、深度代码质量审计、针对变更代码或测试代码的 cleanup/fix 请求、复用检查、垃圾测试清理,或特别严格的可维护性审查。
对当前分支改动做全面的安全性与正确性审查。用于 thermo nuclear、thermonuclear、深度 review、分支或 PR diff 审计,重点检查 bug、破坏性变更、安全漏洞、开发体验回退、feature gate 泄漏、测试可靠性和虚假测试信心。
并行运行两个热核级审查流程,然后综合它们的发现。用于用户明确要求 thermos、double thermo review、两个 thermo reviewer、并行 review agent,或同时覆盖 bug、安全问题、测试可靠性与代码质量的分支审计。
使用这个技能,把工作委派给当前 tmux 会话中的独立交互式 AI Agent TUI 会话。
| name | AutoResearch |
| description | 一套面向长程自主任务的协议框架。针对三个经实证观察到的失败模式——认知循环、停滞、运行时脆弱性——通过规定状态管理、停滞检测和看门狗机制来应对。已在多种任务类型上验证,包括论文写作(4 篇 ICLR 格式综述,在框架内自评 8.0-8.6/10)。 |
| type | Agent Framework |
| tags | autonomous, long-horizon, zero-interaction, anti-loop, heartbeat-watchdog, loop, multi-agent, unattended, orchestration |
这项 skill 是一个面向长程自主任务(数天到数周)的协议框架。它不附带可执行代码;相反,它规定了一组经过实战检验的约定:状态如何持久化、如何检测停滞、如何分层设置守护者,以及哪些约束绑定智能体行为。具体实现细节留给采用者的运行环境决定。
长时间运行的代码智能体会反复出现三类失败模式:
这三者的共同原因不是模型能力不足,而是缺少工程脚手架。本框架中的每个机制都针对上述失败模式。
┌── 编排器(当前会话 / 持久 cron) ──┐
│ 监控状态文件 → 检测停滞 → 注入方向 │
└────┬─────────────┬─────────────┬────────────┘
[任务 A] [任务 B] [任务 C] ← 每个任务都是自己的全新会话
核心设计决策:
{task}/state/
├── task_spec.md # 目标 / 里程碑 / 成功标准
├── progress.json # {iteration, total_findings, status, stale_count}
├── findings.jsonl # 累积发现(仅追加)
├── directions_tried.json # 已尝试方向
└── iteration_log.jsonl # 每轮迭代总结
{task}/logs/
├── work.jsonl # 由工作智能体写入;决策标记为 level=decision
├── orchestrator.jsonl # 由编排器写入
└── heartbeat.jsonl # 由心跳看门狗写入
日志行格式:{"ts":"...", "source":"...", "level":"info|warn|error|decision", "event":"...", "detail":"..."}
# 1. 初始化任务目录,写入 state/task_spec.md 和初始 progress.json
# 2. 启动编排器循环:
/loop 2h check all tasks under : (1) 读取 progress.json;
(2) 如果 stale_count>=3,生成一个新方向;(3) 通过 Agent tool 启动一个工作智能体
(带有明确目标和完成标准);
(4) 将结果写回状态文件。零交互。
# 3. 注册一个持久心跳看门狗(跨会话存活):
每小时巡逻:写入时间戳;检查每个循环的 last_seen 是否超过 interval×3,
若超时则重启;检查每个任务的进度是否在 2 小时内停滞,若停滞则推动。
零交互。
| 机制 | 规则 |
|---|---|
| 停滞检测 | 一轮迭代中有 0 个新发现,或指标下降 → stale_count + 1 |
| 强制转向 | stale_count >= 2 → 改变结构性约束,而不是战术参数;>= 4 → 标记为需要人工关注 |
| 方向多样性 | 新方向必须不同于每个已尝试方向;停滞后注入扰动策略 |
| 轮次上限 | 单个工作会话上限为 15 轮或 30 分钟 |
“转向结构,而不是战术”来自实践经验:当一个任务在某个框架内反复停滞时,决定性收益通常来自修正环境或结构性约束本身,而不是在现有框架内更努力地调参。
业务循环本身并不可靠,需要一个独立的守护层。三个相互检查的层级(V3):
| 层级 | 形式 | 依赖 | 角色 |
|---|---|---|---|
| L0 | 常驻 shell guard | 无会话 | 心跳过期 > 2h → 通过 headless agent 启动紧急巡逻 |
| L1 | 持久 cron,每小时 | 一个存活的交互式会话 | 检查每个循环的 last_seen,重启超时循环,检测停滞并推动 |
| L2 | 业务循环 | 每个循环都是自己的会话 | 每次回调的第一行更新自己的 last_seen |
任意一层死亡,都可以被另一层检测并恢复。
停滞检测:如果进度超过 2 小时没有更新,并且最后输出是一个问题 → 判定为停滞,启动一个推动子智能体。连续三次推动仍无进展 → 判定为结构性卡住;停止推动,并用新方向重新打开。2 小时阈值故意短于 4 小时的卡住任务阈值。
| 模式 | 用途 | 核心思想 |
|---|---|---|
| A 目标驱动 | 研究迭代 | 注入已尝试方向,要求可验证发现,写回 findings.jsonl |
| B 并行探索 | 复杂子问题 | 在一条消息中启动多个智能体:调查、反驳、跨领域类比 |
| C 实验运行 | 长时间计算任务 | 提交后立即启动分钟级轮询:自动诊断错误、修复、重新提交 |
| D 验证 | 迭代后 QA | 一个独立子智能体审计发现的证据链 |
子智能体提示词应包含:背景、可验证交付物、工作目录、文件/行数上限,以及完成标准。
该框架已承载多个异构任务:学术论文写作、长程研究等。论文轨道输出:
| 论文 | 页数 | 引用数 | 自评 |
|---|---|---|---|
| Autonomous Research Agents | 59 | 228 | 8.0/10 |
| Continual Learning | 65 | 326 | 8.0/10 |
| Long-Horizon Decision-Making | 55 | 384 | 8.0/10 |
| Self-Play(285B 强化学习实验 + 理论加固) | 75 | 217 | 8.6/10 |
限制: