원클릭으로
result-analysis
当 Owner 说"分析一下实验结果", 或实验 status 变为 completed 后 autoresearch 自动调用, 分析实验数据并判断假设是否成立
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
메뉴
当 Owner 说"分析一下实验结果", 或实验 status 变为 completed 后 autoresearch 自动调用, 分析实验数据并判断假设是否成立
Codex 또는 Claude로 설치 이 Prompt를 복사해 Codex, Claude 또는 다른 어시스턴트에 붙여 넣으면 Skill 페이지를 검토하고 설치를 진행할 수 있습니다.
SOC 직업 분류 기준
Generate and rank research ideas given a broad direction. Use when user says "找idea", "brainstorm ideas", "generate research ideas", or "what can we work on".
当 Owner 说"设计个实验""怎么验证这个 idea", 或 autoresearch 判断某个 developing/validated idea 需要实验验证时, 为 idea 设计完整实验方案
当 Owner 说"记录一下实验结果""实验跑完了", 或 Researcher 完成一轮实验需要记录时, 在 Experiment 笔记中追加 Run Entry 并更新状态
当 Owner 说"写一下 introduction""起草 related work", 或 autoresearch 判断某 direction 已积累足够素材需要成文时, 起草论文或报告的指定章节
当 Owner 说"打磨一下""改改这段""逻辑不通顺", 或 autoresearch 在写作阶段自检时, 从结构/清晰度/论据三个维度打磨已有文稿
当积累了新的 validated insight、实验结果改变了方向判断、 或 Owner 说"更新研究方向""复盘 agenda"时, 根据记忆和发现演化研究议程
| name | result-analysis |
| description | 当 Owner 说"分析一下实验结果", 或实验 status 变为 completed 后 autoresearch 自动调用, 分析实验数据并判断假设是否成立 |
| argument-hint | <experiment> |
| allowed-tools | Read, Edit, Glob, Grep |
result-analysis 是 MindFlow 实验闭环的最后一环。给定一个实验笔记([[Experiments/xxx.md]]),它系统性地读取所有 Run Entries、关联 Idea 的 hypothesis,结合历史记忆上下文,从五个维度完成分析:
| 分析维度 | 含义 |
|---|---|
| Hypothesis Verdict | hypothesis 是否得到支持——supported / refuted / inconclusive |
| Key Findings | 实验揭示的最重要事实,不局限于 hypothesis |
| Comparison to Baseline | 与 baseline 或对照组的量化对比 |
| Limitations | 当前实验的约束条件和潜在偏差 |
| Implications | 对后续研究方向、Idea 修正或 DomainMaps 更新的启示 |
分析结果写入 Experiment 笔记的 ## Analysis 节;若发现跨实验规律,追加到 Workbench/memory/patterns.md;若 verdict 明确,同步更新关联 Idea 的 status 字段。
用 Read 打开 experiment 参数指向的 Experiments/xxx.md 文件。提取以下字段:
status:确认为 running 或 completed(若为 planned,停止并告知 Owner"实验尚未运行,暂无数据可分析")hypothesis(若直接记录在 Experiment 文件中)或 idea_ref(指向关联 Idea)## Run 节或 Run Entries 表格:记录每个 run 的 config、metrics、observationsbaseline:对照指标或对照组描述将所有 run 数据整理为结构化列表,方便后续比较。
若 Step 1 中发现 idea_ref 字段(格式为 [[Ideas/xxx.md]]),用 Read 打开对应 Idea 文件,提取:
hypothesis:本实验试图验证的核心假设(完整保留原文)status:当前 Idea 状态(用于 Step 7 的同步更新)tags:领域关键词(用于 memory-retrieve 检索范围)若 idea_ref 为空或文件不存在,从 Experiment 文件本身提取 hypothesis,并在分析记录中注明"未找到关联 Idea,hypothesis 来自 Experiment 文件"。
调用 memory-retrieve skill,以 Step 2 的 hypothesis 和 tags 作为 query,scope 设为 insights 和 patterns,检索与本实验相关的历史经验:
将检索结果作为分析的背景上下文,在后续五维分析中标注"参考历史记忆"的依据。若记忆库为空或无相关条目,继续执行,在分析中注明"暂无相关历史记忆"。
综合 Step 1-3 的全部信息,逐维完成分析:
根据实验数据判断 hypothesis 的成立情况,给出三选一结论:
给出 1-3 句证据说明,直接引用 run 数据中的具体数字。禁止在数据不充分时强行判断为 supported 或 refuted。
列出 2-5 条最重要的发现,不局限于 hypothesis 的直接验证。每条一句话,格式:
- [Finding]:<具体描述,引用数据>
Key Findings 可以包含:意外规律、config 敏感性、数据质量问题、与预期相悖的现象等。
若 Experiment 文件中定义了 baseline,量化比较核心 metric 的提升/下降:
| Metric | Baseline | Best Run | Delta | 说明 |
| :----- | :------: | :------: | :---: | :--- |
| ... | ... | ... | ... | ... |
若无 baseline 定义,在此节注明"本实验未定义 baseline,无对照比较",不伪造对比数据。
列出 2-4 条当前实验的主要局限,包括但不限于:
基于本次实验结果,给出 2-4 条对后续研究的启示:
用 Edit 在目标 Experiment 文件(Experiments/xxx.md)中写入(或覆盖)## Analysis 节,格式如下:
## Analysis — YYYY-MM-DD
### Hypothesis Verdict
**Verdict**:supported / refuted / inconclusive
<1-3 句证据说明,引用具体 run 数据>
### Key Findings
- [Finding 1]:<描述>
- [Finding 2]:<描述>
- ...
### Comparison to Baseline
| Metric | Baseline | Best Run | Delta | 说明 |
| :----- | :------: | :------: | :---: | :--- |
| ... | ... | ... | ... | ... |
(若无 baseline,注明"未定义 baseline")
### Limitations
- <限制 1>
- <限制 2>
- ...
### Implications
- <启示 1>
- <启示 2>
- ...
日期填写今天(YYYY-MM-DD)。若文件中已存在 ## Analysis 节,覆盖整节内容(保留其他节不变),并在日志中注明"覆盖了旧 Analysis 节"。不得修改任何 Run Entry 的原始数据。
检查 Step 4 的分析结果,判断是否发现了跨实验规律(cross-experiment pattern)——即:本次发现与 memory-retrieve 返回的历史记忆高度一致,或本次发现可能对多个 Idea/实验具有普适价值。
若存在 cross-experiment pattern,用 Edit 将其追加到 Workbench/memory/patterns.md,格式:
### [YYYY-MM-DD] <Pattern 标题>
- **Observation**:<一句话描述规律>
- **Evidence**:[[Experiments/xxx]] + (可选历史来源引用)
- **Scope**:<适用范围,如 "VLA fine-tuning" 或 "low-data regime">
- **Confidence**:low / medium / high
- **Lesson**:<对未来实验设计的指导意义>
若无跨实验规律,跳过此步。
若 Step 4.1 的 verdict 为 supported 或 refuted(即非 inconclusive),且 Step 2 中找到了关联 Idea 文件,用 Edit 同步更新 Idea 文件的 frontmatter status 字段:
| Verdict | Idea 新 status |
|---|---|
| supported | validated |
| refuted | archived |
| inconclusive | 保持原值,不修改 |
仅修改 status 字段,Idea 文件其他内容保持不变。
用 Edit(若文件不存在则先 Write)将以下 log entry 追加到 Workbench/logs/YYYY-MM-DD.md:
### [HH:MM] result-analysis
- **input**: [[Experiments/xxx]]
- **verdict**: supported / refuted / inconclusive
- **key-finding**: <最重要的一条发现,一句话>
- **idea-status-updated**: yes([[Ideas/xxx]] → validated/archived)/ no
- **pattern-added**: yes / no
- **status**: success
若日志文件不存在,先创建文件(一级标题 # YYYY-MM-DD),再追加 entry。
## Analysis — YYYY-MM-DD 节,包含全部五个子节status 已同步更新(若 verdict 非 inconclusive 且 idea_ref 存在)Workbench/memory/patterns.mdWorkbench/logs/YYYY-MM-DD.md## Run 节的原始内容。分析是独立节,与 run 数据并存。示例:分析一个已完成的 VLN fine-tuning 实验
假设 Experiment 文件为 Experiments/VLN-LoRA-R2R-2026Q1.md,包含以下信息:
status: completedidea_ref: [[Ideas/VLN-LoRAFinetuning]]关联 Idea Ideas/VLN-LoRAFinetuning.md 的 hypothesis:
"对 DUET 应用 LoRA fine-tuning(rank 8-32),可以在 R2R val-unseen 上将 SR 提升至少 5 个百分点,同时保持 SPL 不显著下降。"
执行过程:
Read Experiments/VLN-LoRA-R2R-2026Q1.md — 提取 3 个 Run Entries 数据,整理为结构化列表
Read Ideas/VLN-LoRAFinetuning.md — 提取 hypothesis(SR 提升 ≥5pp)和 status: developing、tags: [VLN, LoRA, R2R]
调用 memory-retrieve(scope: insights + patterns,query: "LoRA fine-tuning VLN R2R")— 假设返回一条历史 pattern:"rank 过大在低数据量场景易过拟合"
五维分析:
Edit Experiments/VLN-LoRA-R2R-2026Q1.md — 写入 ## Analysis — 2026-03-28 节
Edit Workbench/memory/patterns.md — 追加新 pattern:"LoRA rank=16 在 VLN R2R fine-tuning 中表现最优,rank 继续增大无收益"(Confidence: medium,因仅有 1 个实验支撑)
Edit Ideas/VLN-LoRAFinetuning.md — 更新 status: validated(verdict=supported)
Edit Workbench/logs/2026-03-28.md — 追加 log entry