بنقرة واحدة
result-analysis
当 Owner 说"分析一下实验结果", 或实验 status 变为 completed 后 autoresearch 自动调用, 分析实验数据并判断假设是否成立
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
القائمة
当 Owner 说"分析一下实验结果", 或实验 status 变为 completed 后 autoresearch 自动调用, 分析实验数据并判断假设是否成立
التثبيت باستخدام Codex أو Claude انسخ هذا Prompt والصقه في Codex أو Claude أو مساعد آخر ليراجع صفحة Skill ويثبّتها لك.
استنادا إلى تصنيف SOC المهني
Generate and rank research ideas given a broad direction. Use when user says "找idea", "brainstorm ideas", "generate research ideas", or "what can we work on".
当 Owner 说"设计个实验""怎么验证这个 idea", 或 autoresearch 判断某个 developing/validated idea 需要实验验证时, 为 idea 设计完整实验方案
当 Owner 说"记录一下实验结果""实验跑完了", 或 Researcher 完成一轮实验需要记录时, 在 Experiment 笔记中追加 Run Entry 并更新状态
当 Owner 说"写一下 introduction""起草 related work", 或 autoresearch 判断某 direction 已积累足够素材需要成文时, 起草论文或报告的指定章节
当 Owner 说"打磨一下""改改这段""逻辑不通顺", 或 autoresearch 在写作阶段自检时, 从结构/清晰度/论据三个维度打磨已有文稿
当积累了新的 validated insight、实验结果改变了方向判断、 或 Owner 说"更新研究方向""复盘 agenda"时, 根据记忆和发现演化研究议程
| name | result-analysis |
| description | 当 Owner 说"分析一下实验结果", 或实验 status 变为 completed 后 autoresearch 自动调用, 分析实验数据并判断假设是否成立 |
| argument-hint | <experiment> |
| allowed-tools | Read, Edit, Glob, Grep |
result-analysis 是 MindFlow 实验闭环的最后一环。给定一个实验笔记([[Experiments/xxx.md]]),它系统性地读取所有 Run Entries、关联 Idea 的 hypothesis,结合历史记忆上下文,从五个维度完成分析:
| 分析维度 | 含义 |
|---|---|
| Hypothesis Verdict | hypothesis 是否得到支持——supported / refuted / inconclusive |
| Key Findings | 实验揭示的最重要事实,不局限于 hypothesis |
| Comparison to Baseline | 与 baseline 或对照组的量化对比 |
| Limitations | 当前实验的约束条件和潜在偏差 |
| Implications | 对后续研究方向、Idea 修正或 DomainMaps 更新的启示 |
分析结果写入 Experiment 笔记的 ## Analysis 节;若发现跨实验规律,追加到 Workbench/memory/patterns.md;若 verdict 明确,同步更新关联 Idea 的 status 字段。
用 Read 打开 experiment 参数指向的 Experiments/xxx.md 文件。提取以下字段:
status:确认为 running 或 completed(若为 planned,停止并告知 Owner"实验尚未运行,暂无数据可分析")hypothesis(若直接记录在 Experiment 文件中)或 idea_ref(指向关联 Idea)## Run 节或 Run Entries 表格:记录每个 run 的 config、metrics、observationsbaseline:对照指标或对照组描述将所有 run 数据整理为结构化列表,方便后续比较。
若 Step 1 中发现 idea_ref 字段(格式为 [[Ideas/xxx.md]]),用 Read 打开对应 Idea 文件,提取:
hypothesis:本实验试图验证的核心假设(完整保留原文)status:当前 Idea 状态(用于 Step 7 的同步更新)tags:领域关键词(用于 memory-retrieve 检索范围)若 idea_ref 为空或文件不存在,从 Experiment 文件本身提取 hypothesis,并在分析记录中注明"未找到关联 Idea,hypothesis 来自 Experiment 文件"。
调用 memory-retrieve skill,以 Step 2 的 hypothesis 和 tags 作为 query,scope 设为 insights 和 patterns,检索与本实验相关的历史经验:
将检索结果作为分析的背景上下文,在后续五维分析中标注"参考历史记忆"的依据。若记忆库为空或无相关条目,继续执行,在分析中注明"暂无相关历史记忆"。
综合 Step 1-3 的全部信息,逐维完成分析:
根据实验数据判断 hypothesis 的成立情况,给出三选一结论:
给出 1-3 句证据说明,直接引用 run 数据中的具体数字。禁止在数据不充分时强行判断为 supported 或 refuted。
列出 2-5 条最重要的发现,不局限于 hypothesis 的直接验证。每条一句话,格式:
- [Finding]:<具体描述,引用数据>
Key Findings 可以包含:意外规律、config 敏感性、数据质量问题、与预期相悖的现象等。
若 Experiment 文件中定义了 baseline,量化比较核心 metric 的提升/下降:
| Metric | Baseline | Best Run | Delta | 说明 |
| :----- | :------: | :------: | :---: | :--- |
| ... | ... | ... | ... | ... |
若无 baseline 定义,在此节注明"本实验未定义 baseline,无对照比较",不伪造对比数据。
列出 2-4 条当前实验的主要局限,包括但不限于:
基于本次实验结果,给出 2-4 条对后续研究的启示:
用 Edit 在目标 Experiment 文件(Experiments/xxx.md)中写入(或覆盖)## Analysis 节,格式如下:
## Analysis — YYYY-MM-DD
### Hypothesis Verdict
**Verdict**:supported / refuted / inconclusive
<1-3 句证据说明,引用具体 run 数据>
### Key Findings
- [Finding 1]:<描述>
- [Finding 2]:<描述>
- ...
### Comparison to Baseline
| Metric | Baseline | Best Run | Delta | 说明 |
| :----- | :------: | :------: | :---: | :--- |
| ... | ... | ... | ... | ... |
(若无 baseline,注明"未定义 baseline")
### Limitations
- <限制 1>
- <限制 2>
- ...
### Implications
- <启示 1>
- <启示 2>
- ...
日期填写今天(YYYY-MM-DD)。若文件中已存在 ## Analysis 节,覆盖整节内容(保留其他节不变),并在日志中注明"覆盖了旧 Analysis 节"。不得修改任何 Run Entry 的原始数据。
检查 Step 4 的分析结果,判断是否发现了跨实验规律(cross-experiment pattern)——即:本次发现与 memory-retrieve 返回的历史记忆高度一致,或本次发现可能对多个 Idea/实验具有普适价值。
若存在 cross-experiment pattern,用 Edit 将其追加到 Workbench/memory/patterns.md,格式:
### [YYYY-MM-DD] <Pattern 标题>
- **Observation**:<一句话描述规律>
- **Evidence**:[[Experiments/xxx]] + (可选历史来源引用)
- **Scope**:<适用范围,如 "VLA fine-tuning" 或 "low-data regime">
- **Confidence**:low / medium / high
- **Lesson**:<对未来实验设计的指导意义>
若无跨实验规律,跳过此步。
若 Step 4.1 的 verdict 为 supported 或 refuted(即非 inconclusive),且 Step 2 中找到了关联 Idea 文件,用 Edit 同步更新 Idea 文件的 frontmatter status 字段:
| Verdict | Idea 新 status |
|---|---|
| supported | validated |
| refuted | archived |
| inconclusive | 保持原值,不修改 |
仅修改 status 字段,Idea 文件其他内容保持不变。
用 Edit(若文件不存在则先 Write)将以下 log entry 追加到 Workbench/logs/YYYY-MM-DD.md:
### [HH:MM] result-analysis
- **input**: [[Experiments/xxx]]
- **verdict**: supported / refuted / inconclusive
- **key-finding**: <最重要的一条发现,一句话>
- **idea-status-updated**: yes([[Ideas/xxx]] → validated/archived)/ no
- **pattern-added**: yes / no
- **status**: success
若日志文件不存在,先创建文件(一级标题 # YYYY-MM-DD),再追加 entry。
## Analysis — YYYY-MM-DD 节,包含全部五个子节status 已同步更新(若 verdict 非 inconclusive 且 idea_ref 存在)Workbench/memory/patterns.mdWorkbench/logs/YYYY-MM-DD.md## Run 节的原始内容。分析是独立节,与 run 数据并存。示例:分析一个已完成的 VLN fine-tuning 实验
假设 Experiment 文件为 Experiments/VLN-LoRA-R2R-2026Q1.md,包含以下信息:
status: completedidea_ref: [[Ideas/VLN-LoRAFinetuning]]关联 Idea Ideas/VLN-LoRAFinetuning.md 的 hypothesis:
"对 DUET 应用 LoRA fine-tuning(rank 8-32),可以在 R2R val-unseen 上将 SR 提升至少 5 个百分点,同时保持 SPL 不显著下降。"
执行过程:
Read Experiments/VLN-LoRA-R2R-2026Q1.md — 提取 3 个 Run Entries 数据,整理为结构化列表
Read Ideas/VLN-LoRAFinetuning.md — 提取 hypothesis(SR 提升 ≥5pp)和 status: developing、tags: [VLN, LoRA, R2R]
调用 memory-retrieve(scope: insights + patterns,query: "LoRA fine-tuning VLN R2R")— 假设返回一条历史 pattern:"rank 过大在低数据量场景易过拟合"
五维分析:
Edit Experiments/VLN-LoRA-R2R-2026Q1.md — 写入 ## Analysis — 2026-03-28 节
Edit Workbench/memory/patterns.md — 追加新 pattern:"LoRA rank=16 在 VLN R2R fine-tuning 中表现最优,rank 继续增大无收益"(Confidence: medium,因仅有 1 个实验支撑)
Edit Ideas/VLN-LoRAFinetuning.md — 更新 status: validated(verdict=supported)
Edit Workbench/logs/2026-03-28.md — 追加 log entry