| name | interview-designer |
| description | Generate interview questions with assessment dimensions and A-level reference answers from a resume, JD, PRD, or portfolio. Two modes — interviewer mode (scorecard, red flags, A/B/C scoring) and candidate prep mode (question essence, weighted dimensions, speakable A-level scripts). Covers an 11-group / 52-dimension coverage model (truth, demand, solution & AI boundary, product form, technical depth, reliability, enterprise reality, business value, collaboration, learning, fit) plus an Enterprise Reality Test that attacks a plan's unstated premises. Staged output with a hard context budget so large PRDs do not blow up the window. Use when preparing to interview someone, or preparing yourself from your own resume/PRD/course project. |
Interview Designer
两种模式:面试官出题评分 | 候选人备考写逐字稿
四阶段:判断提取 → 素材卡 → 分层逐字稿 → 攻防增强(分阶段产出,禁止一次全出)
输出语言:跟随用户输入语言。中文提问则全部中文输出。
0. 第一性原理
七条原理推导出全部规则。理解这七条,不需要记流程。
一、面试是信息不对称下的预测问题。
用有限的、且由候选人自己控制的证据,预测他未来 12 个月的表现。全部技术都在解决"证据不可信"和"未来不可知"。
二、没有标准,取证就变成挑刺。
先看简历再定标准,标准会被简历污染(因人设岗)。必须先独立定义 A 级长什么样。顺序错了后面全错。
三、候选人提交的文档一定是自洽的。
简历和 PRD 是他自己写的,内部逻辑必然闭环,从文档内部提问永远问不倒他。破自洽文档只能攻击它的前提——它对真实世界那些没说出口的假设。纸面方案通常内部完美、外部幼稚:假设数据干净、接口开放、审核的人不疲劳、需求是真的。这些假设就是攻击面。
四、问题和答案是同一个东西的两面。
一道好题必然存在一个可讲出口的好答案。写不出 A 级答案说明题目本身有问题——太空泛、无法回答、或没有区分度。答案生成是对题目质量的强制校验,不是附加功能。
五、面试官和候选人需要的答案形态不同。
面试官需要 A/B/C 分级做区分。候选人需要唯一一个能内化的标准答案——给他看 C 级答案会污染准备,让他记住错误说法。
六、素材卡是压缩机制,不是内容增量。
N 个答案各自重述同一个例子 = N 份拷贝;一张卡被引用 N 次 = 1 份。卡让产出变小,前提是答案引用卡而不是内联卡。
七、纸面项目(M0-M1)没有"经历"可讲,只有"判断"可证明。
面试官知道课程项目没有真实用户,他要看的是思维方式对不对。而思维方式的证明不在单个答案里,在答案之间的结构里:判断的迁移、正反论证、边界意识、迭代历史、验证路径。
1. 上下文纪律(硬性,违反则输出失败)
问题:PRD 常在 100-250KB。整读输入约 60-80k tokens;一次生成 60 题全量答案约 40,000 字。质量在触到硬限制之前就已经崩了。
输入侧压缩(必须做)
- 先扫大纲不读全文:
grep -n "^#\{1,3\} " 拿到结构。
- 只读含判断与数字的节:摘要、KPI/指标、核心技术决策 3-5 节、范围边界。目标 ≤6000 字(220KB → 约 18 倍压缩)。
- 禁止整读:需要细节时定点再读那一节,不回头整读。
冻结简报(Stage 1 后必须产出)
写一份 800-1200 字 项目冻结简报:项目性质与成熟度、12 个判断各一句话、关键数字清单、已知缺口。
此后所有阶段只读这份简报 + 当前要处理的那张卡,不再回读 PRD,不回读前批产出。
输出侧配额(硬上限)
| 产物 | 上限 | 说明 |
|---|
| 判断台账 | 10-15 条 | 超过说明在抄功能,不是在提判断 |
| 题目索引 | 40-60 题 | 只有题干 + 维度码 + 卡号,不含答案 |
| 全文逐字稿 | 默认只做 P0 的 12-18 题 | 其余按学员点名再展开 |
| 素材卡 | 8-12 张 | 每张支撑 3-5 题 |
| 攻防增强 | 只做 TOP 3 判断 | 正反+边界+验证+迭代 |
| 单次响应 | ≤4000 字 | 超了就分批,宁可多轮 |
P0 不设数量上限。 上面的 12-18 是单批产出的节奏建议,不是总量天花板。P0 有 25 题就出 25 题,分 5 批。
上下文约束靠分批解决,不靠砍题——砍题解决的是学员的时间预算,而准备期通常是几周不是几晚,时间不是瓶颈。
但同源题必须合并,理由不是省时间,是答案一致性:
考同一个判断的多个问法,如果各写一份独立全文,学员手里就有 3 份措辞不同、细节可能互相矛盾的答案。真实面试里面试官问一个、追问另外两个,他需要的是一条连贯的推理链,不是三段各自成立的话。
例:「硬约束为什么放规则引擎」「哪些愿意交给模型」「库存为什么不进知识库」——这是同一个 AI 边界判断的三个切面 → 合成 1 主问 + 2 追问,共用一张判断卡。
判据:两题引用同一张卡的同一栏,就该合并。 引用同一张卡的不同栏(如 判断卡1.正面 vs 判断卡1.边界),可以分开出题。
L2 不写全文:3 分钟口述写全约 800 字。改成写骨架 + 引用哪张卡("背景→引场景卡1;决策点→引判断卡1正面;失败场景→引判断卡1场景;边界→引判断卡1边界")。学员用卡自己组装。这一条单独省掉一半输出。
文件即上下文卸载:每阶段写入独立文件,后续阶段用路径引用,不把前文抬回上下文。
编码代替重复:维度用码(A1/F3/G4),卡用号(判断卡1/推导卡2)。码表只在 references/coverage-model.md 定义一次。
2. 两种模式
开始前判断用户是谁,判断不了就问一句。
| 面试官模式 | 候选人备考模式 |
|---|
| 触发信号 | "我要面试他"、上传别人的简历 | "我要面试了"、上传自己的简历/PRD |
| 目标 | 区分 A/B/C,做录用决策 | 内化标准答案,写逐字稿 |
| 答案形态 | A/B/C 三级 + 判分线 + 陷阱 | 只给 A 级 + 追问应对 |
| 额外产出 | 红旗绿灯、判分矩阵、防偏见提醒 | 攻击面自检、准备缺口、24h 清单 |
| 模板 | templates/interview_guide_template.md | templates/candidate_prep_template.md |
两种模式的 Stage 1/2/4 相同,只在 Stage 3 分叉。
3. 战情室
- Geoff Smart(Topgrading) — 定标准与取证。Scorecard First。
- Lou Adler(Performance-based Hiring) — 预测。过去表现只在情境相似时才能预测未来。
- Marty Cagan(SVPG) — 企业现实检验。四类风险:价值、可用性、可行性、商业可行性。
- Daniel Kahneman(Noise) — 防偏见。找到疑点时也找反证,找到亮点时验证可复用性。
- 领域专家 — 按岗位召唤。
4. 四阶段工作流
Stage 0:定位与 Scorecard(不看简历)
基于 JD 独立定义:Mission(一句话,这岗位为什么存在)、Outcomes(12 个月内 3-5 个可衡量结果)、Competencies(拿到这些结果所需能力)。
然后标注候选人的项目成熟度,这决定后续全部权重:
| 级别 | 含义 | 出题重心 |
|---|
| M0-M1 | 想法 / PRD / 原型,无真实用户 | G 组企业现实 + 判断溯源占 35-40%,禁止问"你碰到什么困难" |
| M2-M3 | 可跑 demo / 内测 | 现实组降到 25%,加真实 Bad Case |
| M4+ | 客户 POC / 生产 | 现实组降到 15%,改问"你踩过哪些坑" |
Stage 1:判断提取 + 题目索引 ⭐ 产出最便宜、价值最高
先提判断,不提功能。 PRD 写的是"要做什么",面试考的是"你为什么这么做"。
产出三样(写入 <候选人>-面试索引.md):
- 判断台账(10-15 条):
判断 | PRD 出处 | 维度码 | 面试概率 | 是否你的原创
- 题目索引(40-60 题):
题号 | 题干 | 维度码 | 优先级 P0/P1/P2 | 需要哪张卡
—— 只有题干,不含答案。 这是全局地图,学员据此点名要哪些题的全文。
- 覆盖诊断:11 组逐组标 充分/薄弱/缺失 + 缺什么 + 下一步动作
然后写 项目冻结简报(800-1200 字),后续阶段只读它。
Stage 2:素材卡(压缩层)
按 references/card-system.md 建 8-12 张卡。卡类型:判断卡、推导卡(每个关键数字一张)、场景卡、溯源卡、降级卡。
每张卡必须标注:它支撑哪几道题。 一张卡支撑 3-5 题,这是压缩比的来源。
Stage 3:分层逐字稿(默认只做 P0)
L0(≤40字结论)/ L1(150-250字主回答,引用卡)/ L2(骨架+卡引用,不写全文)/ L3(追问分支只写"引哪张卡")。
每批开头必须放「卡片速查表」:本批引用到的卡,一行一张写清卡号 + 一句话内容 + 在哪个文件。
否则学员看到"引 判断卡1.第一性原理"不知道该翻哪——卡引用省下的字数,不能变成学员的查找成本。
模式分叉:面试官模式在 L1 后补 B/C 级 + 判分线 + 陷阱;候选人模式只给 A 级 + 追问应对。
详细标准见 references/answer-standards.md。
Stage 3.5:补证据行动清单(准备期 ≥2 周时必做)⭐
为什么单列一步:准备期长会改变策略性质。
- 短准备期:缺口只能"诚实承认"——"我没接触过真实企业数据,这是我的短板"(保底,不丢分)
- 长准备期:缺口可以真去补掉——"我特意找了两个做外贸 ERP 的朋友聊,他们的产品表是这样的……"(把红旗直接转成绿灯)
所以覆盖诊断里每个"缺失/薄弱",都要判断它是只能承认的还是能补掉的,能补的给具体动作:
| 缺口类型 | 能不能补 | 补的动作 | 补完后答案的变化 |
|---|
| 没见过真实企业数据(G1) | ✅ 能 | 找 2-3 个做外贸/ERP 的人各聊 30 分钟,记下产品表的真实形态和字段缺失情况 | "我推测数据是脏的" → "我问过两个人,他们的 MOQ 字段大概三成是空的" |
| ROI 没算过(H1) | ✅ 能 | 用真实薪资水平和询盘量算一遍,写在纸上 | "这个我没算过" → 给出完整测算 + 标明最脆弱的假设 |
| token 成本没算(H4) | ✅ 能 | 按真实 API 定价算单条询盘成本 × 月量 | "大概几百块吧" → "单条约 2.5 万 token,月 3000 条约 X 元" |
| 没有跨职能冲突素材(I 组) | 🟡 部分 | 找课程同学/朋友做一次方案 review,记录被挑战的点和你怎么回应 | 从"没有素材"到"至少有一次真实被质疑的经历" |
| 没有真实用户反馈(B4/H6) | 🟡 部分 | 把原型给 1-2 个外贸从业者看,记录他们的第一反应 | "我假设他们会用" → "我给两个人看过,其中一个说他不会用,因为……" |
| 项目没落地(A3) | ❌ 不能 | — | 只能诚实承认,但可以补"如果真做我会先验证什么" |
| 没有真实 Bad Case(F8) | ❌ 不能 | — | 用 7 天验证路径代替 |
行动清单要带排期(外部依赖的排最前,因为约人要时间):
第1周:锁事实(简历/PRD 对账、判断台账、数字类型标注)
第2周:补证据(约人访谈 ×2-3、算 ROI 和 token、给人看原型)← 外部依赖,最早启动
第3周:写全文(新证据已到手,答案可以从"推测"升级成"我问过")
最后几天:模拟追问、控时练习、30秒/2分钟两版介绍
能补的缺口不要只写"诚实承认"。 承认是保底,补掉是加分。准备期够长时,写答案前先补证据——这一步的收益比多写 5 道题的答案大得多。
Stage 4:攻防增强(只做 TOP 3 判断)
给最核心的 3 个判断补四件事,这四件事是证明思维方式的载体(原理七):
- 反面论证:为什么不选 B/C/D(至少 2 个备选方案 + 各自为什么不行)
- 边界条件:什么情况下这个判断不成立(至少 2 个)
- 7 天验证路径:有时间线、有检查点、预判可能发现什么(证明有实验思维)
- 迭代历史:V1 初始想法 → 转折点(什么让你改) → V2 → V3 方向(还能怎么改)
模板见 references/card-system.md。
5. 维度模型(11 组)
完整 52 个子维度、提问模板、A/C 级信号见 references/coverage-model.md。此处只列骨架与出题配额。
| 码 | 组 | 一句话考什么 | P0 题量 |
|---|
| A | 真实性与诚信 | 项目性质、个人贡献、数字是实测还是推导 | 2-3 |
| B | 问题与需求 | 场景怎么来的、主动发现还是被动接需求、怎么说服立项、北极星怎么定 | 2-3 |
| C | 方案与 AI 边界 | 为什么要用 AI(而不是规则/算法/人工)、什么交给模型什么不交、Agent vs Workflow | 3-4 |
| D | 产品形态与体验 | 独立页面还是嵌入业务系统、交互流程、无结果怎么办、用户凭什么信 | 2 |
| E | 技术深度 | RAG 知识库好的标准、检索与切分、数据到结论的推导链路 | 2-3 |
| F | 可靠性与评测 | 模型必然出错怎么承接、长链路误差累积、阈值怎么定、评测集与 Bad Case 闭环 | 3-4 |
| G | 企业落地现实 ⭐ | 数据脏、接口没有、新老系统兼容、多业务配置化、安全合规、长期运营与审核疲劳 | 3-5 |
| H | 商业价值 | ROI 算给我听、成本结构、效果与成本换算、采纳率、谁掏钱 | 2-3 |
| I | 协作与推动 | 跨职能博弈、和业务方冲突、向上管理、30 秒讲给不懂技术的老板、控时 | 2-3 |
| J | 学习与自驱 | 哪个设计后来发现错了、迭代转折点、AI Coding 工具深度、接手老项目、沉淀成 skill | 2-3 |
| K | 岗位匹配与动机 | 职业路径自洽、JD 对标、目标级别、反问质量、离职与薪资 | 2-3 |
关键提醒:
- C 组的"为什么要用 AI"是最根本一问,却最常被漏。答不出这题,整个方案的立项理由就没了。
- G 组对 M0-M1 候选人是最高权重,因为纸面方案最大的能力缺口就是不知道方案到落地的距离。
- I 组的控时是隐性淘汰项。项目介绍讲超 3 分钟被打断,本身就是失分。
6. 出题原则
- 背不出来 — 逼他现场思考或回忆具体痛处。
- 强制取舍 — 在两个都"对"的选项里选,考价值观不是知识。
- 细节颗粒度 — 能追到"你画了什么图"、"你原话怎么说的"、"那个数字怎么算的"。
- 攻击前提,不攻击逻辑(原理三)— 不问"你的逻辑对吗",问"你假设数据是干净的,如果不是呢"。
- 每题必须能写出 A 级答案(原理四)— 写不出来就删掉重出。
- 每题带追问链 — 真实面试会连追 3 层。单题设计时就要想清第 2、3 层追什么。
- 溯源型追问必配 — 对每个核心技术判断都要问"这想法是你自己想的还是参考的"。这是鉴别 AI 生成方案的主武器。
7. 答案标准
完整标准见 references/answer-standards.md。硬性底线:
- 可讲出口 — 口语节奏。写完出声读一遍,拗口就重写。
- 有具体场景 — 必须出现真实产品、数字、报错、对话。"保证准确性"是废话,"客户要 CE 我们只有 UL,推了就是错的"才是答案。
- 数字可追溯 — 每个数字说清怎么算的,或明确标注"这是估算/推导,依据是X"。禁止把目标值、假设、benchmark 写成实测结果。
- 承认边界 — 没做过就说没做过。坦承是加分项,硬撑是减分项。
- 反废话检验 — 能回答"听完这个答案,面试官/学员今天能改什么看法或做法"。答不出来 = 正确的废话,删掉重写。
- 禁用无信息量大词 — 鲁棒性、赋能、闭环、提效、抓手、最佳实践。
- L1 控制在 150-250 字(约 1 分钟)。
8. 输出与自检
- 面试官模式 →
templates/interview_guide_template.md
- 候选人模式 →
templates/candidate_prep_template.md
- 索引层 →
templates/index_template.md
每阶段收尾必做:
- 报告本次产出字数,超 4000 字要说明为什么没分批。
- Stage 1 必须给 11 组覆盖诊断,明确说哪组缺失,不许假装覆盖全了。
- 列出下一阶段建议做什么,让用户决定是否继续——不要自动展开全部。
防偏见提醒(Kahneman):
- 警惕文档体量光环。上千行 PRD 容易读成"这人很强"。AI 时代体量不证明能力,问文档里没写的东西才行。
- 反向防过度怀疑。技术判断确实对就该给分,不要因为"应届生不可能懂"而压分。
- 纸面项目不是原罪。 区分"没落地过"(可培养)和"不知道自己没落地过"(危险)。