| name | geo-queries |
| description | 给一个品牌(中文名、行业、垂类、一句话定位、竞品),生成 30 条用于测试 AI 可见度的真实用户问题,按 6 类意图(探索发现 / 选型推荐 / 对比评估 / 了解原理 / 采购投资 / 品牌识别)分布,每类内部混合"短抽象"和"长场景具体"两种风格。 |
| triggers | ["生成 GEO 测试问题","GEO 可见度测试问题","生成品牌可见度测试问题","GEO 问题清单","我要测我品牌的 AI 可见度"] |
| metadata | {"author":"KnightMafiaLau","source":"geo-flow v0.1"} |
| user-invocable | true |
| disable-model-invocation | false |
geo-queries — 生成 GEO 可见度测试问题
什么时候用这个 skill
用户要为某个品牌做 GEO(AI 可见度)测试,需要先得到一份"真实用户会问 AI 的问题清单"。这份清单后续会被拿去问 Kimi / 豆包 / DeepSeek 等模型,用来测:
- 品牌会不会在 AI 回答里被自然提到
- 在竞品里排第几
- 哪些场景命中率低(机会清单)
这个 skill 只负责生成问题清单。不做问答、不评分、不出报告。
你(Claude)要做的事
1. 先拿到 5 项输入
调用这个 skill 时,从用户那里拿下面 5 项。少一项就追问,不要自己编:
- 品牌名(中文)
- 行业(如"AI / 软件 SaaS"、"机器人"、"消费电子")
- 垂类(具体子赛道,如"具身智能小脑"、"开源向量数据库"、"跨境电商 SaaS")
- 一句话定位(产品到底干嘛的、解决什么问题)
- 竞品(2-3 个,写品牌名即可)
2. 按下面规则生成 30 条问题
6 类意图(每类 ~5 条)
⚠️ 顺序很重要:品牌识别 必须排在最前(q001-q005)。这是为了让 probe 阶段先跑这 5 条 → 拿到"品牌收没收录"的核心信号 → 再决定后续 25 条的执行策略(比如完全 0 收录时 probe 会先停下问用户)。
- 品牌识别 — 直接问品牌本身:"X 是什么?X 做什么产品?X 的核心技术 / 团队 / 客户群是什么?"。用来测 LLM 有没有收录这个品牌、收录得对不对、有没有跟同名/类似品牌串掉。必须排第一类。
- 探索发现 — 用户在摸索一个陌生领域:"X 领域有哪些公司?""目前业界有什么方案?"
- 选型推荐 — 用户在挑工具/服务:"做 X,用哪个最合适?"
- 对比评估 — 用户在对比候选:"A 和 B 谁更适合 X 场景?"
- 了解原理 — 用户想搞懂技术/事实:"X 怎么工作?成本花在哪?"
- 采购/投资 — B2B 找供应商 / 投资人调研:"找谁能做 X?哪些值得投?"
每类内部要混两种风格
短抽象(每类 2-3 条,15-40 字):宽泛、探索式
长场景具体(每类 3-4 条,80-150 字):具体场景 + 2-3 个真实约束 + 买家口吻
- 例:"做 RAG 知识库项目,初创团队选哪个向量库最省心、不用专门请人运维?"
硬规则(违反就重写)
- 品牌名出现规则(分两种情况):
- ✅ 「品牌识别」类问题必须包含品牌名——这就是测点(看 LLM 知不知道这个品牌、收录得对不对)。q001-q005 都要点名。
- 🚫 后 5 类(探索发现 / 选型推荐 / 对比评估 / 了解原理 / 采购/投资)问题里,绝对不准出现品牌名——这是测"自然提及"的核心。问题里给了暗示,整个测试就废了。q006-q030 都不能出现品牌名。
- 中文,符合中国用户问 AI 的自然口吻(不要像教科书、不要像营销文案)
- 紧扣用户给的"垂类"和"一句话定位",不要泛化到行业之外
- 题型多样:长短交错、角度不同(不要 6 条都长得一样)
- 30 条之间不能高度重复(换几个词重问同一个问题不算新问题)
- 不准复合题——一个
text 里只能问一件事,不许把两个独立子问题用句号/问号串起来。判别方法:能不能拆成两条独立问题且都成立?能 = 复合题,必须拆或删一条。
- 🚫 反例:"FDM 高速打印是靠电机、主板还是算法实现的?为什么同样声称 500mm/s,不同机器实际打印效果差别很大?"(两个独立追问硬拼)
- 🚫 反例:"X 的核心技术是什么?团队背景和主要客户群是什么?"(三件事拼成一句)
- ✅ 正例:"现在桌面级 FDM 都标 500mm/s 起步,实际打印效果差异为什么这么大?判断真实可用速度该看哪几个指标?"(一个核心问题 + 一个紧贴的补充澄清,不是两件事)
- 区分原则:一个核心问题可以带一句补充语境或追问澄清("…该看哪些指标?""…为什么?"),但不能塞两个独立可单测的问题。
- 不准 multiple-choice 引导式——别给 LLM "是 X 还是 Y 还是 Z" 的选项框,这是教科书口吻不是用户口吻。
- 🚫 反例:"高速打印是靠电机、主板还是算法实现的?"
- ✅ 改成:"高速打印的真正瓶颈卡在哪?" 或 "为什么有些高速机能用,有些不能用?"
3. 输出前先自检
输出 YAML 之前,自己过一遍:
- ✓ q001-q005 是「品牌识别」类(必须排最前),每一条都包含品牌名
- ✓ q006-q030 是其余 5 类(探索发现 / 选型推荐 / 对比评估 / 了解原理 / 采购/投资),没有任何一条提到品牌名(中文名 + 英文名都不行)
- ✓ 每类 4-6 条(粗略平衡),总数 30 左右
- ✓ 每类至少 1 条短 + 至少 2 条长
- ✓ 没有"换皮重问"的重复题
- ✓ 没有复合题(每条 text 只问一件事;能拆成两条独立问题 = 复合题,必须拆/删)
- ✓ 没有 multiple-choice 引导式(不出现"是 X 还是 Y 还是 Z" 这种教科书句式)
任何一条不过就重写,不要将就。
4. 输出格式
把 30 条问题包在一段 YAML 里:
brand: <品牌名>
vertical: <垂类>
positioning: <一句话定位>
competitors:
- <竞品 1>
- <竞品 2>
queries:
- id: q001
intent: 品牌识别
text: <包含品牌名的问题>
- id: q002
intent: 品牌识别
text: <包含品牌名的问题>
- id: q006
intent: 探索发现
text: <问题文本,不含品牌名>
id 从 q001 连续编号到 q030
- q001-q005 必须是 品牌识别 类
intent 必须是 6 类之一(品牌识别 / 探索发现 / 选型推荐 / 对比评估 / 了解原理 / 采购/投资)
- 同一 intent 的问题连续放
- 输出 YAML 前不要写多余解释,输出 YAML 后用一两句话总结分布
5. 出完跟用户确认
把 YAML 给用户后,说:
这是给 <品牌名> 生成的 30 条 GEO 测试问题。你过一遍,告诉我要改哪些、删哪些、加哪些。改完确认了,我们再进入下一步(去真实的 AI 里跑这些问题)。
如果用户要改:
- "删第 q005" → 把 q005 从 queries 里去掉,剩下 id 保持不变
- "把 q010 改成…" → 替换 q010 的 text,id 不变
- "再加一条对比评估的" → 加下一个未用的编号
Few-shot 风格演示(仅供 Claude 学习套路,不是给用户用的模板)
假设用户给的是:
- 品牌:灵犀向量
- 行业:数据基础设施
- 垂类:开源向量数据库
- 定位:面向 AI 应用、高性能可水平扩展的开源向量数据库
- 竞品:Milvus、Qdrant、Weaviate
每类应该这样混风格(注意 品牌识别 排第一)——
品牌识别(q001-q005,唯一允许出现品牌名的类别)
- 短:灵犀向量是一家什么公司?
- 短:灵犀向量主要做什么产品?
- 长:灵犀向量作为开源向量数据库,技术路线和 Milvus / Qdrant 主流方案有什么不同?
- 长:灵犀向量这家公司的核心团队背景和主要客户群体分别是什么?
探索发现(q006 开始)
- 短:国内有哪些值得关注的开源向量数据库?
- 长:想给 LLM 应用配套向量存储,目前业界比较成熟、文档完善的开源选择都有哪些?
选型推荐
- 短:做 RAG 用哪个向量数据库最主流?
- 长:做 RAG 知识库项目,初创团队选哪个向量库最省心、不用专门请人运维?
对比评估
- 短:Milvus 和 Qdrant 主要区别是什么?
- 长:做百亿级语义检索,自建 Milvus 集群 vs 用云上托管向量服务,长期成本和稳定性怎么权衡?
了解原理
- 短:向量数据库做近似最近邻搜索,主流实现方案有哪些?
- 长:向量数据库的成本主要花在存储、内存还是索引重建?对中小团队的负担怎么算?
采购/投资
- 短:向量数据库赛道有哪些值得关注的公司?
- 长:把私有部署的 RAG 系统从原型推到生产,找一家能提供向量数据库企业版 + 技术支持的国内厂商,有哪些可选?
⚠ 上面是风格演示,不是模板。用户的真实品牌可能在完全另一个行业(机器人、SaaS、消费品都可能),要根据他的"垂类 + 定位"重新构造场景,不能照搬向量数据库的内容(品牌识别类里的"X 是什么 / X 做什么"句式可以套用,但具体角度要贴合用户的真实品牌)。
不做的事
- 不要执行问题(不要真的去问 LLM)——那是另一个 skill 的事
- 不要给 SEO 建议、写文案、做品牌策略
- 不要编造"已经测过的数据"或假装跑了测试
- 用户没给齐 5 项输入之前,不要先生成问题