| name | international-lead-research |
| description | 自动调研国际化线索(agent、企业、平台、工具),抓取并总结信息,分析与 PaddleOCR/ERNIE 的合作可能性。当用户提到"调研线索"、"分析线索"、"搜集线索信息"、"合作可能性分析"、"线索整理"、"收集信息"、"分析agent"、"平台功能总结"、"线索信息总结"等相似词汇时触发。 |
International Lead Research
自动调研国际化线索(agent、企业、平台、工具),抓取并总结信息,分析与 PaddleOCR/ERNIE 的合作可能性。
适用场景
当用户需要对国际化线索进行调研时,使用本 Skill。线索类型包括但不限于:
- AI Agent 产品
- 海外企业或公司
- 技术平台或工具
- 其他具有潜在合作价值的国际化产品或服务
触发关键词
以下关键词或相似表达都会触发本 Skill:
- 调研线索
- 分析线索
- 搜集线索信息
- 合作可能性分析
- 线索整理
- 收集信息
- 分析 agent
- 平台功能总结
- 线索信息总结
输入要求
- 线索名称:agent、企业、平台或工具的准确名称(例如:Perplexity)
或
- 网站链接:线索的官网或相关页面 URL
输入类型处理差异:
- 线索名称:先通过 Google 搜索找到官网,然后继续访问 GitHub、社交媒体等其他数据源补充信息
- 网站链接:直接访问该网站作为信息源,但仍需搜索 GitHub、社交媒体等渠道补充完整信息
- 例如:用户输入
https://apify.com → 直接访问官网获取基础信息 → 继续搜索 GitHub、社交媒体补充技术细节和社区动态
输入处理规则
中文名称处理
如果用户输入的是中文名称(如"困惑"),需要先通过搜索引擎找到对应的英文官方名称,再继续后续调研流程。
示例:
- 用户输入:"困惑" → 搜索确认对应 "Perplexity" → 继续调研
- 用户输入:"开放AI" → 搜索确认对应 "OpenAI" → 继续调研
别名与变体处理
用户输入可能是产品别名、域名变体或拼写变体,需要自动识别并扩展搜索关键词:
| 输入类型 | 示例 | 处理方式 |
|---|
| 域名变体 | perplexity.ai | 自动识别为 Perplexity |
| 常见别名 | chatgpt | 识别为 ChatGPT / OpenAI |
| 拼写变体 | midjourny | 自动纠正为 Midjourney |
| 简称 | cursor | 结合上下文判断是代码编辑器还是其他产品 |
处理原则:
- 如果无法确定用户输入对应的具体产品,先向用户确认
- 搜索时使用扩展关键词提高匹配准确度
同名消歧处理
当用户输入的名称对应多个不同产品时,需要先进行消歧,向用户确认具体是哪一个。
消歧触发条件:
- 搜索结果显示多个同名但功能不同的产品
- 官网 GitHub 存在多个同名仓库且功能差异明显
- 社交媒体或社区讨论中存在多个同名产品
消歧处理流程:
-
收集候选产品信息:收集所有可能匹配的产品,至少包含:
- 产品名称
- 官网/代码库链接
- 一句话功能描述
- 所属领域/行业
-
向用户提问:以清晰格式列出候选产品,让用户选择
示例:
检测到 "Massive" 对应多个产品,请确认你要调研的是哪一个?
| 选项 | 产品 | 功能描述 | 官网 |
|---|
| 1 | Massive | 数据抓取/API绕过平台 | massive.dev |
| 2 | Massive AI | 3D游戏场景生成平台 | massive.ai |
-
等待用户确认:用户选择后,继续调研指定产品
-
未确认处理:如果用户无法确认,提供以下选项:
- 建议用户提供更具体的信息(如领域、功能关键词)
- 或询问是否需要分别调研所有候选产品
数据源优先级
按以下优先级搜索信息,每个数据源都要尝试访问,确保信息完整性:
- Google 搜索:获取基础信息和相关链接
- 官方网站:了解官方介绍、功能定位、产品文档
- GitHub:了解代码库、开源情况、技术实现
- 社交媒体:Twitter / Facebook / LinkedIn,了解用户反馈和社区动态
- 其他来源:技术论坛、AI 相关社区、媒体报道等
信息完整性原则:
- 不因从官网获取到部分信息就跳过后续数据源
- 不同数据源提供不同维度的信息,相互补充
- 官网:官方定位、功能描述
- GitHub:技术实现、开源程度
- 社交媒体:用户反馈、社区动态
- 如后续数据源提供的信息与前面冲突,优先以官方网站信息为准
GitHub 搜索逻辑
如何确认找到的仓库是正确的:
- 优先匹配官网首页提到的 GitHub 链接
- 根据作者信息(公司账号/创始人账号)判断
- 结合 Star 数量、更新频率等辅助判断
- 如存在多个同名仓库,选择 Star 数最多或官方认证的仓库
组织迁移处理:
- 部分项目会从一个组织/账号迁移到另一个(如 ComfyUI 从 comfyanonymous 迁移到 Comfy-Org)
- 通过 GitHub API 返回的重定向信息识别迁移
- 在报告中记录最新组织信息,同时可注明历史归属
闭源产品处理:
- 如果线索是闭源产品,在"开源程度"信息点标注"未找到代码库(闭源产品)"
- 不因找不到 GitHub 仓库而阻塞整体流程
执行步骤
第一步:信息采集
根据用户输入的线索名称或网站链接,按数据源优先级依次搜索并记录信息:
- 如果输入是线索名称,先通过 Google 搜索找到官网
- 官网无法访问时,优先从 GitHub、社交媒体等其他渠道获取信息
- 记录所有可获取的信息来源,用于资料来源标注
第二步:信息整理
将采集到的信息按以下板块进行整理和归纳:
| 板块 | 信息点 | 说明 |
|---|
| 一、基础信息 | 名称 | 线索的正式名称/品牌名 |
| 官方网站 | 官网 URL |
| 所属国家/地区 | 总部所在地或主要运营地区 |
| 成立时间 | 公司成立或产品发布时间 |
| 公司背景 | 所属公司、母公司、关联企业等 |
| 二、产品定位 | 功能定位 | 核心功能、一句话描述产品 |
| 核心功能 | 详细列出主要功能模块 |
| 使用逻辑/场景 | 主要使用场景、典型用户流程 |
| 三、技术信息 | 技术栈/底层模型 | 使用的技术、AI 模型等 |
| 开源程度 | 是否开源、开源协议类型 |
| 四、市场与竞品 | 用户规模/影响力 | 用户数量、下载量、关注度等 |
| 主要竞争对手 | 同赛道的主要竞品 |
| 五、合作分析 | 可合作信息点 | 潜在合作点分析 |
| 技术对接可能性 | 是否支持 API/SDK 集成、对接难度评估 |
| 已有合作伙伴/生态 | 官方列出的合作伙伴或生态系统 |
| 商业对接窗口 | 商务联系方式、BD 渠道 |
| 六、元数据 | 资料来源 | 信息采集来源列表 |
| 更新时间 | 报告生成时间 |
合作分析背景
在分析线索的合作可能性之前,需了解以下百度产品背景:
PaddleOCR:百度开源的 OCR(光学字符识别)工具库,支持多种语言的文字识别,提供 Python/C++/JavaScript 等多种语言的 API。可应用于图像文字提取、身份证件识别、票据处理等场景。
ERNIE:百度的预训练语言模型系列,包括:
- ERNIE-Bot(文心一言):大语言模型,提供自然语言理解与生成能力
- ERNIE-ViLG(文心一格):文生图模型,提供图像生成能力
- ERNIE-Speed:轻量级模型,适合边缘部署
基于以上背景,分析线索与 PaddleOCR/ERNIE 的合作可能性。
第三步:合作可能性分析
基于以下判断依据,分析线索与 PaddleOCR/ERNIE 的合作可能性:
| 判断依据 | 分析要点 |
|---|
| 是否有 API 开放 | 官方是否提供 API、API 文档是否完善 |
| 是否支持集成 | 是否支持 SDK/插件、对接技术难度如何 |
| 目标市场是否有重叠 | 主要服务市场与百度国际化业务的重叠度 |
| 技术栈是否匹配 | 底层技术路线是否与 PaddleOCR/ERNIE 兼容 |
| 功能定位是否有重合 | 核心功能是否与 PaddleOCR/ERNIE 形成互补或竞争 |
第四步:自查验证
完成信息整理后,进行以下检查:
- 确认每个信息点都有来源依据,未找到信息明确标注"未找到"
- 合作分析结论基于采集到的客观信息,避免主观臆测
- 资料来源列表完整记录所有信息渠道
- 更新时间标注为当前日期
输出要求
格式要求
- 使用 Markdown 表格 格式输出
- 按六个板块分组展示,每个板块有清晰标题
- 信息点与内容对应清晰,一目了然
内容要求
- 信息准确,有据可查
- 未获取到的信息明确标注"未找到"或"信息不明确"
- 合作分析部分重点突出,便于快速判断合作价值
- 资料来源列出,方便后续追溯和验证
多行信息处理规则:
- 使用
<br> 换行符在表格单元格内展示多行内容
- 示例:多个核心功能使用
<br> 分隔
• 功能一<br>• 功能二<br>• 功能三
- 复杂信息(如合作分析多个要点)建议使用
<br> 保持表格格式一致
- 如信息过于复杂无法在表格中清晰展示,可在表格下方添加详细说明段落
语言规则
信息采集语言:
- 优先采集英文内容(官网、文档、社交媒体等)
- 如存在中文内容,可作为补充信息源
- 多语言站点优先选择英文版页面
输出语言:
- 内容总结使用中文表达
- 专业术语、产品名称、技术栈等保留原文
- 示例:技术栈保留 "GPT-4"、"Claude-3.5",不翻译为中文
- 示例:公司名称保留 "Anthropic",标注中文别名"安思罗彼克"(如有)
时效性标注:
- 在"更新时间"信息点标注报告生成时间,格式:
YYYY-MM-DD
- 信息来源有明确时间时,在相应信息点中标注:
- GitHub:标注仓库创建时间、最后更新时间(例如:创建于 2023-01-17,最后更新 2024-03-15)
- 新闻/报道:标注发布日期(例如:[2024-02-20] TechCrunch 报道)
- 官网/文档:标注最后更新时间(如有显示)
- 如信息时效性存疑(如新闻时间久远),可在信息点后标注时效性提示(例如:[信息来源时间较早,可能已变更])
输出模板
## 线索调研报告:[线索名称]
### 一、基础信息
| 信息点 | 内容 |
|--------|------|
| 名称 | [内容] |
| 官方网站 | [内容] |
| 所属国家/地区 | [内容] |
| 成立时间 | [内容] |
| 公司背景 | [内容] |
### 二、产品定位
| 信息点 | 内容 |
|--------|------|
| 功能定位 | [内容] |
| 核心功能 | [内容] |
| 使用逻辑/场景 | [内容] |
### 三、技术信息
| 信息点 | 内容 |
|--------|------|
| 技术栈/底层模型 | [内容] |
| 开源程度 | [内容] |
### 四、市场与竞品
| 信息点 | 内容 |
|--------|------|
| 用户规模/影响力 | [内容] |
| 主要竞争对手 | [内容] |
### 五、合作分析 ⭐
| 信息点 | 内容 |
|--------|------|
| 可合作信息点 | [内容] |
| 技术对接可能性 | [内容] |
| 已有合作伙伴/生态 | [内容] |
| 商业对接窗口 | [内容] |
### 六、元数据
| 信息点 | 内容 |
|--------|------|
| 资料来源 | [内容] |
| 更新时间 | [内容] |
参考资料
references/ 目录当前为空。如需补充业务上下文、内部资料或模板规范,请将资料放在 references/ 目录,并在此处说明用途。
可选参考资料类型:
- PaddleOCR 技术文档和 API 说明
- ERNIE 系列产品介绍和集成指南
- 合作案例分析
- 行业报告和竞品分析模板
注意事项
信息源处理规则
- 当多个信息来源冲突时,优先以官方网站信息为准
- 官网无法访问时,继续尝试下一个数据源,不阻塞整体流程
- 对于初创团队或小规模产品,部分信息可能无法获取,标注"未找到"即可
失败场景处理
单一信息源失败:
| 错误类型 | 处理方式 |
|---|
| 官网 404 Not Found | 继续尝试 GitHub、社交媒体等其他渠道,在"官方网站"信息点标注"官网无法访问(404)" |
| 官网 500 Server Error | 继续尝试其他渠道,标注"官网暂时无法访问" |
| 官网超时/无响应 | 继续尝试其他渠道,标注"官网访问超时" |
| 地区限制/访问被拒 | 继续尝试其他渠道,标注"官网存在地区限制" |
| GitHub 搜索无结果 | 标注"未找到代码库",继续其他信息源 |
| 社交媒体无法访问 | 尝试其他媒体渠道或技术论坛 |
所有信息源均失败:
- 如通过所有数据源都无法获取任何信息
- 返回明确提示:"无法获取该线索的相关信息,请确认线索名称是否正确"
- 列出尝试过的所有数据源及失败原因,便于用户了解调研过程
部分信息缺失:
- 某些信息点无法获取时,标注"未找到"或"信息不明确"
- 不影响其他信息点的完整展示
- 在"资料来源"中说明哪些信息源尝试过但未获取到相关信息
内容质量要求
- 合作可能性分析应客观中立,避免过度乐观或保守
- 资料来源需完整记录,便于团队其他成员复核