一键导入
customer-reviews-extractor
Customer Reviews 块提取器。从 customer_reviews.html 中提取评分摘要和逐条评论,输出 customer_reviews_extracted.md。此块 DOM 结构高度一致,强制复制模版。当 agent 需要提取评论块时调度此技能。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
Customer Reviews 块提取器。从 customer_reviews.html 中提取评分摘要和逐条评论,输出 customer_reviews_extracted.md。此块 DOM 结构高度一致,强制复制模版。当 agent 需要提取评论块时调度此技能。
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
当需要分析 Amazon Bestsellers Top50 的 A+ 页面内容、视觉营销策略、品牌故事、产品对比表、图片素材质量时触发此 skill。 包括但不限于:A+ 模块结构分析、图片视觉风格对比、Comparison Table 分析、品牌叙事策略、A+ 文本内容提取等。 示例触发语:「分析 A+ 页面」「哪些产品的 A+ 做得好」「A+ 图片风格对比」「Comparison Table 怎么设计的」「A+ 文案分析」
当需要对 Amazon Bestsellers Top50 做逐商品更细分类分析时触发此 skill。 适用于平台类目过粗而业务需要细粒度标签的场景。该技能基于 PPD + Product Details + 商品图证据, 输出全量 Top50 的细分类明细表、分布统计和机会判断,且支持全类目通用。
当需要分析 Amazon Bestsellers Top50 的市场竞争格局、排名坑位结构、品牌集中度、价格带分布、卖家结构时触发此 skill。 包括但不限于:类目概览骨架判断、坑位门槛分析、品牌/卖家占坑、新卖家进入路径、市场体量代理判断、自营占比等。 示例触发语:「分析这个类目的市场竞争格局」「排名前10被谁占了」「新卖家有没有机会进入」「品牌集中度怎么样」「价格带分布如何」
当需要分析 Amazon Bestsellers Top50 的用户评论结构、购买动机、高频痛点、产品实用性判断时触发此 skill。 包括但不限于:评论层级分布、用户核心购买理由、差评痛点提炼、产品切入机会识别等。 示例触发语:「分析用户评论」「用户最在意什么」「差评集中在哪里」「产品体验痛点是什么」「新品应该改进什么」
Amazon 商品完整 HTML 页面的分块器。读取 ≈2MB 的完整详情页 HTML,按稳定 DOM id 切出 4 个子 HTML(ppd / customer_reviews / product_details / aplus)。当 agent 需要对完整 HTML 进行分块切分时调度此技能。
Amazon 商品子 HTML 块的结构化提取器(清洗器)。读取分块后的子 HTML,清洗 DOM 噪声,输出结构化 Markdown。包含 4 个子技能(ppd / customer-reviews / aplus / product-details),每个负责一种块类型。当 agent 需要从子 HTML 中提取结构化数据时调度此技能。
| name | customer-reviews-extractor |
| description | Customer Reviews 块提取器。从 customer_reviews.html 中提取评分摘要和逐条评论,输出 customer_reviews_extracted.md。此块 DOM 结构高度一致,强制复制模版。当 agent 需要提取评论块时调度此技能。 |
| type | skill |
输入:customer_reviews.html
输出:customer_reviews_extracted.md
复杂度:简单,无子阶段
此块在所有商品间 DOM 结构高度一致,提供已验证的参考实现。
参考模版位于本 skill 同级目录:customer_reviews_extract.py
customer_reviews_extract.py,完整理解其代码结构、Selector 选择、清洗逻辑chunker/customer_reviews_extract.py,保持相同的架构和 Selector 策略[class*='review'] 等通配符 selector,必须使用精确的 data-hook 属性选择器| 字段 | Selector | 说明 |
|---|---|---|
| 评论列表容器 | li.review.aok-relative | 每条评论的外层容器 |
| 评论标题 | [data-hook="review-title"] | 内层取最后一个非空 span |
| 评分 | [data-hook="review-star-rating"] 或 [data-hook="cmps-review-star-rating"] | 星级文本 |
| 作者 | .a-profile-name | 用户名 |
| 日期 | [data-hook="review-date"] | 含国家和日期 |
| 已认证购买 | [data-hook="avp-badge"] | 存在即 Yes |
| 有用投票 | [data-hook="helpful-vote-statement"] | 有用计数 |
| 评论正文 | [data-hook="review-collapsed"] → [data-hook="review-body"] | fallback 顺序 |
| 总体评分 | [data-hook="rating-out-of-text"] | "x.x out of 5" |
| 总评分数 | [data-hook="total-review-count"] | "N global ratings" |
| 评分分布 | #histogramTable a[aria-label] | aria-label 属性值 |
重点是清洗 DOM 噪声(<br>, <span> 嵌套, Read more 链接等),然后直接提取。
# Customer Reviews
## Summary
- Overall rating: x.x out of 5
- Total ratings: N global ratings
- Rating distribution:
- 73 percent of reviews have 5 stars
- ...
## Review Items (N)
### 1. Review Title
- Rating: x.x out of 5 stars
- Author: ...
- Date: ...
- Verified purchase: Yes/No
- Helpful: N people found this helpful
Review body text...
chunker/customer_reviews_extract.py — 评论提取器(从模版复制)tests/test_customer_reviews_extract.py — 评论提取器测试