一键导入
harvest-usage
Практическое использование Harvest для веб-скрейпинга: scrape, extract, crawl. Конкретные команды и примеры из жизни.
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
菜单
Практическое использование Harvest для веб-скрейпинга: scrape, extract, crawl. Конкретные команды и примеры из жизни.
用 Codex 或 Claude 帮你安装 复制这段 Prompt,粘贴到 Codex、Claude 或其他助手里,让它检查 Skill 页面并帮你完成安装。
基于 SOC 职业分类
End-to-end content creation from idea to monetization.
Self-healing and self-learning loops for AI agents. Auto-recover from errors, remember what works.
Automatic memory preservation hooks for Hermes sessions.
Полный цикл публикации open-source проекта на GitHub — от инициализации до релиза v1.0.0. Включает создание логотипа, проверку валидности SVG, шаблон README, MIT лицензию, pre-commit hooks, тесты, версионирование x.5, и публикацию релиза.
Configure Hermes Agent gateway platforms in DPI-restricted or censored networks — Telegram, Discord, and AI providers behind DPI/packet-inspection filters.
Patterns for deploying and running CEX trading bots (freqtrade, custom) in DPI-restricted environments — proxy configuration, exchange API access, WebSocket vs REST, and bot lifecycle.
| name | harvest-usage |
| description | Практическое использование Harvest для веб-скрейпинга: scrape, extract, crawl. Конкретные команды и примеры из жизни. |
| tags | ["harvest","scraping","web","extraction","russia"] |
Активировать: когда нужно собрать данные с веб-страницы.
Цель: Получить данные с сайта за 3 команды, без написания кода.
Веб-скрейпинг — это боль. Playwright тормозит, BeautifulSoup ломается на динамических страницах, anti-bot блокирует. Harvest решает все эти проблемы одной командой.
pip install harvest-agent
Проверь:
harvest --version
harvest scrape — Полное содержимое страницы# Просто текст (для чтения/анализа)
harvest scrape --mode full --output txt "https://example.com"
# С конкретными элементами
harvest scrape --selector ".price, .product-title" "https://example.com/pricing"
# JSON для программного использования
harvest scrape --mode economy --output json "https://example.com"
Режимы:
full — безопасно, весь контент (по умолчанию)economy — экономит токены, только основноеhybrid — оба вариантаauto — умное определениеФормат вывода:
txt — простой текст (для LLM)json — структурированные данныеmd — Markdowncsv — таблицаharvest extract — Извлечение конкретных полей# Извлечь цену, название и изображение
harvest extract --schema '{"price":".price", "title":"h1", "image":"img.product-photo"}' "https://example.com/product"
# Схема из файла
harvest extract --schema file://schema.json "https://example.com"
Возвращает JSON:
{
"price": "$99.99",
"title": "Product Name",
"image": "https://example.com/photo.jpg"
}
Если элемент не найден — null.
harvest crawl — Глубокий обход сайта# Базовый обход
harvest crawl https://example.com
# Со скриншотом
harvest crawl https://example.com --screenshot shot.png
# С vision-извлечением (через GPT-4V)
harvest crawl https://example.com --vision
# Гибридный режим
harvest crawl https://example.com --mode hybrid-vision
harvest batch — Пакетная обработка# Обработать список URL из файла
harvest batch urls.txt --output results.json
harvest compliance — Проверка robots.txtharvest compliance https://example.com
harvest compliance https://example.com --format json
harvest scrape --selector ".product-card__price" --output json "https://www.wildberries.ru/catalog/12345/detail.aspx"
harvest extract --schema '{"name":".product-title", "price":".price-current", "rating":".rating-value"}' "https://www.ozon.ru/product/12345/"
harvest scrape --selector ".tm-title__link" --output txt "https://habr.com/ru/news/"
harvest compliance https://api.example.com
--mode full --output txt для чтения контентаharvest compliance перед массовым скрейпингом--mode economy или другой селектор| Ошибка | Решение |
|---|---|
--css не работает | Используй --selector для scrape, --schema для extract |
| Пустой вывод | Попробуй другой CSS-селектор или --mode full |
| Anti-bot блокирует | Harvest уже имеет anti-bot, ноบาง sites могут блокировать |
| Нет JSON | Добавь --output json |
import asyncio
from harvest import Scraper
async def main():
scraper = Scraper()
result = await scraper.scrape("https://example.com", mode="full", output="txt")
print(result)
asyncio.run(main())
# Harvest работает как MCP-сервер
harvest mcp serve
Hermes автоматически подключит Harvest как инструмент.