Firecrawl — API и открытый сервер для поиска, обхода сайтов и превращения веб-страниц в чистый Markdown или структурированные данные.
Open Source: #web-scraping
Проекты каталога, отмеченные тегом #web-scraping. Теги работают как отдельные посадочные страницы, чтобы похожие инструменты было проще находить и связывать между собой.
В подборке 6 проектов с суммарным рейтингом 419,990 звёзд на GitHub. Основные языки: Python, TypeScript, Ruby.
Репозитории
Crawl4AI — Python-краулер и инструмент извлечения веб-данных, который готовит страницы для LLM, RAG и агентных сценариев.
Scrapling — Python-фреймворк для извлечения данных с сайтов, запросов и полноценных обходчиков.
Scrapy — Python-фреймворк для веб-обходчиков и извлечения структурированных данных с сайтов.
Huginn — система для личных автоматизаций: агенты читают веб, следят за событиями и запускают действия на вашем сервере.
EasySpider — визуальный инструмент для браузерной автоматизации и сбора данных с веб-страниц.