Crawl4AI — Python-краулер и инструмент извлечения веб-данных, который готовит страницы для LLM, RAG и агентных сценариев.
Open Source: #data-extraction
Проекты каталога, отмеченные тегом #data-extraction. Теги работают как отдельные посадочные страницы, чтобы похожие инструменты было проще находить и связывать между собой.
В подборке 5 проектов с суммарным рейтингом 295,770 звёзд на GitHub. Основные языки: Python.
Репозитории
Найдено: 5
unclecode/crawl4ai
Crawl4AI
D4Vinci/Scrapling
Scrapling
Scrapling — Python-фреймворк для извлечения данных с сайтов, запросов и полноценных обходчиков.
scrapy/scrapy
Scrapy
Scrapy — Python-фреймворк для веб-обходчиков и извлечения структурированных данных с сайтов.
docling-project/docling
Docling
Docling — Python-инструмент для преобразования документов в структурированные данные для поиска и ИИ-систем.
google/langextract
LangExtract
LangExtract — Python-библиотека Google для извлечения структурированных данных из неструктурированного текста.