PaddleOCR — OCR-инструментарий для распознавания текста и структуры документов, включая PDF, изображения, многоязычный OCR и разбор документов для LLM-сценариев.
Open Source: #ocr
Проекты каталога, отмеченные тегом #ocr. Теги работают как отдельные посадочные страницы, чтобы похожие инструменты было проще находить и связывать между собой.
В подборке 6 проектов с суммарным рейтингом 350,725 звёзд на GitHub. Основные языки: Python, C++, JavaScript.
Репозитории
Tesseract OCR — движок распознавания текста на изображениях и сканах, поддерживающий множество языков и сценариев OCR.
MinerU — инструмент анализа документов, который превращает PDF и офисные файлы в Markdown/JSON для поиска, RAG и агентных сценариев.
Umi-OCR — бесплатное офлайн-приложение для распознавания текста на изображениях и PDF.
paperless-ngx — система управления документами: сканирование, OCR, индексация и архивирование файлов.
Tesseract.js — JavaScript-библиотека OCR для распознавания текста на изображениях в браузере и Node.js.