ggml-org/llama.cpp
llama.cpp
llama.cpp запускает большие языковые модели локально: от командной строки до совместимого с OpenAI API сервера.
Проекты каталога, отмеченные тегом #inference. Теги работают как отдельные посадочные страницы, чтобы похожие инструменты было проще находить и связывать между собой.
В подборке 4 проектов с суммарным рейтингом 296,600 звёзд на GitHub. Основные языки: Python, C++.
llama.cpp запускает большие языковые модели локально: от командной строки до совместимого с OpenAI API сервера.
vLLM — высокопроизводительный движок для инференса и обслуживания LLM с API, совместимым с OpenAI, пакетной обработкой запросов и эффективным управлением памятью.
Llama — репозиторий Meta с кодом вывода для ранних моделей Llama и ссылками на современные репозитории семейства.