Никита Орлов

СтатьяГайд

ТОП-5 фреймворков на Python для локальных LLM: личный опыт из репы

ТОП-5 фреймворков на Python для локальных LLM: личный опыт из репы

Как я выбирал фреймворки для локальных моделей python

Привет! У меня в репе скопилось уже столько конфигов под локальные модели, что пора писать автотест на проверку совместимости библиотек. Вчера агент опять затёр рабочий тест для RAG, и я решил сесть и нормально зафиксировать, что вообще стоит ставить, если надо запустить LLM локально в Питоне.

Запрос на фреймворки для локальных моделей python сейчас дикий, но по факту половина тулзовин тащит за собой такой оверхед из зависимостей, что проще написать обертку на чистом requests. Давайте разберем пять инструментов, которые я реально крутил на своем железе, без маркетинговой шелухи.

Как я выбирал фреймворки для локальных моделей python
python code on dark theme IDE

1. Ollama и Python API: минимум боли

Начну с того, на чем сейчас крутится 90 процентов моих локальных задач. Сама Оллама написана на Go, но официальный Python-клиент работает как часы. Никаких танцев с компиляцией llama.cpp под конкретную архитектуру процессора — скачал бинарник, поднял демон, дергаешь из скрипта.

Кому да: тем, кто хочет запустить квантованные веса за две минуты и забыть про проблемы с зависимостями. Кому нет: если вам нужен глубокий кастом внутренних слоев модели и специфические токенайзеры.

2. LlamaIndex: для тех, кто строит RAG

Когда мне нужно быстро прикрутить поиск по локальной базе документов, я открываю LlamaIndex. У них отличная интеграция с локальными эмбеддингами и Ollama. Библиотека выросла из простых поисковиков, но сейчас это комбайн.

Кому да: если вы пишите умный поиск, чат-ботов по документации или агентские системы с индексацией файлов. Кому нет: для простых одноразовых запросов к модели это избыточный оверхед с кучей абстракций.

3. LangChain: классика с большой кодовой базой

Про Лангчейн не ругался только ленивый. У меня в репе он то появляется, то улетает в игнор из-за частых breaking changes в минорных версиях. Но экосистема у них огромная — подтянуть локальную модель через ChatOllama или HuggingFacePipeline можно одной строчкой.

Кому да: разработчикам, которым нужны готовые цепочки (chains), память диалогов и интеграция со всеми возможными векторными базами данных. Кому нет: если вы не готовы переписывать код при обновлении мажорной версии.

4. Llama.cpp Python bindings: для полного контроля

Иногда стандартных оберток не хватает, и нужно работать с GGUF-файлами напрямую из кода на Python. Тут на помощь приходит llama-cpp-python. При правильной сборке с поддержкой Metal на macOS или CUDA на линуксе работает шустро.

Кому да: тем, кто хочет выжать максимум производительности из локального железа и сам управляет контекстом. Кому нет: если при словах «соберите проект из исходников» у вас начинается нервный тик.

5. Hugging Face Transformers + Accelerate

Классика жанра, с которой всё и начиналось. Запуск llm локально python библиотеки от Hugging Face — это стандарт индустрии, но на обычном десктопе без шаманства с bitsandbytes модели вроде Llama-3 могут просто не влезть в память.

Кому да: исследователям, ML-инженерам и тем, кто тестирует оригинальные веса без квантования. Кому нет: обычным бэкендерам, которым нужно просто поднять локальный эндпоинт для автодополнения кода.

Итог: что ставить в проект прямо сейчас

Если коротко резюмировать мои мучения с этими библиотеками: для 80% задач хватает связки Ollama + LlamaIndex. Если пилите сложного агента со своими промптами и кучей памяти — смотрите в сторону LangChain, но будьте готовы к боли при обновлениях.

Делитесь в комментариях, какой у вас стек для локальных моделей и что из этого списка уже пробовали ставить.

0
1

Комментарии (0)

Войдите, чтобы комментировать.

Без Plus — 5 комментариев в месяц. Мало слов — чистый воздух. Войти

Комментариев пока нет — будьте первым.

Ещё в теме «Код и разработка»

Похожие материалы и соседние разборы

Никита Орлов

Как не упереться в лимит запросов в Claude Code и что делать Короче, если вы уже крутите Claude Code в терминале, то наверняка видели эту злую ошибку про rate limit. Сидишь такой, дебажишь сложный баг, агент бодро пишет код, рефакторит тесты — и тут бац: «Rate limit reached». Всё, приплыли, кукушка говорит «ждите час» или сколько там до сброса. У меня такое происходит регулярно, если дать агенту волю. Раньше я просто пускал его в проект и говорил: «Почини всё». Это главная ошибка. Claude начинает читать вообще всю репу, тащит в контекст гигабайты логов и node_modules, если они не заигнорены, и сжирает месячный лимит токенов за полчаса активной работы. Давайте разберем, как я теперь экономлю запросы и выживаю без нервных срывов. Почему улетает claude code rate limit и как с этим жить Основная проблема — контекст. Агенты устроены так, что с

Как не упереться в лимит запросов в Claude Code и что делатьПоказать полностью
0
1
Никита Орлов

Какие фреймворки для разработки AI-агентов использовать в 2024 году Привет! У меня тут на днях агент в очередной раз улетел в бесконечный цикл, сжег кучу токенов на OpenAI и затер локальную базу тестов. Классика для ночной смены. Если вы тоже устали от красивых демок на Streamlit, которые сыпятся на первом же нестандартном ответе модели, давайте смотреть на фреймворки для AI агентов с точки зрения инженера. Мне важен не столько красивый синтаксис графов, сколько стабильность под нагрузкой, нормальный async, человеческий логгинг и понимание, куда делся стейт, когда упал воркер. Короче, собрал пятерку инструментов, которые я сам крутил в продакшене, и готов выдать честное сравнение. LangGraph: когда нужен жесткий контроль стейта LangGraph от создателей LangChain — это первое, куда я смотрю, когда логика агента перестает помещаться в один

Фреймворки для AI агентов в продакшене: топ 5 инструментовПоказать полностью
0
1
Никита Орлов

Почему Claude Code падает с ошибкой rate limit в терминале У меня вчера на середине рефакторинга отвалилась утилита. Сижу, правлю большой модуль, жду фидбек от агента, а в терминале прилетает классика: anthropic api rate limit. Процесс обрывается, контекст теряется, настроение так себе. Сама по себе тулза удобная — гоняешь её прямо из репы, она сама шарится по файлам, запускает тесты. Но у неё есть особенность: если репозиторий огромный или в промпт улетает слишком много лишнего кода, лимиты токенов вылетают мгновенно. Anthropic бьет по рукам за превышение RPM и RPD (requests per minute / day), особенно если тариф базовый. Как понять, что это именно claude code rate limit error Ошибки бывают разные. Иногда тулза просто зависает на этапе генерации дифа, иногда выкидывает JSON с кодом 429. Если вы видите в логах упоминание «Too Many Requests»

Claude Code падает с ошибкой rate limit: как чинить в репеПоказать полностью
0
1
Никита Орлов

Зачем вообще запускать локальные модели для кода У меня в репе лежат приватные ключи, проприетарные алгоритмы и куча legacy, которую стыдно показывать даже коллегам, не то что облачным провайдерам. Вчера очередной агент попытался слить кусок контекста наружу, и я психанул. Решил, что хватит кормить чужие датасеты своими энтерпрайз-костылями. Поставил Ollama, выделил под это дело локальную тачку с нормальной видюхой и начал тестировать лучшие модели для кода локально. Главный критерий простой: чтобы она не тупила на автодополнении в Cursor или VS Code и выдавала рабочий синтаксис с первой попытки, а не генерировала синтаксический мусор. Ниже — мой личный топ-5 локальных нейросетей для программирования, которые я потрогал руками, покрутил в разных сценариях и отобрал для повседневной разработки. 1. DeepSeek-Coder-V2: тяжёлая артиллерия для

Какие локальные LLM для написания кода запустить: топ-5 моделейПоказать полностью
0
0
Никита Орлов

Какие формулировки чаще всего ломают ответ модели по коду? Всем привет. У меня в репе опять веселье: вчера агент погнал какую-то дичь и затёр рабочий тест, потому что я поленился нормально описать задачу. И сразу в чате спросили про топ 5 ошибок при промптах для кода. Короче, давайте без воды и копирайтерского бреда разберем, от каких фраз модели начинают генерировать нерабочий мусор. Когда мы пишем задачу ассистенту на бегу, в стиле «почини там всё, чтобы работало», мы получаем ровно то же самое на выходе. Модель не умещает в голове контекст всего проекта, если мы ей его не скормили. Ниже собрал пять главных грабель, на которые наступал сам и вижу у других в коммитах. Первая ошибка: «сделай красиво и по стандарту» Первый пункт в нашем топе 5 ошибок при промптах для кода — это абстрактные требования вроде «перепиши красиво», «оптимизируй» или

Топ 5 ошибок при промптах для кода: почему модель ломает репуПоказать полностью
0
1
Никита Орлов

Зачем перебирать библиотеки для логирования python Привет! У меня в репе опять разрослось приложение, и стандартный print или basicConfig уже не вывозят. Когда на проде случается деплой с багом, читать консоль через docker logs на виртуалке — это путь к нервному срыву. Я задолбался искать, куда складывать логи python приложения, чтобы они не терялись при рестарте контейнера. Поэтому перетряхнул то, чем сам пользуюсь или тестировал в боевых условиях. Никакого энтерпрайза с ценником в крыло самолета, только то, что можно поднять за вечер. 1. Loguru: кому да, кому нет Начну с базы. Loguru — это любовь с первой строчки в мануале. Заменяет стандартный logging одной строчкой from loguru import logger и избавляет от боли с настройкой форматтеров и хендлеров. У меня она стоит на всех пет-проектах и в паре микросервисов. Красивый вывод в консоль из

Инструменты для мониторинга логов python топ 5: мой личный выборПоказать полностью
0
1