Разбираем цифры, а не маркетинг: какая локальная модель для программирования и какое железо на 16–32 ГБ закрывают автодополнение и рефакторинг, а где заканчивается терпение ревьюера.
Два числа, которые стоит держать рядом. Официальный Aider-скор Qwen2.5-Coder-32B от самого Qwen — 73,7% на задачах code editing, заявлено в техническом отчёте. Независимый прогон той же модели на том же бенчмарке дал 72,9% — а Claude 3.5 Sonnet рядом показал 84,2%, пишет автор failingfast.io. Разница между вендорской и сторонней цифрой для одной модели небольшая, зато разрыв до текущего облачного лидера — стабильные 10+ процентных пунктов. Это не «локальные модели плохие», это конкретная граница, за которой начинается ручной ревью.
За последний год граница честной применимости сдвинулась благодаря архитектуре, а не грубому росту параметров. MoE-модели активируют не всю сеть, а малую её часть на каждый токен: DeepSeek-Coder-V2-Lite-Instruct — 16 млрд параметров всего, но активных на инференсе только 2,4 млрд, указано в карточке модели. Qwen3-Coder-30B-A3B держит похожую пропорцию — 30,5 млрд общих против 3,3 млрд активных при контексте 256K, расширяемом до 1M, сообщает карточка квантованной сборки Unsloth. Devstral Small 2 идёт другим путём — плотные 24B параметров, но лицензия Apache 2.0 и заявленная работа на одной потребительской GPU или вовсе без выделенной видеокарты, указано в релизе Mistral. Именно эта комбинация — редкие активации у MoE и компактность у Devstral — впервые делает 16–32 ГБ рабочим диапазоном для реального проекта, а не для демо.
Подключите модели для разработки с оплатой в рублях на provod.ai
Таблица по тирам
Ориентир по VRAM для квантованных моделей: 7B требует около 5 ГБ, 14B — около 9 ГБ, 32B — около 20 ГБ, указывает практический разбор на failingfast.io — цифры без явного указания уровня квантования и контекстного окна, так что на длинных диалогах реальный расход памяти будет выше.
| Тир | Модель, квант | Уверенно тянет | Нужен ручной ревью |
|---|---|---|---|
| 16 ГБ | DeepSeek-Coder-V2-Lite-Instruct, Q4 GGUF | автодополнение, объяснение репозитория, простые unit-тесты | многофайловый рефакторинг, изменение архитектуры |
| 24 ГБ | Qwen3-Coder-30B-A3B, Q4 GGUF | генерация тестов по существующим паттернам, чат по всей кодовой базе (контекст до 256K) | сложные кросс-модульные diff, миграции API |
| 24 ГБ (альтернатива) | Devstral Small 2, 24B, Apache 2.0 | агентные правки одного-двух файлов, работа без выделенной GPU | рефакторинг, требующий контекста всего репозитория |
| 32 ГБ | Qwen2.5-Coder-32B-Instruct, Q4/Q5 GGUF | code editing на уровне 73–74% Aider, точечные правки, объяснение | архитектурные решения — Sonnet выше на 10+ п.п. |
Практическая связка для любого тира одна и та же: Ollama или llama.cpp плюс расширение Continue.dev в VS Code, две модели на разные задачи — например, qwen2.5-coder:1.5b для автодополнения и qwen2.5-coder:7b для чата, настройка через config.json, шаги описаны в гайде SitePoint. Автор гайда честно не приводит собственных замеров качества ответов — установка проверяема, польза от неё для конкретного репозитория нет.
Бен Холл, основатель Katacoda и автор failingfast.io, после практических тестов на своём железе даёт совет тем, кто не хочет разбираться в вариантах: «If you just want to have something chosen for you and get started, use Qwen as your default coding assistant» — и в том же материале отмечает, что модель проваливается именно на многофайловых архитектурных задачах, комментарий на failingfast.io. Это совпадает с таблицей выше: Qwen2.5-Coder закрывает 32-гигабайтный тир для правок, но не для архитектуры.
Возражение, которое чаще всего игнорируют

Самый частый аргумент за локальный запуск звучит так: код не покидает периметр, значит, комплаенс закрыт. Это неверно как минимум наполовину. По данным отчёта Cyberhaven Labs, число endpoint-агентов для кодинга выросло на 509% за 2025 год, а доля разработчиков, использующих AI-ассистентов, достигла 49,5% к декабрю 2025, пишет Cyberhaven — это цифры вендора DLP-решений, заинтересованного в продаже продукта против описываемого риска, но масштаб проблемы они называют верно. Локальный запуск снимает один вектор — передачу кода стороннему API. Он не снимает доступ агента к shell, credentials и файловой системе, prompt injection через содержимое репозитория и supply-chain риски плагинов и MCP-серверов.
Саймон Уиллисон формулирует это резче: «I think we're due a Challenger disaster with respect to coding agent security» — имея в виду, что кодинг-агенты, включая локальные, массово работают с избыточным доступом к системе без контроля, пост на simonwillison.net. nolabs.ai формулирует нейтральнее: локальные модели не более и не менее безопасны по умолчанию, у них другой профиль риска — снимается передача данных наружу, но вся ответственность за патчинг инфраструктуры и защиту от jailbreak меньших моделей ложится на организацию, источник: nolabs.ai, и это признанно концептуальный разбор без собственных эмпирических тестов.
Практический вывод из этого спора не «не используйте локальные агенты», а «настройте права отдельно от вопроса, где физически лежат веса»: ограничьте доступ агента к shell до конкретных команд, держите MCP-серверы и плагины из проверенных источников, не давайте агенту доступ к credentials, которые не нужны для текущей задачи, и обновляйте модель и инструменты по расписанию, а не по факту инцидента.
Не всякий запрет облака одинаков

Формулировка «облако запрещено» на практике редко бывает тотальной. BNY Mellon заблокировал доступ к публичным LLM целиком, объяснив это фидуциарными требованиями к обработке данных, кейс приводит moveo.ai. Samsung после трёх инцидентов за 20 дней в марте 2023 года, включая загрузку исходного кода в ChatGPT, ввела похожий полный запрет и развернула внутреннее защищённое окружение — прецедент старый, но показательный, по данным того же обзора moveo.ai. А вот Демократический национальный комитет в апреле 2026 года запретил конкретно ChatGPT и Claude из-за вопросов происхождения модели, но разрешил Gemini для кода и анализа данных — запрет оказался списком исключений по вендору, а не универсальным правилом, этот же список moveo.ai.
Сооснователь Mistral Тимоти Лакруа на презентации Vibe 2.0 предлагает вообще сместить рамку: «The fact that it's on-prem, I think, is less relevant than the fact that it's owned by the company», цитата в VentureBeat — то есть важнее не физическое расположение инференса, а контроль над тем, куда уходят веса и данные. Это позиция вендора, продающего в том числе облачный API той же модели, поэтому воспринимать её как нейтральную не стоит — но для читателя она полезна практически: если ваш запрет на самом деле вендороспецифичен, а не тотален, стоит явно проверить у комплаенс-команды список разрешённых исключений, а не считать по умолчанию, что любое облако закрыто.
Если у вас именно такой частичный запрет — часть репозиториев под жёстким локальным контуром, часть допускает разрешённый облачный вендор для сравнения качества, — разумно не переписывать интеграцию клиента под каждый новый вендор вручную. provod.ai даёт совместимый с OpenAI протокол доступ к каталогу моделей одним ключом: тот же Continue.dev, который вы настроили на localhost для чувствительного контура, для разрешённой облачной части достаточно переключить на другой base URL без переписывания клиента заново.
Флагман серии — Qwen3-Coder-480B-A35B с 35 млрд активных параметров из 480 млрд, заявленный разработчиком как сопоставимый с Claude Sonnet 4 на агентных задачах, блог Qwen — хорошо иллюстрирует, что верхняя граница качества серии живёт далеко за пределами бюджета 16–32 ГБ. Для этого диапазона работают младшие MoE-варианты из таблицы выше, и решение о том, где заканчивается автономность локальной модели для программирования и начинается обязательный ревью человека, стоит принимать по конкретной задаче, а не по общему ощущению «локально — значит хуже».
provod.ai — единый API для AI-агентов, MCP и автоматизации
Подключайте агентов, MCP-клиенты, CLI-инструменты и AI IDE к одной точке: модель можно менять под этап сценария, не собирая заново интеграцию и биллинг для каждого поставщика.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Тариф каждой модели передаётся без посреднической наценки: цена в provod.ai равна официальной цене провайдера 1:1, а все агенты расходуют общий рублёвый баланс.
Запустите своего агента через provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции
Источники
- Qwen2.5-Coder Technical Report, arXiv
- Local AI Models for Coding: Is It Realistic in 2026? — failingfast.io
- Introducing: Devstral 2 and Mistral Vibe CLI — Mistral AI
- Карточка модели Qwen3-Coder-30B-A3B-Instruct-GGUF — Unsloth AI на Hugging Face
- Model card DeepSeek-Coder-V2-Lite-Instruct — Hugging Face
- Complete VS Code + Ollama + Continue Setup — SitePoint
- What Is a Local Coding Agent? Security Risks Guide — Cyberhaven Labs
- LLM predictions for 2026 — Simon Willison
- Local Language Models and Security — nolabs.ai
- Companies Banning ChatGPT (2026): The Enterprise Security List — Moveo.AI
- A European AI challenger goes after GitHub Copilot: Mistral launches Vibe 2.0 — VentureBeat
- Qwen3-Coder: Agentic Coding in the World — Alibaba Qwen Team
