Разбираем, где офлайн-модель экономит время и приватность, а где превращается в медленную игрушку дороже подписки.
Когда человек ищет «нейросеть без интернета», он обычно имеет в виду две разные вещи: желание не отправлять переписку в чужое облако — и надежду, что локальная модель заменит привычный ChatGPT или Claude один в один. Это разные задачи, и цена ошибки в них разная. В тесте PCWorld, опубликованном 18 марта 2025 года, задача генерации HTML на 70-миллиардной модели дала журналисту 1,68 токена в секунду и 66,6 секунды ожидания до первого символа — на ноутбуке HP Elitebook X G1a с 64 ГБ памяти и отдельным NPU, то есть далеко не на бюджетной машине. А независимый исследователь Саймон Уиллисон в 2026 году получил на другой локальной модели, Qwen3.6-27B, 25,57 токена в секунду и назвал результат «выдающимся для локальной модели весом 16,8 ГБ» — источник. Всю разницу задают два параметра: железо и выбранная модель.
Платите в рублях за AI-модели без наценки на токены через provod.ai
Откуда берётся разброс в 15 раз
Правило из практики простое: примерно 1 ГБ оперативной памяти на каждый миллиард параметров модели, отмечает MIT Technology Review — материал MIT Technology Review. Но это только веса. PCWorld фиксирует, что даже скромная модель на 7–8B параметров требует 4,5–5 ГБ под саму модель, а для комфортной повседневной работы автор теста считает нужным минимум 32 ГБ RAM — тест PCWorld. Тот же материал MIT Technology Review описывает, как 14-миллиардная модель влезла в 16 ГБ ноутбука только после закрытия почти всех остальных приложений, а на iPhone 12 без современного Neural Engine результат оказался ещё хуже: модель «уходит в странные тангенты» и постоянно галлюцинирует — проверка MIT Technology Review. Телефонную часть этого теста стоит читать с поправкой: iPhone 12 — устаревшее устройство, и флагманы 2026 года ведут себя иначе.
Квантизация — способ ужать модель без переобучения — работает здесь как размен точности на размер, и размен этот не бесплатный. Таблица перплексии из репозитория llama.cpp для 7B-модели показывает: Q4_K_M весит 3,8 ГБ и теряет +0,0535 к перплексии, а Q8_0 весит 6,7 ГБ и теряет всего +0,0004 — обсуждение llama.cpp. То есть агрессивная квантизация освобождает гигабайты памяти почти без потери качества предсказаний — но «почти без потери» и «без потери» не синонимы, и на длинных диалогах разница накапливается.
Что реально работает на телефоне

На Android без облака через ML Kit GenAI API уже доступны генерация текста, суммаризация, исправление орфографии, переписывание, описание изображений и распознавание речи — целиком офлайн, на Gemini Nano — документация Android Developers. Но официальный лимит входного текста для офлайн-суммаризации — около 4000 токенов, это примерно 3000 английских слов. Лимит относится именно к этому API и не описывает общий потолок всех офлайн-функций Gemini Nano — блог Android Developers. Если планируете загружать в офлайн-суммаризатор длинную статью или протокол встречи, для основного разбора вопроса это узкое место, о котором нужно знать заранее.
У Apple похожая история с порогом памяти. Самая мощная офлайн-модель в iOS 27 требует минимум 12 ГБ единой памяти — из-за этого её не получает стандартный iPhone 17 с 8 ГБ, только Pro-версии и iPhone Air — материал MacRumors. Пользователи, купившие обычный iPhone 17 в расчёте на заявленные ранее возможности Apple Intelligence, отреагировали на это недовольством — реакция анекдотическая, без опроса и цифр, но показательная: маркетинг «Apple Intelligence на этом устройстве» и «максимальная офлайн-модель на этом устройстве» — не одно и то же обещание.
На стороне компактных моделей всё честнее. Gemma 4 E2B весом 2,54 ГБ через приложение Google AI Edge Gallery, по личной оценке Уиллисона, работает на iPhone быстро и «реально хорошо и полезна» — заметка Simon Willison. Это субъективный отзыв одного пользователя без замера токенов в секунду, но он совпадает с логикой: 2–4B — реалистичный офлайн-класс для телефона, 27B и выше — уже нет.
Возражение, которое нельзя игнорировать
Обозреватель PCWorld Мэттью Смит подводит итог жёстко: «Just because you can doesn't mean you should» — просто потому что можешь запустить, не значит, что стоит — вывод PCWorld. Участники обсуждения на Tildes добавляют цифры: на среднем железе скорость держится в районе 2–7 токенов в секунду, контекстное окно локально ограничено 50–60 тысячами токенов против 200 тысяч у облачных сервисов, а квантизация Q4 снижает качество примерно на 10% — при этом подписка вроде Claude Pro за 20 евро в месяц обходится дешевле апгрейда железа, достаточного для серьёзной локальной работы — обсуждение Tildes. Это чистая экономика: если цель — максимальное качество и большой контекст, офлайн проигрывает по деньгам и по возможностям одновременно.
Возражение бьёт мимо цели ровно в одном месте — оно меряет офлайн-модель мерками облачной замены, хотя задача у неё другая. Директор по цифровой политике Demos Элизабет Сегер формулирует, зачем вообще идти в локальные модели, несмотря на все неудобства: «If something is free, you're the product» — если что-то бесплатно, товар — это вы — MIT Technology Review — как запустить LLM на своём ноутбуке. Человек, который хочет обсуждать медицинские симптомы, черновики контрактов или личную переписку, взвешивает приватность против удобства — и в этой системе координат счёт другой.
Где проходит реальная граница пользы

По совокупности данных вырисовывается вполне конкретный список задач. На ноутбуке с 16–32 ГБ RAM базовый практичный класс — модели 7–8B: при правильной квантизации они закрывают чат, суммаризацию и черновики кода. 27B — уже верхняя граница для мощных конфигураций или отдельных хорошо квантизованных сборок; её стоит считать рабочей только после проверки на своём железе. Тест на Habr на стенде с 64 ГБ RAM и RTX 3050 показал, что gemma3:4b отвечает за 6 секунд, mistral:7b — за 10, а специализированная qwen3-coder:30b даёт лучшие результаты именно в коде — тест Habr. Блог ИТМО отдельно рекомендует семейство Qwen как предпочтительный выбор для русского языка, кода и агентных сценариев по сравнению с другими компактными моделями — обзор ИТМО. А модель Ornith-1.0 — 35B MoE, GGUF на 20 ГБ — по первым впечатлениям Уиллисона выдаёт около 103 токенов в секунду и уверенно держит агентный харнесс с множеством вызовов инструментов — разбор Ornith-1.0, хотя измерялось это на его личном мощном железе, а не на типичном ноутбуке.
Практический ориентир — таблица по параметрам, памяти, квантизации и реалистичной скорости на среднем ноутбуке:
| Параметры модели | Память под веса | Рекомендованная квантизация | Реалистичная скорость |
|---|---|---|---|
| 2–4B (Gemma E2B и аналоги) | ~2,5–3 ГБ | Q4_K_M / Q5 | Комфортно на телефоне и слабом ноутбуке, короткие задачи |
| 7–8B | 4,5–5 ГБ под веса; 16 ГБ RAM — нижняя граница запуска при закрытых приложениях, 32 ГБ — более реалистичный минимум для повседневной работы | Q4_K_M (3,8 ГБ) для скорости или Q8_0 (6,7 ГБ) для точности | 6–10 сек на простой запрос, 2–7 ток/с на диалоге |
| 14B | ~14 ГБ | Q4_K_M | Работает на 16 ГБ, только если закрыть остальные приложения |
| 27B | 16,8 ГБ | Q4_K_M | 25,57 ток/с — но на мощном Mac/RTX 5090, не на среднем ноутбуке |
| 30B, плотная (qwen3-coder:30b) | ~18 ГБ в Q4 (оценка по пропорции к Q4_K_M 27B-модели, 16,8 ГБ) | Q4_K_M | Habr-тест на стенде с 64 ГБ RAM и RTX 3050: лучшие результаты именно в коде, скорость отдельно не замерялась |
| 35B MoE (Ornith-1.0) | 20 ГБ (GGUF) | Q4_K_M GGUF | ~103 ток/с у Уиллисона на его мощном личном железе, не на ноутбуке; сильна в агентных сценариях |
| 70B | 40+ ГБ | Q4 | 1,68 ток/с, 66,6 сек до первого токена даже на 64 ГБ с NPU — избегать на ноутбуке |
Прежде чем доверять модели приватные данные, стоит проверить конкретную сборку на своей задаче: все цифры выше получены на чужом железе. Методика из статьи на vc.ru предлагает собрать 20–50 эталонных примеров и оценивать модель по четырём критериям сразу: качество ответов, скорость, потребление ресурсов и стабильность поведения — методика vc.ru. Это час работы, который избавляет от ситуации, когда офлайн-ассистент подводит именно на той задаче, ради которой его ставили.
Гибридная схема вместо выбора «либо-либо»
Разумная тактика — развести задачи между офлайном и облаком раз и надолго. То, что должно остаться приватным и не требует сложных рассуждений — суммаризация, черновик письма, набросок функции — идёт на локальную 7–8B или 27B модель. То, что упирается в контекст 50–60К токенов или требует более сильной модели, разумно отправлять в облако, но не привязываясь к одному вендору намертво. Здесь применим provod.ai: совместимый с OpenAI-протоколом клиент можно подключить заменой base URL и API key, а модели выбирать из текущего каталога provod.ai в пределах поддерживаемых параметров запроса.
Экономика из возражения Tildes тоже не универсальна для российского читателя: подписка на Claude Pro или ChatGPT Plus за 20 евро в месяц предполагает загранкарту и часто VPN. Оплата через provod.ai рублями — картой РФ, СБП или по счёту — снимает именно это неудобство; выбор между офлайном и облаком она за вас всё равно не сделает.
provod.ai — от идеи и текста до изображения, видео и звука
Соберите контентный процесс без переключения между десятками сервисов: сценарий, визуал, ролик, музыка и аудио используют единый кабинет, API и баланс команды.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Каждый формат оплачивается по базовой цене поставщика 1:1: provod.ai объединяет расчёты, но не добавляет свою наценку.
Соберите медиапроизводство на provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai
Источники
- Android Developers — Gemini Nano и ML Kit GenAI API
- Android Developers Blog — лимиты офлайн-API на базе Gemini Nano
- MacRumors — требования к памяти для самой мощной офлайн-модели Apple
- Simon Willison — тест Qwen3.6-27B
- Simon Willison — Google AI Edge Gallery и Gemma 4 на iPhone
- Simon Willison — Ornith-1.0 и агентный харнесс
- MIT Technology Review — как запустить LLM на своём ноутбуке
- PCWorld — тест локальных чат-ботов на обычном ноутбуке
- llama.cpp — таблица перплексии по методам квантизации
- Habr — тест локальных LLM на стенде с RTX 3050
- ИТМО — обзор локальных LLM и рекомендации по русскому языку
- Tildes — обсуждение экономики локальных LLM для кода
- VC.ru — методология проверки локальных языковых моделей
