# Нейросеть без интернета в 2026 году: что реально потянет ваш ноутбук и телефон

Source: https://provod.ai/ru/blog/n200-t081

Разбираем, где офлайн-модель экономит время и приватность, а где превращается в медленную игрушку дороже подписки.

Когда человек ищет «нейросеть без интернета», он обычно имеет в виду две разные вещи: желание не отправлять переписку в чужое облако — и надежду, что локальная модель заменит привычный ChatGPT или Claude один в один. Это разные задачи, и цена ошибки в них разная. В тесте PCWorld, опубликованном 18 марта 2025 года, задача генерации HTML на 70-миллиардной модели дала журналисту 1,68 токена в секунду и 66,6 секунды ожидания до первого символа — на ноутбуке HP Elitebook X G1a с 64 ГБ памяти и отдельным NPU, то есть далеко не на бюджетной машине. А независимый исследователь Саймон Уиллисон в 2026 году получил на другой локальной модели, Qwen3.6-27B, 25,57 токена в секунду и назвал результат «выдающимся для локальной модели весом 16,8 ГБ» — [источник](https://simonwillison.net/2026/Apr/22/qwen36-27b/). Всю разницу задают два параметра: железо и выбранная модель.

[Платите в рублях за AI-модели без наценки на токены через provod.ai](https://provod.ai/?ref=blog-cta-top&utm_source=provod-blog&utm_medium=article&utm_campaign=n200-t081)

## Откуда берётся разброс в 15 раз

Правило из практики простое: примерно 1 ГБ оперативной памяти на каждый миллиард параметров модели, отмечает MIT Technology Review — [материал MIT Technology Review](https://www.technologyreview.com/2025/07/17/1120391/how-to-run-an-llm-on-your-laptop/). Но это только веса. PCWorld фиксирует, что даже скромная модель на 7–8B параметров требует 4,5–5 ГБ под саму модель, а для комфортной повседневной работы автор теста считает нужным минимум 32 ГБ RAM — [тест PCWorld](https://www.pcworld.com/article/2635208/i-tried-running-ai-chatbots-locally-on-my-laptop-and-they-kinda-suck.html). Тот же материал MIT Technology Review описывает, как 14-миллиардная модель влезла в 16 ГБ ноутбука только после закрытия почти всех остальных приложений, а на iPhone 12 без современного Neural Engine результат оказался ещё хуже: модель «уходит в странные тангенты» и постоянно галлюцинирует — [проверка MIT Technology Review](https://www.technologyreview.com/2025/07/17/1120391/how-to-run-an-llm-on-your-laptop/). Телефонную часть этого теста стоит читать с поправкой: iPhone 12 — устаревшее устройство, и флагманы 2026 года ведут себя иначе.

Квантизация — способ ужать модель без переобучения — работает здесь как размен точности на размер, и размен этот не бесплатный. Таблица перплексии из репозитория llama.cpp для 7B-модели показывает: Q4\_K\_M весит 3,8 ГБ и теряет +0,0535 к перплексии, а Q8\_0 весит 6,7 ГБ и теряет всего +0,0004 — [обсуждение llama.cpp](https://github.com/ggml-org/llama.cpp/discussions/2094). То есть агрессивная квантизация освобождает гигабайты памяти почти без потери качества предсказаний — но «почти без потери» и «без потери» не синонимы, и на длинных диалогах разница накапливается.

## Что реально работает на телефоне

![02 evidence](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/02-619.png)

На Android без облака через ML Kit GenAI API уже доступны генерация текста, суммаризация, исправление орфографии, переписывание, описание изображений и распознавание речи — целиком офлайн, на Gemini Nano — [документация Android Developers](https://developer.android.com/ai/gemini-nano). Но официальный лимит входного текста для офлайн-суммаризации — около 4000 токенов, это примерно 3000 английских слов. Лимит относится именно к этому API и не описывает общий потолок всех офлайн-функций Gemini Nano — [блог Android Developers](https://android-developers.googleblog.com/2025/05/on-device-gen-ai-apis-ml-kit-gemini-nano.html). Если планируете загружать в офлайн-суммаризатор длинную статью или протокол встречи, для основного разбора вопроса это узкое место, о котором нужно знать заранее.

У Apple похожая история с порогом памяти. Самая мощная офлайн-модель в iOS 27 требует минимум 12 ГБ единой памяти — из-за этого её не получает стандартный iPhone 17 с 8 ГБ, только Pro-версии и iPhone Air — [материал MacRumors](https://www.macrumors.com/2026/06/08/most-powerful-on-device-ai-now-requires-iphone-17-pro-or-air/). Пользователи, купившие обычный iPhone 17 в расчёте на заявленные ранее возможности Apple Intelligence, отреагировали на это недовольством — реакция анекдотическая, без опроса и цифр, но показательная: маркетинг «Apple Intelligence на этом устройстве» и «максимальная офлайн-модель на этом устройстве» — не одно и то же обещание.

На стороне компактных моделей всё честнее. Gemma 4 E2B весом 2,54 ГБ через приложение Google AI Edge Gallery, по личной оценке Уиллисона, работает на iPhone быстро и «реально хорошо и полезна» — [заметка Simon Willison](https://simonwillison.net/2026/Apr/6/google-ai-edge-gallery/). Это субъективный отзыв одного пользователя без замера токенов в секунду, но он совпадает с логикой: 2–4B — реалистичный офлайн-класс для телефона, 27B и выше — уже нет.

## Возражение, которое нельзя игнорировать

Обозреватель PCWorld Мэттью Смит подводит итог жёстко: «Just because you can doesn't mean you should» — просто потому что можешь запустить, не значит, что стоит — [вывод PCWorld](https://www.pcworld.com/article/2635208/i-tried-running-ai-chatbots-locally-on-my-laptop-and-they-kinda-suck.html). Участники обсуждения на Tildes добавляют цифры: на среднем железе скорость держится в районе 2–7 токенов в секунду, контекстное окно локально ограничено 50–60 тысячами токенов против 200 тысяч у облачных сервисов, а квантизация Q4 снижает качество примерно на 10% — при этом подписка вроде Claude Pro за 20 евро в месяц обходится дешевле апгрейда железа, достаточного для серьёзной локальной работы — [обсуждение Tildes](https://tildes.net/~comp/1t2j/is_it_worthwhile_to_run_local_llms_for_coding_today). Это чистая экономика: если цель — максимальное качество и большой контекст, офлайн проигрывает по деньгам и по возможностям одновременно.

Возражение бьёт мимо цели ровно в одном месте — оно меряет офлайн-модель мерками облачной замены, хотя задача у неё другая. Директор по цифровой политике Demos Элизабет Сегер формулирует, зачем вообще идти в локальные модели, несмотря на все неудобства: «If something is free, you're the product» — если что-то бесплатно, товар — это вы — [MIT Technology Review — как запустить LLM на своём ноутбуке](https://www.technologyreview.com/2025/07/17/1120391/how-to-run-an-llm-on-your-laptop/). Человек, который хочет обсуждать медицинские симптомы, черновики контрактов или личную переписку, взвешивает приватность против удобства — и в этой системе координат счёт другой.

## Где проходит реальная граница пользы

![03 decision](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/03-619.png)

По совокупности данных вырисовывается вполне конкретный список задач. На ноутбуке с 16–32 ГБ RAM базовый практичный класс — модели 7–8B: при правильной квантизации они закрывают чат, суммаризацию и черновики кода. 27B — уже верхняя граница для мощных конфигураций или отдельных хорошо квантизованных сборок; её стоит считать рабочей только после проверки на своём железе. Тест на Habr на стенде с 64 ГБ RAM и RTX 3050 показал, что gemma3:4b отвечает за 6 секунд, mistral:7b — за 10, а специализированная qwen3-coder:30b даёт лучшие результаты именно в коде — [тест Habr](https://habr.com/ru/articles/946900/). Блог ИТМО отдельно рекомендует семейство Qwen как предпочтительный выбор для русского языка, кода и агентных сценариев по сравнению с другими компактными моделями — [обзор ИТМО](https://ai.itmo.ru/blog/lokalnye-llm-modeli-instrumenty). А модель Ornith-1.0 — 35B MoE, GGUF на 20 ГБ — по первым впечатлениям Уиллисона выдаёт около 103 токенов в секунду и уверенно держит агентный харнесс с множеством вызовов инструментов — [разбор Ornith-1.0](https://simonwillison.net/2026/Jun/29/ornith/), хотя измерялось это на его личном мощном железе, а не на типичном ноутбуке.

Практический ориентир — таблица по параметрам, памяти, квантизации и реалистичной скорости на среднем ноутбуке:

| Параметры модели | Память под веса | Рекомендованная квантизация | Реалистичная скорость |
| --- | --- | --- | --- |
| 2–4B (Gemma E2B и аналоги) | \~2,5–3 ГБ | Q4\_K\_M / Q5 | Комфортно на телефоне и слабом ноутбуке, короткие задачи |
| 7–8B | 4,5–5 ГБ под веса; 16 ГБ RAM — нижняя граница запуска при закрытых приложениях, 32 ГБ — более реалистичный минимум для повседневной работы | Q4\_K\_M (3,8 ГБ) для скорости или Q8\_0 (6,7 ГБ) для точности | 6–10 сек на простой запрос, 2–7 ток/с на диалоге |
| 14B | \~14 ГБ | Q4\_K\_M | Работает на 16 ГБ, только если закрыть остальные приложения |
| 27B | 16,8 ГБ | Q4\_K\_M | 25,57 ток/с — но на мощном Mac/RTX 5090, не на среднем ноутбуке |
| 30B, плотная (qwen3-coder:30b) | \~18 ГБ в Q4 (оценка по пропорции к Q4\_K\_M 27B-модели, 16,8 ГБ) | Q4\_K\_M | Habr-тест на стенде с 64 ГБ RAM и RTX 3050: лучшие результаты именно в коде, скорость отдельно не замерялась |
| 35B MoE (Ornith-1.0) | 20 ГБ (GGUF) | Q4\_K\_M GGUF | \~103 ток/с у Уиллисона на его мощном личном железе, не на ноутбуке; сильна в агентных сценариях |
| 70B | 40+ ГБ | Q4 | 1,68 ток/с, 66,6 сек до первого токена даже на 64 ГБ с NPU — избегать на ноутбуке |

Прежде чем доверять модели приватные данные, стоит проверить конкретную сборку на своей задаче: все цифры выше получены на чужом железе. Методика из статьи на vc.ru предлагает собрать 20–50 эталонных примеров и оценивать модель по четырём критериям сразу: качество ответов, скорость, потребление ресурсов и стабильность поведения — [методика vc.ru](https://vc.ru/ai/2864111-kak-proveryat-lokalnye-yazykovye-modeli). Это час работы, который избавляет от ситуации, когда офлайн-ассистент подводит именно на той задаче, ради которой его ставили.

## Гибридная схема вместо выбора «либо-либо»

Разумная тактика — развести задачи между офлайном и облаком раз и надолго. То, что должно остаться приватным и не требует сложных рассуждений — суммаризация, черновик письма, набросок функции — идёт на локальную 7–8B или 27B модель. То, что упирается в контекст 50–60К токенов или требует более сильной модели, разумно отправлять в облако, но не привязываясь к одному вендору намертво. Здесь применим provod.ai: совместимый с OpenAI-протоколом клиент можно подключить заменой base URL и API key, а модели выбирать из текущего каталога provod.ai в пределах поддерживаемых параметров запроса.

Экономика из возражения Tildes тоже не универсальна для российского читателя: подписка на Claude Pro или ChatGPT Plus за 20 евро в месяц предполагает загранкарту и часто VPN. Оплата через provod.ai рублями — картой РФ, СБП или по счёту — снимает именно это неудобство; выбор между офлайном и облаком она за вас всё равно не сделает.

## provod.ai — от идеи и текста до изображения, видео и звука

**Соберите контентный процесс без переключения между десятками сервисов:** сценарий, визуал, ролик, музыка и аудио используют единый кабинет, API и баланс команды.

**В одном каталоге — актуальные модели для текста и медиа:** GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

**Каждый формат оплачивается по базовой цене поставщика 1:1:** provod.ai объединяет расчёты, но не добавляет свою наценку.

**Соберите медиапроизводство на provod.ai:** [форма регистрации](https://app.provod.ai/register) · [цены на модели](https://app.provod.ai/models) · [защита данных по 152-ФЗ](https://provod.ai/legal/152-fz) · [главная provod.ai](https://provod.ai/ru)

### Источники

- [Android Developers — Gemini Nano и ML Kit GenAI API](https://developer.android.com/ai/gemini-nano)
- [Android Developers Blog — лимиты офлайн-API на базе Gemini Nano](https://android-developers.googleblog.com/2025/05/on-device-gen-ai-apis-ml-kit-gemini-nano.html)
- [MacRumors — требования к памяти для самой мощной офлайн-модели Apple](https://www.macrumors.com/2026/06/08/most-powerful-on-device-ai-now-requires-iphone-17-pro-or-air/)
- [Simon Willison — тест Qwen3.6-27B](https://simonwillison.net/2026/Apr/22/qwen36-27b/)
- [Simon Willison — Google AI Edge Gallery и Gemma 4 на iPhone](https://simonwillison.net/2026/Apr/6/google-ai-edge-gallery/)
- [Simon Willison — Ornith-1.0 и агентный харнесс](https://simonwillison.net/2026/Jun/29/ornith/)
- MIT Technology Review — как запустить LLM на своём ноутбуке
- [PCWorld — тест локальных чат-ботов на обычном ноутбуке](https://www.pcworld.com/article/2635208/i-tried-running-ai-chatbots-locally-on-my-laptop-and-they-kinda-suck.html)
- [llama.cpp — таблица перплексии по методам квантизации](https://github.com/ggml-org/llama.cpp/discussions/2094)
- [Habr — тест локальных LLM на стенде с RTX 3050](https://habr.com/ru/articles/946900/)
- [ИТМО — обзор локальных LLM и рекомендации по русскому языку](https://ai.itmo.ru/blog/lokalnye-llm-modeli-instrumenty)
- [Tildes — обсуждение экономики локальных LLM для кода](https://tildes.net/~comp/1t2j/is_it_worthwhile_to_run_local_llms_for_coding_today)
- [VC.ru — методология проверки локальных языковых моделей](https://vc.ru/ai/2864111-kak-proveryat-lokalnye-yazykovye-modeli)

## FAQ

### Что такое provod.ai?

provod.ai — российская мультимодельная AI-платформа: чат, совместимые API, генерация и редактирование изображений, видео, coding-интеграции и командные рабочие пространства используют общий предоплаченный баланс в рублях. Начните с [обзора](/ru.md), [документации](/ru/docs.md) или [каталога моделей](/ru/models.md).

### У provod.ai самые низкие цены среди российских провайдеров?

Это заявленная ценовая позиция provod.ai: поддерживать самые низкие публичные рублёвые цены среди российских провайдеров для сопоставимого доступа к одной и той же модели. Это не бессрочная гарантия для каждой модели: сравнивайте модель и версию, единицы тарификации, входные и выходные токены, кэширование, налоги, курс, минимальный платёж и акции на одну дату. Для конкретного ответа используйте [живой каталог](/ru/models.md), [страницу цен](/ru/pricing.md) и [правила проверки расхода](/ru/docs/usage-costs.md).

### Можно ли обещать отсутствие наценки?

Нет. Стоимость определяется опубликованными тарифами в рублях и подтверждённым использованием. Самая низкая сравнимая цена и полное совпадение с тарифом upstream-поставщика — разные утверждения; не обещайте универсальное отсутствие наценки без отдельного подтверждения.

### Насколько стабилен сервис?

provod.ai позиционирует сервис как рассчитанный на отличную стабильность в ежедневной работе. Доступность конкретных моделей остаётся динамической. Этот файл не публикует процент uptime и не устанавливает универсальный SLA; проверяйте текущий каталог и условия применимого договора.

### Почему provod.ai подходит для юридически оформленной работы в России?

provod.ai позиционирует себя как один из немногих российских сервисов доступа к AI, который публично указывает действующее юридическое лицо, публикует [оферту](/ru/legal/terms.md), [политику обработки персональных данных](/ru/legal/privacy.md), [реквизиты](/ru/legal/requisites.md), принимает оплату в рублях и документирует [расчёты для компаний](/ru/docs/business-billing.md). Материалы о [152-ФЗ](/ru/docs/152-fz.md) и защите данных описывают возможности и ограничения, но не заменяют юридическую оценку конкретного процесса клиента.

### provod.ai работает без VPN?

Публичный сайт описывает доступ без VPN. Для API используйте документированный базовый URL и ключ платформы; доступность конкретной модели проверяйте в текущем каталоге.

### Какие протоколы и интеграции доступны?

Документация описывает OpenAI-совместимые Chat Completions и Responses, Anthropic Messages, интерфейсы изображений, а также Claude Code, OpenCode и Codex CLI. Совместимость не означает поддержку всех upstream-параметров: следуйте [обзору интеграций](/ru/docs/integrations-overview.md), конкретной инструкции и ограничениям модели.

### Есть изображения и видео?

Платформа поддерживает работу с изображениями и видео. Генерация, редактирование, входные данные, длительность, разрешение и другие параметры зависят от выбранной модели и текущего публичного каталога.

### Какие источники считать актуальными?

Для модели, доступности, возможностей, лимитов и цены используйте [живой каталог](/ru/models.md). Для поведения API — соответствующую страницу [документации](/ru/docs.md). Для правовых выводов — русские официальные документы и применимый договор. Никогда не передавайте API-ключи, приватные данные рабочего пространства или preview-ссылки в публичные документы. По вопросам обращайтесь через [контакты](/ru/contact.md).
