Как поставить приватный чат с ИИ дома, выбрать нужное квантование модели и не оказаться в чужой статистике незащищённых серверов
В сентябре 2025 года исследователи Cisco Talos за десять минут сканирования Shodan нашли 1139 публично доступных серверов Ollama — из них 214, то есть примерно каждый пятый, отвечали на запросы моделей вообще без какой-либо аутентификации. Cisco Talos назвала это «значительным числом организаций и частных лиц», которые выставляют инфраструктуру LLM в интернет, часто не осознавая последствий. Спустя четыре месяца, в январе 2026-го, SentinelLABS и Censys насчитали уже около 175 000 таких серверов в 130 странах — и почти у половины из них включён tool-calling, то есть модель может не просто отвечать текстом, а вызывать внешние инструменты. Об этом со ссылкой на SentinelOne, Censys и Pillar Security сообщил The Hacker News. Разрыв между этими двумя снимками — не статистическая погрешность, а смена масштаба на два порядка меньше чем за полгода. Домашний Ollama webui решает именно ту задачу, ради которой вы читаете этот текст: приватный чат с моделью в браузере. Но решает её честно только при одном условии — если вы управляете доступом сами, а не полагаетесь на настройки по умолчанию.
Плюс в том, что сама установка тривиальна. Ollama ставится одной командой (curl -fsSL https://ollama.com/install.sh | sh на Linux) или установщиком с сайта, это описано прямо в официальном quickstart. Open WebUI — 146,8 тысячи звёзд на GitHub — поднимается через pip install open-webui && open-webui serve либо одним Docker-контейнером с примонтированным томом -v open-webui:/app/backend/data, чтобы история диалогов не терялась при перезапуске. Это прямо указано в README проекта. За вечер вы действительно получаете браузерный интерфейс, похожий на ChatGPT, но работающий на вашем железе.
Платите в рублях за AI-модели без наценки на токены через provod.ai
Почему по умолчанию всё безопасно — и почему это ловушка
По умолчанию Ollama слушает только localhost:11434 и не требует авторизации для локальных запросов — API-ключ там нужен исключительно для облачных функций и публикации в реестр ollama.com. Это официальная позиция команды, закреплённая в документации: «No authentication is required when accessing Ollama's API locally». Ломается всё на следующем шаге — когда доступ решают расширить. Стоит выставить переменную OLLAMA_HOST=0.0.0.0, чтобы дотянуться до сервера с телефона в своей же Wi-Fi сети — и если на роутере при этом включён проброс порта наружу (в том числе автоматически, через UPnP), тот же порт 11434 становится виден всему интернету, без пароля и без предупреждения от самой Ollama.
Запрос на встроенную базовую аутентификацию висит в трекере проекта с 9 ноября 2023 года — issue #1053 — и до сих пор открыт без обязательства команды его реализовать. Участники обсуждения, включая пользователя sebiweise, годами указывают, что полагаться на внешний реверс-прокси неудобно для человека без опыта сетевого администрирования. Формально они правы, и вывод отсюда неприятный: патча ждать не стоит, закрывать доступ придётся собственной дисциплиной.
Какую модель и квантование ставить: таблица под ваше железо

Здесь развилка попроще — она измеряется в гигабайтах VRAM. Независимый гайд Local AI Master даёт грубое, но рабочее правило: 8 ГБ VRAM тянут модели около 7B параметров, 16 ГБ — 13–14B, от 24 ГБ — уже 32B. Наложим его на точные размеры дистиллированных версий DeepSeek-R1 из карточки модели на ollama.com. Под этими тегами лежат отдельные dense-модели на архитектуре Qwen/Llama, дообученные на данных рассуждений от полной 671B-версии; урезанной копией флагмана они не являются:
| Ваше железо | Ориентир по параметрам | Тег и вес модели | Квантование по умолчанию | Чего ждать по скорости |
|---|---|---|---|---|
| Нет GPU, только CPU | ~1.5B | deepseek-r1:1.5b, 1,1 ГБ | Q4_K_M | Самый медленный режим: всё считает процессор, текст появляется ощутимо медленнее, чем в облачном чате |
| 8 ГБ VRAM | ~7B | deepseek-r1:7b, 4,7 ГБ | Q4_K_M | 4,7 ГБ в 8 ГБ видеопамяти — модель помещается целиком, с запасом под контекст; темп комфортный для диалога |
| 16 ГБ VRAM | 13–14B | deepseek-r1:14b, 9,0 ГБ | Q4_K_M | 9,0 ГБ в 16 ГБ — тоже целиком в VRAM; длинный контекст ест остаток, но модель из видеопамяти не выталкивает |
| 24 ГБ VRAM и выше | 32B | deepseek-r1:32b, 20 ГБ | Q4_K_M, либо Q8_0 при вдвое большем весе | 20 ГБ в 24 ГБ — впритык: на длинном диалоге часть слоёв может уехать в обычную RAM, и скорость просядет до процессорной |
Точных цифр в токенах в секунду в таблице намеренно нет. Доступные независимые замеры сделаны на разных моделях, разных версиях Ollama и разной длине контекста, так что свести их в один столбец — значит выдать разброз чужих блогов за бенчмарк. Практический ориентир проще и надёжнее: скорость упирается в то, помещается ли выбранный вес целиком в видеопамять вместе с контекстом. Помещается — отвечает быстро; не помещается — начинается своп в RAM, и разница чувствуется сразу.
Q4_K_M действительно разумный дефолт по объёму — но называть его «золотым стандартом без потерь» некорректно. Замеры perplexity показывают, что Q4_K_M даёт отклонение от FP16 около +0,0532, тогда как Q8_0 почти не отходит от базовой точности — разница порядка +0,0004. Разрыв между Q4 и Q8 количественно более чем в сто раз больше, чем между Q8 и FP16. Сами абсолютные числа малы, и их ощутимость в живом диалоге — вопрос спорный: методология теста не раскрывает, на какой именно модели и датасете считали perplexity. Если вам важна точность рассуждений больше, чем место на диске, Q8_0 — осознанный компромисс в другую сторону: вдвое больше гигабайт за почти нетронутую точность.
Если 32B на 24 ГБ упирается в потолок качества, а поднимать 70B (43 ГБ) или тем более 671B (404 ГБ, требует мультисерверной GPU-конфигурации) физически негде — Open WebUI это не ограничивает: интерфейс умеет работать не только с локальным Ollama, но и с любым OpenAI-совместимым API, для которого достаточно поменять base URL и ключ. Тот же provod.ai даёт одну такую точку входа к каталогу облачных моделей, доступных через платформу — можно быстро свериться, действительно ли квантованная локальная версия теряет в качестве на ваших задачах, прежде чем мириться с этим компромиссом навсегда.
Сильный контраргумент: Ollama и не обещала защиту

Разработчики Ollama последовательны: сервер сознательно не встраивает аутентификацию, а для удалённого доступа рекомендуют VPN — Tailscale или WireGuard — вместо API-ключей. С их точки зрения открытый порт — не дефект продукта, а следствие того, что пользователь сам открыл 0.0.0.0 наружу без файрвола. Инженер Rost Glukhov формулирует ту же логику практически: «Keep the Ollama API private by default... enforce that policy twice» — то есть закрывать доступ и на уровне VPN-идентичности, и дублирующим правилом файрвола на хосте. Полная рекомендация — в его разборе удалённого доступа к Ollama. Для чисто домашней сети без проброса портов на роутере риск, о котором говорят Cisco и SentinelOne, действительно не реализуется — открытая наружу Ollama и локальная Ollama в вашей Wi-Fi это два разных состояния.
Но у этого возражения есть предел. Pillar Security задокументировала действующую операцию под условным названием Operation Bizarre Bazaar: злоумышленник систематически сканирует интернет на открытые инстансы Ollama, проверяет их работоспособность и перепродаёт доступ через маркетплейс LLMjacking-шлюзов. Об этом также сообщает The Hacker News со ссылкой на исследование Pillar Security. Если такой доступ скомпрометирован, злоумышленник может перечислить и скачать установленные модели, подменить их на модифицированные версии и потреблять ваши GPU-ресурсы незаметно — это отдельно описано в разделе Risk Assessment у Cisco Talos. И вот здесь стоит быть аккуратным в выводах: разбивки по причинам, из-за которых 175 000 хостов оказались снаружи, ни один из доступных отчётов не даёт — ни Cisco Talos, ни пересказ данных SentinelLABS и Censys не разбирают механику каждого случая. Но сама величина выборки — довод против объяснения «каждый сам открыл»: предположить 175 000 отдельных осознанных решений пробросить порт трудно. Позиция «это не моя вина, раз я не пробрасывал порт» работает только если вы точно знаете, что не пробрасывали — а на практике это редко проверяется до инцидента.
Чек-лист доступа с телефона, который не превращает вас в статистику
- По умолчанию —
OLLAMA_HOST=127.0.0.1, доступ только с самого компьютера. - Для телефона в той же домашней Wi-Fi — можно поднять
0.0.0.0, но обязательно ограничить его правилом файрвола хоста по локальной подсети, а не полагаться на «роутер и так закрыт». - Для доступа вне дома — никогда не пробрасывать порт 11434 на роутере. Ставить Tailscale или WireGuard и подключаться через VPN-туннель, как советуют и сами разработчики Ollama, и независимые практики.
- Раз в несколько месяцев проверять через
netstat/настройки роутера, не появился ли случайный проброс — особенно после обновления прошивки роутера или переустановки Docker.
Если вся эта конструкция ради разового вечернего чата с ИИ кажется избыточной — это тоже валидный вывод. Для тех, кто не готов держать в голове файрвол и VPN ради браузерного чата, у provod.ai есть готовый веб-интерфейс с доступом к нескольким моделям через один личный аккаунт и оплатой в рублях с закрывающими документами для бизнеса — альтернативная ветка того же решения, без локального сервера, который нужно защищать самостоятельно.
provod.ai — прозрачная стоимость рабочего AI-продукта
Считайте расходы по фактическим запросам и выбранным моделям: единый баланс помогает видеть общую экономику продукта без счетов из нескольких иностранных кабинетов.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
База расчёта не меняется по дороге в production: официальный тариф применяется 1:1, без собственной наценки provod.ai.
Рассчитайте экономику своего сценария: форма регистрации · цены на модели · защита данных по 152-ФЗ · реквизиты для договора
Источники
- Cisco Talos — Detecting Exposed LLM Servers: A Shodan Case Study on Ollama
- The Hacker News — Researchers Find 175,000 Publicly Exposed Ollama AI Servers Across 130 Countries
- Ollama — Quickstart, официальная документация по установке
- Ollama — Authentication, официальная документация
- Ollama — карточка модели deepseek-r1 с таблицей тегов и размеров
- GitHub — open-webui/open-webui, README проекта
- Local AI Master — Ollama VRAM Requirements 2026
- Kunal Ganglani — LLM Quantization Levels Compared: Q4 vs Q8 vs FP16
- GitHub — issue #1053, запрос на базовую аутентификацию в Ollama
- Rost Glukhov — Remote Ollama access via Tailscale or WireGuard, no public ports
