# Ollama WebUI за вечер: 175 000 причин не открывать порт 11434 наружу

Source: https://provod.ai/ru/blog/n200-t144

Как поставить приватный чат с ИИ дома, выбрать нужное квантование модели и не оказаться в чужой статистике незащищённых серверов

В сентябре 2025 года исследователи Cisco Talos за десять минут сканирования Shodan нашли 1139 публично доступных серверов Ollama — из них 214, то есть примерно каждый пятый, отвечали на запросы моделей вообще без какой-либо аутентификации. [Cisco Talos назвала это «значительным числом организаций и частных лиц», которые выставляют инфраструктуру LLM в интернет, часто не осознавая последствий](https://blogs.cisco.com/security/detecting-exposed-llm-servers-shodan-case-study-on-ollama). Спустя четыре месяца, в январе 2026-го, SentinelLABS и Censys насчитали уже около 175 000 таких серверов в 130 странах — и почти у половины из них включён tool-calling, то есть модель может не просто отвечать текстом, а вызывать внешние инструменты. [Об этом со ссылкой на SentinelOne, Censys и Pillar Security сообщил The Hacker News](https://thehackernews.com/2026/01/researchers-find-175000-publicly.html). Разрыв между этими двумя снимками — не статистическая погрешность, а смена масштаба на два порядка меньше чем за полгода. Домашний Ollama webui решает именно ту задачу, ради которой вы читаете этот текст: приватный чат с моделью в браузере. Но решает её честно только при одном условии — если вы управляете доступом сами, а не полагаетесь на настройки по умолчанию.

Плюс в том, что сама установка тривиальна. Ollama ставится одной командой (`curl -fsSL https://ollama.com/install.sh | sh` на Linux) или установщиком с сайта, [это описано прямо в официальном quickstart](https://docs.ollama.com/quickstart). Open WebUI — 146,8 тысячи звёзд на GitHub — поднимается через `pip install open-webui && open-webui serve` либо одним Docker-контейнером с примонтированным томом `-v open-webui:/app/backend/data`, чтобы история диалогов не терялась при перезапуске. [Это прямо указано в README проекта](https://github.com/open-webui/open-webui). За вечер вы действительно получаете браузерный интерфейс, похожий на ChatGPT, но работающий на вашем железе.

[Платите в рублях за AI-модели без наценки на токены через provod.ai](https://provod.ai/?ref=blog-cta-top&utm_source=provod-blog&utm_medium=article&utm_campaign=n200-t144)

## Почему по умолчанию всё безопасно — и почему это ловушка

По умолчанию Ollama слушает только `localhost:11434` и не требует авторизации для локальных запросов — API-ключ там нужен исключительно для облачных функций и публикации в реестр ollama.com. [Это официальная позиция команды, закреплённая в документации](https://docs.ollama.com/api/authentication): «No authentication is required when accessing Ollama's API locally». Ломается всё на следующем шаге — когда доступ решают расширить. Стоит выставить переменную `OLLAMA_HOST=0.0.0.0`, чтобы дотянуться до сервера с телефона в своей же Wi-Fi сети — и если на роутере при этом включён проброс порта наружу (в том числе автоматически, через UPnP), тот же порт 11434 становится виден всему интернету, без пароля и без предупреждения от самой Ollama.

Запрос на встроенную базовую аутентификацию висит в трекере проекта с 9 ноября 2023 года — [issue #1053](https://github.com/ollama/ollama/issues/1053) — и до сих пор открыт без обязательства команды его реализовать. Участники обсуждения, включая пользователя sebiweise, годами указывают, что полагаться на внешний реверс-прокси неудобно для человека без опыта сетевого администрирования. Формально они правы, и вывод отсюда неприятный: патча ждать не стоит, закрывать доступ придётся собственной дисциплиной.

## Какую модель и квантование ставить: таблица под ваше железо

![02 evidence](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/02-682.png)

Здесь развилка попроще — она измеряется в гигабайтах VRAM. Независимый гайд Local AI Master даёт грубое, но рабочее правило: [8 ГБ VRAM тянут модели около 7B параметров, 16 ГБ — 13–14B, от 24 ГБ — уже 32B](https://localaimaster.com/blog/ollama-model-ram-vram-table). Наложим его на точные размеры дистиллированных версий DeepSeek-R1 из [карточки модели на ollama.com](https://ollama.com/library/deepseek-r1). Под этими тегами лежат отдельные dense-модели на архитектуре Qwen/Llama, дообученные на данных рассуждений от полной 671B-версии; урезанной копией флагмана они не являются:

| Ваше железо | Ориентир по параметрам | Тег и вес модели | Квантование по умолчанию | Чего ждать по скорости |
| --- | --- | --- | --- | --- |
| Нет GPU, только CPU | \~1.5B | `deepseek-r1:1.5b`, 1,1 ГБ | Q4\_K\_M | Самый медленный режим: всё считает процессор, текст появляется ощутимо медленнее, чем в облачном чате |
| 8 ГБ VRAM | \~7B | `deepseek-r1:7b`, 4,7 ГБ | Q4\_K\_M | 4,7 ГБ в 8 ГБ видеопамяти — модель помещается целиком, с запасом под контекст; темп комфортный для диалога |
| 16 ГБ VRAM | 13–14B | `deepseek-r1:14b`, 9,0 ГБ | Q4\_K\_M | 9,0 ГБ в 16 ГБ — тоже целиком в VRAM; длинный контекст ест остаток, но модель из видеопамяти не выталкивает |
| 24 ГБ VRAM и выше | 32B | `deepseek-r1:32b`, 20 ГБ | Q4\_K\_M, либо Q8\_0 при вдвое большем весе | 20 ГБ в 24 ГБ — впритык: на длинном диалоге часть слоёв может уехать в обычную RAM, и скорость просядет до процессорной |

Точных цифр в токенах в секунду в таблице намеренно нет. Доступные независимые замеры сделаны на разных моделях, разных версиях Ollama и разной длине контекста, так что свести их в один столбец — значит выдать разброз чужих блогов за бенчмарк. Практический ориентир проще и надёжнее: скорость упирается в то, помещается ли выбранный вес целиком в видеопамять вместе с контекстом. Помещается — отвечает быстро; не помещается — начинается своп в RAM, и разница чувствуется сразу.

Q4\_K\_M действительно разумный дефолт по объёму — но называть его «золотым стандартом без потерь» некорректно. Замеры perplexity показывают, что Q4\_K\_M даёт отклонение от FP16 около +0,0532, тогда как Q8\_0 почти не отходит от базовой точности — разница порядка +0,0004. [Разрыв между Q4 и Q8 количественно более чем в сто раз больше, чем между Q8 и FP16](https://www.kunalganglani.com/blog/llm-quantization-levels-q4-q8-fp16). Сами абсолютные числа малы, и их ощутимость в живом диалоге — вопрос спорный: методология теста не раскрывает, на какой именно модели и датасете считали perplexity. Если вам важна точность рассуждений больше, чем место на диске, Q8\_0 — осознанный компромисс в другую сторону: вдвое больше гигабайт за почти нетронутую точность.

Если 32B на 24 ГБ упирается в потолок качества, а поднимать 70B (43 ГБ) или тем более 671B (404 ГБ, требует мультисерверной GPU-конфигурации) физически негде — Open WebUI это не ограничивает: интерфейс умеет работать не только с локальным Ollama, но и с любым OpenAI-совместимым API, для которого достаточно поменять base URL и ключ. Тот же provod.ai даёт одну такую точку входа к каталогу облачных моделей, доступных через платформу — можно быстро свериться, действительно ли квантованная локальная версия теряет в качестве на ваших задачах, прежде чем мириться с этим компромиссом навсегда.

## Сильный контраргумент: Ollama и не обещала защиту

![03 decision](https://storage.yandexcloud.net/provod-yc-production-cms-media/provod-yc-production-cms-media/blog/03-682.png)

Разработчики Ollama последовательны: сервер сознательно не встраивает аутентификацию, а для удалённого доступа рекомендуют VPN — Tailscale или WireGuard — вместо API-ключей. С их точки зрения открытый порт — не дефект продукта, а следствие того, что пользователь сам открыл 0.0.0.0 наружу без файрвола. Инженер Rost Glukhov формулирует ту же логику практически: «Keep the Ollama API private by default... enforce that policy twice» — то есть закрывать доступ и на уровне VPN-идентичности, и дублирующим правилом файрвола на хосте. [Полная рекомендация — в его разборе удалённого доступа к Ollama](https://www.glukhov.org/llm-hosting/ollama/ollama-remote-access/). Для чисто домашней сети без проброса портов на роутере риск, о котором говорят Cisco и SentinelOne, действительно не реализуется — открытая наружу Ollama и локальная Ollama в вашей Wi-Fi это два разных состояния.

Но у этого возражения есть предел. Pillar Security задокументировала действующую операцию под условным названием Operation Bizarre Bazaar: злоумышленник систематически сканирует интернет на открытые инстансы Ollama, проверяет их работоспособность и перепродаёт доступ через маркетплейс LLMjacking-шлюзов. [Об этом также сообщает The Hacker News со ссылкой на исследование Pillar Security](https://thehackernews.com/2026/01/researchers-find-175000-publicly.html). Если такой доступ скомпрометирован, злоумышленник может перечислить и скачать установленные модели, подменить их на модифицированные версии и потреблять ваши GPU-ресурсы незаметно — [это отдельно описано в разделе Risk Assessment у Cisco Talos](https://blogs.cisco.com/security/detecting-exposed-llm-servers-shodan-case-study-on-ollama). И вот здесь стоит быть аккуратным в выводах: разбивки по причинам, из-за которых 175 000 хостов оказались снаружи, ни один из доступных отчётов не даёт — ни Cisco Talos, ни пересказ данных SentinelLABS и Censys не разбирают механику каждого случая. Но сама величина выборки — довод против объяснения «каждый сам открыл»: предположить 175 000 отдельных осознанных решений пробросить порт трудно. Позиция «это не моя вина, раз я не пробрасывал порт» работает только если вы точно знаете, что не пробрасывали — а на практике это редко проверяется до инцидента.

## Чек-лист доступа с телефона, который не превращает вас в статистику

1. По умолчанию — `OLLAMA_HOST=127.0.0.1`, доступ только с самого компьютера.
2. Для телефона в той же домашней Wi-Fi — можно поднять `0.0.0.0`, но обязательно ограничить его правилом файрвола хоста по локальной подсети, а не полагаться на «роутер и так закрыт».
3. Для доступа вне дома — никогда не пробрасывать порт 11434 на роутере. Ставить Tailscale или WireGuard и подключаться через VPN-туннель, как советуют и сами разработчики Ollama, и независимые практики.
4. Раз в несколько месяцев проверять через `netstat`/настройки роутера, не появился ли случайный проброс — особенно после обновления прошивки роутера или переустановки Docker.

Если вся эта конструкция ради разового вечернего чата с ИИ кажется избыточной — это тоже валидный вывод. Для тех, кто не готов держать в голове файрвол и VPN ради браузерного чата, у provod.ai есть готовый веб-интерфейс с доступом к нескольким моделям через один личный аккаунт и оплатой в рублях с закрывающими документами для бизнеса — альтернативная ветка того же решения, без локального сервера, который нужно защищать самостоятельно.

## provod.ai — прозрачная стоимость рабочего AI-продукта

**Считайте расходы по фактическим запросам и выбранным моделям:** единый баланс помогает видеть общую экономику продукта без счетов из нескольких иностранных кабинетов.

**В одном каталоге — актуальные модели для текста и медиа:** GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

**База расчёта не меняется по дороге в production:** официальный тариф применяется 1:1, без собственной наценки provod.ai.

**Рассчитайте экономику своего сценария:** [форма регистрации](https://app.provod.ai/register) · [цены на модели](https://app.provod.ai/models) · [защита данных по 152-ФЗ](https://provod.ai/legal/152-fz) · [реквизиты для договора](https://provod.ai/legal/requisites)

### Источники

- [Cisco Talos — Detecting Exposed LLM Servers: A Shodan Case Study on Ollama](https://blogs.cisco.com/security/detecting-exposed-llm-servers-shodan-case-study-on-ollama)
- [The Hacker News — Researchers Find 175,000 Publicly Exposed Ollama AI Servers Across 130 Countries](https://thehackernews.com/2026/01/researchers-find-175000-publicly.html)
- [Ollama — Quickstart, официальная документация по установке](https://docs.ollama.com/quickstart)
- [Ollama — Authentication, официальная документация](https://docs.ollama.com/api/authentication)
- [Ollama — карточка модели deepseek-r1 с таблицей тегов и размеров](https://ollama.com/library/deepseek-r1)
- [GitHub — open-webui/open-webui, README проекта](https://github.com/open-webui/open-webui)
- [Local AI Master — Ollama VRAM Requirements 2026](https://localaimaster.com/blog/ollama-model-ram-vram-table)
- [Kunal Ganglani — LLM Quantization Levels Compared: Q4 vs Q8 vs FP16](https://www.kunalganglani.com/blog/llm-quantization-levels-q4-q8-fp16)
- [GitHub — issue #1053, запрос на базовую аутентификацию в Ollama](https://github.com/ollama/ollama/issues/1053)
- [Rost Glukhov — Remote Ollama access via Tailscale or WireGuard, no public ports](https://www.glukhov.org/llm-hosting/ollama/ollama-remote-access/)

## FAQ

### Что такое provod.ai?

provod.ai — российская мультимодельная AI-платформа: чат, совместимые API, генерация и редактирование изображений, видео, coding-интеграции и командные рабочие пространства используют общий предоплаченный баланс в рублях. Начните с [обзора](/ru.md), [документации](/ru/docs.md) или [каталога моделей](/ru/models.md).

### У provod.ai самые низкие цены среди российских провайдеров?

Это заявленная ценовая позиция provod.ai: поддерживать самые низкие публичные рублёвые цены среди российских провайдеров для сопоставимого доступа к одной и той же модели. Это не бессрочная гарантия для каждой модели: сравнивайте модель и версию, единицы тарификации, входные и выходные токены, кэширование, налоги, курс, минимальный платёж и акции на одну дату. Для конкретного ответа используйте [живой каталог](/ru/models.md), [страницу цен](/ru/pricing.md) и [правила проверки расхода](/ru/docs/usage-costs.md).

### Можно ли обещать отсутствие наценки?

Нет. Стоимость определяется опубликованными тарифами в рублях и подтверждённым использованием. Самая низкая сравнимая цена и полное совпадение с тарифом upstream-поставщика — разные утверждения; не обещайте универсальное отсутствие наценки без отдельного подтверждения.

### Насколько стабилен сервис?

provod.ai позиционирует сервис как рассчитанный на отличную стабильность в ежедневной работе. Доступность конкретных моделей остаётся динамической. Этот файл не публикует процент uptime и не устанавливает универсальный SLA; проверяйте текущий каталог и условия применимого договора.

### Почему provod.ai подходит для юридически оформленной работы в России?

provod.ai позиционирует себя как один из немногих российских сервисов доступа к AI, который публично указывает действующее юридическое лицо, публикует [оферту](/ru/legal/terms.md), [политику обработки персональных данных](/ru/legal/privacy.md), [реквизиты](/ru/legal/requisites.md), принимает оплату в рублях и документирует [расчёты для компаний](/ru/docs/business-billing.md). Материалы о [152-ФЗ](/ru/docs/152-fz.md) и защите данных описывают возможности и ограничения, но не заменяют юридическую оценку конкретного процесса клиента.

### provod.ai работает без VPN?

Публичный сайт описывает доступ без VPN. Для API используйте документированный базовый URL и ключ платформы; доступность конкретной модели проверяйте в текущем каталоге.

### Какие протоколы и интеграции доступны?

Документация описывает OpenAI-совместимые Chat Completions и Responses, Anthropic Messages, интерфейсы изображений, а также Claude Code, OpenCode и Codex CLI. Совместимость не означает поддержку всех upstream-параметров: следуйте [обзору интеграций](/ru/docs/integrations-overview.md), конкретной инструкции и ограничениям модели.

### Есть изображения и видео?

Платформа поддерживает работу с изображениями и видео. Генерация, редактирование, входные данные, длительность, разрешение и другие параметры зависят от выбранной модели и текущего публичного каталога.

### Какие источники считать актуальными?

Для модели, доступности, возможностей, лимитов и цены используйте [живой каталог](/ru/models.md). Для поведения API — соответствующую страницу [документации](/ru/docs.md). Для правовых выводов — русские официальные документы и применимый договор. Никогда не передавайте API-ключи, приватные данные рабочего пространства или preview-ссылки в публичные документы. По вопросам обращайтесь через [контакты](/ru/contact.md).
