Разбираемся, где кончается «установил и заработало» и когда ради точных ответов придётся вручную менять эмбеддер и хранилище
Ставите AnythingLLM, закидываете туда десяток договоров и заметок на русском — и на прямой вопрос по конкретному пункту система выдаёт что-то рядом, но не то. Это не баг конкретной сборки, а следствие трёх чисел, зашитых в дефолт: встроенный эмбеддер all-MiniLM-L6-v2 отдаёт 384-мерные векторы, обучен преимущественно на английских текстах и обрезает вход на 256 токенов — примерно абзац текста, дальше модель просто не видит содержимое чанка целиком, что фиксирует независимый обзор embedding-моделей. При этом текст режется на куски по 1000 символов с перекрытием 200 — эти параметры заданы в документации как значения по умолчанию для текстового сплиттера продукта. На английском абзаце в 1000 символов эмбеддер укладывается в лимит токенов почти без потерь. На кириллице тот же объём символов обходится заметно дороже в токенах, а точного соотношения не даёт никто: чанкинг в AnythingLLM настраивается в символах, лимит эмбеддера измеряется в токенах, и вендор эти две шкалы нигде не сводит. Практическое следствие от этого не меняется — часть чанка эмбеддер попросту не учитывает при векторизации. Отсюда и нерелевантные ответы: ищет система не по всему договору, а по обрезанному фрагменту.
Подключите модели для поиска и баз знаний с оплатой в рублях на provod.ai
Позиция основателя против независимой практики
Тимоти Карамбат, основатель Mintplex Labs, публично называет продукт «магической коробкой» — локальным ИИ без кода и инфраструктурной возни, судя по его постам. Для документного пайплайна это правда: скачал, закинул PDF, получил чат по содержимому — без единой настройки. Но независимый обозреватель Паскуале Пиллиттери формулирует иначе: качество RAG определяется «гигиеной» базы документов больше, чем мощностью модели, а локальная Llama3 на сложных рассуждениях заметно отстаёт от GPT и Claude — по его словам, «you can feel it». Комфортная локальная работа с моделью такого уровня требует GPU от 8 ГБ VRAM и вложений свыше 1000 евро. То есть «без забот» относится к загрузке файлов, а не к качеству того, что вы в итоге получите на экране.
Когда дефолт реально держится
Здесь важно не переусложнять раньше времени. Для небольшого личного архива англоязычных документов сценарий «поставил и сразу получил точный ответ» — не маркетинг, а реальность: чанк на 1000 символов английского текста укладывается в 256-токенный лимит all-MiniLM-L6-v2 без потерь смысла, LanceDB не требует отдельного сервера, а официальные системные требования десктопной версии — 16 ГБ ОЗУ и восьмиядерный процессор — покрывают обычный ноутбук. Если у вас полсотни PDF на английском и вопросы вроде «что написано в контракте про сроки поставки» — трогать конфигурацию незачем. Усложнение через BGE-M3, внешние векторные БД и self-hosted Qdrant оправдано конкретными триггерами: кириллица, смешанные языки, растущая коллекция, командный доступ. Не потому что «так правильнее», а потому что дефолт перестаёт справляться именно в этих условиях.
Что стоит смена эмбеддера

Для мультиязычных корпусов рекомендуют BGE-M3 через Ollama — модель поддерживает более 100 языков и контекст до 8192 токенов против 256 у дефолтной английской модели. Разница на порядок, но это не переключатель в настройках. Эмбеддер в AnythingLLM задан на уровне всего приложения, а не отдельного workspace, и смена ломает уже загруженные документы — прямое указание документации. Все документы придётся удалить и заново проиндексировать, инструментов частичного переноса нет.
Проблема глубже, чем «подождать индексацию». При подключении PostgreSQL с pgvector размерность колонки VECTOR обязана совпадать с размерностью эмбеддера — у дефолтной модели это 384 измерения. Переход на BGE-M3 с другой размерностью вектора означает не просто переиндексацию, а пересоздание таблицы. Насколько это критично, показывает закрытый баг-репорт: пользователь, подключивший text-embedding-ada-002 с её 1536 измерениями поверх LanceDB, получил ошибку несовпадения размерности вектора, и issue закрыли мейнтейнеры со статусом «not planned» — то есть это архитектурное ограничение, а не временный баг, который починят следующим релизом.
Где встроенное хранилище упирается в потолок
LanceDB работает как embedded-инстанс внутри самого приложения — без отдельного сервера это действительно избавляет от настройки на старте, подтверждает документация. Но именно отсутствие внешнего серверного режима — предмет открытого feature request: пользователи просят поддержку внешних LanceDB-инстансов для нескольких развёртываний, и на дату снимка ответа мейнтейнеров нет. Параллельно есть пользовательский отчёт о том, что после добавления нескольких крупных документов через веб-скрапер интерфейс импорта замедляется «до полной остановки» — единичное наблюдение без официального фикса, но оно совпадает по направлению с архитектурным ограничением из первого issue: LanceDB не рассчитан на рост коллекции сверх личного архива.
Есть и более свежий сигнал о точности самого поиска. В версии v1.8.2 пользователь сообщил, что чанки с нулевой или отрицательной похожестью попадают в цитаты даже при пороге схожести 0.75 — issue помечен «investigating», подтверждения бага мейнтейнерами нет, привязан к конкретному эмбеддеру и режиму. Не факт, что это воспроизведётся у вас — но если после смены эмбеддера ответы вдруг стали хуже, а не лучше, порог схожести — первое, что стоит перепроверить, а не списывать на саму модель.
Чек-лист: когда менять эмбеддер, а когда не трогать

| Признак | Оставаться на all-MiniLM-L6-v2 | Переходить на BGE-M3 |
|---|---|---|
| Язык документов | Только английский | Русский или смешанный |
| Объём коллекции | До нескольких сотен страниц | Растёт, счёт на тысячи страниц |
| Длина смыслового блока | Короткие фрагменты, до ~150 слов на чанк | Абзацы длиннее ~200 слов на чанк |
| Доступ | Один пользователь | Команда, несколько workspace |
| Готовность к переиндексации | Не готов тратить время сейчас | Готов удалить и загрузить документы заново |
Если хотя бы два признака справа — переиндексация окупится. Перед переключением зафиксируйте текущий размер базы: после смены эмбеддера система не оставляет пути назад без повторной полной загрузки.
Отдельно стоит проверка на этапе выбора эмбеддера, а не после переезда всей коллекции: прежде чем разворачивать локальную Ollama с BGE-M3, можно быстро сравнить качество ответов на нескольких эмбеддинг-моделях через облачные API — provod.ai даёт единый OpenAI-совместимый доступ к каталогу эмбеддинг-моделей, и смена провайдера здесь сводится к замене base URL и ключа в уже настроенном клиенте, без отдельной регистрации у каждого вендора. Это дешёвый способ убедиться, что кириллица действительно «поедет» лучше, прежде чем тратить часы на переиндексацию всей коллекции локально.
Куда девать эмбеддинги вместо Pinecone
Официальная документация перечисляет поддерживаемые векторные базы: Chroma, Milvus локально и Pinecone, Zilliz, AstraDB, Qdrant, Weaviate, PGVector как облачные или self-host варианты. Pinecone выглядит логичной облачной заменой LanceDB — бесплатный план Starter даёт до 2 ГБ хранилища и 2 млн write units в месяц, платный Builder стоит 20 долларов в месяц. Но это чисто облачный SaaS без self-hosted варианта, а российские карты Visa и Mastercard не работают на зарубежных платформах из-за отключённого международного процессинга — оплата требует посредников с комиссией 20–25%, иностранной карты или крипты, показывает общий обзор платёжных обходов. Для команды это дополнительный организационный слой поверх уже нетривиального архитектурного решения.
Практическая альтернатива — self-hosted. Qdrant можно поднять локально через Docker бесплатно, а бесплатный облачный кластер ограничен скромно — 0.5 vCPU, 1 ГБ RAM и 4 ГБ диска на узле, указывает страница тарифов вендора. Для команды, у которой уже есть PostgreSQL, логичнее pgvector — но помните про совпадение размерности вектора из предыдущего раздела: смените эмбеддер позже, и таблицу придётся пересоздавать заново.
Если генерирующую модель для ответов по документам вы всё равно берёте не локальную Llama3 — а именно так советует поступать Пиллиттери ради качества рассуждений — тот же вопрос оплаты из России встаёт снова, но уже для GPT или Claude. Система подключает LLM-провайдера через OpenAI-совместимый протокол, и здесь рублёвая оплата через provod.ai картой, СБП или счётом закрывает именно ту проблему, которую Pinecone создаёт для векторной БД, — без иностранной карты и посредников.
Что запускать в понедельник
Автор гайда Better Stack Стэнли Улили описывает документный пайплайн нейтрально — чанкинг, эмбеддинг, LanceDB работают автоматически, но требуют отдельно запущенного сервиса Ollama, которым нужно управлять как процессом. Это и есть честная итоговая картина: «из коробки» — это про документный пайплайн, а не про сумму всех решений, которые определяют точность ответа. Если база на английском и небольшая — не трогайте дефолт, он справится. Если в ней кириллица и она растёт — сначала снимите порог схожести до «No Restriction» и проверьте чанкинг, прежде чем менять эмбеддер вслепую; и только затем планируйте полную переиндексацию под BGE-M3 и self-hosted Qdrant или pgvector — с чётким пониманием, что обратного пути без повторной загрузки документов у вас не будет.
provod.ai — генерация изображений без отдельного медиасервиса
Создавайте визуалы в том же контуре, где команда работает с текстом и кодом: один кабинет и баланс упрощают производство баннеров, иллюстраций, концептов и продуктовой графики.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Генерации идут по официальной цене модели 1:1: provod.ai не добавляет собственную наценку к стоимости изображения.
Добавьте изображения в рабочий процесс: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai
Источники
- AnythingLLM — Vector Databases Overview
- AnythingLLM — Embedding Models Overview
- AnythingLLM Desktop — System Requirements
- pgvector SETUP.md в репозитории AnythingLLM
- GitHub issue #2156 — несовместимость LanceDB с text-embedding-ada-002
- GitHub issue #1776 — замедление загрузки крупных документов
- GitHub issue #3940 — запрос поддержки внешнего LanceDB
- GitHub issue #4080 — порог схожести не соблюдается
- MorphLLM — обзор Ollama embedding-моделей 2026
- Qdrant Cloud — тарифы
- Pinecone — тарифы
- vc.ru — как оплатить зарубежные сервисы из России
- Pasquale Pillitteri — обзор AnythingLLM 2026
- Better Stack Community — гайд по AnythingLLM
- Тимоти Карамбат — публичный пост о AnythingLLM
