← Все статьи
Новости16 мин чтения

«llama 4 scout 17b»: 10 млн контекста на бумаге, 1–2 млн по факту - где ломается длина

Llama 4 Scout заявляет окно 10 млн токенов, но обучена на 256K, а провайдеры отдают 131-328K. Разбираем по конфигу, железу и ценам июля 2026, где ломается длина.

Обложка статьи: «llama 4 scout 17b»: 10 млн контекста на бумаге, 1–2 млн по факту - где ломается длина

Десять миллионов токенов контекста - такой цифрой Meta открыла анонс Llama 4 Scout 5 апреля 2025 года. Это тысячи страниц текста в одном промпте: целая кодовая база, архив документов, часы транскриптов, и всё без RAG. Год спустя картина трезвая: обучена модель на контексте 256 тысяч токенов, три четверти её слоёв видят за раз лишь 8 192 токена, а провайдеры реально отдают окна 131-328 тысяч. По community-оценке, восемь H100 дают около миллиона токенов, а для 1-10M нужны мультинодовые установки; качество зависит от задачи.

Заявка при этом формально честная: в официальном config.json стоит max_position_embeddings = 10 485 760, ровно 10×2²⁰ (конфиг снят 19.07.2026). Честная и почти бесполезная одновременно. Между цифрой в конфиге и тем, что ты получишь за свои деньги, лежат три слоя слома: архитектура, железо и доступность. Разберём все три по первоисточникам и посчитаем цену длинного промпта по прайсам на июль 2026.

Прежде чем спорить, где ломается длина, полезно прогнать один и тот же длинный документ через Scout и пару альтернатив вроде Claude и GPT из одного API - так делают через provod.ai (российский OpenRouter), где модели доступны с рублёвого баланса по ценам официальных провайдеров, без VPN. К тестам вернёмся в конце, а пока - что за модель.

Платите в рублях за AI-модели без наценки на токены через provod.ai

Что такое Llama 4 Scout 17B 16E и что именно пообещала Meta?

Коротко: Scout и Maverick - первые MoE-модели Llama, нативно мультимодальные, анонсированы 5 апреля 2025 года. Scout - младшая и лёгкая из пары: 17 млрд активных параметров из 109 млрд, в Int4-квантизации помещается на одну NVIDIA H100. Главный рекламный тезис - «industry-leading context window of 10M».

Полное имя весов читается как расшифровка: Llama-4-Scout-17B-16E-Instruct. Здесь 17b - активные параметры на токен, 16e - число экспертов, instruct - версия, дообученная под инструкции и чат. Характеристики - по блогу Meta (05.04.2025), документации NVIDIA NIM (страница от 21.02.2026) и конфигу чекпоинта (19.07.2026):

ПараметрЗначение
Активные параметры17 млрд (всего 109 млрд)
Эксперты16 (на токен - один роутируемый плюс общий)
Слои / hidden48 / 5120
Обучающий корпусоколо 40 трлн токенов, знания до августа 2024
Заявленное окно10 485 760 токенов
Обучающий контекст256 тысяч токенов
Железоодна H100 в Int4-квантизации
Языки12 официально; русского в списке нет

Две строки из таблицы стоит перечитать: заявленное окно и обучающий контекст отличаются в 40 раз. Это не опечатка, это суть всей истории.

Почему 10 млн токенов - это экстраполяция, а не «честная» длина?

Коротко: Scout предобучен и дообучен на контексте 256K. Десять миллионов получаются растяжением на инференсе: архитектура iRoPE чередует слои без позиционных кодировок, а внимание дополнительно поджимают температурным шкалированием. Модель никогда не видела десять миллионов токенов в обучении - она умеет только «дотягиваться».

В конфиге это написано дословно: attn_temperature_tuning = true, attn_scale = 0.1, rope_scaling типа llama3 с factor 16 и original_max_position_embeddings = 8192. Последняя цифра - вторая опора: большинство слоёв работают в режиме chunked attention с окном 8 192 токена (attention_chunk_size = 8192 в том же конфиге). По независимым разборам, лишь каждый четвёртый слой - полный causal attention без позиционных кодировок: примерно 75% слоёв смотрят локально, 25% «прочёсывают» весь контекст как прожектор.

Меня здесь напрягает подача: трюк рабочий, инженерно интересный - но в пресс-релизе из него сделали «окно 10M» без оговорки, что это length generalization. В эпоху gpt-3 окно в несколько тысяч токенов казалось роскошью; с тех пор маркетинговые цифры выросли на три порядка быстрее физики внимания.

И попутно о единицах. «10 млн токенов» - это не 10 млн слов: токенизатор byte pair encoding режет текст на подсловные куски, поэтому в словах реальный объём заметно меньше. Считай цену всегда в токенах, не в страницах.

Где ломается длина: архитектура, железо или качество?

Коротко: на всех трёх уровнях, и ломаются они в разном порядке. Первой сдаёт память железа: KV-cache растёт линейно с длиной, и iRoPE этого не решает. Дальше - качество рассуждений: найти факт в длинном тексте модель ещё может, связывать факты между собой - уже плохо.

По железу есть community-оценка предельного контекста (разбор на GitHub, 04.05.2025; не официальные данные Meta): одна H100 с 80 ГБ вытягивает около 100K токенов, четыре карты - порядка 400K, восемь - около миллиона. Для диапазона 1-10M уже нужны мультинодовые установки. То есть «помещается на одну H100» из анонса - правда про веса в Int4, но не про длинный контекст: веса помещаются, а память под KV-cache к ним - нет.

С качеством хуже: независимые тесты противоречат друг другу, и оба верифицировать не удалось. TokenMix (24.04.2026) описывает зоны слома: рабочая 100-500K, «обвал рассуждений» на 500K-1M с точностью multi-hop ниже 40%, хрупкая 1-5M и «маркетинговая» 5-10M. Aumiqx (09.04.2026) наоборот заявляет больше 95% needle-recall на полных 10M. Обе цифры подаю как есть, по неподтверждённым данным. Но они сходятся в главном: retrieval живёт далеко, рассуждения - нет.

Болезнь при этом общая, Scout здесь не один: бенчмарк RULER ещё в 2024 году ввёл понятие effective context length и показал, что почти все модели теряют качество с ростом длины задолго до конца заявленного окна. BABILong со сплитами до 10M добавил Scout в свой лидерборд в апреле 2025 - проверяемые данные по длинным дистанциям у модели есть, просто они не про «10 млн работают».

Одна H100 выдыхается на сотне тысяч токенов: лестница предельного контекста

Сколько контекста реально отдают провайдеры и сколько это стоит?

Коротко: меньше 10M - у всех. Cloudflare Workers AI отдаёт окно 131K за $0,27/$0,85 за миллион входных/выходных токенов, GCP Vertex AI - 328K за $0,20/$0,65. Листинг OpenRouter держит пометку «10M» с ценами от $0,10/$0,30. Запрос на полные 10M входных токенов стоил бы $0,8-2,7 только за вход; на практике при окне 131-328K длинный запрос обходится в $0,01-0,09.

Цифры - по спецификациям провайдеров на июль 2026: Cloudflare (29.05-07.06.2026), Vertex AI (11.05.2026), OpenRouter (проверено 19.07.2026). Всего Scout раздают 12 провайдеров, самый дешёвый вход - от $0,08 за миллион токенов (по данным LLMReference на 09.07.2026).

ПровайдерОкноInput, $/1MOutput, $/1MМакс. выход
Cloudflare Workers AI131K0,270,8516 384 токена
GCP Vertex AI328K0,200,65в источнике не указан
OpenRouter (листинг)«10M»от 0,10от 0,30зависит от backend

Строка OpenRouter - отдельная ловушка: пометка «10M» в листинге говорит о конфиге модели, а не о том, что конкретный backend примет десятимиллионный промпт. Перед расчётом бюджета смотри лимит своего провайдера, а не карточку модели.

На фоне конкурентов картина забавная. Миллионный класс окна есть у gpt-4.1 от OpenAI и у gemini-2.5-flash от Google, у Maverick заявлен миллион. Meta ответила десятикратной цифрой - и выиграла заголовок, но не инфраструктуру.

Чем Scout отличается от Maverick и что случилось с behemoth?

Коротко: у Scout и Maverick одинаковые 17 млрд активных параметров, но Maverick вчетверо шире по весам - 128 экспертов и 400 млрд против 16 и 109; заявленное окно у него скромнее, 1M, а железо нужно тяжелее - целый хост H100 DGX. Флагман behemoth (288 млрд активных, около 2 трлн всего) анонсирован как «учитель» для всего стада и к июлю 2026 публично так и не вышел.

МодельАктивныеВсегоЭкспертыЗаявленное окноЖелезо
Scout17 млрд109 млрд1610Mодна H100 (Int4)
Maverick17 млрд400 млрд1281Mхост H100 DGX
Behemoth288 млрдоколо 2 трлн--не выпущен

Люди ищут это сравнение дословно так: «llama 4 scout и maverick отличие». В анонсе Meta ставила Maverick рядом с DeepSeek v3.1 - и здесь стоит вспомнить, почему headline-цифрам компании не верят на слово. На LMArena отправили кастомную «Llama-4-Maverick-03-26-Experimental» с ELO 1417 и вторым местом после Gemini 2.5 Pro, а публичная модель оказалась другим изделием: после замены на релизный вариант Maverick упал со 2-го на 32-е место. LMArena публично заявила о несоответствии ожиданиям, The Verge вышла 08.04.2025 с заголовком «Meta got caught gaming AI benchmarks».

Второй штрих: в январе 2026 года уходящий главный AI-учёный Meta Янн ЛеКан в интервью FT признал, что бенчмарки Llama 4 были «fudged a little bit» - для разных тестов брались разные варианты модели. Пересказ двух независимых вторичных источников; оригинал FT за пейволом, дословно проверить не удалось. Цифра «10M» - из той же серии: юридически не ложь, практически - мираж.

Что длинный контекст Scout не решает?

Коротко: он не отменяет RAG по цене, не добавляет русский язык в официальный список, не запускается на домашнем железе и не делает рассуждения на дальних дистанциях надёжными.

По деньгам retrieval выигрывает всухую: десятимиллионный промпт по $0,8-2,7 за вход против выборки нужных фрагментов - разница на порядки, и платить её придётся на каждый запрос, а не один раз за построение индекса. Это мой расчёт из цен выше, а не данные вендора, но арифметика упрямая.

По языку: официальный список - 12 языков, русского среди них нет (документация Meta и NVIDIA). По-русски модель отвечать умеет, но это уровень «как получилось при обучении», без обещаний вендора.

По железу: «одна H100» - это серверная карта, а не твой ноутбук и не edge-плата. Платы класса jetson - люди ищут «jetson nano» и «jetson orin» - для 109-миллиардной MoE непрактичны, а одна H100 по community-оценке даёт около 100K токенов контекста, см. лестницу выше. И по качеству: если твоя задача - рассуждения над связями в длинном архиве, а не поиск иголки, зона за пределами сотен тысяч токенов тебе не поможет.

Как проверить эффективную длину на своей задаче?

Коротко: не верь цифре окна - измерь свою. Берёшь реальный длинный документ, расставляешь закладки, гоняешь нарастающими длинами и сравниваешь две-три модели на одном материале. Пара вечеров работы, зато дальше решения принимаешь по своим данным.

  1. Собери тестовый корпус из своих документов: кодовая база, архив переписки, длинный отчёт - то, что реально пойдёт в прод.
  2. Расставь needle-закладки - уникальные факты - на 25, 50, 75 и 95% глубины текста и спроси про каждую.
  3. Добавь multi-hop вопросы, где ответ собирается из двух мест документа на разных концах: здесь рассуждения сдают первыми.
  4. Прогони нарастающими длинами - 32K, 128K, 256K, потолок провайдера - и зафиксируй, где точность начинает падать.
  5. Повтори прогон на двух-трёх альтернативах: у разных вендоров effective context length разный при одинаковой цифре в карточке.
  6. Считай деньги на каждом прогоне: цена входа умножается на длину промпта. И отделяй сбои доступа от деградации модели: если API вернул insufficient balance, это пустой баланс счёта, а не «сломался контекст».

Весь такой тест удобнее делать из одного API: в provod.ai Scout соседствует с альтернативами, подключение - смена ключа и base_url в клиенте, совместимом с OpenAI SDK, а расход по прогонам виден на одном рублёвом балансе. Условия оплаты и цены уточняй на сайте сервиса.

Когда provod.ai не подходит

Коротко: если ты качаешь веса Scout и гоняешь их на своём железе, агрегатор не нужен вовсе. Ещё два случая мимо: fine-tuning с on-prem контуром и прямой enterprise-контракт с провайдером ради SLA.

Веса у Llama открыты, и self-host - легальный, часто правильный путь, когда железо уже куплено: там ты сам решаешь, сколько памяти отдать под KV-cache. Fine-tuning и on-prem - тоже про свой стек, а не про API-агрегатор. И если расход вырос до уровня прямого контракта с вендором, посредник смысла не добавит. Наконец, официальную поддержку русского языка не даст ни один агрегатор: её нет у самой Meta, и это чинить только ей.

Словарик запросов кластера: что ещё ищут рядом с Llama 4

Коротко: поиск сваливает в этот кластер много лишнего - от металлоискателей до роботов. Разбираю, что к чему.

Железо и роботы - не языковые модели

  • «fisher» - металлоискатель Fisher Gemini 3; к нейросети Gemini отношения нет.
  • «bayckrc» - радиопередатчик BayckRC Gemini для дронов.
  • «optimus» - робот Tesla Optimus.
  • «gr-1» и «fourier» - человекоидный робот Fourier GR-1.
  • «quest» - VR-шлем Meta Quest, на него пытаются поставить ChatGPT.
  • «а37» - смартфон Samsung A37; ищут, как поставить на него Perplexity.
  • «пда» - форум 4PDA; «грок 4 пда» - тема про Grok там.
  • «ро» - обрывок запроса про телевизор с Алисой.

Модели и версии других вендоров

  • «119b» - Mistral Small 4 119B.
  • «80b» - Qwen 3 Next 80B.
  • «4.4» - Grok 4.4.
  • «291.1» - версия приложения Perplexity; ищут взломанный apk, это серая тема.
  • «гпт-4» и «гпт-5» - кириллическое написание моделей OpenAI.
  • «gpt-one» - слитное «GPT one» из запросов с городом.
  • «gpt-4.1-mini» - младшая модель линейки OpenAI 4.1.
  • «gpt-5.1-codex», «gpt-5.1-codex-mini», «gpt-5.3-codex», «gpt-5.3-codex-spark», «gpt-5.5-cyber» - ветки кодовых моделей OpenAI; чаще всего спрашивают «что это».
  • «rugpt-3» и «rugpt-3.5» - русские генеративные модели Сбера.
  • «дипсик4» и «дипсик5» - DeepSeek на слух; сюда же склейки «дипсикз», «дипсикм», «дипсикто», «дипсикэ», «дипсикэъ» и «дипсикээ» - название пишут как слышат.
  • «qwenchat» и «qwencode» - чат и кодовый инструмент Qwen.
  • «tiny» - TinyLlama 1.1B для слабого железа; со Scout её роднит только фамилия.
  • «StepFun» - китайская ИИ-лаборатория.
  • «эни» - кириллическое «ani», компаньон-аватар в Grok.

Опечатки и склейки вокруг ChatGPT

  • «chft» - ChatGPT, напечатанный с опечаткой.
  • «gpttunell», «gpttunnels» и «gptunel» - обходные «туннели» к ChatGPT; рабочая альтернатива - официальный API или легальный агрегатор.
  • «wegptru» - нечитаемая склейка про GPT.
  • «accunte» - «account» с опечаткой; продажа чужих аккаунтов - риск бана и потери денег.
  • «dco» - обрывок запроса про ChatGPT для Arma 3.
  • «wormgpt» - «вредоносный двойник» ChatGPT для фишинга; платформы такие запросы режут фильтрами.
  • «mathgptpro», «roomsgpt» и «musicgpt» - сторонние приложения-клиенты.
  • «идп» - обрывок «скачать 4 идп» без читаемого интента.
  • «null» - обрывок «редактор фото null null».

Алиса и её опечатки

  • «алисаal» - склейка «Алиса AI».
  • «алисанейро» и «алисапро» - «Алиса Нейро» и «Алиса Про» слитно.
  • «алисаа», «алисааа», «алисаааа» и «алисаъ» - опечатки с лишними буквами.

Картинки, видео и музыка

  • «Seedream» - генератор изображений ByteDance.
  • «Veo» - видеомодель Google; ищут и как «veon».
  • «gen-2» - Runway Gen-2, видеогенерация; «references» - режим референсов у Runway.
  • «amber» - Flux Amber, вариант генератора картинок.
  • «realism» - realism-наборы LoRA для Flux и Ideogram.
  • «8bit» - генерации в стиле пиксель-арт.
  • «kj» - конструктор промптов для Ideogram.
  • «fallout» - нейросетевая русская озвучка Fallout 4.
  • «kapwing» - онлайн-видеоредактор с ИИ-функциями.
  • «x-minus» - сервис минусовок.
  • «autotunes» - ИИ-каверы с автотюном.
  • «beats» и «monkey» - обрывки запроса «remix monkey beats sunoai veo 3».
  • «saga» и «lore» - обрывки музыкального запроса «saga lore ai blues string».
  • «mini-tts» - озвучка текста.
  • «stady» - «stady 24 ai», сторонний сервис.
  • «starpoint» - «starpoint gemini 3» ищут на торрентах; к Gemini отношения нет.
  • «историко» - «историко ия генератор картинка», стилизация фото под старину.
  • «сестер» - «6 сестра картинка шедеврум»: генерация изображения сестёр в Шедевруме.
  • «режиссер» - «режиссёр клод 4», запрос без чёткого интента, чаще про генерацию видео.
  • «soraoraora» - Sora, напечатанная с захлёбом клавиш.
  • «dao» и «bao» - обрывки «dao bao нейросеть скачать», мобильное приложение.

Соседние интенты про Llama и доступ

  • «obliterated» - abliterated-файнтюны Llama 4 без отказов; к официальному окну отношения нет.
  • «LibreChat» - опенсорсный чат-клиент, который подключают к разным API.
  • «прикрепленными» - из запросов про загрузку файлов: люди хотят отправить документ с прикрепленными данными и не находят кнопку.
  • «sexy» - adult-интент вида «sexy ai girls»; к Llama отношения нет, платформы такие запросы режут фильтрами.

Вопросы читателей

Коротко: пять вопросов, которые остаются после разбора.

Сколько реально держит Llama 4 Scout - миллион или десять? По совокупности источников рабочее окно - сотни тысяч токенов. Retrieval-задачи могут работать на большей длине, чем multi-hop рассуждения; точную эффективную длину измеряй на своей задаче. Точные пер-длинные баллы независимых тестов противоречивы, поэтому свою длину измерь сам.

Почему провайдер даёт 131-328K, если заявлено 10M? Потому что длинный контекст стоит памяти и денег: KV-cache растёт линейно, и провайдер режет окно под экономику своих кластеров. Пометка «10M» в листинге описывает конфиг модели, а не SLA конкретного backend.

Что взять для длинных документов: Scout или Maverick? У Maverick заявлен миллион и вчетверо больше весов при тех же активных параметрах, но железо ему нужно тяжелее. Решает не карточка, а прогон твоего документа через обе модели: effective context length у них разный и не равен заявленному.

Во сколько обойдётся промпт на миллион токенов? По ценам июля 2026 вход обойдётся примерно в $0,08-0,27 за миллион токенов плюс выход по тарифу провайдера. Оговорка: массово окна в миллион сейчас не отдаёт никто, так что реальный чек длинного запроса - те самые $0,01-0,09 при окне 131-328K.

Можно ли запустить Scout дома? Нет. «Одна H100» - серверная карта дата-центра, да и она тянет длинный контекст лишь до сотни тысяч токенов по community-оценкам. Домашнее железо и edge-платы класса jetson 109-миллиардную MoE не поднимают; реалистичный путь - облачные API.

Проверь длину на своей задаче: один API, один баланс, все модели рядом

provod.ai — от идеи и текста до изображения, видео и звука

Соберите контентный процесс без переключения между десятками сервисов: сценарий, визуал, ролик, музыка и аудио используют единый кабинет, API и баланс команды.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Каждый формат оплачивается по базовой цене поставщика 1:1: provod.ai объединяет расчёты, но не добавляет свою наценку.

Соберите медиапроизводство на provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai

Источники

Коротко: первоисточники и разборы, на которых собран текст.