Десять миллионов токенов контекста - такой цифрой Meta открыла анонс Llama 4 Scout 5 апреля 2025 года. Это тысячи страниц текста в одном промпте: целая кодовая база, архив документов, часы транскриптов, и всё без RAG. Год спустя картина трезвая: обучена модель на контексте 256 тысяч токенов, три четверти её слоёв видят за раз лишь 8 192 токена, а провайдеры реально отдают окна 131-328 тысяч. По community-оценке, восемь H100 дают около миллиона токенов, а для 1-10M нужны мультинодовые установки; качество зависит от задачи.
Заявка при этом формально честная: в официальном config.json стоит max_position_embeddings = 10 485 760, ровно 10×2²⁰ (конфиг снят 19.07.2026). Честная и почти бесполезная одновременно. Между цифрой в конфиге и тем, что ты получишь за свои деньги, лежат три слоя слома: архитектура, железо и доступность. Разберём все три по первоисточникам и посчитаем цену длинного промпта по прайсам на июль 2026.
Прежде чем спорить, где ломается длина, полезно прогнать один и тот же длинный документ через Scout и пару альтернатив вроде Claude и GPT из одного API - так делают через provod.ai (российский OpenRouter), где модели доступны с рублёвого баланса по ценам официальных провайдеров, без VPN. К тестам вернёмся в конце, а пока - что за модель.
Что такое Llama 4 Scout 17B 16E и что именно пообещала Meta?
Коротко: Scout и Maverick - первые MoE-модели Llama, нативно мультимодальные, анонсированы 5 апреля 2025 года. Scout - младшая и лёгкая из пары: 17 млрд активных параметров из 109 млрд, в Int4-квантизации помещается на одну NVIDIA H100. Главный рекламный тезис - «industry-leading context window of 10M».
Полное имя весов читается как расшифровка: Llama-4-Scout-17B-16E-Instruct. Здесь 17b - активные параметры на токен, 16e - число экспертов, instruct - версия, дообученная под инструкции и чат. Характеристики - по блогу Meta (05.04.2025), документации NVIDIA NIM (страница от 21.02.2026) и конфигу чекпоинта (19.07.2026):
| Параметр | Значение |
|---|---|
| Активные параметры | 17 млрд (всего 109 млрд) |
| Эксперты | 16 (на токен - один роутируемый плюс общий) |
| Слои / hidden | 48 / 5120 |
| Обучающий корпус | около 40 трлн токенов, знания до августа 2024 |
| Заявленное окно | 10 485 760 токенов |
| Обучающий контекст | 256 тысяч токенов |
| Железо | одна H100 в Int4-квантизации |
| Языки | 12 официально; русского в списке нет |
Две строки из таблицы стоит перечитать: заявленное окно и обучающий контекст отличаются в 40 раз. Это не опечатка, это суть всей истории.
Почему 10 млн токенов - это экстраполяция, а не «честная» длина?
Коротко: Scout предобучен и дообучен на контексте 256K. Десять миллионов получаются растяжением на инференсе: архитектура iRoPE чередует слои без позиционных кодировок, а внимание дополнительно поджимают температурным шкалированием. Модель никогда не видела десять миллионов токенов в обучении - она умеет только «дотягиваться».
В конфиге это написано дословно: attn_temperature_tuning = true, attn_scale = 0.1, rope_scaling типа llama3 с factor 16 и original_max_position_embeddings = 8192. Последняя цифра - вторая опора: большинство слоёв работают в режиме chunked attention с окном 8 192 токена (attention_chunk_size = 8192 в том же конфиге). По независимым разборам, лишь каждый четвёртый слой - полный causal attention без позиционных кодировок: примерно 75% слоёв смотрят локально, 25% «прочёсывают» весь контекст как прожектор.
Меня здесь напрягает подача: трюк рабочий, инженерно интересный - но в пресс-релизе из него сделали «окно 10M» без оговорки, что это length generalization. В эпоху gpt-3 окно в несколько тысяч токенов казалось роскошью; с тех пор маркетинговые цифры выросли на три порядка быстрее физики внимания.
И попутно о единицах. «10 млн токенов» - это не 10 млн слов: токенизатор byte pair encoding режет текст на подсловные куски, поэтому в словах реальный объём заметно меньше. Считай цену всегда в токенах, не в страницах.
Где ломается длина: архитектура, железо или качество?
Коротко: на всех трёх уровнях, и ломаются они в разном порядке. Первой сдаёт память железа: KV-cache растёт линейно с длиной, и iRoPE этого не решает. Дальше - качество рассуждений: найти факт в длинном тексте модель ещё может, связывать факты между собой - уже плохо.
По железу есть community-оценка предельного контекста (разбор на GitHub, 04.05.2025; не официальные данные Meta): одна H100 с 80 ГБ вытягивает около 100K токенов, четыре карты - порядка 400K, восемь - около миллиона. Для диапазона 1-10M уже нужны мультинодовые установки. То есть «помещается на одну H100» из анонса - правда про веса в Int4, но не про длинный контекст: веса помещаются, а память под KV-cache к ним - нет.
С качеством хуже: независимые тесты противоречат друг другу, и оба верифицировать не удалось. TokenMix (24.04.2026) описывает зоны слома: рабочая 100-500K, «обвал рассуждений» на 500K-1M с точностью multi-hop ниже 40%, хрупкая 1-5M и «маркетинговая» 5-10M. Aumiqx (09.04.2026) наоборот заявляет больше 95% needle-recall на полных 10M. Обе цифры подаю как есть, по неподтверждённым данным. Но они сходятся в главном: retrieval живёт далеко, рассуждения - нет.
Болезнь при этом общая, Scout здесь не один: бенчмарк RULER ещё в 2024 году ввёл понятие effective context length и показал, что почти все модели теряют качество с ростом длины задолго до конца заявленного окна. BABILong со сплитами до 10M добавил Scout в свой лидерборд в апреле 2025 - проверяемые данные по длинным дистанциям у модели есть, просто они не про «10 млн работают».
Сколько контекста реально отдают провайдеры и сколько это стоит?
Коротко: меньше 10M - у всех. Cloudflare Workers AI отдаёт окно 131K за $0,27/$0,85 за миллион входных/выходных токенов, GCP Vertex AI - 328K за $0,20/$0,65. Листинг OpenRouter держит пометку «10M» с ценами от $0,10/$0,30. Запрос на полные 10M входных токенов стоил бы $0,8-2,7 только за вход; на практике при окне 131-328K длинный запрос обходится в $0,01-0,09.
Цифры - по спецификациям провайдеров на июль 2026: Cloudflare (29.05-07.06.2026), Vertex AI (11.05.2026), OpenRouter (проверено 19.07.2026). Всего Scout раздают 12 провайдеров, самый дешёвый вход - от $0,08 за миллион токенов (по данным LLMReference на 09.07.2026).
| Провайдер | Окно | Input, $/1M | Output, $/1M | Макс. выход |
|---|---|---|---|---|
| Cloudflare Workers AI | 131K | 0,27 | 0,85 | 16 384 токена |
| GCP Vertex AI | 328K | 0,20 | 0,65 | в источнике не указан |
| OpenRouter (листинг) | «10M» | от 0,10 | от 0,30 | зависит от backend |
Строка OpenRouter - отдельная ловушка: пометка «10M» в листинге говорит о конфиге модели, а не о том, что конкретный backend примет десятимиллионный промпт. Перед расчётом бюджета смотри лимит своего провайдера, а не карточку модели.
На фоне конкурентов картина забавная. Миллионный класс окна есть у gpt-4.1 от OpenAI и у gemini-2.5-flash от Google, у Maverick заявлен миллион. Meta ответила десятикратной цифрой - и выиграла заголовок, но не инфраструктуру.
Чем Scout отличается от Maverick и что случилось с behemoth?
Коротко: у Scout и Maverick одинаковые 17 млрд активных параметров, но Maverick вчетверо шире по весам - 128 экспертов и 400 млрд против 16 и 109; заявленное окно у него скромнее, 1M, а железо нужно тяжелее - целый хост H100 DGX. Флагман behemoth (288 млрд активных, около 2 трлн всего) анонсирован как «учитель» для всего стада и к июлю 2026 публично так и не вышел.
| Модель | Активные | Всего | Эксперты | Заявленное окно | Железо |
|---|---|---|---|---|---|
| Scout | 17 млрд | 109 млрд | 16 | 10M | одна H100 (Int4) |
| Maverick | 17 млрд | 400 млрд | 128 | 1M | хост H100 DGX |
| Behemoth | 288 млрд | около 2 трлн | - | - | не выпущен |
Люди ищут это сравнение дословно так: «llama 4 scout и maverick отличие». В анонсе Meta ставила Maverick рядом с DeepSeek v3.1 - и здесь стоит вспомнить, почему headline-цифрам компании не верят на слово. На LMArena отправили кастомную «Llama-4-Maverick-03-26-Experimental» с ELO 1417 и вторым местом после Gemini 2.5 Pro, а публичная модель оказалась другим изделием: после замены на релизный вариант Maverick упал со 2-го на 32-е место. LMArena публично заявила о несоответствии ожиданиям, The Verge вышла 08.04.2025 с заголовком «Meta got caught gaming AI benchmarks».
Второй штрих: в январе 2026 года уходящий главный AI-учёный Meta Янн ЛеКан в интервью FT признал, что бенчмарки Llama 4 были «fudged a little bit» - для разных тестов брались разные варианты модели. Пересказ двух независимых вторичных источников; оригинал FT за пейволом, дословно проверить не удалось. Цифра «10M» - из той же серии: юридически не ложь, практически - мираж.
Что длинный контекст Scout не решает?
Коротко: он не отменяет RAG по цене, не добавляет русский язык в официальный список, не запускается на домашнем железе и не делает рассуждения на дальних дистанциях надёжными.
По деньгам retrieval выигрывает всухую: десятимиллионный промпт по $0,8-2,7 за вход против выборки нужных фрагментов - разница на порядки, и платить её придётся на каждый запрос, а не один раз за построение индекса. Это мой расчёт из цен выше, а не данные вендора, но арифметика упрямая.
По языку: официальный список - 12 языков, русского среди них нет (документация Meta и NVIDIA). По-русски модель отвечать умеет, но это уровень «как получилось при обучении», без обещаний вендора.
По железу: «одна H100» - это серверная карта, а не твой ноутбук и не edge-плата. Платы класса jetson - люди ищут «jetson nano» и «jetson orin» - для 109-миллиардной MoE непрактичны, а одна H100 по community-оценке даёт около 100K токенов контекста, см. лестницу выше. И по качеству: если твоя задача - рассуждения над связями в длинном архиве, а не поиск иголки, зона за пределами сотен тысяч токенов тебе не поможет.
Как проверить эффективную длину на своей задаче?
Коротко: не верь цифре окна - измерь свою. Берёшь реальный длинный документ, расставляешь закладки, гоняешь нарастающими длинами и сравниваешь две-три модели на одном материале. Пара вечеров работы, зато дальше решения принимаешь по своим данным.
- Собери тестовый корпус из своих документов: кодовая база, архив переписки, длинный отчёт - то, что реально пойдёт в прод.
- Расставь needle-закладки - уникальные факты - на 25, 50, 75 и 95% глубины текста и спроси про каждую.
- Добавь multi-hop вопросы, где ответ собирается из двух мест документа на разных концах: здесь рассуждения сдают первыми.
- Прогони нарастающими длинами - 32K, 128K, 256K, потолок провайдера - и зафиксируй, где точность начинает падать.
- Повтори прогон на двух-трёх альтернативах: у разных вендоров effective context length разный при одинаковой цифре в карточке.
- Считай деньги на каждом прогоне: цена входа умножается на длину промпта. И отделяй сбои доступа от деградации модели: если API вернул
insufficient balance, это пустой баланс счёта, а не «сломался контекст».
Весь такой тест удобнее делать из одного API: в provod.ai Scout соседствует с альтернативами, подключение - смена ключа и base_url в клиенте, совместимом с OpenAI SDK, а расход по прогонам виден на одном рублёвом балансе. Условия оплаты и цены уточняй на сайте сервиса.
Когда provod.ai не подходит
Коротко: если ты качаешь веса Scout и гоняешь их на своём железе, агрегатор не нужен вовсе. Ещё два случая мимо: fine-tuning с on-prem контуром и прямой enterprise-контракт с провайдером ради SLA.
Веса у Llama открыты, и self-host - легальный, часто правильный путь, когда железо уже куплено: там ты сам решаешь, сколько памяти отдать под KV-cache. Fine-tuning и on-prem - тоже про свой стек, а не про API-агрегатор. И если расход вырос до уровня прямого контракта с вендором, посредник смысла не добавит. Наконец, официальную поддержку русского языка не даст ни один агрегатор: её нет у самой Meta, и это чинить только ей.
Проверь эффективный контекст на своём архиве: подключи provod.ai, поменяй base_url и ключ - и сравни модели на одной задаче. Оплата в рублях по ценам провайдеров без наценки, для юрлиц - договор и закрывающие документы.
Словарик запросов кластера: что ещё ищут рядом с Llama 4
Коротко: поиск сваливает в этот кластер много лишнего - от металлоискателей до роботов. Разбираю, что к чему.
Железо и роботы - не языковые модели
- «fisher» - металлоискатель Fisher Gemini 3; к нейросети Gemini отношения нет.
- «bayckrc» - радиопередатчик BayckRC Gemini для дронов.
- «optimus» - робот Tesla Optimus.
- «gr-1» и «fourier» - человекоидный робот Fourier GR-1.
- «quest» - VR-шлем Meta Quest, на него пытаются поставить ChatGPT.
- «а37» - смартфон Samsung A37; ищут, как поставить на него Perplexity.
- «пда» - форум 4PDA; «грок 4 пда» - тема про Grok там.
- «ро» - обрывок запроса про телевизор с Алисой.
Модели и версии других вендоров
- «119b» - Mistral Small 4 119B.
- «80b» - Qwen 3 Next 80B.
- «4.4» - Grok 4.4.
- «291.1» - версия приложения Perplexity; ищут взломанный apk, это серая тема.
- «гпт-4» и «гпт-5» - кириллическое написание моделей OpenAI.
- «gpt-one» - слитное «GPT one» из запросов с городом.
- «gpt-4.1-mini» - младшая модель линейки OpenAI 4.1.
- «gpt-5.1-codex», «gpt-5.1-codex-mini», «gpt-5.3-codex», «gpt-5.3-codex-spark», «gpt-5.5-cyber» - ветки кодовых моделей OpenAI; чаще всего спрашивают «что это».
- «rugpt-3» и «rugpt-3.5» - русские генеративные модели Сбера.
- «дипсик4» и «дипсик5» - DeepSeek на слух; сюда же склейки «дипсикз», «дипсикм», «дипсикто», «дипсикэ», «дипсикэъ» и «дипсикээ» - название пишут как слышат.
- «qwenchat» и «qwencode» - чат и кодовый инструмент Qwen.
- «tiny» - TinyLlama 1.1B для слабого железа; со Scout её роднит только фамилия.
- «StepFun» - китайская ИИ-лаборатория.
- «эни» - кириллическое «ani», компаньон-аватар в Grok.
Опечатки и склейки вокруг ChatGPT
- «chft» - ChatGPT, напечатанный с опечаткой.
- «gpttunell», «gpttunnels» и «gptunel» - обходные «туннели» к ChatGPT; рабочая альтернатива - официальный API или легальный агрегатор.
- «wegptru» - нечитаемая склейка про GPT.
- «accunte» - «account» с опечаткой; продажа чужих аккаунтов - риск бана и потери денег.
- «dco» - обрывок запроса про ChatGPT для Arma 3.
- «wormgpt» - «вредоносный двойник» ChatGPT для фишинга; платформы такие запросы режут фильтрами.
- «mathgptpro», «roomsgpt» и «musicgpt» - сторонние приложения-клиенты.
- «идп» - обрывок «скачать 4 идп» без читаемого интента.
- «null» - обрывок «редактор фото null null».
Алиса и её опечатки
- «алисаal» - склейка «Алиса AI».
- «алисанейро» и «алисапро» - «Алиса Нейро» и «Алиса Про» слитно.
- «алисаа», «алисааа», «алисаааа» и «алисаъ» - опечатки с лишними буквами.
Картинки, видео и музыка
- «Seedream» - генератор изображений ByteDance.
- «Veo» - видеомодель Google; ищут и как «veon».
- «gen-2» - Runway Gen-2, видеогенерация; «references» - режим референсов у Runway.
- «amber» - Flux Amber, вариант генератора картинок.
- «realism» - realism-наборы LoRA для Flux и Ideogram.
- «8bit» - генерации в стиле пиксель-арт.
- «kj» - конструктор промптов для Ideogram.
- «fallout» - нейросетевая русская озвучка Fallout 4.
- «kapwing» - онлайн-видеоредактор с ИИ-функциями.
- «x-minus» - сервис минусовок.
- «autotunes» - ИИ-каверы с автотюном.
- «beats» и «monkey» - обрывки запроса «remix monkey beats sunoai veo 3».
- «saga» и «lore» - обрывки музыкального запроса «saga lore ai blues string».
- «mini-tts» - озвучка текста.
- «stady» - «stady 24 ai», сторонний сервис.
- «starpoint» - «starpoint gemini 3» ищут на торрентах; к Gemini отношения нет.
- «историко» - «историко ия генератор картинка», стилизация фото под старину.
- «сестер» - «6 сестра картинка шедеврум»: генерация изображения сестёр в Шедевруме.
- «режиссер» - «режиссёр клод 4», запрос без чёткого интента, чаще про генерацию видео.
- «soraoraora» - Sora, напечатанная с захлёбом клавиш.
- «dao» и «bao» - обрывки «dao bao нейросеть скачать», мобильное приложение.
Соседние интенты про Llama и доступ
- «obliterated» - abliterated-файнтюны Llama 4 без отказов; к официальному окну отношения нет.
- «LibreChat» - опенсорсный чат-клиент, который подключают к разным API.
- «прикрепленными» - из запросов про загрузку файлов: люди хотят отправить документ с прикрепленными данными и не находят кнопку.
- «sexy» - adult-интент вида «sexy ai girls»; к Llama отношения нет, платформы такие запросы режут фильтрами.
provod.ai — сократите интеграционный зоопарк вокруг AI
Один совместимый API заменяет отдельную обвязку каждого вендора: разработчики быстрее добавляют AI-функции, а продуктовая команда свободнее выбирает модель под качество, скорость и задачу.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
За удобство роутинга нет отдельной ценовой надбавки: стоимость остаётся 1:1 с официальной ценой поставщика, а расчёты собираются на одном рублёвом балансе.
Упростите AI-архитектуру продукта: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai
Вопросы читателей
Коротко: пять вопросов, которые остаются после разбора.
Сколько реально держит Llama 4 Scout - миллион или десять?
По совокупности источников рабочее окно - сотни тысяч токенов. Retrieval-задачи могут работать на большей длине, чем multi-hop рассуждения; точную эффективную длину измеряй на своей задаче. Точные пер-длинные баллы независимых тестов противоречивы, поэтому свою длину измерь сам.
Почему провайдер даёт 131-328K, если заявлено 10M?
Потому что длинный контекст стоит памяти и денег: KV-cache растёт линейно, и провайдер режет окно под экономику своих кластеров. Пометка «10M» в листинге описывает конфиг модели, а не SLA конкретного backend.
Что взять для длинных документов: Scout или Maverick?
У Maverick заявлен миллион и вчетверо больше весов при тех же активных параметрах, но железо ему нужно тяжелее. Решает не карточка, а прогон твоего документа через обе модели: effective context length у них разный и не равен заявленному.
Во сколько обойдётся промпт на миллион токенов?
По ценам июля 2026 вход обойдётся примерно в $0,08-0,27 за миллион токенов плюс выход по тарифу провайдера. Оговорка: массово окна в миллион сейчас не отдаёт никто, так что реальный чек длинного запроса - те самые $0,01-0,09 при окне 131-328K.
Можно ли запустить Scout дома?
Нет. «Одна H100» - серверная карта дата-центра, да и она тянет длинный контекст лишь до сотни тысяч токенов по community-оценкам. Домашнее железо и edge-платы класса jetson 109-миллиардную MoE не поднимают; реалистичный путь - облачные API.
Источники
Коротко: первоисточники и разборы, на которых собран текст.
- S1 Meta AI Blog, анонс Llama 4 (05.04.2025): https://ai.meta.com/blog/llama-4-multimodal-intelligence/
- S2 NVIDIA NIM Docs, llama-4-scout-17b-16e-instruct (21.02.2026): https://docs.api.nvidia.com/nim/reference/meta-llama-4-scout-17b-16e-instruct
- S3 config.json чекпоинта, зеркало unsloth (снят 19.07.2026): https://huggingface.co/unsloth/Llama-4-Scout-17B-16E-Instruct/raw/main/config.json
- S4 RisingStack, обзор Llama 4 (19.04.2025): https://blog.risingstack.com/llama-4-overview/
- S5 arXiv 2601.11659, обзор Llama 4: https://www.arxiv.org/pdf/2601.11659
- S7 OpenRouter, meta-llama/llama-4-scout (19.07.2026): https://openrouter.ai/meta-llama/llama-4-scout
- S8 Cloudflare Workers AI specs (29.05-07.06.2026): https://models.sulat.com/models/cloudflare-workers-ai-at-cfmetallama-4-scout-17b-16e-instruct-e4e9c5c7
- S9 LLMReference, GCP Vertex AI (11.05.2026): https://www.llmreference.com/model/llama-4-scout-17b-16e-instruct/gcp-vertex-ai
- S10 LLMReference, Fireworks AI (09.07.2026): https://www.llmreference.com/model/llama-4-scout-17b-16e-instruct/fireworks-ai
- S11 GitHub, llama4-long-context (04.05.2025): https://github.com/jonathan-politzki/llama4-long-context/blob/main/Documentation/irope_findings.md
- S12 BABILong: https://github.com/booydar/babilong
- S13 RULER, arXiv 2404.06654: https://arxiv.org/pdf/2404.06654v3
- S14 «Defeat Devices in AI Systems», arXiv 2606.28863 (27.06.2026): https://arxiv.org/html/2606.28863
- S15 ITHome, падение Maverick на LMArena (14.04.2025): https://www.ithome.com/0/845/134.htm
- S16 TokenMix, разбор 10M-контекста (24.04.2026): https://tokenmix.ai/blog/llama-4-scout-10m-context-reality-check-2026
- S17 Birjob, разбор окна Scout (04.04.2026): https://www.birjob.com/blog/llama-4-scout-10m-token-context-window-reality
- S18 Merginit (12.03.2026) и Miraflow (20.04.2026), пересказы интервью ЛеКана: https://merginit.com/blog/11032026-meta-llama-4-flop-hardware-pivot
- S21 Aumiqx, тест 10M (09.04.2026): https://aumiqx.com/ai-tools/llama-4-scout-maverick-meta-open-source-2026/


Top comments (0)