DEV Community

Cover image for «llama 4 scout 17b»: 10 млн контекста на бумаге, 1–2 млн по факту - где ломается длина
Promptra Team for Promptra

Posted on

«llama 4 scout 17b»: 10 млн контекста на бумаге, 1–2 млн по факту - где ломается длина

Десять миллионов токенов контекста - такой цифрой Meta открыла анонс Llama 4 Scout 5 апреля 2025 года. Это тысячи страниц текста в одном промпте: целая кодовая база, архив документов, часы транскриптов, и всё без RAG. Год спустя картина трезвая: обучена модель на контексте 256 тысяч токенов, три четверти её слоёв видят за раз лишь 8 192 токена, а провайдеры реально отдают окна 131-328 тысяч. По community-оценке, восемь H100 дают около миллиона токенов, а для 1-10M нужны мультинодовые установки; качество зависит от задачи.

Заявка при этом формально честная: в официальном config.json стоит max_position_embeddings = 10 485 760, ровно 10×2²⁰ (конфиг снят 19.07.2026). Честная и почти бесполезная одновременно. Между цифрой в конфиге и тем, что ты получишь за свои деньги, лежат три слоя слома: архитектура, железо и доступность. Разберём все три по первоисточникам и посчитаем цену длинного промпта по прайсам на июль 2026.

Прежде чем спорить, где ломается длина, полезно прогнать один и тот же длинный документ через Scout и пару альтернатив вроде Claude и GPT из одного API - так делают через provod.ai (российский OpenRouter), где модели доступны с рублёвого баланса по ценам официальных провайдеров, без VPN. К тестам вернёмся в конце, а пока - что за модель.

Что такое Llama 4 Scout 17B 16E и что именно пообещала Meta?

Коротко: Scout и Maverick - первые MoE-модели Llama, нативно мультимодальные, анонсированы 5 апреля 2025 года. Scout - младшая и лёгкая из пары: 17 млрд активных параметров из 109 млрд, в Int4-квантизации помещается на одну NVIDIA H100. Главный рекламный тезис - «industry-leading context window of 10M».

Полное имя весов читается как расшифровка: Llama-4-Scout-17B-16E-Instruct. Здесь 17b - активные параметры на токен, 16e - число экспертов, instruct - версия, дообученная под инструкции и чат. Характеристики - по блогу Meta (05.04.2025), документации NVIDIA NIM (страница от 21.02.2026) и конфигу чекпоинта (19.07.2026):

Параметр Значение
Активные параметры 17 млрд (всего 109 млрд)
Эксперты 16 (на токен - один роутируемый плюс общий)
Слои / hidden 48 / 5120
Обучающий корпус около 40 трлн токенов, знания до августа 2024
Заявленное окно 10 485 760 токенов
Обучающий контекст 256 тысяч токенов
Железо одна H100 в Int4-квантизации
Языки 12 официально; русского в списке нет

Две строки из таблицы стоит перечитать: заявленное окно и обучающий контекст отличаются в 40 раз. Это не опечатка, это суть всей истории.

Почему 10 млн токенов - это экстраполяция, а не «честная» длина?

Коротко: Scout предобучен и дообучен на контексте 256K. Десять миллионов получаются растяжением на инференсе: архитектура iRoPE чередует слои без позиционных кодировок, а внимание дополнительно поджимают температурным шкалированием. Модель никогда не видела десять миллионов токенов в обучении - она умеет только «дотягиваться».

В конфиге это написано дословно: attn_temperature_tuning = true, attn_scale = 0.1, rope_scaling типа llama3 с factor 16 и original_max_position_embeddings = 8192. Последняя цифра - вторая опора: большинство слоёв работают в режиме chunked attention с окном 8 192 токена (attention_chunk_size = 8192 в том же конфиге). По независимым разборам, лишь каждый четвёртый слой - полный causal attention без позиционных кодировок: примерно 75% слоёв смотрят локально, 25% «прочёсывают» весь контекст как прожектор.

Меня здесь напрягает подача: трюк рабочий, инженерно интересный - но в пресс-релизе из него сделали «окно 10M» без оговорки, что это length generalization. В эпоху gpt-3 окно в несколько тысяч токенов казалось роскошью; с тех пор маркетинговые цифры выросли на три порядка быстрее физики внимания.

И попутно о единицах. «10 млн токенов» - это не 10 млн слов: токенизатор byte pair encoding режет текст на подсловные куски, поэтому в словах реальный объём заметно меньше. Считай цену всегда в токенах, не в страницах.

Где ломается длина: архитектура, железо или качество?

Коротко: на всех трёх уровнях, и ломаются они в разном порядке. Первой сдаёт память железа: KV-cache растёт линейно с длиной, и iRoPE этого не решает. Дальше - качество рассуждений: найти факт в длинном тексте модель ещё может, связывать факты между собой - уже плохо.

По железу есть community-оценка предельного контекста (разбор на GitHub, 04.05.2025; не официальные данные Meta): одна H100 с 80 ГБ вытягивает около 100K токенов, четыре карты - порядка 400K, восемь - около миллиона. Для диапазона 1-10M уже нужны мультинодовые установки. То есть «помещается на одну H100» из анонса - правда про веса в Int4, но не про длинный контекст: веса помещаются, а память под KV-cache к ним - нет.

С качеством хуже: независимые тесты противоречат друг другу, и оба верифицировать не удалось. TokenMix (24.04.2026) описывает зоны слома: рабочая 100-500K, «обвал рассуждений» на 500K-1M с точностью multi-hop ниже 40%, хрупкая 1-5M и «маркетинговая» 5-10M. Aumiqx (09.04.2026) наоборот заявляет больше 95% needle-recall на полных 10M. Обе цифры подаю как есть, по неподтверждённым данным. Но они сходятся в главном: retrieval живёт далеко, рассуждения - нет.

Болезнь при этом общая, Scout здесь не один: бенчмарк RULER ещё в 2024 году ввёл понятие effective context length и показал, что почти все модели теряют качество с ростом длины задолго до конца заявленного окна. BABILong со сплитами до 10M добавил Scout в свой лидерборд в апреле 2025 - проверяемые данные по длинным дистанциям у модели есть, просто они не про «10 млн работают».

Одна H100 выдыхается на сотне тысяч токенов: лестница предельного контекста

Сколько контекста реально отдают провайдеры и сколько это стоит?

Коротко: меньше 10M - у всех. Cloudflare Workers AI отдаёт окно 131K за $0,27/$0,85 за миллион входных/выходных токенов, GCP Vertex AI - 328K за $0,20/$0,65. Листинг OpenRouter держит пометку «10M» с ценами от $0,10/$0,30. Запрос на полные 10M входных токенов стоил бы $0,8-2,7 только за вход; на практике при окне 131-328K длинный запрос обходится в $0,01-0,09.

Цифры - по спецификациям провайдеров на июль 2026: Cloudflare (29.05-07.06.2026), Vertex AI (11.05.2026), OpenRouter (проверено 19.07.2026). Всего Scout раздают 12 провайдеров, самый дешёвый вход - от $0,08 за миллион токенов (по данным LLMReference на 09.07.2026).

Провайдер Окно Input, $/1M Output, $/1M Макс. выход
Cloudflare Workers AI 131K 0,27 0,85 16 384 токена
GCP Vertex AI 328K 0,20 0,65 в источнике не указан
OpenRouter (листинг) «10M» от 0,10 от 0,30 зависит от backend

Строка OpenRouter - отдельная ловушка: пометка «10M» в листинге говорит о конфиге модели, а не о том, что конкретный backend примет десятимиллионный промпт. Перед расчётом бюджета смотри лимит своего провайдера, а не карточку модели.

На фоне конкурентов картина забавная. Миллионный класс окна есть у gpt-4.1 от OpenAI и у gemini-2.5-flash от Google, у Maverick заявлен миллион. Meta ответила десятикратной цифрой - и выиграла заголовок, но не инфраструктуру.

Чем Scout отличается от Maverick и что случилось с behemoth?

Коротко: у Scout и Maverick одинаковые 17 млрд активных параметров, но Maverick вчетверо шире по весам - 128 экспертов и 400 млрд против 16 и 109; заявленное окно у него скромнее, 1M, а железо нужно тяжелее - целый хост H100 DGX. Флагман behemoth (288 млрд активных, около 2 трлн всего) анонсирован как «учитель» для всего стада и к июлю 2026 публично так и не вышел.

Модель Активные Всего Эксперты Заявленное окно Железо
Scout 17 млрд 109 млрд 16 10M одна H100 (Int4)
Maverick 17 млрд 400 млрд 128 1M хост H100 DGX
Behemoth 288 млрд около 2 трлн - - не выпущен

Люди ищут это сравнение дословно так: «llama 4 scout и maverick отличие». В анонсе Meta ставила Maverick рядом с DeepSeek v3.1 - и здесь стоит вспомнить, почему headline-цифрам компании не верят на слово. На LMArena отправили кастомную «Llama-4-Maverick-03-26-Experimental» с ELO 1417 и вторым местом после Gemini 2.5 Pro, а публичная модель оказалась другим изделием: после замены на релизный вариант Maverick упал со 2-го на 32-е место. LMArena публично заявила о несоответствии ожиданиям, The Verge вышла 08.04.2025 с заголовком «Meta got caught gaming AI benchmarks».

Второй штрих: в январе 2026 года уходящий главный AI-учёный Meta Янн ЛеКан в интервью FT признал, что бенчмарки Llama 4 были «fudged a little bit» - для разных тестов брались разные варианты модели. Пересказ двух независимых вторичных источников; оригинал FT за пейволом, дословно проверить не удалось. Цифра «10M» - из той же серии: юридически не ложь, практически - мираж.

Что длинный контекст Scout не решает?

Коротко: он не отменяет RAG по цене, не добавляет русский язык в официальный список, не запускается на домашнем железе и не делает рассуждения на дальних дистанциях надёжными.

По деньгам retrieval выигрывает всухую: десятимиллионный промпт по $0,8-2,7 за вход против выборки нужных фрагментов - разница на порядки, и платить её придётся на каждый запрос, а не один раз за построение индекса. Это мой расчёт из цен выше, а не данные вендора, но арифметика упрямая.

По языку: официальный список - 12 языков, русского среди них нет (документация Meta и NVIDIA). По-русски модель отвечать умеет, но это уровень «как получилось при обучении», без обещаний вендора.

По железу: «одна H100» - это серверная карта, а не твой ноутбук и не edge-плата. Платы класса jetson - люди ищут «jetson nano» и «jetson orin» - для 109-миллиардной MoE непрактичны, а одна H100 по community-оценке даёт около 100K токенов контекста, см. лестницу выше. И по качеству: если твоя задача - рассуждения над связями в длинном архиве, а не поиск иголки, зона за пределами сотен тысяч токенов тебе не поможет.

Как проверить эффективную длину на своей задаче?

Коротко: не верь цифре окна - измерь свою. Берёшь реальный длинный документ, расставляешь закладки, гоняешь нарастающими длинами и сравниваешь две-три модели на одном материале. Пара вечеров работы, зато дальше решения принимаешь по своим данным.

  1. Собери тестовый корпус из своих документов: кодовая база, архив переписки, длинный отчёт - то, что реально пойдёт в прод.
  2. Расставь needle-закладки - уникальные факты - на 25, 50, 75 и 95% глубины текста и спроси про каждую.
  3. Добавь multi-hop вопросы, где ответ собирается из двух мест документа на разных концах: здесь рассуждения сдают первыми.
  4. Прогони нарастающими длинами - 32K, 128K, 256K, потолок провайдера - и зафиксируй, где точность начинает падать.
  5. Повтори прогон на двух-трёх альтернативах: у разных вендоров effective context length разный при одинаковой цифре в карточке.
  6. Считай деньги на каждом прогоне: цена входа умножается на длину промпта. И отделяй сбои доступа от деградации модели: если API вернул insufficient balance, это пустой баланс счёта, а не «сломался контекст».

Весь такой тест удобнее делать из одного API: в provod.ai Scout соседствует с альтернативами, подключение - смена ключа и base_url в клиенте, совместимом с OpenAI SDK, а расход по прогонам виден на одном рублёвом балансе. Условия оплаты и цены уточняй на сайте сервиса.

Когда provod.ai не подходит

Коротко: если ты качаешь веса Scout и гоняешь их на своём железе, агрегатор не нужен вовсе. Ещё два случая мимо: fine-tuning с on-prem контуром и прямой enterprise-контракт с провайдером ради SLA.

Веса у Llama открыты, и self-host - легальный, часто правильный путь, когда железо уже куплено: там ты сам решаешь, сколько памяти отдать под KV-cache. Fine-tuning и on-prem - тоже про свой стек, а не про API-агрегатор. И если расход вырос до уровня прямого контракта с вендором, посредник смысла не добавит. Наконец, официальную поддержку русского языка не даст ни один агрегатор: её нет у самой Meta, и это чинить только ей.

Проверь длину на своей задаче: один API, один баланс, все модели рядом

Проверь эффективный контекст на своём архиве: подключи provod.ai, поменяй base_url и ключ - и сравни модели на одной задаче. Оплата в рублях по ценам провайдеров без наценки, для юрлиц - договор и закрывающие документы.

Словарик запросов кластера: что ещё ищут рядом с Llama 4

Коротко: поиск сваливает в этот кластер много лишнего - от металлоискателей до роботов. Разбираю, что к чему.

Железо и роботы - не языковые модели

  • «fisher» - металлоискатель Fisher Gemini 3; к нейросети Gemini отношения нет.
  • «bayckrc» - радиопередатчик BayckRC Gemini для дронов.
  • «optimus» - робот Tesla Optimus.
  • «gr-1» и «fourier» - человекоидный робот Fourier GR-1.
  • «quest» - VR-шлем Meta Quest, на него пытаются поставить ChatGPT.
  • «а37» - смартфон Samsung A37; ищут, как поставить на него Perplexity.
  • «пда» - форум 4PDA; «грок 4 пда» - тема про Grok там.
  • «ро» - обрывок запроса про телевизор с Алисой.

Модели и версии других вендоров

  • «119b» - Mistral Small 4 119B.
  • «80b» - Qwen 3 Next 80B.
  • «4.4» - Grok 4.4.
  • «291.1» - версия приложения Perplexity; ищут взломанный apk, это серая тема.
  • «гпт-4» и «гпт-5» - кириллическое написание моделей OpenAI.
  • «gpt-one» - слитное «GPT one» из запросов с городом.
  • «gpt-4.1-mini» - младшая модель линейки OpenAI 4.1.
  • «gpt-5.1-codex», «gpt-5.1-codex-mini», «gpt-5.3-codex», «gpt-5.3-codex-spark», «gpt-5.5-cyber» - ветки кодовых моделей OpenAI; чаще всего спрашивают «что это».
  • «rugpt-3» и «rugpt-3.5» - русские генеративные модели Сбера.
  • «дипсик4» и «дипсик5» - DeepSeek на слух; сюда же склейки «дипсикз», «дипсикм», «дипсикто», «дипсикэ», «дипсикэъ» и «дипсикээ» - название пишут как слышат.
  • «qwenchat» и «qwencode» - чат и кодовый инструмент Qwen.
  • «tiny» - TinyLlama 1.1B для слабого железа; со Scout её роднит только фамилия.
  • «StepFun» - китайская ИИ-лаборатория.
  • «эни» - кириллическое «ani», компаньон-аватар в Grok.

Опечатки и склейки вокруг ChatGPT

  • «chft» - ChatGPT, напечатанный с опечаткой.
  • «gpttunell», «gpttunnels» и «gptunel» - обходные «туннели» к ChatGPT; рабочая альтернатива - официальный API или легальный агрегатор.
  • «wegptru» - нечитаемая склейка про GPT.
  • «accunte» - «account» с опечаткой; продажа чужих аккаунтов - риск бана и потери денег.
  • «dco» - обрывок запроса про ChatGPT для Arma 3.
  • «wormgpt» - «вредоносный двойник» ChatGPT для фишинга; платформы такие запросы режут фильтрами.
  • «mathgptpro», «roomsgpt» и «musicgpt» - сторонние приложения-клиенты.
  • «идп» - обрывок «скачать 4 идп» без читаемого интента.
  • «null» - обрывок «редактор фото null null».

Алиса и её опечатки

  • «алисаal» - склейка «Алиса AI».
  • «алисанейро» и «алисапро» - «Алиса Нейро» и «Алиса Про» слитно.
  • «алисаа», «алисааа», «алисаааа» и «алисаъ» - опечатки с лишними буквами.

Картинки, видео и музыка

  • «Seedream» - генератор изображений ByteDance.
  • «Veo» - видеомодель Google; ищут и как «veon».
  • «gen-2» - Runway Gen-2, видеогенерация; «references» - режим референсов у Runway.
  • «amber» - Flux Amber, вариант генератора картинок.
  • «realism» - realism-наборы LoRA для Flux и Ideogram.
  • «8bit» - генерации в стиле пиксель-арт.
  • «kj» - конструктор промптов для Ideogram.
  • «fallout» - нейросетевая русская озвучка Fallout 4.
  • «kapwing» - онлайн-видеоредактор с ИИ-функциями.
  • «x-minus» - сервис минусовок.
  • «autotunes» - ИИ-каверы с автотюном.
  • «beats» и «monkey» - обрывки запроса «remix monkey beats sunoai veo 3».
  • «saga» и «lore» - обрывки музыкального запроса «saga lore ai blues string».
  • «mini-tts» - озвучка текста.
  • «stady» - «stady 24 ai», сторонний сервис.
  • «starpoint» - «starpoint gemini 3» ищут на торрентах; к Gemini отношения нет.
  • «историко» - «историко ия генератор картинка», стилизация фото под старину.
  • «сестер» - «6 сестра картинка шедеврум»: генерация изображения сестёр в Шедевруме.
  • «режиссер» - «режиссёр клод 4», запрос без чёткого интента, чаще про генерацию видео.
  • «soraoraora» - Sora, напечатанная с захлёбом клавиш.
  • «dao» и «bao» - обрывки «dao bao нейросеть скачать», мобильное приложение.

Соседние интенты про Llama и доступ

  • «obliterated» - abliterated-файнтюны Llama 4 без отказов; к официальному окну отношения нет.
  • «LibreChat» - опенсорсный чат-клиент, который подключают к разным API.
  • «прикрепленными» - из запросов про загрузку файлов: люди хотят отправить документ с прикрепленными данными и не находят кнопку.
  • «sexy» - adult-интент вида «sexy ai girls»; к Llama отношения нет, платформы такие запросы режут фильтрами.

provod.ai — сократите интеграционный зоопарк вокруг AI

Один совместимый API заменяет отдельную обвязку каждого вендора: разработчики быстрее добавляют AI-функции, а продуктовая команда свободнее выбирает модель под качество, скорость и задачу.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

За удобство роутинга нет отдельной ценовой надбавки: стоимость остаётся 1:1 с официальной ценой поставщика, а расчёты собираются на одном рублёвом балансе.

Упростите AI-архитектуру продукта: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai

Вопросы читателей

Коротко: пять вопросов, которые остаются после разбора.

Сколько реально держит Llama 4 Scout - миллион или десять?
По совокупности источников рабочее окно - сотни тысяч токенов. Retrieval-задачи могут работать на большей длине, чем multi-hop рассуждения; точную эффективную длину измеряй на своей задаче. Точные пер-длинные баллы независимых тестов противоречивы, поэтому свою длину измерь сам.

Почему провайдер даёт 131-328K, если заявлено 10M?
Потому что длинный контекст стоит памяти и денег: KV-cache растёт линейно, и провайдер режет окно под экономику своих кластеров. Пометка «10M» в листинге описывает конфиг модели, а не SLA конкретного backend.

Что взять для длинных документов: Scout или Maverick?
У Maverick заявлен миллион и вчетверо больше весов при тех же активных параметрах, но железо ему нужно тяжелее. Решает не карточка, а прогон твоего документа через обе модели: effective context length у них разный и не равен заявленному.

Во сколько обойдётся промпт на миллион токенов?
По ценам июля 2026 вход обойдётся примерно в $0,08-0,27 за миллион токенов плюс выход по тарифу провайдера. Оговорка: массово окна в миллион сейчас не отдаёт никто, так что реальный чек длинного запроса - те самые $0,01-0,09 при окне 131-328K.

Можно ли запустить Scout дома?
Нет. «Одна H100» - серверная карта дата-центра, да и она тянет длинный контекст лишь до сотни тысяч токенов по community-оценкам. Домашнее железо и edge-платы класса jetson 109-миллиардную MoE не поднимают; реалистичный путь - облачные API.

Источники

Коротко: первоисточники и разборы, на которых собран текст.

Top comments (0)