DEV Community

Cover image for mistral nemo 12b уходит на пенсию: линейка Mistral в июле 2026 - куда мигрировать
Promptra Team for Promptra

Posted on

mistral nemo 12b уходит на пенсию: линейка Mistral в июле 2026 - куда мигрировать

В официальной таблице Legacy/Deprecated на docs.mistral.ai напротив Mistral NeMo 12B (API-имя open-mistral-nemo-2407) стоят две даты: депрекация объявлена 22 мая 2026, отключение - 31 июля 2026. Таблица проверена 19 июля 2026 - до конца жизни эндпоинта остаётся 12 дней.

Если твой прод или пет-проект до сих пор ходит в NeMo, паниковать рано, но открыть календарь пора. Миграция по API - это замена имени модели в конфиге, код переписывать не придётся. Промедление кончится ошибками в проде первого августа.

provod.ai - это агрегатор нейросетей для пользователей из России: Claude, GPT, Gemini, DeepSeek и Qwen в одном чате и через единый API (OpenAI- и Anthropic-совместимый), с оплатой в рублях легально, без VPN и зарубежных карт, с договором и закрывающими для юрлиц.

Через provod.ai (российский OpenRouter) доступны и уходящая NeMo, и все три кандидата на её место - одним ключом, так что замену реально прогнать A/B-тестом на том же коде до дедлайна. Ниже план эвакуации: что отключают, куда переходить и где подвох.

Что именно отключают 31 июля 2026?

Коротко: перестанет отвечать облачный эндпоинт open-mistral-nemo-2407. Это подтверждённый факт: строка есть в официальной таблице депрекаций Mistral, а независимый ChangeRadar 1 июля 2026 её дублирует: «open-mistral-nemo-2407 · retires 7/31/2026 · Deprecated → move to Ministral 3 8B». Веса никто не удаляет - речь только про API.

У таблицы две даты, и их путают. Депрекация (22 мая 2026) - табличка «модель устарела, новые проекты на ней не стартуйте». Отключение (31 июля 2026) - момент, когда эндпоинт перестаёт принимать запросы. Между ними у владельцев прода окно на переезд; у NeMo оно закрывается.

NeMo уходит не одна. На ту же дату записаны Mistral Small 3.2 (замена - Mistral Small 4), Magistral Small 1.2 и Magistral Medium 1.2, код-модель Devstral 2; 31 августа 2026 отключат Mistral Medium 3 и Medium 3.1 - всё в пользу Small 4 и Medium 3.5.

Для Mistral это система, а не ЧП: 30 марта 2025 ушли Mistral 7B всех версий, Mixtral 8x7B и 8x22B, Large 2.0; 31 декабря 2025 - Pixtral 12B и Ministral 3B/8B (24.10); 31 мая 2026 - Large 2.1. У каждой строки в таблице есть колонка с заменой: старый эндпоинт умирает, новый уже работает.

Чем был Mistral NeMo 12B и почему его жалко?

Коротко: NeMo - совместный релиз Mistral и NVIDIA от 18 июля 2024: 12B параметров (точнее 12.2B), контекст 128k, лицензия Apache 2.0 с base- и instruct-чекпоинтами. Модель делали как прямую замену Mistral 7B и сразу обучали с quantisation awareness - чтобы FP8-инференс шёл без потери качества.

Народной её сделали три вещи. Первая - токенизатор Tekken на базе Tiktoken, обученный на 100+ languages: по данным анонса, он примерно на 30% экономнее SentencePiece на коде и русском, вдвое - на корейском, втрое - на арабском и обходит токенизатор Llama 3 примерно на 85% языков. Для русскоязычных продуктов это значило меньшие счета за те же тексты.

Вторая - железо: квант Q4_K_M весит около 6.8 ГБ, то есть модель с контекстом 128k влезала в обычную 8-гигабайтную видеокарту, и связка «Apache 2.0 + 128k + 8 ГБ VRAM» два года оставалась редкостью. Третья - цена: у сторонних API-провайдеров NeMo держала нижнюю строчку линейки, от $0.02 за миллион входных токенов (pricepertoken, 08.07.2026); MMLU 68.0% для такого класса - честная рабочая цифра.

Моя претензия к Mistral одна: первой в летней волне гасят именно ту модель, которая была входным билетом в локальные и бюджетные сценарии. По ощущениям это закрытие эпохи «дешёвого 128k» - дальше линейка уходит в MoE и более дорогие конфигурации.

Как выглядит линейка Mistral в июле 2026?

Коротко: актуальное ядро - семейство Mistral 3 (анонс 2 декабря 2025), Mistral Small 4 (март 2026) и Mistral Medium 3.5 (конец апреля 2026), плюс голосовая Voxtral TTS. Потребительский Le Chat переименован в Vibe. Роли и цены - в таблице: данные pricepertoken на 08.07.2026 и официальные анонсы Mistral.

Модель Релиз Параметры Контекст Лицензия Цена API, $/1M (вход/выход) Роль
Ministral 3 3B 02.12.2025 3B н/д Apache 2.0 $0.10/$0.10 edge-задачи
Ministral 3 8B 02.12.2025 8B н/д Apache 2.0 $0.15/$0.15 официальная замена NeMo
Ministral 3 14B 02.12.2025 14B н/д Apache 2.0 $0.20/$0.20 edge с запасом
Mistral Small 4 03.2026 MoE 119B / 6B активных 256k Apache 2.0 ≈$0.15-0.20/$0.60* reasoning + мультимодальность
Mistral Medium 3.5 04.2026 128B плотная 256k Modified MIT $1.50/$7.50 код-агент, тяжёлые задачи
Mistral Large 3 02.12.2025 MoE 675B / 41B активных н/д Apache 2.0 $0.50/$1.50** флагман
Voxtral TTS 03.2026 4B - CC BY-NC 4.0 $0.016 за 1k символов голос

* Цена Small 4 не подтверждена первоисточником: gate.ai (25.06.2026) - $0.15/$0.60, techjacksolutions (02.07.2026) - $0.20/$0.60. ** Так pricepertoken; у официального FAQ другой пример - ниже.

Пара пояснений к строкам. Small 4 - первая модель компании, собравшая в одних весах reasoning из Magistral, мультимодальность из Pixtral и агентный код из Devstral: MoE 119B с 6B активных, контекст 256k, ручка reasoning_effort. Минус 40% времени ответа и тройной рост запросов в секунду против Small 3 - это слова вендора, а не независимый замер.

Medium 3.5 (карточка NVIDIA NIM, 29.04.2026) заменила сразу три продукта - Medium 3.1, Magistral и Devstral 2, держит 77.6% на SWE-Bench Verified, веса на Hugging Face, селф-хост от 4 GPU. Лицензия не Apache, а Modified MIT: юристам крупных компаний стоит прочитать текст до коммита.

С ценой Large 3 путаница: официальный FAQ Mistral приводит пример «$2 за 1M вход, $6 за 1M выход» для Mistral Large, а pricepertoken показывает для Large 3 $0.50/$1.50. Цифры расходятся вчетверо - любую цену из статьи проверяй на день чтения, особенно перед сметой.

Куда мигрировать с NeMo: три сценария

Коротко: по умолчанию бери Ministral 3 8B - это официальная замена из таблицы депрекаций. Если NeMo у тебя отвечала за reasoning или картинки на входе - смотри на Small 4. Если она была тяжёлым код-агентом - на Medium 3.5. Локальные веса не трогай вообще: они продолжают работать.

Сценарий использования NeMo Замена Цена, $/1M (вход/выход) Что изменится
Дешёвый API-чат, ассистент в продукте Ministral 3 8B $0.15/$0.15 Официальная замена; дороже старых $0.02 у сторонних провайдеров
Reasoning, мультимодальность, длинный контекст Mistral Small 4 ≈$0.15-0.20/$0.60 Контекст 256k, reasoning_effort, другой токенизатор
Код-агент, сложные задачи Mistral Medium 3.5 $1.50/$7.50 Modified MIT, селф-хост от 4 GPU
Локальные веса Остаются + GGUF Ministral 3 8B 0 (только железо) Ничего: Apache 2.0 бессмертна

Про цену Small 4 честно: первоисточник её не подтвердил, поэтому в таблице диапазон по агрегаторам за июнь-июль 2026. Для большинства чат-сценариев выбор всё равно встанет между Ministral 3 8B и Small 4, а типичная задача класса assistants - чат-ассистент в поддержке или внутри продукта - почти всегда ложится на Ministral.

Кстати, все три кандидата уже доступны из России без VPN: в provod.ai они живут в одном чате с Claude, GPT и Gemini, а платишь картой РФ по официальному тарифу - те же $0.15/$0.15 за Ministral 3 8B, только в рублях и без наценки. К деталям доступа вернёмся в конце, а пока - карта переезда.

Карта миграции с NeMo: три сценария замены с ценами и контекстом, июль 2026

Если готов уйти с Mistral совсем, рынок reasoning и vision в июле 2026 выглядит так:

Задача Вариант вне Mistral
Тяжёлый reasoning DeepSeek R1 671B
Лёгкий reasoning вместо Magistral Qwen QwQ 32B
Vision-запросы Qwen 3 VL
Ещё reasoning-моды Hunyuan T1, DeepSeek R1T2 Chimera

С GPT сравнивай трезво: gpt4o - сильный продукт, но к дедлайну 31 июля отношения не имеет, а ценник там другой весовой категории.

Как провести upgrade за один вечер?

Коротко: upgrade по API - это замена одной строки с именем модели плюс честный прогон твоих реальных запросов на двух моделях. Заложи вечер: час на код и конфиги, пара часов на сравнение ответов.

Если integration с моделью держится на OpenAI-совместимом клиенте (у NeMo чаще всего так и есть), вся механика - в двух переменных: base_url и model. Выглядит это примерно так:

from openai import OpenAI

client = OpenAI(
    api_key="PROVOD_KEY",
    base_url="https://api.provod.ai/v1",
)

# точное имя модели сверь в каталоге своего провайдера - нотация различается
resp = client.chat.completions.create(
    model="ministral-3-8b",  # было: open-mistral-nemo-2407
    messages=[...],
)
Enter fullscreen mode Exit fullscreen mode

Дальше чек-лист, без которого замена строки превращается в лотерею:

  1. Найди все места, где зашито open-mistral-nemo-2407: конфиги, env-файлы, фича-флаги, боты.
  2. Собери eval-набор из 20-50 реальных запросов из логов - боевых, с ожидаемым форматом ответа.
  3. Прогони его на NeMo и на кандидате через один ключ: A/B здесь - смена значения model при том же base_url.
  4. Проверь длинные контексты: у NeMo было 128k, у Small 4 и Medium 3.5 - 256k, а лимит Ministral 3 8B смотри в карточке модели у провайдера.
  5. Пересчитай стоимость запроса на своём трафике: у Small 4 другой токенизатор, не Tekken, и счёт за тот же текст изменится.
  6. Переключи прод до 31 июля 2026, а не «в августе»: первого числа старое имя начнёт возвращать ошибку, и дебажить это на боевом трафике - так себе план.

А если NeMo стояла локально?

Коротко: делать ничего не надо. Отключают только облачный эндпоинт; скачанные веса под Apache 2.0 остаются у тебя навсегда, и GGUF-квант Q4_K_M продолжит крутиться хоть в 2030 году. Писать «NeMo удалили с Hugging Face» - неправда, не ведись.

Если руки чешутся обновиться, ближайший наследник по классу железа - Ministral 3 8B: та же Apache 2.0, веса на Hugging Face. Сценарии знакомые: docker compose на сервере, venv плюс llama-cpp-python на ноутбуке, сборка с rocm, если у тебя AMD, и даже termux на телефоне для самых упорных. Self-host по Apache 2.0 - это и есть честное «besplatno»: модель твоя, платишь только за железо и электричество.

Тем, у кого на машине уже живёт соседний стек генерации картинок, экосистема llama.cpp покажется родной: та же логика «скачал веса - поднял - работает». Stability matrix и webui reforge с directml на AMD-картах, декодер taesd, модели с civit и openpose для поз - всё это из того же мира локальных весов.

Оговорка для инфраструктурных команд: если ваш пайплайн строился вокруг FP8 и quantisation-aware обучения (фишка релиза с NVIDIA), перепроверь, как схема ложится на новые веса - автоматом она не переносится.

Чего миграция не решает?

Коротко: смена имени модели не сохраняет поведение один в один. Ответы поплывут, расход токенов изменится, цена почти наверняка окажется выше старых $0.02, а часть инфраструктуры придётся перепроверить руками.

Дальше по граблям. Промпты, заточенные под NeMo, на новой модели могут дать другой тон и структуру - отсюда требование eval-набора выше. Лицензия Medium 3.5 - Modified MIT с оговорками для крупного бизнеса, а Voxtral TTS вышел под некоммерческой CC BY-NC 4.0: для коммерческой озвучки он не подходит. И у Small 4 собственный токенизатор - калькуляторы стоимости, прибитые к Tekken, пересчитывай.

Когда provod.ai не подходит

Коротко: агрегатор закрывает доступ из России, оплату в рублях и переключение между моделями одним ключом. Всё за пределами этого контура он не решает - и вот случаи, когда он тебе не нужен.

Если NeMo у тебя локальная и такой останется - миграция и любые API-сервисы не про тебя. Если нужен прямой Enterprise-контракт с Mistral ради SLA - иди к вендору. Если весь сценарий - тяжёлая переписка в чате по подписке, Vibe Pro за $14.99 в месяц может выйти дешевле токенов (страница тарифов Mistral, 19.07.2026). Fine-tuning и on-prem - работа с вендором или своим железом, а не с агрегатором.

Словарик запросов кластера

Коротко: рядом с запросами про NeMo в поиске живёт много шума - люди ищут вообще не Mistral. Разбираю частые соседние запросы по одной строке, чтобы ты быстро понял, туда ли попал.

  • «suno alaska», «suno andfm cpacec», «suno metallica», «сорайя болеро», «путевка в детство», «suno ai аленка», «nacer ultra slowed», «ген эпи суно ай» - генерация песен в Suno; Mistral пишет тексты, не музыку.
  • «00025», «haier hw60 bp10919a», «es100v c1 ga04j201dru», «electrolux mz 57875», «xigma turbocool xg txe27rha», «jbl колонка алиса» - коды устройств с Алисой, к Mistral отношения нет.
  • «сеа скачать яндекс музыка», «алиса йа», «алиса грт» - музыка и голосовые запросы к Алисе, тоже не сюда.
  • «hunyuan t1», «deepseek r1t2 chimera», «qwen qwq», «qwen 3vl», «deepseek r1 671b» - reasoning- и vision-модели вне Mistral, их роль - в таблице выше.
  • «midjourney v8 alpha», «sref», «cref», «midjourney prompt helper», «runway gen2», «gpt 4v» - Midjourney и Runway: версии, параметры стиля, хелперы; «gpt 4v» - устаревший запрос про GPT-4 со зрением.
  • «Hedra» - нейросеть говорящих видео-аватаров, самый частый соседний запрос; к Mistral отношения нет.
  • «claude vonstroke», «claude de lune», «claude corps fellowship», «gemini fourth», «gemini tahir editz» - люди и проекты-однофамильцы.
  • «omvl gemini», «gemini 470 dsp» - газобаллонное оборудование и автозвук, совпадение названия.
  • «tesla fsd», «fsd audio» - автопилот Tesla и его звуки.
  • «дипсик ошибка 1004», «grok jailbrake», «gptru», «xhat gpt», «grok xom», «syntxaibot», «gptunnel grom» - ошибки DeepSeek, джейлбрейки и сторонние боты.
  • «xiaozhi deepseek esp32 s3 / c3», «sber sdx 65uq5233 с gigachat», «chatgpt ip address» - прошивка на ESP32, телевизор Sber с GigaChat, блокировки по IP.
  • «pixai art», «yandexart viral», «peopletalk как отличить картинку от нейросети», «gummy bear ai sora», «ninjutso sora», «alone veo mods», «шедеврум профиль оао», «freetts» - картинки и видео вокруг Sora, Veo, YandexART и Шедеврума; freetts - бесплатная озвучка, у Mistral за голос отвечает Voxtral TTS (лицензия некоммерческая).
  • «chatgpt skachat uzbekcha», «gemini merhaba», «чао gpt», «геминь гунл», «алиса какая погода в Башмакове», «живой быть не помрем» - многоязычные «скачать чат», погода и поиск песни.
  • запросы про 18+-генерацию (tits, slooty), slots и patreon - не тема статьи; такой контент платформа режет фильтром.
  • «claude pronunciation», «gemini pronunciation», «claude styles», «midjourney styles» - как произносить имена («Клод», «Джемини») и как задавать стили.

provod.ai — один API для привычных AI-инструментов

Подключайте клиенты, агентов, IDE, SDK, библиотеки и приложения с поддержкой OpenAI-совместимого API: во многих случаях достаточно заменить базовый URL и ключ без изменения прикладного кода.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Широкая совместимость не оплачивается отдельной наценкой: тарифы моделей остаются на уровне официальных провайдеров 1:1, а расчёты объединяются в рублёвом балансе.

Подключите привычный инструмент к provod.ai: миграция OpenAI SDK · форма регистрации · цены на модели · защита данных по 152-ФЗ

FAQ

Коротко: старое имя после 31 июля вернёт ошибку, веса никто не отнимал, наследник для слабых GPU - Ministral 3 8B, платить можно в рублях. Детали и edge cases - ниже.

Что будет, если после 31 июля вызвать open-mistral-nemo-2407?

Ввел старое имя - получил ошибку: по таблице docs.mistral.ai retirement - жёсткая дата, эндпоинт перестаёт принимать запросы. Совет: залогируй имя модели в каждом запросе уже сейчас - первого августа увидишь все забытые места по логам, а не по падающему проду.

Mistral NeMo 12B теперь под запретом?

Нет. «Пенсия» касается только облачного API. Веса под Apache 2.0 остаются доступными и легальными: качай, запускай, встраивай в продукт - лицензия это разрешала и продолжает разрешать.

Чем заменить mistral nemo 12b instruct, если нужен именно 128k на слабой GPU?

Ближайший кандидат - Ministral 3 8B в GGUF: тот же класс железа (NeMo в Q4_K_M занимал около 6.8 ГБ), Apache 2.0. Лимит контекста сверь в карточке конкретной сборки - у NeMo было 128k, требование «не меньше» проверь до переезда. В облаке запас дают Small 4 и Medium 3.5 с их 256k.

Сколько стоит замена и где платить в рублях?

По pricepertoken на 08.07.2026: Ministral 3 8B - $0.15/$0.15 за миллион токенов (вход/выход), Small 4 - ориентировочно $0.15-0.20/$0.60 по агрегаторам июня-июля 2026, Medium 3.5 - $1.50/$7.50. В рублях те же цифры считает provod.ai: платить можно картой РФ, по СБП или по счёту с закрывающими документами.

Mistral Small 4 или Ministral 3 8B - что взять для ассистента?

Если ассистент отвечает на типовые вопросы и важна цена - Ministral 3 8B. Если нужны рассуждения с регулируемым reasoning_effort, картинки на входе или запас контекста 256k - Small 4. Спорный момент: платить в разы больше за reasoning, который твои пользователи, возможно, никогда не заметят. Я бы начинал с Ministral и смотрел на метрики, а не на шильдик.

Финал: 12 дней - это много, если не тянуть

Коротко: до 31 июля успеваешь всё - выбрать кандидата, прогнать A/B на своём коде и переключить прод. Расклад по сценариям - ниже.

Дедлайн 31 июля 2026 - редкий случай, когда у индустрии есть точная дата смерти эндпоинта и готовая замена. Мой расклад: боевой чат переводи на Ministral 3 8B уже на этой неделе, Small 4 держи вторым номером там, где нужен reasoning, а Medium 3.5 бери, только если код-агент окупает $1.50/$7.50. Не согласен с раскладом - скажи, на что переходишь ты и чем это кончилось.

12 дней до 31 июля 2026: замени имя модели и переключи прод - provod.ai

Проверь замену до дедлайна: на provod.ai Ministral 3 8B, Mistral Small 4 и Medium 3.5 доступны с одного баланса - подставь base_url и ключ вместо текущего эндпоинта, прогони свой основной сценарий на двух кандидатах и переключи прод до 31 июля. Оплата в рублях с карты РФ, для юрлиц - договор и закрывающие.

Источники

Top comments (0)