Пока все следили за гонкой закрытых моделей, Xiaomi довела линейку MiMo до триллиона параметров — и опубликовала веса под лицензией MIT. Разбираю, что там внутри и почему это важно.
Это не одна модель, а целое семейство
MiMo — не отдельный чекпойнт, а зонтик для нескольких моделей. Под ним выходили рассуждающая MiMo-7B (май 2025), зрение MiMo-VL, аудио MiMo-Audio, модель для роботов и машин MiMo-Embodied, разреженные MoE поколения V2 и V2.5. Общего у них — имя и команда, а не архитектура. Полтора года путь выглядел так:
- май 2025 — MiMo-7B, 25 трлн токенов, обучение с нуля ради рассуждений;
- июнь 2025 — MiMo-VL-7B: картинки, видео, OCR, интерфейсы;
- декабрь 2025 — MiMo-V2-Flash: 309 млрд всего, 15 млрд активных;
- апрель 2026 — V2.5 и V2.5-Pro, уже под MIT;
- июнь 2026 — UltraSpeed и больше тысячи токенов в секунду.
Работает не только с текстом
MiMo-V2.5 — нативная омнимодальность: 310 млрд параметров всего, 15 млрд активных, плюс визуальный энкодер на 729 млн и аудиоэнкодер на 261 млн. На вход модель принимает текст, картинки, видео и звук, на выходе выдаёт текст и вызовы инструментов. Рядом живут MiMo-V2.5-ASR — распознавание речи под Apache 2.0 — и семейство TTS: синтез, голос по описанию и клонирование по короткой записи.
Триллион, из которого реально работает 4%
Флагман MiMo-V2.5-Pro — это разреженная смесь экспертов: 1.02 трлн параметров всего и 42 млрд активных на каждый токен. Семьдесят слоёв, 384 эксперта, из которых для каждого токена выбираются восемь. Контекст — до 1 048 576 токенов, веса открыты под MIT.
Внимание с окном в 128 токенов
Самое интересное — как удешевили длинный контекст. 60 слоёв из 70 смотрят только на 128 предыдущих токенов, и лишь 10 — на весь контекст. Чтобы дешёвое окно не роняло качество, добавили обучаемый «сток внимания»: голова вправе не тратить вероятность на бесполезных соседей и «сбросить» её в пустоту.
Учителей много, ученица одна
Пост-тренировка держится на MOPD: несколько моделей-специалистов — математика, код, терминал, поиск, безопасность — дают токенные подсказки одной ученице на её собственных траекториях, а не на чужих ответах. Рядом работает R3: маршрутизация экспертов, записанная на инференсе, повторяется при обучении — без этого обучение MoE разъезжается.
Тысяча токенов в секунду
Конфигурация UltraSpeed: веса экспертов сжимают в MXFP4, добавляют спекулятивное декодирование DFlash и «живучие» ядра TileRT. На одном узле из восьми GPU получается больше тысячи токенов в секунду. Триллион весов в четыре бита — это около 510 ГБ, и всё это надо где-то держать.
Что это значит
Xiaomi показала: открытые веса — уже не удел семимиллиардных моделей. Но «open-weight» точнее, чем «open source»: веса есть, а данных и всего пайплайна обучения — нет. И ещё одно: миллион токенов в карточке не обещает одинаковой точности на всей длине — в GraphWalks модель держала ненулевой результат на миллионе, а прошлое поколение там резко проседало. Хостинг V2 Xiaomi погасила 30 июня 2026 года и попросила клиентов перейти на V2.5, но скачанные веса это не отменяет.
Модель и карточка: mimo.xiaomi.com. Код и веса: github.com/XiaomiMiMo.
Полная версия: https://habr.com/ru/articles/1082686/
Текст подготовлен с использованием искусственного интеллекта.
Top comments (0)