Xiaomi MiMo: триллион параметров, из которых работает четыре процента
Пока остальные соревновались в закрытых моделях, Xiaomi выросла в линейке MiMo до триллиона параметров и выложила веса под лицензией MIT. Ниже — что внутри этого релиза и почему на него стоит посмотреть.
Это не одна модель, а целое семейство
MiMo — общий бренд для нескольких чекпойнтов, а не название конкретной версии. Под этим именем выходили рассуждающая MiMo-7B в мае 2025-го, зрительная MiMo-VL, звуковая MiMo-Audio, вариант для роботов и автомобилей MiMo-Embodied, а также разреженные MoE поколений V2 и V2.5. Связывает их команда и название, а не единая архитектура. От старта до текущего состояния прошло полтора года.
Хронология такая:
- май 2025 — MiMo-7B: 25 трлн токенов, обучение с нуля ради рассуждений;
- июнь 2025 — MiMo-VL-7B: изображения, видео, OCR, интерфейсы;
- декабрь 2025 — MiMo-V2-Flash: 309 млрд параметров всего, 15 млрд активных;
- апрель 2026 — V2.5 и V2.5-Pro, уже под MIT;
- июнь 2026 — UltraSpeed со скоростью больше тысячи токенов в секунду.
Модель работает не только с текстом
MiMo-V2.5 получила нативную омнимодальность: 310 млрд параметров суммарно, 15 млрд активных, плюс визуальный энкодер на 729 млн и аудиоэнкодер на 261 млн. На вход идут текст, картинки, видео и звук, на выходе — текст и вызовы инструментов. Отдельно существуют MiMo-V2.5-ASR для распознавания речи под Apache 2.0 и линейка TTS: синтез, генерация голоса по описанию и клонирование по короткой записи.
Триллион параметров, активны четыре процента
Флагманская MiMo-V2.5-Pro построена как разреженная смесь экспертов: 1.02 трлн параметров всего, на каждый токен работают 42 млрд. Внутри — 70 слоёв и 384 эксперта, из которых для токена активируются восемь. Контекст достигает 1 048 576 токенов. Веса открыты под MIT.
Окно внимания сократили до 128 токенов
Главный ход по удешевлению длинного контекста — ограниченное окно. 60 слоёв из 70 видят лишь 128 предыдущих токенов, а весь контекст доступен только 10 слоям. Чтобы урезанное окно не роняло качество, в модель добавили обучаемый «сток внимания»: голова может не тратить вероятность на бесполезных соседей и сбрасывать её в пустоту.
Учителей много, ученица одна
Пост-тренировка опирается на MOPD — метод, при котором несколько моделей-специалистов по математике, коду, терминалу, поиску и безопасности дают токенные подсказки одной ученице. Подсказки идут на её собственных траекториях, а не на чужих ответах. Параллельно работает R3: маршрутизация экспертов, зафиксированная на инференсе, повторяется при обучении. Без этого обучение MoE разъезжается.
Тысяча токенов в секунду
В конфигурации UltraSpeed веса экспертов сжимают в MXFP4, добавляют спекулятивное декодирование DFlash и «живучие» ядра TileRT. На одном узле с восемью GPU выходит больше тысячи токенов в секунду. Триллион весов в четырёхбитном виде занимает около 510 ГБ, и всё это нужно где-то хранить.
Что из этого следует
Xiaomi доказала: открытые веса больше не ограничиваются моделями на семь миллиардов параметров. Но слово «open-weight» здесь точнее, чем «open source»: веса доступны, а данные и полный пайплайн обучения — нет. Ещё один нюанс: миллион токенов в спецификации не гарантирует одинаковой точности на всей длине. В GraphWalks модель сохраняла ненулевой результат на миллионе токенов, тогда как прошлое поколение на такой дистанции проседало резко. Хостинг V2 компания отключила 30 июня 2026 года и предложила клиентам перейти на V2.5, но уже скачанные веса это не отменяет.
Модель и карточка: mimo.xiaomi.com. Код и веса: github.com/XiaomiMiMo.
Полная версия: https://habr.com/ru/articles/1082686/