DEV Community

Cover image for LTX 2.3 и Kandinsky 5.0 Video: что реально запускается на вашей видеокарте в июле 2026
Promptra Team for provod.ai

Posted on

LTX 2.3 и Kandinsky 5.0 Video: что реально запускается на вашей видеокарте в июле 2026

Один вендор говорит — хватит RTX 4090. Разработчик модели говорит — нужен H100. Разница в цене вопроса — сотни тысяч рублей.

Это не гипотетический пример. Гайд GPU-хостинга Serverflow утверждает, что Kandinsky 5.0 Video Pro можно запустить на RTX 4090 «с оптимизациями», при диапазоне VRAM 40–80+ ГБ. А сам разработчик модели в Сбере, комментируя релиз на Habr, пишет прямо: сейчас Pro требует H100 с 96 ГБ или A100 с 80 ГБ, и снижение до 24 ГБ — это только план после будущей оптимизации VAE (комментарий VArkhipkin). Если вы поверите вендорскому гайду и купите 4090 под Pro, вы получите OOM вместо видео.

Поэтому разговор о локальном запуске стоит вести не по маркетинговым карточкам, а по тому, что подтверждено первичными источниками и что говорят люди, которые это уже пытались завести.

Реалистичный выбор на июль 2026

Из двух открытых семейств, доступных без подписки, сегодня работоспособны на потребительском железе только облегчённые версии: LTX-2.3 dev/distilled и Kandinsky 5.0 Video Lite. Video Pro от Kandinsky по заявлению собственного разработчика пока живёт на дата-центровых картах — и планы её удешевления пока остаются планами, без подтверждённой даты.

Официальная карточка модели LTX-2.3 на Hugging Face указывает 22 млрд параметров, Python ≥3.12, CUDA >12.7 и точность bf16, но не называет минимальный объём VRAM напрямую (model card Lightricks/LTX-2.3). Конкретные цифры даёт вендорский гайд: bf16-версия требует около 52 ГБ, а с 4-битным квантованием — около 18 ГБ (intelion.cloud, ценообразование и конфигурации). Собственный блог LTX формулирует это иначе — через рекомендации по разрешению: GPU с 24+ ГБ тянут 720p24 на 4 секунды за 20 шагов, GPU с 8–16 ГБ — только 540p24, а NVFP4/FP8-квантование снижает VRAM до 60% и ускоряет генерацию до 3× (ltx.io, Low VRAM Guide).

Таблица для покупки железа

Модель / сборка VRAM минимум VRAM комфортный Лицензия Порог коммерции GPU
LTX-2.3 dev (bf16) ~52 ГБ 80 ГБ (A100/H100) LTX-2 Community License $10 млн/год выручки A100/H100
LTX-2.3 distilled / GGUF 4-бит ~18 ГБ 24+ ГБ (720p24 по Low VRAM Guide) LTX-2 Community License $10 млн/год выручки RTX 3090/4090
Kandinsky 5.0 Video Lite 14 ГБ 20 ГБ MIT нет порога RTX 3060 Ti+
Kandinsky 5.0 Video Pro вендор: 40–80+ ГБ вендор допускает RTX 4090 «с оптимизациями» MIT нет порога расхождение: вендор — 4090 с оптимизациями; разработчик — H100 96 ГБ / A100 80 ГБ, без RTX 4090 как рабочего варианта

Про 24 ГБ важно не перепутать строки: рекомендация «24+ ГБ → 720p24, 4 секунды, 20 шагов» из Low VRAM Guide относится к квантованным и дистиллированным сборкам, а не к полному bf16. Полный dev в bf16 при своих ~52 ГБ в 24-гигабайтную карту не помещается ни при каком удачном стечении обстоятельств — под него это A100/H100 80 ГБ, своя или арендованная.

Строка Pro — не опечатка, а фиксация конфликта между источниками: Serverflow как поставщик хостинга заинтересован показать модель доступной (serverflow.ru), а комментарий разработчика — прямое техническое заявление без коммерческого интереса приукрашивать требования. При планировании бюджета доверять стоит второму.

Лицензии решают не меньше, чем VRAM

LTX-2.3 распространяется по LTX-2 Community License Agreement. Вторичные обзоры иногда называют её Apache 2.0 — прямая проверка LICENSE-файла на Hugging Face это опровергает: коммерческое использование бесплатно до годовой выручки компании в $10 млн, выше порога требуется платная лицензия (LICENSE, Commercial Entities). Вендор отдельно поясняет, что переход через порог не влечёт ретроактивных платежей за уже сделанные генерации (ltx.io, Licensing Explained) — то есть можно расти без риска задним числом получить счёт за прошлые месяцы.

Kandinsky 5.0 в этом смысле проще: код и веса под MIT, без порога выручки и ограничений на коммерческое использование (README kandinskylab/kandinsky-5). Единственная неурегулированная зона для обоих семейств — авторские права на сам сгенерированный ролик, а не на веса: этот вопрос ни в одной из лицензий отдельно не прописан, и для коммерческого проекта его стоит закрывать юридической консультацией отдельно.

Почему Lite вообще работает на потребительских картах

Скорость Kandinsky Lite не случайна: архитектура использует механизм разреженного внимания NABLA, который при 90%-й разреженности даёт, по данным препринта разработчиков, 2,7-кратное сокращение времени обучения и инференса (arXiv 2511.14993v3, NABLA mechanism). Это собственный бенчмарк авторов — независимого воспроизведения на стороннем железе пока не публиковалось, так что цифру стоит воспринимать как верхнюю границу ожиданий, а не гарантию.

Замеры latency на H100 из репозитория модели дают ориентир по порядку величин: генерация 5-секундного клипа на Video Lite (SFT) занимает 139 секунд, Video Pro (SD) — 560 секунд, Video Pro (HD) — 1241 секунду (GitHub kandinskylab/kandinsky-5, Latency). Замеров именно на потребительских картах авторы не публикуют — экстраполировать эти числа на RTX 3090 нужно с запасом в разы, а не на глазок.

Два голоса, которые не совпадают

Андрей Пешков в независимой статье на Habr фиксирует факт: Kandinsky 5.0 Pro занял 14-е место в общем рейтинге LMArena Text-to-Video Arena в декабре 2025 — лучший результат среди open-source моделей, обойдя Wan 2.2 A14B на 20-м месте (habr.com/ru/amp/publications/979126). Подача фактическая, без критики железных требований — это репортаж о позиции в рейтинге, не о том, на чём эту позицию можно воспроизвести дома.

А в комментариях к статье компании на Habr разворачивается другой разговор. Пользователь GhoSt24601 прямо называет требование в 24 ГБ VRAM избыточным для рядового пользователя и сомневается в практичности модели с учётом цены соответствующих карт. Другой комментатор, Shannon, указывает на конкурента: «WAN2.2 can run on 24GB with quantization/optimization techniques» — то есть аналогичный результат достигается без специфичных для Kandinsky танцев с оптимизацией (комментарии к статье Сбербанка на Habr).

Сильнейшее возражение и что на него ответить

Возражение честное: заявленные минимумы в 10–14 ГБ достигаются офлоадингом весов в системную RAM и агрессивным квантованием, а это плата временем — генерация замедляется, иногда сильно. Пользователь BazilioMike в тех же комментариях описывает результат Kandinsky как «размазанный» по сравнению с другими генераторами того же класса, повторяя проблему, которая была и у Kandinsky 4 (комментарий BazilioMike) — субъективное впечатление одного человека, но оно совпадает по духу с претензией Shannon о превосходстве Wan 2.2 при том же объёме памяти.

Ответ данными здесь неполный, но он есть. Во-первых, LMArena-рейтинг (E09) и независимое сравнение версий LTX на MaxVideoAI — LTX-2.3 Pro лидирует по 10 из 11 критериев качества относительно LTX-2.0 Pro, с лучшими показателями по управляемости и визуальному качеству (maxvideoai.com, LTX 2.0 vs 2.3 Pro) — говорят о реальном прогрессе моделей, а не только об оптимизациях под VRAM. Во-вторых, методология независимого сравнения на MaxVideoAI не раскрыта полностью, и это ограничивает воспроизводимость вывода; относитесь к нему как к сигналу, доказанным фактом он пока не стал. Итог для практика: возражение про офлоадинг справедливо для Kandinsky Pro и для самых жёстких квантований LTX, но LTX-2.3 dev/distilled и Kandinsky Lite в их «комфортных» конфигурациях (24 ГБ, без экстремального сжатия) работают в штатном режиме — пограничным сценарий становится тогда, когда его пытаются ужать к нижней границе в 10–12 ГБ.

Купить карту или арендовать

Если генерации разовые или проектные — аренда почти всегда дешевле входа. Интелион Облако предлагает A100 80 ГБ от 179 ₽/час, чего достаточно для LTX-2.3 в bf16 (~52 ГБ) без квантования (intelion.cloud). Если генерации регулярные и еженедельные — экономика смещается к покупке 24-гигабайтной карты и работе с distilled/fp8-сборками LTX или Kandinsky Lite, где VRAM укладывается в бюджет без переноса весов в RAM.

Перед тем как тратить деньги на аренду GPU ради проверки, устроит ли вас вообще качество генерации, разумно сначала посмотреть на результат без затрат на инфраструктуру: provod.ai даёт доступ к видеомоделям, доступным на платформе, через один совместимый API и веб-интерфейс, так что можно оценить, чего ждать от результата, прежде чем платить за часы аренды H100. Локальный запуск это не отменяет — веса, офлайн-работа и контроль над пайплайном остаются на вашей карте; но вопрос «нужна ли под эту задачу 24-гигабайтная карта вообще» дешевле закрыть до покупки.

Перепроверять эти цифры стоит не реже раза в квартал: LTX выпустил версию 2.3 всего через два месяца после LTX-2, а разработчик Kandinsky публично анонсировал снижение требований VRAM для Pro — обе эти линии могут сдвинуть таблицу раньше, чем принято ожидать в этой индустрии.


provod.ai — от идеи и текста до изображения, видео и звука

Соберите контентный процесс без переключения между десятками сервисов: сценарий, визуал, ролик, музыка и аудио используют единый кабинет, API и баланс команды.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Каждый формат оплачивается по базовой цене поставщика 1:1: provod.ai объединяет расчёты, но не добавляет свою наценку.

Соберите медиапроизводство на provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai

Источники

Top comments (0)