DEV Community

Cover image for «qwen 3 5 397b a17b»: почему таких весов не будет - флагманская линия ушла в API
Promptra Team for Promptra

Posted on

«qwen 3 5 397b a17b»: почему таких весов не будет - флагманская линия ушла в API

Запрос «qwen 3 5 397b a17b» в июле 2026 набирают два разных человека. Первый хочет скачать веса флагмана Qwen и боится, что их не существует. Второй слышал, что «Qwen закрылся», и проверяет слух. Правда неудобна для обоих: веса есть, лежат в открытом доступе под Apache 2.0 - но это последний открытый флагман Alibaba. Всё, что Alibaba выпустила после него в качестве флагмана, существует только как API.

Дальше - спецификации из официальной карточки, таймлайн закрытия, расчёт железа и ответ, что ставить вместо: открытый Qwen3.6-27B, уже обыгрывающий старый флагман, или API закрытых флагманов.

Когда флагман существует только как строка в прайсе API, веса перестают быть входным билетом - входным билетом становится доступ. Из России его даёт provod.ai (российский OpenRouter): Qwen и Claude живут там в одном чате, оплата идёт в рублях с карты РФ, без VPN и зарубежных карт. К доступу вернёмся в конце.

Что такое Qwen3.5-397B-A17B и где лежат его веса?

Коротко: открытый флагман серии Qwen3.5, выпущенный Alibaba 13-16 февраля 2026. Веса на HuggingFace под Apache 2.0. Модель нативно мультимодальная: текст, изображение и видео на входе, 201 язык.

Из официальной карточки Qwen Team: 397 млрд параметров всего, но на каждый токен работают только 17 млрд - буква «A» в a17b это и значит, active. Классическая MoE-раскладка: 512 экспертов, на токен активируются 10 routed плюс 1 shared. Из 60 слоёв три четверти - на линейном внимании Gated DeltaNet. Контекст - 262 144 токена нативно, до 1 010 000 растягивается через YaRN прямо в конфиге. Видеопоток сэмплируется с частотой 2 фпс: длинные ролики модель смотрит выборочными кадрами.

Параметр Значение из карточки
Параметры 397B всего / a17b активных
Слои 60, скрытая размерность 4096
Эксперты 512, активны 10 + 1 shared
Словарь 248 320 токенов
Контекст 262 144 нативно, до 1 010 000 через YaRN
Выход 32 768 рекомендовано, до 81 920 на сложных задачах
Лицензия Apache 2.0

Источник: карточка Qwen/Qwen3.5-397B-A17B на HuggingFace, февраль 2026.

В собственных таблицах Alibaba ставит его рядом с GPT-5.2, Claude 4.5 Opus, Gemini-3 Pro и Qwen3-Max-Thinking; thinking-режим включён по умолчанию.

Почему 397B-A17B стал последним открытым флагманом Alibaba?

Коротко: закрытый поворот начался до него: в сентябре 2025 Qwen3-Max-Preview, первая модель компании с 1+ трлн параметров, вышел только в API. Февральский 397B-A17B оказался исключением - и последним.

Дата Релиз Веса
Сен 2025 Qwen3-Max-Preview, 1+ трлн параметров закрыты, только API
Фев 2026 Qwen3.5-397B-A17B и вся лестница 3.5 открыты, Apache 2.0
Апр 2026 Qwen3.6-35B-A3B и Qwen3.6-27B открыты
Апр 2026 Qwen3.6-Plus и Qwen3.6-Max-Preview закрыты, только API
Май 2026 Qwen3.7-Max и Qwen3.7-Plus-Preview закрыты, только API

Источники: CurateClick, The Batch #356, llm-stats - июль 2026.

The Batch от 05.06.2026 формулирует сухо: «как и у других топовых моделей Qwen с конца 2025, веса не открыты». Ждать весов 3.7-Max с такой предысторией - значит ждать смены стратегии, а не релиза.

Что произошло с командой Qwen весной 2026 года?

Коротко: из команды ушли ключевые люди, а Alibaba собрала ИИ-активы в одну структуру с задачей зарабатывать. Раздача флагманских весов в эту задачу не вписывается.

3-4 марта 2026, через день после релиза малой серии Qwen3.5, уволился техлид Лин Цзюнянь, самый молодой обладатель грейда P10 в истории Alibaba (Pandaily). В ту же неделю ушёл глава пост-обучения Юй Бовэнь, глава Qwen Code Хуэй Биньюань ушёл в Meta ещё в январе, а CEO Эдди Ву собрал экстренное общее собрание. Лин уже основал в Шанхае компанию 语用科技 и привлёк около $220 млн (ZenGen Labs).

16 марта 2026 Alibaba свела Tongyi Lab, MaaS-платформу, ассистента Qwen (100+ млн MAU) и платформу Wukong в Alibaba Token Hub во главе с Эдди Ву. Bloomberg описал реорганизацию как «решимость зарабатывать на ИИ» и прямо связал её с уходом звёздного ресёрч-лида. Замыкает картину деталь из The Batch: Alibaba начала брать плату за CLI-инструмент Qwen Code, который раньше был бесплатным.

Чем закрытый Qwen3.7-Max отличается от открытого 397B-A17B?

Коротко: «agent-first» флагман с нераскрытой архитектурой, входом до 1 млн токенов и скоростью около 208 ток/с. В API Alibaba Cloud Model Studio - $2.50 за миллион входных и $7.50 за миллион выходных токенов, в Qwen Chat - бесплатно с аккаунтом.

Qwen3.5-397B-A17B Qwen3.7-Max
Веса открыты, Apache 2.0 закрыты
Параметры 397B / a17b активных не раскрыты
Контекст 262K нативно, 1M через YaRN до 1M входа, 64K выхода
Цена своё железо $2.50 / $7.50 за 1M токенов
API совместимый у хостеров нативно совместим с OpenAI и Anthropic

Источники: The Batch #356 и карточка Qwen3.5, июль 2026.

По Artificial Analysis у 3.7-Max седьмое место в Intelligence Index (56.6 в reasoning) и самый низкий уровень галлюцинаций среди frontier-моделей - 23%, приводит The Batch. Если нужен именно 397B, но как сервис, в Model Studio есть Qwen3.5-Plus - по официальной карточке это его хостинговая версия с контекстом 1 млн токенов по умолчанию.

Что нужно, чтобы поднять 397B-A17B у себя?

Коротко: в BF16 веса занимают около 807 ГБ, официальные примеры на SGLang и vLLM идут в тензорном параллелизме на 8 GPU. Комьюнити-квант IQ4 XS (в репозиториях - IQ4_XS) весит 219.24 ГБ: уже реально, но всё ещё серверная история.

Одна серверная V100 с её 16-32 ГБ задачу не решает: нужен стенд из 8 ускорителей с общей памятью под терабайт. На Apple Silicon сообщество собирает версии под mlx - фреймворк Apple для собственных чипов, но и там 397B упирается в объём unified memory. Для картинок и видео в llama.cpp отдельно подключается mmproj - vision-проектор. На бытовом Ryzen AI Max осмысленны только младшие модели линейки: квант уровня q6 от 397B один съест всю память.

Альтернатива неожиданно сильнее флагмана. Открытый Qwen3.6-27B занимает около 55.6 ГБ, а его квант Q4_K_M в 16.8 ГБ встаёт на одну 24-ГБ видеокарту; Simon Willison замерил через llama.cpp около 25 токенов в секунду. И на агентском коде 27B старого флагмана обходит: SWE-bench Verified 77.2 против 76.2, SWE-bench Pro 53.5 против 50.9, Terminal-Bench 2.0 59.3 против 52.5.

Объём весов Qwen: 807 ГБ у флагмана против 16.8 ГБ у 27B, который сильнее на коде

Какие веса Qwen ещё открыты в 2026 году?

Коротко: вся лестница Qwen3.5 от 0.8B до 397B и два средних Qwen3.6 - MoE 35B-A3B и плотный 27B, всё под Apache 2.0. Закрыты верхние этажи: 3.6-Plus, 3.6-Max-Preview, 3.7-Max. Вторая по масштабу открытая - ветка 122b a10b, MoE на 122 млрд параметров с десятью активными.

Модель Релиз Активных параметров
Qwen3.5-397B-A17B 13-16.02.2026 a17b из 397B
Qwen3.5-122B-A10B 24.02.2026 10B из 122B
Qwen3.5-35B-A3B, 27B 24.02.2026 средний этаж
Qwen3.5-0.8B / 2B / 4B / 9B 02.03.2026 малая серия
Qwen3.6-35B-A3B 15-16.04.2026 средняя MoE
Qwen3.6-27B 21-22.04.2026 плотный, обходит 397B на коде

Источники: HuggingFace, llm-stats, boostN.ai - июль 2026.

Qwen3.5-9B набирает 81.7 на GPQA Diamond и обходит OpenAI gpt-oss-120B с его 71.5 - модель примерно в 13.5 раза больше. Вокруг открытых весов есть и сцена файнтюнов: сборки hauhaucs с пометкой Aggressive снимают часть отказов, ветки Heretic правят поведение модели, Vikhr делает русскоязычные версии на базе Qwen. Это комьюнити-релизы, не официальные - качество проверяй на своей задаче.

Что выбрать: последние открытые веса или API?

Коротко: своё железо оправдано, когда данные нельзя отправлять наружу или нужен файнтюн. В остальных случаях сравни стоимость API с полной стоимостью собственного железа: 3.7-Max отдаёт 208 ток/с без закупки восьми GPU.

Порядок действий:

  1. Определи границу данных. Если запросы нельзя выпускать из контура компании, выбор один - открытые веса локально.
  2. Посчитай задачу. Для кода сначала тестируй Qwen3.6-27B: он сильнее 397B на SWE-bench и живёт на одной карте.
  3. Сверься с флагманом через API: прогони один набор промптов через 3.7-Max и сравни ответы по своей метрике, не по чужим таблицам.
  4. Подключи API сменой двух строк, без переписывания кода.

Переход на закрытые флагманы - смена ключа и base_url на единый API provod.ai: он совместим и с OpenAI SDK (/v1/chat/completions), и с Anthropic (/v1/messages), так что Для Cursor, Claude Code и n8n совместимость нужно проверить по документации и на тестовом сценарии. Один ключ вместо нескольких, один рублёвый баланс на чат и прод, оплата картой РФ или по счёту.

from openai import OpenAI

client = OpenAI(
    api_key="ВАШ_КЛЮЧ_PROVOD",
    base_url="https://api.provod.ai/v1",
)
# дальше код не меняется - только имя модели
Enter fullscreen mode Exit fullscreen mode

Чего эта статья не решит?

Коротко: весов Qwen3.7-Max здесь не будет - их не существует в открытом доступе.

Файнтюн 397B - отдельная инфраструктура: если веса в BF16 занимают 807 ГБ, обучению нужно кратно больше видеопамяти. API не даёт офлайн-приватности: запросы уходят во внешний контур, для чувствительных данных остаются только локальные веса. И чужие бенчмарки не заменяют теста на твоих промптах - разрыв в два пункта SWE-bench на твоей кодовой базе может исчезнуть.

Когда provod.ai не подходит

Коротко: агрегатор решает доступ и оплату, но не заменяет офлайн-контур, файнтюн и прямой контракт с вендором.

Если данные нельзя отправлять наружу вообще, агрегатор не нужен: бери открытые веса из таблицы выше и своё железо. Файнтюн 397B и on-prem развёртывание - это собственная инфраструктура, а не API. Прямой enterprise-контракт с Alibaba Cloud ради их SLA тоже заключается напрямую. Агрегатор закрывает доступ к готовым моделям и рублёвую оплату; всё, что глубже весов, остаётся на тебе.

Словарик запросов кластера: что ещё ищут рядом с «qwen 3 5 397b a17b»

Коротко: рядом живут опечатки, чужие модели и бытовой шум. Разбираем, что есть что.

Опечатки и искажённые имена. «qen» и «quen» - Qwen с пропущенными буквами. «antropic» - Anthropic; API 3.7-Max нативно совместим со спецификациями именно Anthropic и OpenAI. «sonet» - Claude Sonnet. «magine» - обрубок Grok Imagine. «ranwayml» - RunwayML с перестановкой букв. «speciale» - DeepSeek Speciale. «gpt5.2» - GPT-5.2 из таблиц сравнения Alibaba. «ligne» - французское «chatgpt en ligne». «cla» - короткая форма Claude. «tescher» - неудачное «teacher». «spud» - игровой шум. «agressive» и «hauhauc» - те же Aggressive и HauhauCS с опечатками. «бесплтано» - «бесплатно» с двумя «т»; за опечаткой скрыто реальное: бесплатный вход в Qwen Chat существует, с аккаунтом.

Числа, размеры и чужие модели. «06b» - база 0.6B предыдущего поколения Qwen3; в серии 3.5 младшая - 0.8B. «a4b» и «26b» - неточные формы; правильные имена - 35B-A3B и 27B. «scaled» - пометка «fp8 scaled safetensors»: тензоры FP8 с масштабирующими коэффициентами, а не «усиленная» версия. «8steps» - Qwen Image Lightning 8steps, ветка image-моделей, не LLM-линия. «128b» - Mistral Medium. «13b» - Llama 2 13B. «1b» - Llama 3.2 1B. «86m» - Llama Prompt Guard 2 86M, фильтр безопасности Meta. «stabilityai» - Stability AI. «1111» - Automatic1111, интерфейс для Stable Diffusion.

Железо и сервисы - ложные совпадения. «tt» - виниловые проигрыватели Gemini TT, к Google Gemini отношения не имеют. «915» и «915m» - FPV-передатчик RadioMaster и диапазон 915 МГц. «nb-100» - диктофон Plaud Note. «comfort» и «zfb» - опрыскиватель GPT ZFB-12 Comfort Mix. «oneui» - оболочка Samsung. «армв7» - старая архитектура armv7 под APK. «apkp» и «arkpure» - сайты с APK-файлами вроде APKPure. «делфи», «кс», «tl» - обрубки запросов: Delphi, Counter-Strike, сетевое железо.

Программный и офисный мусор. «bitrix» - Битрикс24 и боты в CRM. «ultracode» и «statusline» - термины из обсуждений Claude Code. «winget» - пакетный менеджер Windows. «skilljar» - платформа онлайн-курсов. «79803» - фрагмент названия PDF-руководства с пометкой GPT. «b1gfhcctb7un9b0qag7f» - идентификатор каталога YandexGPT. «1.2024» и «1.2026» - номера сборок мобильного «чат gpt». «uhd» - пометка 4K у видеогенераторов.

Мемы, музыка и числа-шум. «klasky» и «csupo» - логотип Klasky Csupo из мемов про Sora. «numberblocks», «fireman», «sprunki» - детские персонажи из волны «Sora 2»-роликов. «likee», «jxp» - соцсеть Likee и её теги. «outpaint», «pulid», «spatial», «f2», «9bbf», «aotos», «fluxgram» - термины кластера Flux: дорисовка кадра, лица, spatial-контроль, сборки Flux 2. «vst», «1526», «kbs», «nights», «fai», «artist», «gold», «hits» - музыкальный шум рядом с Suno. «1982», «1994», «2012», «2051», «251», «4х» - годы и арифметика из бытовых запросов. «15мг» - дозировка таблеток в вопросе к Алисе. «sphere» и «relaxed» - теги видеогенераторов, relaxed - режим Veo 3.1.


provod.ai — единый API для AI-агентов, MCP и автоматизации

Подключайте агентов, MCP-клиенты, CLI-инструменты и AI IDE к одной точке: модель можно менять под этап сценария, не собирая заново интеграцию и биллинг для каждого поставщика.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Тариф каждой модели передаётся без посреднической наценки: цена в provod.ai равна официальной цене провайдера 1:1, а все агенты расходуют общий рублёвый баланс.

Запустите своего агента через provod.ai: форма регистрации · цены на модели · защита данных по 152-ФЗ · API и интеграции

Частые вопросы

Коротко: весов 3.7-Max ждать не стоит, 397B требует восьми ускорителей, для одной карты есть более сильный 27B.

Будут ли когда-нибудь открыты веса Qwen3.7-Max?
Признаков нет: топовые модели Qwen с конца 2025 весов не получают (The Batch), а Token Hub собран, чтобы зарабатывать на ИИ, а не раздавать флагманы.

Сколько видеокарт нужно для Qwen3.5-397B-A17B?
В официальных примерах - 8 GPU с тензорным параллелизмом; кванты GGUF от 219.24 ГБ тоже требуют серверной памяти.

Что означает «A17B» в названии?
Активные параметры MoE: из 397 млрд на токен работают 17 млрд - 10 routed-экспертов из 512 плюс один shared.

Чем Qwen3.6-27B сильнее старого флагмана 397B?
Он плотный, весит 55.6 ГБ (16.8 ГБ в Q4_K_M), встаёт на одну 24-ГБ карту и выше на агентском коде: 77.2 против 76.2 на SWE-bench Verified.

Qwen3.7-Max бесплатный?
В Qwen Chat - да, с аккаунтом. В API Model Studio - $2.50 за миллион входных и $7.50 за миллион выходных, кэш $0.25, цены на июль 2026.

Точка перелома необратима: открытые веса Qwen остановились на среднем этаже, флагман ушёл в подписку. Дальше выбор с ценой: локальный контур на открытых весах с потолком средних моделей - или API с внешним контуром данных. У обоих путей есть сторонники, и спор обычно упирается в то, чьи данные ходят по чужим серверам.

Один ключ provod.ai к закрытым флагманам и открытым весам - оплата в рублях

Актуальный список моделей и цены в рублях - на provod.ai: один баланс, тестируешь в чате, катишь в прод через тот же ключ.

Источники

Top comments (0)