DEV Community

Cover image for «bert нейросеть» жива: ModernBERT проиграл старому BERT-base в sparse-ретривале
Promptra Team for Promptra

Posted on

«bert нейросеть» жива: ModernBERT проиграл старому BERT-base в sparse-ретривале

В июне 2026 года вышла работа «Rescaling MLM-Head for Neural Sparse Retrieval» (arXiv:2606.18811, 17.06.2026) с неудобным для прогресса результатом. Авторы обучили sparse-ретриверы SPLADE по одному рецепту на разных бэкбонах - и свежий энкодер ModernBERT схлопнулся до 0.127 mean nDCG@10 на бенчмарке BEIR-13. Старый BERT-base, которому этой осенью исполняется восемь лет, на том же рецепте держит 0.361-0.403.

Вторая статья, принятая на SIGIR 2026 («Why Advanced Encoders Lag on Sparse Retrieval?», arXiv:2607.00004), называет причину - Vocabulary Gap, разрыв словарей. И предлагает лекарство, после которого тот же ModernBERT ставит рекорд на BEIR: 52.4 nDCG, прирост +4.7 к прошлому SOTA.

Если ты строишь поиск, RAG или классификацию и выбираешь энкодер-фундамент, этот разбор про твою задачу. Проверить спор на своих документах можно без зоопарка аккаунтов у провайдеров: provod.ai (российский OpenRouter) даёт единый API к современным моделям, включая embedding-модели для поиска, с оплатой в рублях по официальным тарифам.

Что такое нейросеть BERT и почему о ней снова спорят в 2026 году?

Коротко: BERT - энкодерная нейросеть Google 2018 года, которая читает текст сразу в две стороны и превращает слова в векторы. Спор разгорелся снова, потому что две свежие работы показали: в sparse-поиске старичок обходит своего преемника.

BERT (Bidirectional Encoder Representations from Transformers) опубликовали Devlin, Chang, Lee и Toutanova из Google 11 октября 2018 года (arXiv:1810.04805). BERT-base - 110 млн параметров, 12 слоёв, 12 голов внимания, обучение на 3.3 млрд слов: BooksCorpus и английская Википедия. Предобучение - Masked LM: модель видит фразу с прорехами (маскируют 15% токенов) и угадывает пропавшие слова, глядя на контекст с двух сторон сразу.

На пенсию модель так и не ушла. 25 октября 2019 года Google встроил BERT в ранжирование поиска и featured snippets: по данным официального блога компании, она помогала понимать каждый десятый запрос на английском в США; Google назвал это крупнейшим скачком в понимании запросов за пять лет. На декабрь 2024 года BERT оставался второй по скачиваниям моделью Hugging Face Hub - больше 68 млн в месяц, по данным Answer.AI (свежей статистики за июль 2026 у хаба публично нет).

Чем архитектура BERT отличается от GPT?

Коротко: BERT - энкодер, GPT - декодер. Первый читает фразу целиком и строит её сжатое представление для понимания. Второй предсказывает следующий токен и потому умеет генерировать текст. Разные органы, разные работы.

Запрос «чем отличаться архитектура bert от gpt» - один из самых частых рядом с этой темой. Разница в направлении чтения: обе модели - трансформеры, но BERT смотрит на предложение сразу с двух сторон, поэтому его векторы ложатся на классификацию, извлечение сущностей и эмбеддинги для поиска. GPT обучен авторегрессионно: токен за токеном, слева направо, и его сила - продолжать текст.

Отсюда разделение труда и цен. Энкодер - орган восприятия: дёшево превращает горы документов в числа. Декодер - орган речи: дорого сочиняет ответ. Кейс из блога Answer.AI (19.12.2024): фильтрация 15 триллионов токенов файнтюненной BERT-моделью заняла 6000 H100-часов, около $60 000 по $10 за час. Те же 15 триллионов через дешёвый декодер Gemini Flash по $0.075 за миллион токенов обошлись бы дороже миллиона долларов.

Почему ModernBERT проиграл BERT-base в sparse-ретривале?

Коротко: виноват Vocabulary Gap. Словарь BERT - 30 522 нормализованных WordPiece-токена без учёта регистра. Словарь ModernBERT - 50 368 регистрозависимых BPE-токенов. Одно слово рассыпается на веер поверхностных форм, и лексическое совпадение страдает.

ModernBERT вышел 19 декабря 2024 года (Answer.AI совместно с LightOn) как slot-in replacement для BERT-подобных моделей: контекст 8192 токена против 512, обучение на 2 триллионах токенов с большой долей кода в данных. В dense-ретривале и классификации он действительно сильнее старичков. Но авторы статьи для SIGIR 2026, Zhichao Geng и Yang Yang, зафиксировали обратное для learned sparse retrieval: при стандартном fine tune продвинутые энкодеры отстают от стареющего BERT-base.

Механика такая. Токенизатор BERT приводит слово к нижнему регистру: search, Search и SEARCH станут одним токеном и одной строкой в индексе. Регистрозависимый словарь ModernBERT хранит все три формы раздельно - для точной реконструкции текста это плюс, а для sparse-поиска минус: емкость модели уходит на морфологический шум, вес термина размазывается по избыточным формам. Размеры словарей - из официальных конфигов Hugging Face на 19 июля 2026 года.

Как эксперимент с MLM-головой подтвердил диагноз независимо?

Коротко: июньская работа замерила L2-норму матрицы MLM-головы у разных бэкбонов. У моделей с нормой ниже 2 (BERT, DistilBERT, ALBERT, GTE-MLM) sparse-ретриверы получаются сильными. У ModernBERT норма большая - и качество рушится до 0.127.

MLM-голова - последний слой энкодера, превращающий скрытое состояние в распределение по словарю. SPLADE строит sparse-вектор документа именно через эту голову, поэтому её масштаб критичен. Итоги прогона на BEIR-13 (mean nDCG@10, по данным arXiv:2606.18811 от 17.06.2026):

  • BERT, DistilBERT, ALBERT, GTE-MLM: 0.361-0.403
  • RoBERTa: 0.331
  • Ettin: 0.221
  • ModernBERT: 0.127

Разрыв между семейством BERT и ModernBERT - почти тройной, и он воспроизводится на сводке из тринадцати датасетов: версия «просто не повезло на одном корпусе» отпадает.

ModernBERT проигрывает BERT family на BEIR-13: 0.127 против 0.361-0.403, после rescaling k=16 - 0.405

Что такое sparse-ретривал и причём тут словарь?

Коротко: sparse-ретривер хранит документ как разреженный вектор размером со словарь: каждому терму - неотрицательный вес важности. Такой вектор ложится на классический инвертированный индекс, как BM25, только веса расставляет нейросеть.

SPLADE (Sparse Lexical and Expansion Model for First Stage Ranking) предложили Formal, Piwowarski и Clinchant на SIGIR 2021 (arXiv:2107.05720). Идея: прогнать документ через MLM-голову энкодера и получить веса сразу для десятков тысяч термов - включая синонимы, которых в тексте нет. Получается нейросетевое расширение термов плюс скорость BM25-подобного поиска. Обзор «A Unified Framework for Learned Sparse Retrieval» (arXiv:2303.13416, март 2023) добавляет ограничение: веса обязаны быть неотрицательными - таково требование стека инвертированных индексов, поэтому вектор живёт в координатах словаря.

Меряется всё это на BEIR (Thakur et al., NeurIPS 2021) - zero-shot бенчмарке из 18 датасетов, де-факто стандарте оценки ретриверов; обе работы 2026 года использовали именно его.

Как починили ModernBERT: пересадка словаря и одна константа

Коротко: два независимых фикса. Vocabulary Transfer пересаживает энкодер на нормализованный словарь и ставит SOTA на BEIR: 52.4 nDCG, прирост +4.7. Rescaling умножает матрицу MLM-головы на константу k=16 и поднимает ModernBERT с 0.127 до 0.405 - без новых параметров и без смены архитектуры.

Первый путь - из статьи SIGIR 2026. Фреймворк Vocabulary Transfer мигрирует продвинутые энкодеры на sparse-friendly словари: Semantic Initialization по топологии векторного пространства плюс Activation Potential Calibration, предотвращающая мёртвые нейроны и dense collapse. Тот же приём реанимирует просевший RoBERTa-large; код и модели авторы выложили в открытый доступ.

Второй путь - из июньской работы: перескейлить веса MLM-головы константой k до обучения SPLADE. При k=16 ModernBERT растёт с 0.127 до 0.405 на BEIR-13 (плюс 215% относительного прироста), MS MARCO MRR@10 - с 0.045 до 0.250, TREC-DL 2019 nDCG@10 - с 0.266 до 0.609; Ettin - с 0.221 до 0.391. Подвох: оптимум зависит от бэкбона. RoBERTa пикает при k=2, а при k=16 рушится. Константу подбирают, а не копируют.

Какой бэкбон взять под поиск: план на неделю

Коротко: нужен sparse-ретривер по стандартному рецепту - бери BERT-family. Нужен длинный контекст или dense-поиск - ModernBERT. В любом случае прогони оба варианта на своих данных: спор решается замером, а не датой релиза.

Сводка по официальным конфигам Hugging Face (проверены 19 июля 2026 года) и материалам Answer.AI:

BERT-base ModernBERT-base
Год релиза 2018 2024 (19 декабря)
Параметры 110M 149M
Словарь 30 522, WordPiece, без учёта регистра 50 368, BPE, регистрозависимый
Контекст 512 токенов 8192 токена
Позиции абсолютные эмбеддинги RoPE
Внимание полное локальное 128 + глобальное каждый 3-й слой
Слои 12 22
Где сильнее sparse-файнтюнинг «из коробки» dense-ретривал, длинный контекст, код

Практический порядок действий:

  1. Собери 200-500 реальных запросов и релевантных им документов из своей базы - это твой мини-BEIR.
  2. Обучи SPLADE по стандартному рецепту на BERT-base и на ModernBERT, замерь nDCG@10 на своей разметке.
  3. Если ModernBERT просел - посмотри L2-норму его MLM-головы; при норме выше 2 пробуй rescaling с сеткой k = 2, 4, 8, 16.
  4. Есть ресурс на серьёзный эксперимент - ставь Vocabulary Transfer, код открыт.
  5. Сравни оба варианта с готовыми embedding-моделями через API: иногда файнтюн вообще не нужен.

Пятый шаг заводится из России сменой двух строк: ключ и base_url единого API provod.ai. Он совместим с OpenAI SDK, поэтому скрипт сравнения не переписываешь под каждого провайдера, а переключаешь модель одной строкой. Один ключ вместо пяти, один баланс на эксперименты и прод, виден расход по каждой модели.

Что это НЕ решает?

Коротко: проигрыш ModernBERT - нишевый кейс одного рецепта. Из него следует узкий вывод про sparse-файнтюнинг; приговаривать новую архитектуру по нему нельзя.

  • В dense-ретривале, классификации и на длинном контексте ModernBERT сильнее: по заявлениям Answer.AI, это первый base-размерный энкодер, обыгравший DeBERTaV3 на GLUE, при менее чем пятой части её памяти и вдвое большей скорости.
  • Оба эксперимента - на английских данных (MS MARCO, BEIR). Для русского языка берут мультиязычные энкодеры, и переносить цифры без проверки нельзя.
  • VT и rescaling - препринты июня-июля 2026 года, а не production-стандарт: у рецептов просто не было времени набрать отрицательные отзывы из практики.

Когда provod.ai не подходит

Коротко: если ты обучаешь собственный энкодер на своём железе, агрегатор на этом этапе ни при чём.

По теме статьи честно так: provod.ai - про доступ к готовым моделям по API из России, с рублёвым балансом и документами для юрлиц. Файнтюн SPLADE на своих GPU, пересадку словаря и self-hosted инвертированный индекс он не заменяет - это работа твоей команды на твоём железе. Не подойдёт он и там, где нужен on-prem контур без внешних вызовов. А вот этап «быстро сравнить готовые embedding-модели на своих текстах до того, как платить за обучение» - как раз его территория.

Словарик запросов кластера

Коротко: вокруг запроса «bert нейросеть» поиск собрал хвост из сотни соседних формулировок. Размечаем, что люди на самом деле искали, чтобы ты не перепутал.

Техника рядом, которую путают с BERT

  • «tree» - tree of thoughts, техника промптинга LLM, к BERT отношения нет.
  • «gptq» - формат квантования весов: ужимает LLM под домашнюю видеокарту.
  • «gptzero.me» - детектор ИИ-текста, запрос пишут как «gptzero me».
  • «gym» - OpenAI Gym, тренажёр для обучения агентов с подкреплением.
  • «worm» - WormGPT, вредоносная LLM для фишинга; ищут «worm gpt github».
  • «cursorrules» - файл правил для AI-редактора Cursor.
  • «regional» и «material» - Regional Prompter у Stable Diffusion и ошибка Suno про авторские права на тексты песен.
  • «method», «extractor», «i2v» - обрывки про сэмплеры Stable Diffusion, извлечение звука и генерацию видео из картинки.
  • «try-on» - Kolors Virtual Try-On, виртуальная примерка одежды.
  • «daw», «xln», «lhy», «ztx» - звуковые станции и аудио-плагины; Suno стыкуют с DAW.
  • «salutespeech» - SaluteSpeech, голосовой стек Сбера.
  • «20studio» и «animan» - студийные сервисы из соседних выдач про Qwen и Udio.
  • «master» - «promt master»: уроки промптинга, не про энкодеры.
  • «table» - «gpt table»: генерация таблиц в ChatGPT.

Опечатки и склейки брендов

  • «gptcom», «gptchatcom» - так ошибочно набирают адрес ChatGPT.
  • «gptrus», «gptrussia» - поиск «ChatGPT в России».
  • «chatgptappcom», «chatgptappgpt», «chatgptchatappcom», «chatpgptapp», «chatbotappgpt» - попытки набрать адрес приложения ChatGPT по памяти.
  • «chatgpttestbot», «chatgpttools» - тестовые боты и подборки инструментов вокруг ChatGPT.
  • «dgpt», «gptcat», «gpttea», «lein» - мемные и обрывочные склейки с GPT.
  • «gptinnel», «gpttonel», «gpttonnel» - искажённый «GPT tunnel»: пути обхода блокировок.
  • «gptroom», «yard» - room gpt: дизайн комнат и двора по фото.
  • «gpt4tbot», «gpt5tbot», «gpt4agentsbot», «aigptbot» - телеграм-боты с доступом к GPT.
  • «chatdeepseek», «deepseekchat» - навигация к DeepSeek.
  • «diplom», «diplomgpt» - diplom gpt: сервисы дипломных работ, ищут отзывы.
  • «girlfriendgpt» - боты-компаньоны на базе GPT.
  • «gemini0508», «geminicode22», «geminigenal» - сгенерированные варианты запросов к Gemini.
  • «cle», «ent», «mes», «met», «ме» - обрывки запросов про Qwen, Kandinsky, тарифы и Алису.
  • «72to» - из «sd 72to ru техподдержка»: поддержка сервиса Stable Diffusion.
  • «cookies», «name», «offer» - «claude cookies», имя Claude, студенческая акция Gemini.
  • «boy» - «шедеврум boy model»: генерация персонажа в Шедевруме.
  • «verb», «intrigue» - песня Claude Ciari и аромат Devil's Intrigue; попали сюда случайно.
  • «heart» - «запустить нейросеть atomic heart»: про игру.
  • «mind» - ai money mind gpt, приложение из соседней темы.
  • «fit» - «llama cpp fit on»: влезет ли модель в память при локальном запуске.
  • «grill» - «grill me skill claude»: развлекательный скилл.
  • «zone», «hammer», «fire» - flux zone, flux hammer, misa fire: выдача про генератор картинок Flux.

Музыка, картинки, чаты - соседние темы

  • «house», «baby» - slap house промпты для Suno, The Loud House и ai baby generator «как будет выглядеть ребёнок».
  • «hot», «god», «lie», «night», «folk», «dress», «тум» - треки и ИИ-каверы: Inna «Hot», dark folk, Dress Up, «тум балалайка».
  • «feed», «flower», «mine» - лента генераций Sora, цветок в Veo 3, генератор видео Pika.
  • «secret», «sona» - «уфанета secret mini 2» с голосовой Алисой и нейросеть для песен.
  • «sex» - запросы про чат-ботов 18+: категория, которую крупные платформы режут фильтром.
  • «wed», «men», «mon», «amour» - чаты с ИИ-персонажами и ласковое «mon amour» в адрес Gemini.
  • «пис» - фан-арт по «Ван Пис».
  • «айстудио», «черри» - Google AI Studio и Cherry Studio, клиент для разных LLM.
  • «комбо», «ано» - мусорные склейки вроде «грок взлом мода комбо» и «ано сор».
  • «мед» - из «минь мёд вео»: запросы про Veo после автозамены.
  • «мена» - из «шедя мена»: мультик, который голосом просят включить Алису.

provod.ai — подключение AI без переписывания продукта

Сохраняйте привычный стек: приложение, AI-клиент, агент, IDE, SDK или библиотека продолжают работать в знакомом формате. Если инструмент поддерживает OpenAI-совместимый API, обычно меняются только URL и ключ.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Стоимость моделей совпадает с официальными тарифами поставщиков 1:1: агрегатор не добавляет свою наценку, а российская команда платит в рублях через единый баланс.

Подключите существующий AI-стек к provod.ai: инструкция по миграции · форма регистрации · цены на модели · защита данных по 152-ФЗ

FAQ

Коротко: собрали вопросы, которые остаются после цифр, - от актуальности BERT до русского языка.

BERT ещё актуален в 2026 году?

Для энкодерных задач - да: поиск, классификация, эмбеддинги, фильтрация данных. На конец 2024 года - больше 68 млн скачиваний в месяц и второе место на Hugging Face; энкодер-only модели суммарно набирали свыше 1 млрд скачиваний против 397 млн у декодерных (данные Answer.AI на декабрь 2024).

Что выбрать для sparse-поиска: BERT или ModernBERT?

По стандартному рецепту SPLADE - BERT-family: 0.361-0.403 против 0.127 на BEIR-13. Нужен контекст 8192 токена - ModernBERT с Vocabulary Transfer (52.4 nDCG, SOTA на BEIR) или хотя бы rescaling MLM-головы с подобранной k.

Что такое SPLADE простыми словами?

Способ превратить энкодер в поисковую машину: MLM-голова расставляет веса десяткам тысяч термов, включая синонимы, а искать можно старым добрым инвертированным индексом, без векторной базы.

Эти выводы работают для русского языка?

Неизвестно. Оба исследования мерились на английских MS MARCO и BEIR. Для русского обычно берут мультиязычные энкодеры, и L2-норму MLM-головы там стоит проверять отдельно.

Чем BERT отличается от ChatGPT?

BERT - энкодер понимания 2018 года, он не ведёт диалог. ChatGPT - чат-продукт поверх генеративного декодера GPT. Один индексирует и классифицирует, другой разговаривает.

Где взять код починки ModernBERT?

Авторы статьи про Vocabulary Gap (SIGIR 2026) выложили код и модели в открытый доступ; ссылка - в препринте arXiv:2607.00004.

Один API provod.ai - сравнение embedding-моделей на своих документах

Итог всей истории простой: выбор энкодера - эмпирический вопрос. Сравнить готовые embedding-модели на своих документах можно за один вечер через provod.ai: единый API, баланс в рублях с карты РФ, условия оплаты и документы для юрлиц стоит проверить на сайте сервиса. Замер на своих данных решит спор честнее любой статьи, включая эту.

Мой рабочий вывод спорный: под sparse-поиск в 2026 году я бы стартовал с BERT-base, а ModernBERT брал только с пересаженным словарём. Ты на чём собрал бы индекс - на проверенном старичке или на новичке с докруткой?

Источники

Top comments (0)