В июне 2026 года вышла работа «Rescaling MLM-Head for Neural Sparse Retrieval» (arXiv:2606.18811, 17.06.2026) с неудобным для прогресса результатом. Авторы обучили sparse-ретриверы SPLADE по одному рецепту на разных бэкбонах - и свежий энкодер ModernBERT схлопнулся до 0.127 mean nDCG@10 на бенчмарке BEIR-13. Старый BERT-base, которому этой осенью исполняется восемь лет, на том же рецепте держит 0.361-0.403.
Вторая статья, принятая на SIGIR 2026 («Why Advanced Encoders Lag on Sparse Retrieval?», arXiv:2607.00004), называет причину - Vocabulary Gap, разрыв словарей. И предлагает лекарство, после которого тот же ModernBERT ставит рекорд на BEIR: 52.4 nDCG, прирост +4.7 к прошлому SOTA.
Если ты строишь поиск, RAG или классификацию и выбираешь энкодер-фундамент, этот разбор про твою задачу. Проверить спор на своих документах можно без зоопарка аккаунтов у провайдеров: provod.ai (российский OpenRouter) даёт единый API к современным моделям, включая embedding-модели для поиска, с оплатой в рублях по официальным тарифам.
Что такое нейросеть BERT и почему о ней снова спорят в 2026 году?
Коротко: BERT - энкодерная нейросеть Google 2018 года, которая читает текст сразу в две стороны и превращает слова в векторы. Спор разгорелся снова, потому что две свежие работы показали: в sparse-поиске старичок обходит своего преемника.
BERT (Bidirectional Encoder Representations from Transformers) опубликовали Devlin, Chang, Lee и Toutanova из Google 11 октября 2018 года (arXiv:1810.04805). BERT-base - 110 млн параметров, 12 слоёв, 12 голов внимания, обучение на 3.3 млрд слов: BooksCorpus и английская Википедия. Предобучение - Masked LM: модель видит фразу с прорехами (маскируют 15% токенов) и угадывает пропавшие слова, глядя на контекст с двух сторон сразу.
На пенсию модель так и не ушла. 25 октября 2019 года Google встроил BERT в ранжирование поиска и featured snippets: по данным официального блога компании, она помогала понимать каждый десятый запрос на английском в США; Google назвал это крупнейшим скачком в понимании запросов за пять лет. На декабрь 2024 года BERT оставался второй по скачиваниям моделью Hugging Face Hub - больше 68 млн в месяц, по данным Answer.AI (свежей статистики за июль 2026 у хаба публично нет).
Чем архитектура BERT отличается от GPT?
Коротко: BERT - энкодер, GPT - декодер. Первый читает фразу целиком и строит её сжатое представление для понимания. Второй предсказывает следующий токен и потому умеет генерировать текст. Разные органы, разные работы.
Запрос «чем отличаться архитектура bert от gpt» - один из самых частых рядом с этой темой. Разница в направлении чтения: обе модели - трансформеры, но BERT смотрит на предложение сразу с двух сторон, поэтому его векторы ложатся на классификацию, извлечение сущностей и эмбеддинги для поиска. GPT обучен авторегрессионно: токен за токеном, слева направо, и его сила - продолжать текст.
Отсюда разделение труда и цен. Энкодер - орган восприятия: дёшево превращает горы документов в числа. Декодер - орган речи: дорого сочиняет ответ. Кейс из блога Answer.AI (19.12.2024): фильтрация 15 триллионов токенов файнтюненной BERT-моделью заняла 6000 H100-часов, около $60 000 по $10 за час. Те же 15 триллионов через дешёвый декодер Gemini Flash по $0.075 за миллион токенов обошлись бы дороже миллиона долларов.
Почему ModernBERT проиграл BERT-base в sparse-ретривале?
Коротко: виноват Vocabulary Gap. Словарь BERT - 30 522 нормализованных WordPiece-токена без учёта регистра. Словарь ModernBERT - 50 368 регистрозависимых BPE-токенов. Одно слово рассыпается на веер поверхностных форм, и лексическое совпадение страдает.
ModernBERT вышел 19 декабря 2024 года (Answer.AI совместно с LightOn) как slot-in replacement для BERT-подобных моделей: контекст 8192 токена против 512, обучение на 2 триллионах токенов с большой долей кода в данных. В dense-ретривале и классификации он действительно сильнее старичков. Но авторы статьи для SIGIR 2026, Zhichao Geng и Yang Yang, зафиксировали обратное для learned sparse retrieval: при стандартном fine tune продвинутые энкодеры отстают от стареющего BERT-base.
Механика такая. Токенизатор BERT приводит слово к нижнему регистру: search, Search и SEARCH станут одним токеном и одной строкой в индексе. Регистрозависимый словарь ModernBERT хранит все три формы раздельно - для точной реконструкции текста это плюс, а для sparse-поиска минус: емкость модели уходит на морфологический шум, вес термина размазывается по избыточным формам. Размеры словарей - из официальных конфигов Hugging Face на 19 июля 2026 года.
Как эксперимент с MLM-головой подтвердил диагноз независимо?
Коротко: июньская работа замерила L2-норму матрицы MLM-головы у разных бэкбонов. У моделей с нормой ниже 2 (BERT, DistilBERT, ALBERT, GTE-MLM) sparse-ретриверы получаются сильными. У ModernBERT норма большая - и качество рушится до 0.127.
MLM-голова - последний слой энкодера, превращающий скрытое состояние в распределение по словарю. SPLADE строит sparse-вектор документа именно через эту голову, поэтому её масштаб критичен. Итоги прогона на BEIR-13 (mean nDCG@10, по данным arXiv:2606.18811 от 17.06.2026):
- BERT, DistilBERT, ALBERT, GTE-MLM: 0.361-0.403
- RoBERTa: 0.331
- Ettin: 0.221
- ModernBERT: 0.127
Разрыв между семейством BERT и ModernBERT - почти тройной, и он воспроизводится на сводке из тринадцати датасетов: версия «просто не повезло на одном корпусе» отпадает.
Что такое sparse-ретривал и причём тут словарь?
Коротко: sparse-ретривер хранит документ как разреженный вектор размером со словарь: каждому терму - неотрицательный вес важности. Такой вектор ложится на классический инвертированный индекс, как BM25, только веса расставляет нейросеть.
SPLADE (Sparse Lexical and Expansion Model for First Stage Ranking) предложили Formal, Piwowarski и Clinchant на SIGIR 2021 (arXiv:2107.05720). Идея: прогнать документ через MLM-голову энкодера и получить веса сразу для десятков тысяч термов - включая синонимы, которых в тексте нет. Получается нейросетевое расширение термов плюс скорость BM25-подобного поиска. Обзор «A Unified Framework for Learned Sparse Retrieval» (arXiv:2303.13416, март 2023) добавляет ограничение: веса обязаны быть неотрицательными - таково требование стека инвертированных индексов, поэтому вектор живёт в координатах словаря.
Меряется всё это на BEIR (Thakur et al., NeurIPS 2021) - zero-shot бенчмарке из 18 датасетов, де-факто стандарте оценки ретриверов; обе работы 2026 года использовали именно его.
Как починили ModernBERT: пересадка словаря и одна константа
Коротко: два независимых фикса. Vocabulary Transfer пересаживает энкодер на нормализованный словарь и ставит SOTA на BEIR: 52.4 nDCG, прирост +4.7. Rescaling умножает матрицу MLM-головы на константу k=16 и поднимает ModernBERT с 0.127 до 0.405 - без новых параметров и без смены архитектуры.
Первый путь - из статьи SIGIR 2026. Фреймворк Vocabulary Transfer мигрирует продвинутые энкодеры на sparse-friendly словари: Semantic Initialization по топологии векторного пространства плюс Activation Potential Calibration, предотвращающая мёртвые нейроны и dense collapse. Тот же приём реанимирует просевший RoBERTa-large; код и модели авторы выложили в открытый доступ.
Второй путь - из июньской работы: перескейлить веса MLM-головы константой k до обучения SPLADE. При k=16 ModernBERT растёт с 0.127 до 0.405 на BEIR-13 (плюс 215% относительного прироста), MS MARCO MRR@10 - с 0.045 до 0.250, TREC-DL 2019 nDCG@10 - с 0.266 до 0.609; Ettin - с 0.221 до 0.391. Подвох: оптимум зависит от бэкбона. RoBERTa пикает при k=2, а при k=16 рушится. Константу подбирают, а не копируют.
Какой бэкбон взять под поиск: план на неделю
Коротко: нужен sparse-ретривер по стандартному рецепту - бери BERT-family. Нужен длинный контекст или dense-поиск - ModernBERT. В любом случае прогони оба варианта на своих данных: спор решается замером, а не датой релиза.
Сводка по официальным конфигам Hugging Face (проверены 19 июля 2026 года) и материалам Answer.AI:
| BERT-base | ModernBERT-base | |
|---|---|---|
| Год релиза | 2018 | 2024 (19 декабря) |
| Параметры | 110M | 149M |
| Словарь | 30 522, WordPiece, без учёта регистра | 50 368, BPE, регистрозависимый |
| Контекст | 512 токенов | 8192 токена |
| Позиции | абсолютные эмбеддинги | RoPE |
| Внимание | полное | локальное 128 + глобальное каждый 3-й слой |
| Слои | 12 | 22 |
| Где сильнее | sparse-файнтюнинг «из коробки» | dense-ретривал, длинный контекст, код |
Практический порядок действий:
- Собери 200-500 реальных запросов и релевантных им документов из своей базы - это твой мини-BEIR.
- Обучи SPLADE по стандартному рецепту на BERT-base и на ModernBERT, замерь nDCG@10 на своей разметке.
- Если ModernBERT просел - посмотри L2-норму его MLM-головы; при норме выше 2 пробуй rescaling с сеткой k = 2, 4, 8, 16.
- Есть ресурс на серьёзный эксперимент - ставь Vocabulary Transfer, код открыт.
- Сравни оба варианта с готовыми embedding-моделями через API: иногда файнтюн вообще не нужен.
Пятый шаг заводится из России сменой двух строк: ключ и base_url единого API provod.ai. Он совместим с OpenAI SDK, поэтому скрипт сравнения не переписываешь под каждого провайдера, а переключаешь модель одной строкой. Один ключ вместо пяти, один баланс на эксперименты и прод, виден расход по каждой модели.
Что это НЕ решает?
Коротко: проигрыш ModernBERT - нишевый кейс одного рецепта. Из него следует узкий вывод про sparse-файнтюнинг; приговаривать новую архитектуру по нему нельзя.
- В dense-ретривале, классификации и на длинном контексте ModernBERT сильнее: по заявлениям Answer.AI, это первый base-размерный энкодер, обыгравший DeBERTaV3 на GLUE, при менее чем пятой части её памяти и вдвое большей скорости.
- Оба эксперимента - на английских данных (MS MARCO, BEIR). Для русского языка берут мультиязычные энкодеры, и переносить цифры без проверки нельзя.
- VT и rescaling - препринты июня-июля 2026 года, а не production-стандарт: у рецептов просто не было времени набрать отрицательные отзывы из практики.
Когда provod.ai не подходит
Коротко: если ты обучаешь собственный энкодер на своём железе, агрегатор на этом этапе ни при чём.
По теме статьи честно так: provod.ai - про доступ к готовым моделям по API из России, с рублёвым балансом и документами для юрлиц. Файнтюн SPLADE на своих GPU, пересадку словаря и self-hosted инвертированный индекс он не заменяет - это работа твоей команды на твоём железе. Не подойдёт он и там, где нужен on-prem контур без внешних вызовов. А вот этап «быстро сравнить готовые embedding-модели на своих текстах до того, как платить за обучение» - как раз его территория.
Словарик запросов кластера
Коротко: вокруг запроса «bert нейросеть» поиск собрал хвост из сотни соседних формулировок. Размечаем, что люди на самом деле искали, чтобы ты не перепутал.
Техника рядом, которую путают с BERT
- «tree» - tree of thoughts, техника промптинга LLM, к BERT отношения нет.
- «gptq» - формат квантования весов: ужимает LLM под домашнюю видеокарту.
- «gptzero.me» - детектор ИИ-текста, запрос пишут как «gptzero me».
- «gym» - OpenAI Gym, тренажёр для обучения агентов с подкреплением.
- «worm» - WormGPT, вредоносная LLM для фишинга; ищут «worm gpt github».
- «cursorrules» - файл правил для AI-редактора Cursor.
- «regional» и «material» - Regional Prompter у Stable Diffusion и ошибка Suno про авторские права на тексты песен.
- «method», «extractor», «i2v» - обрывки про сэмплеры Stable Diffusion, извлечение звука и генерацию видео из картинки.
- «try-on» - Kolors Virtual Try-On, виртуальная примерка одежды.
- «daw», «xln», «lhy», «ztx» - звуковые станции и аудио-плагины; Suno стыкуют с DAW.
- «salutespeech» - SaluteSpeech, голосовой стек Сбера.
- «20studio» и «animan» - студийные сервисы из соседних выдач про Qwen и Udio.
- «master» - «promt master»: уроки промптинга, не про энкодеры.
- «table» - «gpt table»: генерация таблиц в ChatGPT.
Опечатки и склейки брендов
- «gptcom», «gptchatcom» - так ошибочно набирают адрес ChatGPT.
- «gptrus», «gptrussia» - поиск «ChatGPT в России».
- «chatgptappcom», «chatgptappgpt», «chatgptchatappcom», «chatpgptapp», «chatbotappgpt» - попытки набрать адрес приложения ChatGPT по памяти.
- «chatgpttestbot», «chatgpttools» - тестовые боты и подборки инструментов вокруг ChatGPT.
- «dgpt», «gptcat», «gpttea», «lein» - мемные и обрывочные склейки с GPT.
- «gptinnel», «gpttonel», «gpttonnel» - искажённый «GPT tunnel»: пути обхода блокировок.
- «gptroom», «yard» - room gpt: дизайн комнат и двора по фото.
- «gpt4tbot», «gpt5tbot», «gpt4agentsbot», «aigptbot» - телеграм-боты с доступом к GPT.
- «chatdeepseek», «deepseekchat» - навигация к DeepSeek.
- «diplom», «diplomgpt» - diplom gpt: сервисы дипломных работ, ищут отзывы.
- «girlfriendgpt» - боты-компаньоны на базе GPT.
- «gemini0508», «geminicode22», «geminigenal» - сгенерированные варианты запросов к Gemini.
- «cle», «ent», «mes», «met», «ме» - обрывки запросов про Qwen, Kandinsky, тарифы и Алису.
- «72to» - из «sd 72to ru техподдержка»: поддержка сервиса Stable Diffusion.
- «cookies», «name», «offer» - «claude cookies», имя Claude, студенческая акция Gemini.
- «boy» - «шедеврум boy model»: генерация персонажа в Шедевруме.
- «verb», «intrigue» - песня Claude Ciari и аромат Devil's Intrigue; попали сюда случайно.
- «heart» - «запустить нейросеть atomic heart»: про игру.
- «mind» - ai money mind gpt, приложение из соседней темы.
- «fit» - «llama cpp fit on»: влезет ли модель в память при локальном запуске.
- «grill» - «grill me skill claude»: развлекательный скилл.
- «zone», «hammer», «fire» - flux zone, flux hammer, misa fire: выдача про генератор картинок Flux.
Музыка, картинки, чаты - соседние темы
- «house», «baby» - slap house промпты для Suno, The Loud House и ai baby generator «как будет выглядеть ребёнок».
- «hot», «god», «lie», «night», «folk», «dress», «тум» - треки и ИИ-каверы: Inna «Hot», dark folk, Dress Up, «тум балалайка».
- «feed», «flower», «mine» - лента генераций Sora, цветок в Veo 3, генератор видео Pika.
- «secret», «sona» - «уфанета secret mini 2» с голосовой Алисой и нейросеть для песен.
- «sex» - запросы про чат-ботов 18+: категория, которую крупные платформы режут фильтром.
- «wed», «men», «mon», «amour» - чаты с ИИ-персонажами и ласковое «mon amour» в адрес Gemini.
- «пис» - фан-арт по «Ван Пис».
- «айстудио», «черри» - Google AI Studio и Cherry Studio, клиент для разных LLM.
- «комбо», «ано» - мусорные склейки вроде «грок взлом мода комбо» и «ано сор».
- «мед» - из «минь мёд вео»: запросы про Veo после автозамены.
- «мена» - из «шедя мена»: мультик, который голосом просят включить Алису.
provod.ai — подключение AI без переписывания продукта
Сохраняйте привычный стек: приложение, AI-клиент, агент, IDE, SDK или библиотека продолжают работать в знакомом формате. Если инструмент поддерживает OpenAI-совместимый API, обычно меняются только URL и ключ.
В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.
Стоимость моделей совпадает с официальными тарифами поставщиков 1:1: агрегатор не добавляет свою наценку, а российская команда платит в рублях через единый баланс.
Подключите существующий AI-стек к provod.ai: инструкция по миграции · форма регистрации · цены на модели · защита данных по 152-ФЗ
FAQ
Коротко: собрали вопросы, которые остаются после цифр, - от актуальности BERT до русского языка.
BERT ещё актуален в 2026 году?
Для энкодерных задач - да: поиск, классификация, эмбеддинги, фильтрация данных. На конец 2024 года - больше 68 млн скачиваний в месяц и второе место на Hugging Face; энкодер-only модели суммарно набирали свыше 1 млрд скачиваний против 397 млн у декодерных (данные Answer.AI на декабрь 2024).
Что выбрать для sparse-поиска: BERT или ModernBERT?
По стандартному рецепту SPLADE - BERT-family: 0.361-0.403 против 0.127 на BEIR-13. Нужен контекст 8192 токена - ModernBERT с Vocabulary Transfer (52.4 nDCG, SOTA на BEIR) или хотя бы rescaling MLM-головы с подобранной k.
Что такое SPLADE простыми словами?
Способ превратить энкодер в поисковую машину: MLM-голова расставляет веса десяткам тысяч термов, включая синонимы, а искать можно старым добрым инвертированным индексом, без векторной базы.
Эти выводы работают для русского языка?
Неизвестно. Оба исследования мерились на английских MS MARCO и BEIR. Для русского обычно берут мультиязычные энкодеры, и L2-норму MLM-головы там стоит проверять отдельно.
Чем BERT отличается от ChatGPT?
BERT - энкодер понимания 2018 года, он не ведёт диалог. ChatGPT - чат-продукт поверх генеративного декодера GPT. Один индексирует и классифицирует, другой разговаривает.
Где взять код починки ModernBERT?
Авторы статьи про Vocabulary Gap (SIGIR 2026) выложили код и модели в открытый доступ; ссылка - в препринте arXiv:2607.00004.
Итог всей истории простой: выбор энкодера - эмпирический вопрос. Сравнить готовые embedding-модели на своих документах можно за один вечер через provod.ai: единый API, баланс в рублях с карты РФ, условия оплаты и документы для юрлиц стоит проверить на сайте сервиса. Замер на своих данных решит спор честнее любой статьи, включая эту.
Мой рабочий вывод спорный: под sparse-поиск в 2026 году я бы стартовал с BERT-base, а ModernBERT брал только с пересаженным словарём. Ты на чём собрал бы индекс - на проверенном старичке или на новичке с докруткой?
Источники
- S1: «Why Advanced Encoders Lag on Sparse Retrieval? The Answer and an Approach to Bridging Vocabulary Gaps», Geng & Yang, arXiv:2607.00004, accepted at SIGIR 2026 - https://arxiv.org/abs/2607.00004
- S2: «Rescaling MLM-Head for Neural Sparse Retrieval», 17.06.2026 - https://arxiv.org/html/2606.18811
- S3: Answer.AI, «Finally, a replacement for BERT: Introducing ModernBERT», 19.12.2024 - https://www.answer.ai/posts/2024-12-19-modernbert.html
- S5: «BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding», Devlin et al., 11.10.2018 - https://arxiv.org/abs/1810.04805
- S6: «SPLADE: Sparse Lexical and Expansion Model for First Stage Ranking», Formal et al., SIGIR 2021 - https://arxiv.org/abs/2107.05720
- S7: «A Unified Framework for Learned Sparse Retrieval», март 2023 - https://arxiv.org/pdf/2303.13416.pdf
- S8: конфиг bert-base-uncased (vocab 30522), проверен 19.07.2026 - https://huggingface.co/google-bert/bert-base-uncased/raw/main/config.json
- S9: конфиг ModernBERT-base (vocab 50368), проверен 19.07.2026 - https://huggingface.co/answerdotai/ModernBERT-base/raw/main/config.json
- S13: «BEIR: A Heterogeneous Benchmark for Zero-shot Evaluation of Information Retrieval Models», Thakur et al., 17.04.2021 - https://arxiv.org/abs/2104.08663
- S14: Google, «Understanding searches better than ever before», 25.10.2019 - https://blog.google/products/search/search-language-understanding-bert/


Top comments (0)