DEV Community

Cover image for «chatpdf» в 2026: Mistral OCR 4 научился bounding boxes и 170 языкам - коробочный RAG
Promptra Team for Promptra

Posted on

«chatpdf» в 2026: Mistral OCR 4 научился bounding boxes и 170 языкам - коробочный RAG

Запрос «chatpdf» в 2026 году - это уже не про сайт. Люди ищут способ спросить у документа: где в договоре прописана неустойка, что стоит в таблице на сороковой странице отчёта, какой вывод у статьи на 300 листах. 23 июня 2026 года Mistral выпустила OCR 4 - и сценарий «поговорить с PDF» переехал из потребительских сервисов в коробочную инфраструктуру, которую собирают у себя в контуре.

Цена вопроса при этом разъехалась в разы. ChatPDF Plus просит $19.99 в месяц (тариф сверен с chatpdf.com 18.04.2026), а тот же трюк через API - $4 за 1000 страниц распознавания плюс недорогие токены модели. Рабочих путей три: подписка готового сервиса, бесплатные тарифы соседних инструментов и свой пайплайн через агрегатор вроде provod.ai (российский OpenRouter), где модели для документных задач доступны в рублях по официальным тарифам. Дальше - что именно добавил OCR 4 и во что выльется собственный чат с PDF, цены и лимиты на июль 2026.

provod.ai - это агрегатор нейросетей для пользователей из России: топовые модели в одном чате и через единый API, оплата в рублях легально, без VPN и зарубежных карт, с договором и закрывающими для юрлиц.

Что такое ChatPDF и почему его до сих пор гуглят?

Коротко: ChatPDF - сайт, куда загружаешь PDF и задаёшь вопросы чату, который отвечает по тексту документа с указанием страницы. Запустил его 2 марта 2023 года немецкий инженер Матис Лихтенбергер, до этого создавший Firefoo и побывавший VP Engineering в Bliq. Сервис собрал миллион пользователей за первую неделю.

Компания ChatPDF GmbH сидит в немецком Лабё, полностью бутстрапнута, без инвестиций, команда - около четырёх человек. Редкий случай, когда узкая обёртка над готовой LLM пережила волну клонов и стала именем нарицательным: «chatpdf» люди вбивают в поиск, когда им нужен вообще любой чат с документом. Через год после запуска это был 45-й по посещаемости генеративно-ИИ сайт мира.

Тарифы на 2026 год: бесплатно дают 2 PDF в день, до 120 страниц и 10 МБ на файл; Plus за $19.99 в месяц поднимает потолок до 2000 страниц и 32 МБ, снимает лимит вопросов и даёт доступ к API. Цена Plus пришла дугой: около $5 в 2023-м, потом $9.99, теперь $19.99. Меня здесь напрягает вот что: продукт за три года почти не изменился, а подорожал вчетверо. Именно поэтому запрос не угасает - люди ищут, чем его заменить или как повторить самим.

Как чат с PDF устроен под капотом?

Коротко: схема одна и та же у всех сервисов категории. Документ распознаётся, нарезается на смысловые куски, куски превращаются в векторы, по вопросу находятся ближайшие - и LLM пишет ответ с цитатой. Ломается это хозяйство почти всегда на первой ступени.

По порядку. Сначала OCR достаёт текст из страниц, включая сканы без текстового слоя. Потом текст режут на чанки и считают для них эмбеддинги - векторы, по которым можно мерить близость смыслов. Идея старая: word2vec больше десяти лет назад научил машину сравнивать слова по контексту, ещё раньше тексты жевали рекуррентные сети вроде rnn, а сегодня работают специализированные embedding-модели. Найденные чанки уходят в промпт, и модель отвечает, опираясь на них.

Слабое место - вход. Плохой скан, таблица с объединёнными ячейками, формула, двухколоночная вёрстка: на каждом препятствии наивный распознаватель теряет порядок строк или рвёт таблицу на бессмысленные куски. Дальше цепочка работает исправно, только уже с битыми данными. Отсюда и интерес к релизу Mistral: он как раз про первую ступень.

Mistral OCR 4: что именно добавили 23 июня 2026

Коротко: OCR 4 возвращает извлечённый текст в markdown и вместе с ним bounding boxes - координаты каждого блока на странице, типизированную классификацию блоков (заголовки, таблицы, формулы, подписи и другие) и инлайновые оценки уверенности на уровне страницы и слова. По данным Mistral, bounding boxes - самая запрашиваемая функция у пользователей линейки.

Второй блок новостей - языки. Модель поддерживает 170 языков в 10 группах, и, по заявлению вендора, наибольший отрыв от конкурентов достаётся на редких и малообеспеченных - хинди, грузинском, бенгальском, армянском, иврите, греческом, тамильском и других, где конкурирующие системы резко деградируют.

С цифрами качества держи в голове атрибуцию: это данные самой Mistral из анонса. OlmOCRBench - 85.20, рекорд среди протестированных ею систем; OmniDocBench - 93.07, причём сам вендор оговаривает известные артефакты скоринга обоих бенчмарков; внутренний Crawl Multilingual - 0.98. В слепой человеческой оценке на 600 с лишним документах на 12 с лишним языках независимые аннотаторы в среднем в 72% случаев предпочли вывод OCR 4. Звучит сильно, но независимой проверки этим числам пока нет.

Цены из того же анонса: $4 за 1000 страниц через API, $2 за 1000 в пакетном Batch API со скидкой 50%, Document AI (тот же движок плюс JSON-схемы и аннотации изображений) - $5 за 1000 страниц. Входные форматы: PDF, DOC, PPT, OpenDocument и изображения. Типовые нагрузки из документации - семантический чанкинг для RAG, структурные примитивы для агентов (заполнение форм, обработка инвойсов, комплаенс-проверки) и типизированный контент для коннекторов.

Неделя у релиза выдалась конкурентная: по данным ExplainX, за день до OCR 4 вышел Baidu Unlimited-OCR с открытыми весами, двумя днями ранее - PixelRAG, который ретривит по скриншотам страниц без извлечения текста. Подтверждается это одним источником, поэтому держу как фон, а не как фактуру.

Почему это называют «коробочным RAG»?

Коротко: OCR 4 компактен и разворачивается одним контейнером для полностью self-hosted сценариев - резидентности, суверенитета и комплаенса данных. А ещё он встроен в Mistral Search Toolkit, открытый компонуемый поисковый фреймворк в статусе public preview, анонсированный на AI Now Summit. «Свой ChatPDF» теперь собирается из официальных компонентов, без самодельных костылей.

Логика вендора видна в цепочке: структурированный вывод OCR 4 подаёт citation-ready вход для ingestion, retrieval и evaluation в RAG и корпоративном поиске. Каналы доступа - Mistral API, Document AI в Mistral Studio, Amazon SageMaker и Microsoft Foundry; интеграция Snowflake Parse Document заявлена как «скоро». Контейнер помогает оставить данные в собственном контуре, но комплаенс требует отдельной настройки и проверки.

Схема коробочного RAG: PDF, OCR 4, чанкинг, векторный индекс, ответ с цитатой

Что это даёт на практике, видно по кейсам из анонса. Rogo приводит цифры своего AI-инженера Aidan Donohue: сопоставимая точность примерно при 8-кратной экономии и 17-кратном снижении задержки против ведущих агентных парсеров на финансовом QA-датасете с графиками и фигурами. Anaqua, по словам их AI-инженера Ivan Mihailov, получила обработку примерно в 4 раза быстрее на страницу против прежнего провайдера. Это заявления из материалов вендора, не независимый замер, но масштаб понятен: ingestion перестал быть самым дорогим местом пайплайна.

Три поколения Mistral OCR: что менялось за полтора года

Коротко: цена за тысячу страниц выросла с $1 до $4, потому что выросла сама выдача - от «просто текст» к «карта документа с типами блоков и уверенностью».

Версия Дата Цена за 1000 страниц Что добавила
Mistral OCR, первое поколение март 2025 $1 до 2000 страниц в минуту на одном узле, режим doc-as-prompt
Mistral OCR 3 декабрь 2025 $2 ($1 в Batch) винрейт 74% над OCR 2 на формах, сканах, сложных таблицах и рукописном тексте; HTML-реконструкция таблиц с colspan и rowspan
Mistral OCR 4 23.06.2026 $4 ($2 в Batch) bounding boxes, типы блоков, confidence на уровне слова и страницы, 170 языков

Цены и винрейты - по анонсам Mistral. По стороннему замеру IntuitionLabs, у OCR 3 точность на рукописном тексте была 88.9% против 78.2% у Azure, а на таблицах - 96.6% против 84.8% у Amazon Textract. И держи ухо востро со скоростью: цифру «2000 страниц в минуту» обзоры уже приписывают OCR 4, но в его анонсе её нет - это заявление про первое поколение. Для четвёртой версии Mistral говорит только про экономичную пакетную обработку.

Какой сервис для чата с PDF выбрать в 2026 году?

Коротко: разовый вопрос к одному документу - ChatPDF, AskYourPDF или бесплатный NotebookLM. Академические тексты - SciSpace. Таблицы и данные - PowerDrill. Поток документов в компании - свой пайплайн на OCR 4.

Сервис Бесплатно Платный тариф Кому подходит
ChatPDF 2 PDF/день, до 120 стр. и 10 МБ Plus $19.99/мес разовые вопросы к одному файлу
AskYourPDF 100 стр./документ, 1 документ и 50 вопросов в день Premium $11.99, Pro $14.99/мес длинные файлы, связка с Zotero
SciSpace академический фокус, база 220 млн+ статей Premium от $20/мес исследователи и студенты
NotebookLM до 50 источников, до 500 тыс. слов на источник - мультидокументные исследования бесплатно
PowerDrill есть бесплатный тариф от $3.90/мес анализ данных, графики и SQL из чата
Perplexity тарифа в наших источниках нет - по свежим сравнениям хвалят за работу со сканами

Лимиты и цены сверены по обзорам Aipedia, ColdIQ, Denser, Atlas Workspace и Unisender на июнь-июль 2026. Про Perplexity компании Аравинда Сриниваса: в сравнении Denser её хвалят за сильный OCR сканов, но это чужая оценка, не мой замер. PowerDrill стоит особняком: это no-code анализ данных, где чат строит SQL- и Python-запросы и рисует графики.

Границы: что эти инструменты не решают

Коротко: сама Mistral честно ограничивает применение OCR 4. Это модель понимания документов, а не принятия решений: она не предназначена для медицинской диагностики, юридических заключений, высокорисковых финансовых решений, safety-critical систем, обработки в реальном времени и не-документных входов вроде сырого аудио и видео.

Из этого списка следует правило: ответ чата с PDF - черновик для проверки человеком, а не заключение. Юрист сверяет пункт договора глазами, врач открывает первоисточник. Дальше - ограничения самой схемы. На очень длинных документах ретрив деградирует: нужный абзац не попадает в выдачу чанков, и модель уверенно отвечает по соседнему. Плохой скан вводит в заблуждение даже сильные системы - здесь помогают confidence-плашки OCR 4, показывающие, где модель сама сомневается. И отдельная тема - конфиденциальность: загружая договор в чужое облако, ты даришь его содержимое чужому контуру.

Как собрать свой ChatPDF за вечер?

Коротко: пять шагов - распознать документы через OCR 4, нарезать результат по типам блоков, посчитать эмбеддинги, сложить всё в векторный индекс и спрашивать LLM, подсвечивая источник по bounding boxes. Тысяча страниц обойдётся в $4 по прайсу Mistral на 23.06.2026.

  1. Распознай документы. Запрос к OCR 4 вернёт markdown, координаты блоков и оценки уверенности. Пакетный Batch режет цену вдвое - до $2 за 1000 страниц.
  2. Нарежь чанки по типам блоков: таблица живёт отдельно от абзаца, формула - отдельно от подписи.
  3. Посчитай эмбеддинги для чанков и положи их в векторный индекс.
  4. На вопрос пользователя доставай релевантные чанки и подавай их LLM вместе с вопросом.
  5. В ответе подсвечивай источник: bounding boxes дают точную рамку на странице, так что цитата ведёт на конкретное место, а не «куда-то в документ».

Экономика прозрачная. Подписка ChatPDF Plus - $19.99 каждый месяц за один узкий сценарий; у своей связки OCR-компонент стоит $4 за тысячу страниц, а также нужны токены, эмбеддинги, хранилище, инфраструктура и работа по сборке. Если документы идут потоком и они конфиденциальные, разница окупает вечер настройки быстро.

Весь пайплайн заводится из России сменой двух строк: ключ и base_url на единый API provod.ai. Он совместим с OpenAI SDK (/v1/chat/completions) и с Anthropic (/v1/messages), так что готовый скрипт переписывать не нужно: распознавание, эмбеддинги и финальную генерацию выбираешь из одного каталога, платишь с одного баланса в рублях по ценам официальных провайдеров. Для рабочих документов заранее проверьте, какие данные можно передавать внешней модели.

from openai import OpenAI

client = OpenAI(
    api_key="ВАШ_КЛЮЧ",
    base_url="https://api.provod.ai/v1",
)

resp = client.chat.completions.create(
    model="имя-модели-из-каталога",
    messages=[{"role": "user", "content": question}],
)
print(resp.choices[0].message.content)
Enter fullscreen mode Exit fullscreen mode

Этот кусок - финальный шаг схемы: в question подставляется вопрос вместе с найденными чанками, и модель отвечает по ним. Смена провайдера сводится к замене адреса и ключа, логика остаётся твоей.

Когда provod.ai не подходит?

Коротко: если тебе нужен именно ChatPDF с его папками и привычным окном чата, прямой Enterprise-контракт с Mistral ради SLA, полностью свой on-prem с аудитом - или всего пара вопросов в месяц, агрегатор ничего не добавит.

По пунктам. Фирменный флоу ChatPDF Plus - подписочная фича вендора; повторять её незачем, она и так работает. Прямые отношения с Mistral, где SLA и юридическая ответственность самого вендора критичны для тендера, заключаются с вендором, а не с посредником. Self-hosted контейнер с квартальным аудитом инфраструктуры - это твой собственный деплой, тут агрегатор ни при чём. И если сценарий - «два PDF в месяц про учёбу», честный ответ: хватит бесплатного тарифа любого сервиса из таблицы выше, платить вообще не нужно.

Словарик запросов кластера: что ещё гуглят рядом с chatpdf

Коротко: поисковая статистика рядом с «chatpdf» - это опечатки, соседние сервисы и случайные слова. Движки опечатки исправляют, а запросы живут годами. Вот честная разметка, чтобы ты не гадал, что за слово тебе встретилось.

Опечатки и обрывки запросов:

  • deepsek - DeepSeek с пропущенной буквой; деспек (он же деспечь) - тот же DeepSeek кириллицей, на слух.
  • qpt, qven, qvin, qwn - GPT и Qwen с опечатками.
  • генеми - Gemini на слух; виспер - Whisper кириллицей; алиа и алиаа - «Алиса» на слух.
  • вф, dc - обрывки запросов, конкретного сервиса за ними нет.
  • buss - из запросов про «взломанную версию»; облачную модель не взломать, она живёт на серверах вендора.
  • jernblod - ник или искажённое название рядом с «скачать нейросеть бесплатно»; калимба - музыкальный инструмент, попадает сюда из запросов про скачивание.
  • glm-т4636sa - модель GLM с хвостом идентификатора сборки.
  • promley, sorya, verale, sintx, slid, weavy, roboneo, smartbuddy, study24ai - небольшие сервисы соседних ниш, их гуглят по имени; к документам отношения нет.

Термины, которые помогают читать новости про модели:

  • backpropagation - обучение сетей: ошибка разносится назад по слоям; pretraining - предобучение на большом корпусе до настройки под задачи.
  • overfitting - переобучение, зубрёжка вместо обобщения; unsupervised - обучение без разметки.
  • softmax - функция, превращающая баллы модели в вероятности.
  • grpo, orpo - методы дообучения на предпочтениях и групповом сравнении ответов.
  • speculative - про speculative decoding: черновая модель предлагает токены, большая проверяет.
  • bitnet - сверхкомпактные модели с урезанной разрядностью весов; llada - модель, генерирующая текст диффузией, а не слева направо.
  • word2vec и rnn - классика представления слов и рекуррентные сети; про них подробнее в разделе «под капотом».

Персоны недели в ИИ: sutskever - Илья Суцкевер, один из сооснователей OpenAI; suleyman - Мустафа Сулейман, фигура из новостей про крупные лаборатории; yann - Янн Лекун, один из отцов глубокого обучения; srinivas - Аравинд Сринивас из Perplexity, он уже встречался тебе в таблице выше.

Крипто на стыке с ИИ (к документам отношения нет): ai16z и aixbt - проекты ИИ-агентов с токенами; bittensor - сеть, где вычисления для ИИ оплачиваются криптой, а tao - её токен; virtuals - протокол токенизированных агентов.

Инструменты соседних ниш - если тебе на самом деле нужно другое:

  • Графика: photopea - фоторедактор в браузере; removebg - удаление фона с фото; piclumen - генератор картинок; dashtoon - комиксы; creatify - рекламные креативы; headshotpro - деловые портреты по селфи.
  • Аудио: soundraw - фоновая музыка; steosvoice - синтез голоса; notta и turboscribe - транскрибация; speech2text - сам класс задач распознавания речи.
  • Учёба: magicschool и twee - для учителей; turbolearn и coconote - конспекты для студентов.
  • Тексты: sudowrite и novelcrafter - для прозаиков; kickresume - резюме; frase - SEO-тексты; sinonimorg - синонимы и сокращение текста, это про переписывание, а не про вопросы к документу.
  • Право и медицина: spellbook и cocounsel - для юристов; openevidence - справочник для врачей.
  • Код и данные: greptile - поиск по коду; gumloop - автоматизации без кода; sambanova - железо для инференса; mercor - найм с ИИ-собеседованиями.
  • Биометрия и прочее: findface, pimeyes, search4faces и ntechlab - поиск и распознавание лиц; promobot - промо-роботы; paradromics - нейроинтерфейсы; lerobot - открытая робототехника; robotaxi - беспилотные такси; saros - робот-пылесос; elliq - компаньон для пожилых; wysa - чат психологической поддержки; griefbot - бот, имитирующий умершего; tilly - виртуальная актриса Tilly Norwood; phygital - смесь физического и цифрового в ритейле.
  • Из народных запросов: аленушка и федоров - сказки, пересказанные или нарисованные нейросетью; алматы - гео-запрос про доступный ИИ; 2127 - школьники ищут, какой нейросетью задать вопрос по урокам; warface и radmir - игровые помощники для шутера и RP-серверов; мертвый интернет - теория о вебе, заполненном сгенерированным контентом, её гуглят рядом с любой нейросетью.

provod.ai — оптимизируйте RAG по качеству, скорости и цене

Поиск, переранжирование, анализ контекста и финальный ответ не обязаны выполнять одна и та же модель: подберите лучший инструмент для каждого этапа и сохраните общую интеграцию.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Считайте экономику пайплайна без ценового шума: каждая модель тарифицируется 1:1 с официальным провайдером, без собственной наценки provod.ai.

Настройте модельный состав RAG: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai

Частые вопросы

Коротко: здесь ответы на то, что спрашивают перед выбором сервиса: про бесплатность ChatPDF, отличия от AskYourPDF, объединение файлов, bounding boxes и русский язык в OCR 4.

ChatPDF бесплатный?
Да, в лимитах: 2 PDF в день, до 120 страниц и 10 МБ на файл. Plus за $19.99 в месяц (тариф сверен 18.04.2026) поднимает потолок до 2000 страниц и 32 МБ, снимает лимит вопросов и даёт API. Цена росла по дуге: около $5 в 2023-м, затем $9.99, теперь $19.99.

Чем ChatPDF отличается от AskYourPDF?
Лимитами и экосистемой. AskYourPDF бесплатно даёт 100 страниц на документ, один документ и 50 вопросов в день; тарифы $11.99 и $14.99 поднимают потолок до 2500 и 6000 страниц, есть интеграция с Zotero и Chrome-расширение. ChatPDF проще и держится на привычке аудитории и на API в Plus-тарифе.

Можно ли объединить несколько PDF в один чат?
В NotebookLM подтверждён вариант с блокнотами до 50 источников и до 500 тысяч слов на источник (по данным Atlas Workspace на 01.07.2026). Получается одна объединенная база для вопросов сразу к стопке документов. В собственном пайплайне ты просто кладёшь все чанки в один индекс.

Что такое bounding boxes в OCR и зачем они нужны?
Это координаты рамки каждого блока на странице: заголовка, таблицы, формулы, подписи. С ними система цитирует точным местом, а не «где-то в документе», а проверяющий видит, что именно модель прочитала и насколько уверенно.

Поддерживает ли Mistral OCR 4 русский язык?
В приведённых источниках русский язык отдельно не указан; уточните его поддержку в актуальной документации Mistral.

Источники

  1. Mistral AI - Mistral OCR 4, анонс, 23.06.2026
  2. Mistral AI - Mistral OCR 3, анонс, декабрь 2025
  3. Mistral AI - документация Document AI, 19.07.2026
  4. Releasebot - зеркало обновлений Mistral, 19.07.2026
  5. Microsoft - OCR 4 в Microsoft Foundry, 23.06.2026
  6. Implicator.ai - OCR как карта корпоративного поиска, 24.06.2026
  7. Aipedia - обзор ChatPDF, тарифы сверены 18.04.2026
  8. AI Wiki - история ChatPDF, 20.06.2026
  9. ToolBistro - One-person AI startups, 30.06.2026
  10. ColdIQ - тарифы AskYourPDF, 2026
  11. Denser - Chat with PDF, 15.06.2026
  12. IntuitionLabs - сравнение OCR-моделей
  13. BuildFastWithAI - What is Mistral OCR, 10.03.2025
  14. ExplainX - контекст недели OCR 4, 04.07.2026
  15. Atlas Workspace - альтернативы ChatPDF, 01.07.2026
  16. Unisender - нейросети для анализа данных, 30.09.2025

Вывод из всего этого простой. Разовый вопрос к документу - готовый сервис: ChatPDF, AskYourPDF или бесплатный NotebookLM. Поток документов в компании - своя связка «OCR + эмбеддинги + LLM», где OCR 4 на июль 2026 выглядит эталонным ingestion-слоем: структура с bounding boxes, 170 языков, контейнер для своего контура и $4 за тысячу страниц.

Спорный момент напоследок. Разница между $19.99 подписки и $4 за тысячу страниц - вопрос не экономии, а того, кому ты доверяешь документы. Для рабочего архива с договорами я бы собрал своё и замкнул данные в контуре; для учебной статьи на 30 страниц - взял бесплатный тариф. Согласен с таким разделением или у тебя порог «связываться с API» ниже?

Свой чат с документами через единый API provod.ai: оплата в рублях, без наценки

Актуальный список моделей и цены в рублях - на provod.ai. Один баланс: задаёшь вопросы своему PDF в чате, потом катишь тот же ключ в прод-пайплайн; для юрлиц - договор и закрывающие документы.

Top comments (0)