DEV Community

Cover image for Чат GPT переводчик обогнал DeepL по вкусу людей — но не там, где решают юристы
Promptra Team for provod.ai

Posted on

Чат GPT переводчик обогнал DeepL по вкусу людей — но не там, где решают юристы

Модель, которую переводчики называют лучшей в слепом тесте, в юридическом документе может незаметно поменять «может» на «обязан» — и оба вывода подтверждены цифрами.

Запрос «чат gpt переводчик» вместо привычного «DeepL» или «Google Переводчик» стал стандартной формулировкой года: люди действительно спрашивают модель вместо специализированного движка. И у этого есть основание. В слепом тестировании семи профессиональных переводчиков переводы Claude 3.5 признавались «хорошими» в 78% из 615 попарных сравнений — выше GPT-4, DeepL и Google Translate. Это вендорское исследование платформы локализации Lokalise, и панель оценщиков — всего семь человек, но методология описана прозрачно, и по её же данным реального использования принятие ИИ-перевода без правок доходит до 84% на десятках языковых пар Lokalise.

Одновременно независимое академическое исследование юридических текстов зафиксировало лексические ошибки в 43,4% случаев и ошибки юридического регистра в 30,2% — при переводе всего пяти законодательных документов AWEJ Translation Studies. Здесь важна оговорка: тестировался Google Translate образца 2023 года, а не текущие LLM — так что цифру нельзя механически переносить на Claude или GPT-4-класс. Но проблема, которую она подсвечивает — юридическая терминология требует не «похожего», а точного слова — никуда не делась и у моделей нового поколения, просто её масштаб для них отдельно не измерен.

Почему нет единого рейтинга «кто лучше переводит»

На конференции WMT24 при человеческой оценке (ESA) Claude 3.5 Sonnet занял первое место в 9 из 11 языковых пар, обойдя GPT-4o и DeepL. Но по автоматической метрике COMET лидером оказалась специализированная система TOWER-v2-70B Ninth Conference on Machine Translation. Это не разночтение в интерпретации — это разные измерительные линейки, дающие разных победителей на одном и том же материале. Плюс тексты WMT — преимущественно новостные и общего профиля, а не договор с нумерованными пунктами или инструкция с таблицами и сносками. Так что даже «объективный» лидерборд отвечает не совсем на тот вопрос, который стоит перед человеком, переводящим конкретный контракт.

Если нужно быстро сверить, как разные модели справляются с одним и тем же трудным абзацем — термином, модальностью, числом — прежде чем доверять им целый документ, удобнее не заводить отдельные подписки на каждый сервис, а прогнать один и тот же кусок текста через Claude- и GPT-класс моделей в одном месте. provod.ai даёт доступ к каталогу моделей через один OpenAI-совместимый API: клиент, уже настроенный на протокол OpenAI, подключается заменой base URL и ключа, без переписывания кода — это снижает трение именно на этапе «сравнить, а не поверить на слово одному вендору».

Что говорят те, кто уже работает с этим каждый день

Мария Стасимиоти, аналитик Slator, разбирая данные Anthropic Economic Index за январь 2026 года, отмечает: доля переводческих задач в использовании Claude выросла лишь с 0,63% до 0,71% за несколько месяцев, и переводчики применяют модель в основном для проверки текста и сверки терминологии, а не для автономного перевода документа целиком. Её формулировка звучит жёстко: «A prompt such as 'Translate this paragraph into French' is considered high automation but low AI autonomy» Slator, Anthropic Economic Index — то есть даже там, где действие полностью автоматизировано, самостоятельности у модели в профессиональном контуре пока немного.

Лингвист Надежда Акимова в колонке для Mel занимает более жёсткую позицию: использовать ИИ-перевод «как есть» для документов, влияющих на деньги, репутацию или юридические последствия, категорически недопустимо, потому что хороший перевод — это перевод смысла и контекста, а не слов. Она приводит хрестоматийные истории о цене одной ошибки — случай с медицинским термином «intoxicado» и инструкцию Boeing Mel.fm. Эти примеры стоит воспринимать как анекдотическое наблюдение, иллюстрирующее логику риска, а не как задокументированный факт о работе конкретно ChatGPT или Claude — они старше современных LLM и относятся к переводу вообще.

Расходятся эти два голоса не в фактах, а в единице анализа: Стасимиоти описывает, как переводчики уже встроили ИИ в рабочий процесс с контролем; Акимова описывает, что случается, когда контроля нет. Обе позиции совместимы с одним и тем же практическим правилом.

Где именно смысл ломается чаще всего

Сильнейший контраргумент тезису «ИИ ещё сырой» звучит так: если 78–84% переводов принимаются профессионалами без правок, то для переписки, инструкций и статей категорический отказ от ИИ избыточен, а разбираться имеет смысл с одним конкретным сценарием — когда договор вышел из модели и сразу пошёл на подпись, никем не вычитанный. Это разумное возражение, и данные его частично подтверждают: проблема концентрируется в конкретных доменах, а не размазана равномерно по всем видам текста.

Но концентрация — это не отсутствие. Исследование Alibaba (октябрь 2025) на 17 крупных LLM зафиксировало «переводческие галлюцинации» — вставленный или искажённый смысл — на уровне от 33% до почти 60% в зависимости от модели и языковой пары Slator, AI translation struggles. Исследование Appen того же обзора отдельно отмечает, что модели плохо справляются с идиомами и игрой слов, нередко оставляя идиому вообще непереведённой. А академическое сравнение художественного перевода по MQM-фреймворку показало точность в 94,5% у человека против 77,9% у ChatGPT — при этом беглость текста у модели была даже чуть выше человеческой, 97,2% против 96,6% Cogent Social Sciences. Это ключевая деталь: модель звучит гладко именно в тех местах, где смысл уже потерян — гладкость текста не сигнализирует о его точности, а маскирует её отсутствие.

Косвенное подтверждение с рынка: по данным опроса языковых сервисных компаний, 84% из них сообщили, что клиенты за прошедший год отдельно заказывали услугу человеческого пост-редактирования именно для исправления результата ИИ-перевода Slator, AI translation struggles — источник 8. Качество черновика растёт, а спрос на проверку остаётся: заказ смещается с «перевести» на «перепроверить».

Риск, который не про качество перевода вообще

Отдельная категория ошибки — не лингвистическая. По данным DLP-вендора Cyberhaven, 11% данных, которые сотрудники вставляют в ChatGPT, конфиденциальны, а на каждые 100 000 сотрудников еженедельно фиксируется около 319 случаев утечки внутренних данных Cyberhaven. Инженеры Samsung минимум трижды за месяц вставили в ChatGPT исходный код техпроцесса и протокол совещания — после чего компания запретила генеративный ИИ на рабочих устройствах Xakep. Кейс не про перевод напрямую, но логика та же: как только текст документа уходит в облачную модель, вы больше не контролируете, что с ним будет дальше, если тариф это не гарантирует явно.

Отсюда рабочее правило: немаскированный конфиденциальный документ — договор с реальными именами сторон, суммами, номерами счетов — отправляется в облачную модель только на корпоративном тарифе без обучения на пользовательских данных, а не через личный аккаунт. Здесь имеет значение, что именно происходит с идентификаторами до отправки во внешнюю модель: у provod.ai защищённый контур маскирует прямые персональные идентификаторы прежде, чем запрос уходит к внешней модели, а корпоративное пространство даёт команде единый биллинг в рублях и закрывающие документы вместо ситуации, когда каждый сотрудник вставляет фрагменты контракта в свой личный чат.

Что перепроверить в любом случае

Для документа с юридическими, финансовыми или репутационными последствиями — четыре зоны, которые нельзя пропускать после машинного перевода, независимо от того, какая модель его делала:

Категория Что искать Почему опасно пропустить
Числа и единицы Валюты, проценты, даты, единицы измерения Модель может «нормализовать» формат и незаметно сдвинуть значение
Юридическая модальность must / shall / may, «termination at will» и аналоги Разница между обязанностью и правом — это разница в исходе спора
Сноски и ссылки на нормы Номера статей закона, привязка сноски к абзацу Разрыв связи делает документ юридически нечитаемым
Структура таблиц Совпадение строк/столбцов оригинала и перевода Перестановка ячеек меняет смысл условия без единой ошибки в тексте

Бюро переводов Lingva-Pro в своём разборе типовых ошибок ИИ-перевода — смысловых, терминологических, грамматических — рекомендует для критичных документов двухэтапную проверку: переводчик плюс независимый редактор Lingva-Pro. Это разумно ровно там, где цена ошибки высокая, и избыточно там, где её нет — для внутренней переписки такой протокол не нужен.

Когда экономика решает за вас

Профессиональный перевод страницы у бюро стоит от 550–750 рублей за английский до 1000–1500 рублей за иврит, плюс 30–100% надбавка за срочность SmartPerevod — против подписки на модель в районе 20 долларов в месяц. Разрыв в цене подсказывает практичный порядок действий: модель делает черновик за секунды, человек проверяет по чек-листу выше только то, что реально влияет на исход — а не весь документ построчно. Для инструкции или статьи этого достаточно. Для договора — обязательно, и именно на этом этапе, а не на этапе выбора модели, обычно теряются деньги.


provod.ai — оптимизируйте RAG по качеству, скорости и цене

Поиск, переранжирование, анализ контекста и финальный ответ не обязаны выполнять одна и та же модель: подберите лучший инструмент для каждого этапа и сохраните общую интеграцию.

В одном каталоге — актуальные модели для текста и медиа: GPT от OpenAI, Claude от Anthropic, Gemini от Google, Grok от xAI, DeepSeek, Qwen, GLM, Kimi и MiniMax; для изображений — Nano Banana 2 Pro и GPT Image; для видео — последние версии Seedance, Kling, Veo и Google Omni. Также доступны модели для reasoning, поиска, документов, эмбеддингов, музыки и аудио.

Считайте экономику пайплайна без ценового шума: каждая модель тарифицируется 1:1 с официальным провайдером, без собственной наценки provod.ai.

Настройте модельный состав RAG: форма регистрации · цены на модели · защита данных по 152-ФЗ · главная provod.ai

Источники

Top comments (0)