Короткий ответ
В усложнённом раунде Claude Opus 5 получил 17/18 (94,4%), а GPT-5.6 Luna — 16/18 (88,9%). Это преимущество в одну задачу в данной выборке, а не доказательство универсального превосходства. Важнее тип ошибок: Opus сдал все три исполняемых алгоритма, но нарушил контракт строгого JSON; Luna идеально выполнила три форматных инструкции, однако два Python-файла падали уже при импорте.
Почему задачи пришлось усложнить
Первый раунд из восьми задач не разделил модели: обе набрали 8/8. Поэтому второй раунд включил 18 задач уровней hard, harder и extreme в шести категориях. Требовались точные дроби, многоэтапные физические модели, целые исполняемые файлы, распознавание ложных предпосылок, единственные решения систем ограничений и буквальное соблюдение формата. Красивое объяснение само по себе баллов не давало: решающие утверждения проверялись вычислением, парсером JSON или запуском Python.
Как оценивались 18 задач
Обе модели получали одинаковые задания, системную инструкцию, temperature и бюджет вывода для каждой задачи. Математика и физика сверялись с точными значениями и допусками. Код сохранялся без правок и импортировался одним скрытым набором тестов. JSON и CSV проверялись как машинные артефакты. Если файл начинает работать только после удаления написанных моделью assert, это объясняет причину сбоя, но не превращает исходную поставку в успешную. Задержка маршрута сохранена только в исходном JSON и не влияет на победителя.
Результаты по шести направлениям
| Направление | Opus 5 | GPT-5.6 Luna |
|---|---|---|
| Математические рассуждения | 3/3 | 3/3 |
| Сложная физика | 3/3 | 3/3 |
| Готовые алгоритмы | 3/3 | 1/3 |
| Отказ от ложных предпосылок | 3/3 | 3/3 |
| Логика ограничений | 3/3 | 3/3 |
| Соблюдение инструкций | 2/3 | 3/3 |
| Total | 17/18 (94.4%) | 16/18 (88.9%) |
Разрыв в алгоритмах оказался разрывом в поставке
В двух неудачных ответах Luna основные функции проходили скрытые тесты после удаления нижнего блока самопроверки. Но собственные assert содержали неверные ожидаемые значения, поэтому исходные файлы выбрасывали AssertionError при импорте. По контракту «готовый Python-файл» это ошибки. Все три файла Opus импортировались и прошли общий harness. Для продакшена вывод прост: правдоподобное тело функции ещё не является готовым артефактом.
Строгий JSON показал преимущество Luna
Единственная ошибка Opus была зеркальной. Поля и значения JSON оказались правильными, но объект был окружён Markdown-блоком, хотя требовался ровно один JSON-объект без дополнительного текста. Независимый повтор дал тот же результат. Luna прошла все три задачи на соблюдение инструкции. Если ответ сразу поступает в парсер, оболочка — часть корректности, а не вопрос оформления.
Лимит вывода отделён от ошибок интеллекта
Ранние ответы иногда завершались с finish_reason=length: скрытое рассуждение съедало доступный бюджет. Эти попытки сохранены, но не засчитаны как интеллектуальные ошибки. Перед итоговой оценкой эффективный бюджет одинаково увеличили обеим моделям. Так конфигурация не смешивается с качеством рассуждения, но интеграционный риск остаётся видимым.
Как маршрутизировать запросы в продакшене
Для строгого JSON, CSV, короткого извлечения и массовой структурированной обработки разумно начинать с Luna, обязательно сохраняя schema-валидацию. Для длинных алгоритмов и защитного инженерного кода — с Opus. В математике, сложной физике, сопротивлении ложным предпосылкам и логике ограничений получилась ничья; здесь полезнее учитывать цену, интерфейс и стиль ответа. Любой результат нужно проверять как артефакт: парсить JSON, сверять числа и запускать код без ручной очистки.
Воспроизведение и исходные данные
Сценарий запуска: scripts/opus5_vs_luna_hard_benchmark.py. Полный результат: .tmp/opus5-vs-luna-hard-benchmark-results.json. Независимые повторы: .tmp/opus5-hard-failure-retry.json и .tmp/luna-hard-failure-retry.json. Использовался чистый API-адрес https://cn.crazyrouter.com/v1/chat/completions; параметры задержки находятся только в исходных доказательствах.
Частые вопросы
Означает ли 17/18, что Opus 5 — абсолютный победитель?
Нет. Это лидерство в одну задачу на конкретном наборе. Здесь не тестировались изображения, инструменты, сверхдлинный контекст и многошаговые агенты.
Почему ошибочные самотесты считаются провалом алгоритма?
Потому что требовался полный Python-файл. Если исходный файл падает при импорте, система не может использовать его без ручного ремонта.
Почему задержки нет в итоговом решении?
Она зависит от модели, шлюза, маршрута, нагрузки и состояния канала. Это важная операционная метрика, но не показатель правильности интеллекта.
Итог
В тесте с приоритетом проверяемой точности Opus 5 выиграл 17/18 против 16/18 благодаря трём готовым алгоритмам. Luna лучше соблюдала строгий формат. Практический итог — не «вечный чемпион», а воспроизводимое правило маршрутизации.
Проверьте обе модели в Crazyrouter на собственных рабочих запросах



Top comments (1)
Результаты сравнения Claude Opus 5 и GPT-5.6 Luna в 18 проверяемых задачах без рейтинга скорости показывают, что Opus 5 имеет преимущество в одну задачу, набрав 17/18 (94,4%) против 16/18 (88,9%) у Luna. Однако, как отмечается в статье, это преимущество не является доказательством универсального превосходства, а важнее тип ошибок, совершенных каждой моделью. Интересно, что Opus 5 сдал все три исполняемых алгоритма, но нарушил контракт строгого JSON, в то время как Luna идеально выполнила три форматных инструкции, но два Python-файла падали при импорте. Можно ли предположить, что в продакшене будет более эффективным использовать Luna для задач, требующих строгого соблюдения формата, а Opus 5 для задач, требующих исполняемых алгоритмов?