DEV Community

Cover image for GLM-5.3 против GLM-5.2: сложный тест с реальными API-вызовами
Jemmmm
Jemmmm

Posted on • Originally published at crazyrouter.com

GLM-5.3 против GLM-5.2: сложный тест с реальными API-вызовами

GLM-5.3 против GLM-5.2: сложный тест с реальными API-вызовами

В первом сравнении GLM-5.3 чаще успевал выдать видимый ответ в пределах фиксированного бюджета. В этом раунде сложность была повышена: экстремальная математика, причинный анализ, ограничения, строгий вложенный JSON, многоэтапная физика и исполняемый оптимизационный код.

По первой попытке результат составил 4/6 для GLM-5.3 и 2/6 для GLM-5.2. Однако единственный оптимизатор, прошедший скрытые тесты, был сгенерирован GLM-5.2.

Матрица первой попытки GLM-5.3 и GLM-5.2

Условия теста

Параметр Значение
Base URL https://cn.crazyrouter.com
Endpoint POST /v1/chat/completions
Модели glm-5.3, glm-5.2
Temperature 0.2
Инструменты и веб отключены
Оценка только первая попытка; повторы нужны для диагностики

Перед тестом GET https://cn.crazyrouter.com/v1/models подтвердил наличие обоих точных ID. Во всех 12 первичных ответах returned model совпал с запрошенной моделью.

Результаты первой попытки

Задача Бюджет GLM-5.3 GLM-5.2
Coupon collector с разными вероятностями 9 000 length, пустой ответ length, пустой ответ
Парадокс Simpson и причинность 6 000 пройдено length, пустой ответ
Минимальное ядро UNSAT 5 000 строгий JSON, пройдено length, пустой ответ
Вложенный региональный JSON 4 000 пройдено пройдено
Блок, шкив, ослабшая нить и пружина 14 000 пройдено length, пустой ответ
Оптимизатор с зависимостями 16 000 length, пустой ответ скрытые тесты пройдены

Экстремальная математика остановила обе модели

Вероятности четырех купонов равны 1/2, 1/4, 1/8, 1/8. Требовалось вывести два точных результата методом включений-исключений:

E[T] = 1339/105 ≈ 12.752380952
P(T<=8) = 46179/131072 ≈ 0.352317810
Enter fullscreen mode Exit fullscreen mode

Обе модели израсходовали 9 000 reasoning tokens и не вернули видимый текст. Повтор GLM-5.3 с 20k снова дал пустое тело; запрос GLM-5.2 с 20k превысил таймаут чтения 420 секунд.

Следовательно, увеличение max_tokens само по себе не гарантирует результат. Нужно одновременно проверять finish reason, длину видимого ответа и таймаут.

Где GLM-5.3 оказался сильнее

В задаче Simpson модель правильно восстановила направление внутри слоев и после стандартизации:

Малые камни: A 81/87 > B 234/270
Крупные камни: A 192/263 > B 55/80
Общий итог: A 273/350 < B 289/350
Стандартизация 50/50: A=0.8305, B=0.7771
Enter fullscreen mode Exit fullscreen mode

GLM-5.3 также отметил, что стандартизация не доказывает причинность без рандомизации или достаточного контроля смешения, positivity и оценки неопределенности.

В задаче минимального ядра модель вернула чистый JSON с [1,2,3] и верно доказала конфликт позиций C и D. В многоэтапной физике были получены все контрольные значения: a≈0.847, v1≈1.59, v2≈1.18, x≈0.0835.

Где победил GLM-5.2

Требовалось реализовать optimize_release_plan с транзитивными зависимостями, дневными ограничениями, максимизацией value, минимизацией risk, лексикографическим tie-break, ошибочными ссылками и циклами.

Файл GLM-5.2 прошел внешний набор скрытых тестов без ручных исправлений. GLM-5.3 не выдал текст при 16k. При 24k он сгенерировал код, но выбрал план стоимостью 24 вместо оптимума 29.

Это показывает, почему сгенерированный код необходимо запускать. Красивое объяснение и большой файл не заменяют тесты.

Пример запроса

import os, requests

r = requests.post(
    "https://cn.crazyrouter.com/v1/chat/completions",
    headers={"Authorization": f"Bearer {os.environ['CRAZYROUTER_API_KEY']}"},
    json={"model": "glm-5.3", "messages": [{"role": "user", "content": "Ваша приемочная задача"}], "temperature": 0.2, "max_tokens": 6000},
    timeout=600,
)
choice = r.json()["choices"][0]
assert choice["finish_reason"] == "stop"
assert choice["message"]["content"].strip()
Enter fullscreen mode Exit fullscreen mode

Практические рекомендации

  1. Для причинного анализа, ограничений и многоэтапных выводов в этом тесте надежнее GLM-5.3.
  2. Для генерации алгоритмов стоит сохранять GLM-5.2 в пуле и запускать одинаковые тесты.
  3. HTTP 200 с пустым content должен считаться бизнес-ошибкой.
  4. JSON необходимо разбирать и проверять по schema.
  5. Успех первой попытки и успех после повторов должны быть разными метриками.

Итог

GLM-5.3 выиграл по охвату первой попытки — 4/6 против 2/6. GLM-5.2 дал лучший исполняемый алгоритм. Обоснованная производственная стратегия — маршрутизация по типу задачи с обязательной проверкой, а не автоматическая замена старой версии.

Запустить обе модели через OpenAI-compatible API Crazyrouter

Top comments (0)