GLM-5.3 против GLM-5.2: сложный тест с реальными API-вызовами
В первом сравнении GLM-5.3 чаще успевал выдать видимый ответ в пределах фиксированного бюджета. В этом раунде сложность была повышена: экстремальная математика, причинный анализ, ограничения, строгий вложенный JSON, многоэтапная физика и исполняемый оптимизационный код.
По первой попытке результат составил 4/6 для GLM-5.3 и 2/6 для GLM-5.2. Однако единственный оптимизатор, прошедший скрытые тесты, был сгенерирован GLM-5.2.
Условия теста
| Параметр | Значение |
|---|---|
| Base URL | https://cn.crazyrouter.com |
| Endpoint | POST /v1/chat/completions |
| Модели |
glm-5.3, glm-5.2
|
| Temperature | 0.2 |
| Инструменты и веб | отключены |
| Оценка | только первая попытка; повторы нужны для диагностики |
Перед тестом GET https://cn.crazyrouter.com/v1/models подтвердил наличие обоих точных ID. Во всех 12 первичных ответах returned model совпал с запрошенной моделью.
Результаты первой попытки
| Задача | Бюджет | GLM-5.3 | GLM-5.2 |
|---|---|---|---|
| Coupon collector с разными вероятностями | 9 000 | length, пустой ответ | length, пустой ответ |
| Парадокс Simpson и причинность | 6 000 | пройдено | length, пустой ответ |
| Минимальное ядро UNSAT | 5 000 | строгий JSON, пройдено | length, пустой ответ |
| Вложенный региональный JSON | 4 000 | пройдено | пройдено |
| Блок, шкив, ослабшая нить и пружина | 14 000 | пройдено | length, пустой ответ |
| Оптимизатор с зависимостями | 16 000 | length, пустой ответ | скрытые тесты пройдены |
Экстремальная математика остановила обе модели
Вероятности четырех купонов равны 1/2, 1/4, 1/8, 1/8. Требовалось вывести два точных результата методом включений-исключений:
E[T] = 1339/105 ≈ 12.752380952
P(T<=8) = 46179/131072 ≈ 0.352317810
Обе модели израсходовали 9 000 reasoning tokens и не вернули видимый текст. Повтор GLM-5.3 с 20k снова дал пустое тело; запрос GLM-5.2 с 20k превысил таймаут чтения 420 секунд.
Следовательно, увеличение max_tokens само по себе не гарантирует результат. Нужно одновременно проверять finish reason, длину видимого ответа и таймаут.
Где GLM-5.3 оказался сильнее
В задаче Simpson модель правильно восстановила направление внутри слоев и после стандартизации:
Малые камни: A 81/87 > B 234/270
Крупные камни: A 192/263 > B 55/80
Общий итог: A 273/350 < B 289/350
Стандартизация 50/50: A=0.8305, B=0.7771
GLM-5.3 также отметил, что стандартизация не доказывает причинность без рандомизации или достаточного контроля смешения, positivity и оценки неопределенности.
В задаче минимального ядра модель вернула чистый JSON с [1,2,3] и верно доказала конфликт позиций C и D. В многоэтапной физике были получены все контрольные значения: a≈0.847, v1≈1.59, v2≈1.18, x≈0.0835.
Где победил GLM-5.2
Требовалось реализовать optimize_release_plan с транзитивными зависимостями, дневными ограничениями, максимизацией value, минимизацией risk, лексикографическим tie-break, ошибочными ссылками и циклами.
Файл GLM-5.2 прошел внешний набор скрытых тестов без ручных исправлений. GLM-5.3 не выдал текст при 16k. При 24k он сгенерировал код, но выбрал план стоимостью 24 вместо оптимума 29.
Это показывает, почему сгенерированный код необходимо запускать. Красивое объяснение и большой файл не заменяют тесты.
Пример запроса
import os, requests
r = requests.post(
"https://cn.crazyrouter.com/v1/chat/completions",
headers={"Authorization": f"Bearer {os.environ['CRAZYROUTER_API_KEY']}"},
json={"model": "glm-5.3", "messages": [{"role": "user", "content": "Ваша приемочная задача"}], "temperature": 0.2, "max_tokens": 6000},
timeout=600,
)
choice = r.json()["choices"][0]
assert choice["finish_reason"] == "stop"
assert choice["message"]["content"].strip()
Практические рекомендации
- Для причинного анализа, ограничений и многоэтапных выводов в этом тесте надежнее GLM-5.3.
- Для генерации алгоритмов стоит сохранять GLM-5.2 в пуле и запускать одинаковые тесты.
-
HTTP 200с пустым content должен считаться бизнес-ошибкой. - JSON необходимо разбирать и проверять по schema.
- Успех первой попытки и успех после повторов должны быть разными метриками.
Итог
GLM-5.3 выиграл по охвату первой попытки — 4/6 против 2/6. GLM-5.2 дал лучший исполняемый алгоритм. Обоснованная производственная стратегия — маршрутизация по типу задачи с обязательной проверкой, а не автоматическая замена старой версии.
Запустить обе модели через OpenAI-compatible API Crazyrouter

Top comments (0)