DEV Community

Cover image for GLM-5.3 vs GLM-5.2: benchmark khó bằng các lệnh gọi API thực tế
Jenny Met
Jenny Met

Posted on • Originally published at crazyrouter.com

GLM-5.3 vs GLM-5.2: benchmark khó bằng các lệnh gọi API thực tế

GLM-5.3 vs GLM-5.2: benchmark khó bằng các lệnh gọi API thực tế

Trong vòng kiểm thử cơ bản, GLM-5.3 thường trả được nội dung nhìn thấy trong giới hạn đầu ra tốt hơn. Lần này độ khó được tăng lên với sáu bài có thể kiểm chứng khách quan: toán cực khó, phân tích nhân quả, suy luận ràng buộc, JSON lồng nhau, vật lý nhiều giai đoạn và mã tối ưu có thể thực thi.

Kết quả lần trả lời đầu là GLM-5.3 đạt 4/6, GLM-5.2 đạt 2/6. Tuy nhiên, GLM-5.2 lại tạo ra chương trình tối ưu duy nhất vượt qua toàn bộ kiểm thử ẩn.

Ma trận kết quả lần trả lời đầu

Môi trường kiểm thử

Trường Giá trị
Base URL https://cn.crazyrouter.com
Endpoint POST /v1/chat/completions
Model glm-5.3, glm-5.2
Temperature 0.2
Công cụ và web tắt
Chấm điểm chỉ lần trả lời đầu; chạy lại chỉ để chẩn đoán

Trước khi chạy, GET https://cn.crazyrouter.com/v1/models xác nhận cả hai ID chính xác đều tồn tại. Cả 12 phản hồi đầu tiên đều trả đúng model đã yêu cầu.

Kết quả

Bài Ngân sách GLM-5.3 GLM-5.2
Coupon collector xác suất không đều 9.000 length, nội dung rỗng length, nội dung rỗng
Nghịch lý Simpson và nhân quả 6.000 đạt length, nội dung rỗng
Lõi UNSAT tối thiểu 5.000 đạt, JSON nghiêm ngặt length, nội dung rỗng
JSON sự cố theo khu vực 4.000 đạt đạt
Ròng rọc, dây chùng, ma sát, lò xo 14.000 đạt length, nội dung rỗng
Tối ưu kế hoạch có phụ thuộc 16.000 length, nội dung rỗng qua kiểm thử ẩn

Bài toán cực khó làm cả hai model thất bại

Bốn loại coupon có xác suất 1/2, 1/4, 1/8, 1/8. Bài yêu cầu hai kết quả chính xác bằng nguyên lý bao hàm-loại trừ:

E[T] = 1339/105 ≈ 12.752380952
P(T<=8) = 46179/131072 ≈ 0.352317810
Enter fullscreen mode Exit fullscreen mode

Cả hai model dùng hết 9.000 reasoning tokens nhưng không trả nội dung nhìn thấy. GLM-5.3 vẫn rỗng khi tăng lên 20k; yêu cầu 20k của GLM-5.2 vượt quá thời gian đọc 420 giây.

Điều này cho thấy chỉ tăng max_tokens không phải là cách sửa tổng quát. Hệ thống cần kiểm tra đồng thời finish reason, độ dài nội dung và timeout.

Điểm mạnh của GLM-5.3

Ở bài Simpson, model xác định đúng sự đảo chiều:

Sỏi nhỏ: A 81/87 > B 234/270
Sỏi lớn: A 192/263 > B 55/80
Tổng thô: A 273/350 < B 289/350
Chuẩn hóa 50/50: A=0.8305, B=0.7771
Enter fullscreen mode Exit fullscreen mode

GLM-5.3 cũng phân biệt chuẩn hóa với kết luận nhân quả, nhắc đến ngẫu nhiên hóa, nhiễu chưa đo, positivity và khoảng tin cậy.

Trong bài lõi UNSAT, model trả đúng một JSON với [1,2,3] và chứng minh C, D bị ép vào cùng vị trí. Ở bài vật lý nhiều giai đoạn, model đạt đủ các giá trị a≈0.847, v1≈1.59, v2≈1.18, x≈0.0835.

Điểm GLM-5.2 thắng

Bài mã yêu cầu optimize_release_plan xử lý phụ thuộc bắc cầu, giới hạn theo ngày, tối đa value, tối thiểu risk, phân xử từ điển, tham chiếu sai và chu trình.

Tệp Python gốc của GLM-5.2 vượt qua bộ kiểm thử ẩn mà không chỉnh sửa. GLM-5.3 không có nội dung ở 16k. Khi chạy lại với 24k, nó sinh được mã nhưng chọn phương án value 24 thay vì tối ưu đúng là 29.

Vì vậy mã do model sinh ra phải được chạy thật. Độ dài mã và cách giải thích không thay thế được kiểm thử.

Ví dụ gọi API

import os, requests

r = requests.post(
    "https://cn.crazyrouter.com/v1/chat/completions",
    headers={"Authorization": f"Bearer {os.environ['CRAZYROUTER_API_KEY']}"},
    json={"model": "glm-5.3", "messages": [{"role": "user", "content": "Bài nghiệm thu thực tế"}], "temperature": 0.2, "max_tokens": 6000},
    timeout=600,
)
choice = r.json()["choices"][0]
assert choice["finish_reason"] == "stop"
assert choice["message"]["content"].strip()
Enter fullscreen mode Exit fullscreen mode

Khuyến nghị vận hành

  1. Trong lần này, GLM-5.3 phù hợp hơn cho nhân quả, ràng buộc và suy luận vật lý nhiều bước.
  2. Giữ GLM-5.2 trong nhóm ứng viên cho mã thực thi và chạy cùng bộ kiểm thử.
  3. Xem HTTP 200 + content rỗng là lỗi nghiệp vụ.
  4. Parse JSON và kiểm tra schema bắt buộc.
  5. Tách tỷ lệ thành công lần đầu khỏi tỷ lệ thành công sau retry.

Kết luận

GLM-5.3 dẫn về độ phủ lần đầu với 4/6 so với 2/6. GLM-5.2 tạo ra thuật toán thực thi tốt nhất. Kết luận phù hợp cho production là định tuyến theo loại nhiệm vụ cùng kiểm định nghiêm ngặt, không phải tự động thay thế model cũ.

Chạy hai model qua API tương thích OpenAI của Crazyrouter

Top comments (0)