<?xml version="1.0" encoding="UTF-8"?>
<rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
  <channel>
    <title>DEV Community: Jenny Met</title>
    <description>The latest articles on DEV Community by Jenny Met (@xujfcn).</description>
    <link>https://dev.to/xujfcn</link>
    <image>
      <url>https://media2.dev.to/dynamic/image/width=90,height=90,fit=cover,gravity=auto,format=auto/https:%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Fuser%2Fprofile_image%2F3789823%2F2c9e4c1c-52be-4e47-b75c-c97051adb99c.png</url>
      <title>DEV Community: Jenny Met</title>
      <link>https://dev.to/xujfcn</link>
    </image>
    <atom:link rel="self" type="application/rss+xml" href="https://dev.to/feed/xujfcn"/>
    <language>en</language>
    <item>
      <title>Kimi K3 so với GPT-5.6-SOL: thử sức thực chiến mức khó cao về toán, vật lý và lập trình</title>
      <dc:creator>Jenny Met</dc:creator>
      <pubDate>Sat, 18 Jul 2026 01:17:19 +0000</pubDate>
      <link>https://dev.to/xujfcn/kimi-k3-so-voi-gpt-56-sol-thu-suc-thuc-chien-muc-kho-cao-ve-toan-vat-ly-va-lap-trinh-4ph5</link>
      <guid>https://dev.to/xujfcn/kimi-k3-so-voi-gpt-56-sol-thu-suc-thuc-chien-muc-kho-cao-ve-toan-vat-ly-va-lap-trinh-4ph5</guid>
      <description>&lt;h1&gt;
  
  
  Kimi K3 so với GPT-5.6-SOL: thử sức thực chiến mức khó cao về toán, vật lý và lập trình
&lt;/h1&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2F5x6vgkqdlq09ogmnzl4s.webp" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2F5x6vgkqdlq09ogmnzl4s.webp" alt="vi benchmark overview" width="800" height="457"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Lần này mình không test mấy câu hỏi đáp đơn giản, mà chốt hẳn ba bài cần suy luận nhiều bước: một bài xác suất có mẫu chồng lấp và moment bậc hai, một bài vật lý có mô-men quán tính của ròng rọc và chuyển trạng thái do dây chùng sau khi chạm đất, và một bài Python phụ thuộc vào closure, dung lượng nhiều ngày và tie-break ba tầng. Hai model dùng cùng một interface, cùng prompt và mức output cap gần tương đương, không bật tool và không dùng internet.&lt;/p&gt;

&lt;p&gt;Kết luận ngắn gọn trước:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;gpt-5.6-sol&lt;/code&gt; trả lời trọn vẹn ở cả ba bài, và kết quả tham chiếu cho toán lẫn vật lý đều đúng.&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;kimi-k3&lt;/code&gt; ở mức trần &lt;code&gt;6500&lt;/code&gt; token vòng đầu thì cả toán và vật lý đều kết thúc với &lt;code&gt;finish_reason=length&lt;/code&gt;, phần nhìn thấy trống rỗng; riêng bài toán, tăng trần lên &lt;code&gt;10000&lt;/code&gt; vẫn bị cắt cụt. Bài lập trình thì sau khoảng 245 giây bị đọc timeout.&lt;/li&gt;
&lt;li&gt;Phần triển khai lập trình của GPT-5.6-SOL vượt qua các kiểm tra bổ sung độc lập về closure phụ thuộc, dung lượng, tie-break, dependency không hợp lệ và vòng lặp phụ thuộc, nhưng chính nó lại kèm một assert mẫu đầu tiên có expected value sai. Điều này cho thấy “thân code đúng” và “mọi test ví dụ đều đúng” là hai việc phải kiểm riêng.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Độ trễ trong bài viết này là giá trị quan sát được của lần request này, không đại diện cho SLA cố định. Ở lượt đồng thời đầu tiên, request toán và vật lý của GPT từng nhận HTTP 408, sau đó mình chuyển sang retry tuần tự; vì vậy tốc độ chỉ dùng để quan sát trải nghiệm gọi API, không dùng để tuyên bố xếp hạng tuyệt đối.&lt;/p&gt;

&lt;h2&gt;
  
  
  Thiết lập test
&lt;/h2&gt;

&lt;p&gt;Thời điểm test là từ giờ Bắc Kinh &lt;code&gt;2026-07-17&lt;/code&gt; đến &lt;code&gt;2026-07-18&lt;/code&gt;, interface là:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;POST https://cn.crazyrouter.com/v1/chat/completions
model: kimi-k3 / gpt-5.6-sol
temperature: 0.2
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Lượt đầu tiên dùng thống nhất: toán và vật lý &lt;code&gt;max_tokens=6500&lt;/code&gt;, lập trình &lt;code&gt;max_tokens=7500&lt;/code&gt;. Mỗi bài đều yêu cầu model đưa ra suy diễn có thể kiểm tra lại hoặc code có thể chạy, đồng thời ghi lại &lt;code&gt;finish_reason&lt;/code&gt;, completion/reasoning token, độ trễ request, độ đúng số học và việc code có chạy độc lập được trong Python 3.11 hay không.&lt;/p&gt;

&lt;h2&gt;
  
  
  Bảng tổng kết kết quả
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th&gt;kimi-k3&lt;/th&gt;
&lt;th&gt;gpt-5.6-sol&lt;/th&gt;
&lt;th&gt;Kết luận&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Toán: kỳ vọng và phương sai của HHTH&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;length&lt;/code&gt;, 186.98 s, 6500 tokens; nội dung nhìn thấy trống&lt;/td&gt;
&lt;td&gt;Retry tuần tự &lt;code&gt;stop&lt;/code&gt;, 236.07 s, 6872 tokens&lt;/td&gt;
&lt;td&gt;GPT trả lời đầy đủ; Kimi vòng đầu chưa ra được đáp án&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Vật lý: ròng rọc, chạm đất, lò xo&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;length&lt;/code&gt;, 202.05 s, 6500 tokens; nội dung nhìn thấy trống&lt;/td&gt;
&lt;td&gt;Retry tuần tự &lt;code&gt;stop&lt;/code&gt;, 156.29 s, 4501 tokens&lt;/td&gt;
&lt;td&gt;GPT đầy đủ và đúng số&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Lập trình: dependency closure knapsack&lt;/td&gt;
&lt;td&gt;Sau 245.54 s &lt;code&gt;TimeoutError&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;stop&lt;/code&gt;, 87.96 s, 4514 tokens&lt;/td&gt;
&lt;td&gt;GPT code chạy được; Kimi chưa trả về code hoàn chỉnh&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Kimi test lại môn toán&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;length&lt;/code&gt;, 286.99 s, 10000 tokens&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;Tăng budget vẫn chưa xong&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Trong các request toán và vật lý của Kimi, reasoning token do API báo cáo lần lượt gần &lt;code&gt;6497&lt;/code&gt;; ở bài toán test lại, reasoning token gần &lt;code&gt;9997&lt;/code&gt;. Điều này không có nghĩa là Kimi không có năng lực suy luận, mà chỉ cho thấy với prompt của bài này và routing hiện tại, budget suy luận rất dễ bị hút cạn, khiến bên gọi không nhận được đáp án cuối.&lt;/p&gt;

&lt;h2&gt;
  
  
  Bài toán: chồng lấp mẫu không chỉ ảnh hưởng kỳ vọng, mà còn ảnh hưởng cả phương sai
&lt;/h2&gt;

&lt;p&gt;Đề bài là: xác suất mặt ngửa &lt;code&gt;p=3/5&lt;/code&gt;, xác suất mặt sấp &lt;code&gt;q=2/5&lt;/code&gt;, tung liên tục cho đến khi lần đầu xuất hiện &lt;code&gt;HHTH&lt;/code&gt;, cho phép chồng lấp mẫu, hãy tìm &lt;code&gt;E[T]&lt;/code&gt; và &lt;code&gt;Var(T)&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;Automaton tiền tố đúng có các trạng thái &lt;code&gt;S0=tiền tố rỗng&lt;/code&gt;, &lt;code&gt;S1=H&lt;/code&gt;, &lt;code&gt;S2=HH&lt;/code&gt;, &lt;code&gt;S3=HHT&lt;/code&gt;, &lt;code&gt;S4=HHTH (trạng thái hấp thụ)&lt;/code&gt;. Chuyển trạng thái quan trọng là &lt;code&gt;S2 --H--&amp;gt; S2&lt;/code&gt;: khi đã có &lt;code&gt;HH&lt;/code&gt; mà lại ra &lt;code&gt;H&lt;/code&gt;, hậu tố dài nhất vẫn là &lt;code&gt;HH&lt;/code&gt;, không được sai mà quay về trạng thái rỗng.&lt;/p&gt;

&lt;p&gt;GPT-5.6-SOL lập hệ phương trình moment bậc nhất là:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;M0 = 1 + p M1 + q M0
M1 = 1 + p M2 + q M0
M2 = 1 + p M2 + q M3
M3 = 1 + q M0
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Tiếp tục lập hệ phương trình moment bậc hai, ta được:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;E[T]   = 715/54       ≈ 13.2407407407
E[T²]  = 195335/729   ≈ 267.9492455418
Var(T) = 270115/2916  ≈ 92.6320301783
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Kỳ vọng còn có thể kiểm chứng độc lập bằng công thức biên. &lt;code&gt;HHTH&lt;/code&gt; có biên thực sự không rỗng duy nhất là một ký tự &lt;code&gt;H&lt;/code&gt;, nên &lt;code&gt;E[T] = 1/p + 1/(p³q) = 715/54&lt;/code&gt;. Câu trả lời đầy đủ của GPT bao gồm cả chuyển trạng thái, khai triển moment bậc hai và sanity check. Kimi ở cả mức &lt;code&gt;6500&lt;/code&gt; lẫn &lt;code&gt;10000&lt;/code&gt; đều không xuất ra phần suy diễn nhìn thấy được, nên lần này không thể chấm độ đúng toán của nó, chỉ có thể ghi nhận là “chưa hoàn thành trong budget”.&lt;/p&gt;

&lt;h2&gt;
  
  
  Bài vật lý: sau khi chạm đất, ràng buộc bị ngắt, không thể bê nguyên phương trình năng lượng cũ
&lt;/h2&gt;

&lt;p&gt;Đề bài đặt như sau: &lt;code&gt;m_A=4.0 kg&lt;/code&gt; nằm trên mặt phẳng nghiêng nhám &lt;code&gt;25°&lt;/code&gt;, &lt;code&gt;μ_k=0.18&lt;/code&gt;; &lt;code&gt;m_B=3.0 kg&lt;/code&gt; treo; ròng rọc có &lt;code&gt;M_p=1.2 kg&lt;/code&gt;, &lt;code&gt;R=0.10 m&lt;/code&gt;; B đi xuống &lt;code&gt;1.50 m&lt;/code&gt; rồi chạm đất; dây ngay lập tức chùng; A trượt lên thêm &lt;code&gt;0.10 m&lt;/code&gt; thì chạm lò xo &lt;code&gt;k=250 N/m&lt;/code&gt;; &lt;code&gt;g=9.8 m/s²&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;Trước khi chạm đất, dây căng và không trượt, khối lượng quán tính tương đương của ròng rọc là &lt;code&gt;I/R²=(1/2)M_p=0.60 kg&lt;/code&gt;. Ghép phương trình động lực học của hai vật và phương trình quay của ròng rọc, ta được:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;a  ≈ 0.847 m/s²
v1 ≈ 1.59 m/s
v2 ≈ 1.18 m/s
x  ≈ 0.0835 m = 8.35 cm
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Sau khi chạm đất, vận tốc của B bị thay đổi do va chạm với mặt đất, A vẫn còn vận tốc hướng lên dọc mặt phẳng nghiêng, và ròng rọc cũng có thể tiếp tục quay; hơn nữa đề đã nói rõ dây ngay lập tức chùng, nên không thể tiếp tục dùng &lt;code&gt;v_A=v_B=Rω&lt;/code&gt;. Giai đoạn sau chỉ nên phân tích riêng A:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;v2² = v1² - 2g(sinθ + μ_k cosθ)d
1/2 m_A v2² = 1/2 kx² + m_A g(sinθ + μ_k cosθ)x
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;GPT-5.6-SOL còn kiểm tra cả đơn vị, khoảng dừng khi không có lò xo, và sự khớp giữa năng lượng đàn hồi với tổn hao do ma sát/trọng lực, số liệu tự nhất quán. Kimi ở lượt đầu không tạo ra đáp án nhìn thấy được nên không thể so sánh chất lượng mô hình hóa trung gian.&lt;/p&gt;

&lt;h2&gt;
  
  
  Bài lập trình: thân thuật toán qua kiểm độc lập, nhưng sample test của model có bug
&lt;/h2&gt;

&lt;p&gt;Bài lập trình yêu cầu cài &lt;code&gt;optimize_release_plan(items, capacity_by_day, dependencies)&lt;/code&gt;, xử lý dung lượng theo ngày, ngày không cấu hình thì dung lượng bằng 0, closure phụ thuộc trực tiếp và gián tiếp, dependency không hợp lệ và phát hiện chu trình, cùng tie-break ba tầng &lt;code&gt;value → risk → danh sách id đã sắp xếp&lt;/code&gt;. &lt;code&gt;items &amp;lt;= 18&lt;/code&gt;, nên brute-force bằng bitmask là baseline hợp lý.&lt;/p&gt;

&lt;p&gt;GPT-5.6-SOL dùng cache closure phụ thuộc và duyệt &lt;code&gt;2^n&lt;/code&gt; tập con. Mình tách code ra và kiểm tra độc lập trong Python 3.11: closure phụ thuộc, ví dụ dung lượng nhiều ngày, tie-break ba tầng &lt;code&gt;value/risk/id&lt;/code&gt;, dung lượng ngày chưa cấu hình, dependency không tồn tại và dependency vòng lặp, tổng cộng 6 nhóm kiểm tra đều qua.&lt;/p&gt;

&lt;p&gt;Nhưng ở cuối code, model lại kèm theo assert đầu tiên bị fail: nó viết &lt;code&gt;A -&amp;gt; B -&amp;gt; C&lt;/code&gt;, đồng thời lại đưa thêm &lt;code&gt;X&lt;/code&gt; có giá trị 11. Với dung lượng đã cho, tổng giá trị của &lt;code&gt;B + C + X&lt;/code&gt; là 13, cao hơn &lt;code&gt;A + B + C&lt;/code&gt; là 12, nên hàm trả về &lt;code&gt;['B', 'C', 'X']&lt;/code&gt; mới là đúng; assert viết &lt;code&gt;['A', 'B', 'C']&lt;/code&gt; là sai ở fixture test.&lt;/p&gt;

&lt;p&gt;Chi tiết này khá điển hình: làm bài code không thể chỉ nhìn thân hàm, cũng không thể vì “kèm 8 assert” mà mặc nhiên tin bộ test đó. Dữ liệu test do model sinh ra cũng cần được người viết hoặc reference implementation kiểm lại. Request lập trình của Kimi K3 thì sau khoảng 245 giây bị đọc timeout, không lấy được code hoàn chỉnh.&lt;/p&gt;

&lt;h2&gt;
  
  
  Đánh giá tổng hợp
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Khía cạnh&lt;/th&gt;
&lt;th&gt;kimi-k3&lt;/th&gt;
&lt;th&gt;gpt-5.6-sol&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Độ đầy đủ ở bài toán&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;6500/10000&lt;/code&gt; token đều bị cắt, không thể nghiệm thu&lt;/td&gt;
&lt;td&gt;Kỳ vọng, moment bậc hai, phương sai và sanity check đều đầy đủ&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Mô hình hóa vật lý&lt;/td&gt;
&lt;td&gt;Bị cắt ở vòng đầu&lt;/td&gt;
&lt;td&gt;Xử lý đúng quán tính ròng rọc, dây chùng và giai đoạn lò xo&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Bàn giao code&lt;/td&gt;
&lt;td&gt;Lượt này timeout&lt;/td&gt;
&lt;td&gt;Thân code qua kiểm độc lập, nhưng kèm một assert sai&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Độ ổn định đầu ra&lt;/td&gt;
&lt;td&gt;Tốn reasoning nhiều, dễ không có phần nhìn thấy&lt;/td&gt;
&lt;td&gt;Cả ba bài retry tuần tự đều &lt;code&gt;stop&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tốc độ phản hồi&lt;/td&gt;
&lt;td&gt;Khoảng 187–246 s, lại còn bị cắt/timeout&lt;/td&gt;
&lt;td&gt;Request thành công khoảng 88–236 s; lượt đầu đồng thời có 408&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Kết luận chính xác hơn không phải là “model nào chắc chắn thông minh hơn”, mà là:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Với routing và budget của lần test này, GPT-5.6-SOL dễ thu gọn suy luận phức tạp thành đáp án cuối hơn, hợp với workflow cần ngay lời giải hoặc code đọc được.&lt;/li&gt;
&lt;li&gt;Vấn đề lớn nhất của Kimi K3 là hiệu quả chuyển từ reasoning budget sang output nhìn thấy; dù tăng toán lên &lt;code&gt;10000&lt;/code&gt; token, nó vẫn chưa kết thúc.&lt;/li&gt;
&lt;li&gt;Code của GPT-5.6-SOL cũng không thể tin mù quáng. Logic hàm đã qua kiểm độc lập, nhưng bộ test đi kèm có lỗi tính giá trị.&lt;/li&gt;
&lt;li&gt;Khi chọn cho production, nên ghi đồng thời &lt;code&gt;finish_reason&lt;/code&gt;, reasoning token, độ trễ và kết quả test nội bộ; không thể chỉ nhìn câu cuối cùng kiểu “đáp án đúng”.&lt;/li&gt;
&lt;/ol&gt;

&lt;h2&gt;
  
  
  Cách tái hiện thí nghiệm
&lt;/h2&gt;

&lt;p&gt;Script test và kết quả retry theo thứ tự của lần này được lưu tại (tóm tắt của lượt đồng thời đầu tiên cũng đã được ghi vào output của script):&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;.tmp/kimi_k3_vs_gpt56sol_test.py
.tmp/kimi-k3-vs-gpt56sol-results.json
.tmp/retry-gpt56sol-math.json
.tmp/retry-gpt56sol-physics.json
.tmp/retry-gpt56sol-programming.json
.tmp/retry-kimi-k3-math.json
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Khi chạy lại, nên cố định model ID, prompt, temperature, &lt;code&gt;max_tokens&lt;/code&gt; và mức độ đồng thời, rồi lưu riêng từng output thành file độc lập. Tải upstream, cache hit và trạng thái rate limit đều có thể ảnh hưởng đến độ trễ; trong bài này, mình ghi nhận cả HTTP 408, &lt;code&gt;length&lt;/code&gt; và đọc timeout như một phần của kết quả test, chứ không giấu chúng đi.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fgolptcw6d4yigxv738fe.webp" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fgolptcw6d4yigxv738fe.webp" alt="vi comparison chart" width="800" height="457"&gt;&lt;/a&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>benchmark</category>
    </item>
    <item>
      <title>Kimi K3 im Vergleich zu GPT-5.6-SOL: Praxistest bei schweren Aufgaben aus Mathematik, Physik und Programmierung</title>
      <dc:creator>Jenny Met</dc:creator>
      <pubDate>Sat, 18 Jul 2026 01:15:52 +0000</pubDate>
      <link>https://dev.to/xujfcn/kimi-k3-im-vergleich-zu-gpt-56-sol-praxistest-bei-schweren-aufgaben-aus-mathematik-physik-und-i0p</link>
      <guid>https://dev.to/xujfcn/kimi-k3-im-vergleich-zu-gpt-56-sol-praxistest-bei-schweren-aufgaben-aus-mathematik-physik-und-i0p</guid>
      <description>&lt;h1&gt;
  
  
  Kimi K3 im Vergleich zu GPT-5.6-SOL: Praxistest bei schweren Aufgaben aus Mathematik, Physik und Programmierung
&lt;/h1&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fgvw53dv7ljnc1tusfvg1.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fgvw53dv7ljnc1tusfvg1.png" alt="de benchmark overview" width="800" height="450"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Diesmal geht es nicht um einfache Q&amp;amp;A, sondern um drei fest definierte Aufgaben, die mehrstufiges Schlussfolgern verlangen: eine Wahrscheinlichkeitsaufgabe mit Musterüberlappung und zweitem Moment, eine Physikaufgabe mit Trägheitsmoment der Rolle und Umschalten durch Seilentspannung sowie eine Python-Aufgabe mit Closure, mehrtägigen Kapazitäten und dreistufigem Tie-Break. Beide Modelle liefen über dieselbe Schnittstelle, mit demselben Prompt und vergleichbaren Ausgabelimits, ohne Tools und ohne Internetzugriff.&lt;/p&gt;

&lt;p&gt;Vorab das Ergebnis:&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;gpt-5.6-sol&lt;/code&gt; lieferte bei allen drei Aufgaben vollständige sichtbare Antworten; die Referenzwerte in Mathematik und Physik waren korrekt.&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;kimi-k3&lt;/code&gt; endete unter dem ersten &lt;code&gt;6500&lt;/code&gt;-Token-Limit bei Mathematik und Physik jeweils mit &lt;code&gt;finish_reason=length&lt;/code&gt;; die sichtbare Antwort blieb leer. Selbst nach Erhöhung des Limits auf &lt;code&gt;10000&lt;/code&gt; bei der Matheaufgabe wurde der Output wieder abgeschnitten. Die Programmieraufgabe lief nach rund 245 Sekunden in einen Read-Timeout.&lt;/li&gt;
&lt;li&gt;Die Programmierimplementierung von GPT-5.6-SOL bestand unabhängige Zusatzprüfungen zu Dependency-Closure, Kapazität, Tie-Break, ungültigen Abhängigkeiten und Zyklen. Allerdings war die erste mitgelieferte Assertions-Beispielprüfung mit einem falschen Erwartungswert versehen. Das zeigt: „Kernlogik korrekt“ und „alle Beispieltests korrekt“ sind getrennt zu bewerten.&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;Die hier gemessene Latenz ist der beobachtete Wert dieser Anfrage und kein fester SLA-Wert. In den ersten parallelen Requests erhielt GPT für Mathematik und Physik zunächst HTTP 408; danach wurde sequenziell erneut versucht. Daher dient die Geschwindigkeit hier nur der Beobachtung der Nutzungserfahrung, nicht als absoluter Rangvergleich.&lt;/p&gt;

&lt;h2&gt;
  
  
  Testaufbau
&lt;/h2&gt;

&lt;p&gt;Getestet wurde vom &lt;code&gt;2026-07-17&lt;/code&gt; bis &lt;code&gt;2026-07-18&lt;/code&gt; (Beijing-Zeit), über:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;POST https://cn.crazyrouter.com/v1/chat/completions
model: kimi-k3 / gpt-5.6-sol
temperature: 0.2
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;In der ersten Runde galten einheitlich: Mathematik und Physik &lt;code&gt;max_tokens=6500&lt;/code&gt;, Programmierung &lt;code&gt;max_tokens=7500&lt;/code&gt;. Jede Aufgabe verlangte entweder eine überprüfbare Herleitung oder ausführbaren Code. Zusätzlich wurden &lt;code&gt;finish_reason&lt;/code&gt;, completion/reasoning tokens, Request-Latenz, numerische Korrektheit sowie die eigenständige Ausführbarkeit in Python 3.11 protokolliert.&lt;/p&gt;

&lt;h2&gt;
  
  
  Gesamtergebnis-Tabelle
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Aufgabe&lt;/th&gt;
&lt;th&gt;kimi-k3&lt;/th&gt;
&lt;th&gt;gpt-5.6-sol&lt;/th&gt;
&lt;th&gt;Beurteilung&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Mathematik: Erwartungswert und Varianz von HHTH&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;length&lt;/code&gt;, 186.98 s, 6500 tokens; sichtbarer Inhalt leer&lt;/td&gt;
&lt;td&gt;sequenzieller Retry &lt;code&gt;stop&lt;/code&gt;, 236.07 s, 6872 tokens&lt;/td&gt;
&lt;td&gt;GPT vollständig; Kimi in Runde 1 ohne Antwort&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Physik: Rolle, Bodenkontakt, Feder&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;length&lt;/code&gt;, 202.05 s, 6500 tokens; sichtbarer Inhalt leer&lt;/td&gt;
&lt;td&gt;sequenzieller Retry &lt;code&gt;stop&lt;/code&gt;, 156.29 s, 4501 tokens&lt;/td&gt;
&lt;td&gt;GPT vollständig und numerisch korrekt&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Programmierung: Dependency-Closure-Rucksackproblem&lt;/td&gt;
&lt;td&gt;nach 245.54 s &lt;code&gt;TimeoutError&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;stop&lt;/code&gt;, 87.96 s, 4514 tokens&lt;/td&gt;
&lt;td&gt;GPT-Code lauffähig; Kimi gab keinen vollständigen Code zurück&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Kimi Mathe-Repeat&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;length&lt;/code&gt;, 286.99 s, 10000 tokens&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;Auch mit höherem Budget kein Abschluss&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Bei Kimi meldete die Schnittstelle für Mathematik und Physik jeweils einen reasoning token-Wert nahe &lt;code&gt;6497&lt;/code&gt;; beim Mathe-Repeat lag er nahe &lt;code&gt;9997&lt;/code&gt;. Das heißt nicht, dass Kimi keine Schlussfolgerungsfähigkeit hat, sondern dass unter diesem Prompt und über diesen Router das Reasoning-Budget sehr leicht aufgebraucht wird und der Auftraggeber am Ende keine finale Antwort erhält.&lt;/p&gt;

&lt;h2&gt;
  
  
  Mathematikaufgabe: Musterüberlappung beeinflusst nicht nur den Erwartungswert, sondern auch die Varianz
&lt;/h2&gt;

&lt;p&gt;Die Aufgabe lautet: Bei Kopf-Wahrscheinlichkeit &lt;code&gt;p=3/5&lt;/code&gt; und Zahl-Wahrscheinlichkeit &lt;code&gt;q=2/5&lt;/code&gt; wird so lange geworfen, bis erstmals &lt;code&gt;HHTH&lt;/code&gt; erscheint, wobei Überlappungen erlaubt sind. Gesucht sind &lt;code&gt;E[T]&lt;/code&gt; und &lt;code&gt;Var(T)&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;Die korrekten Präfix-Automat-Zustände sind &lt;code&gt;S0=leeres Präfix&lt;/code&gt;, &lt;code&gt;S1=H&lt;/code&gt;, &lt;code&gt;S2=HH&lt;/code&gt;, &lt;code&gt;S3=HHT&lt;/code&gt;, &lt;code&gt;S4=HHTH (absorbierender Zustand)&lt;/code&gt;. Der entscheidende Übergang ist &lt;code&gt;S2 --H--&amp;gt; S2&lt;/code&gt;: Nach &lt;code&gt;HH&lt;/code&gt; bleibt bei erneutem &lt;code&gt;H&lt;/code&gt; der längste Suffix weiterhin &lt;code&gt;HH&lt;/code&gt;; man darf also nicht fälschlich auf den Leerzustand zurückfallen.&lt;/p&gt;

&lt;p&gt;Die von GPT-5.6-SOL aufgestellten Gleichungen für das erste Moment waren:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;M0 = 1 + p M1 + q M0
M1 = 1 + p M2 + q M0
M2 = 1 + p M2 + q M3
M3 = 1 + q M0
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Nach Aufstellen der Gleichungen für das zweite Moment ergibt sich:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;E[T]   = 715/54       ≈ 13.2407407407
E[T²]  = 195335/729   ≈ 267.9492455418
Var(T) = 270115/2916  ≈ 92.6320301783
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Der Erwartungswert lässt sich außerdem unabhängig über die Randformel gegenprüfen. Die nichtleeren echten Ränder von &lt;code&gt;HHTH&lt;/code&gt; bestehen aus dem Einzelzeichen &lt;code&gt;H&lt;/code&gt;, daher gilt &lt;code&gt;E[T] = 1/p + 1/(p³q) = 715/54&lt;/code&gt;. Die vollständige GPT-Antwort deckte Zustandsübergänge, die Herleitung des zweiten Moments und den Sanity Check ab. Kimi lieferte weder bei &lt;code&gt;6500&lt;/code&gt; noch bei &lt;code&gt;10000&lt;/code&gt; Tokens eine sichtbare Herleitung, daher lässt sich die mathematische Korrektheit in dieser Runde nicht bewerten; es bleibt bei „innerhalb des Budgets nicht abgeschlossen“.&lt;/p&gt;

&lt;h2&gt;
  
  
  Physikaufgabe: Nach dem Bodenkontakt reißt die Zwangsbedingung, dieselbe Energiebilanz gilt dann nicht mehr
&lt;/h2&gt;

&lt;p&gt;Gegeben sind: &lt;code&gt;m_A=4.0 kg&lt;/code&gt; auf einer rauen Ebene mit &lt;code&gt;25°&lt;/code&gt;, &lt;code&gt;μ_k=0.18&lt;/code&gt;; &lt;code&gt;m_B=3.0 kg&lt;/code&gt; hängt frei; die Rolle hat &lt;code&gt;M_p=1.2 kg&lt;/code&gt;, &lt;code&gt;R=0.10 m&lt;/code&gt;; nach dem Absenken um &lt;code&gt;1.50 m&lt;/code&gt; trifft B auf den Boden und das Seil wird sofort locker; A gleitet danach noch &lt;code&gt;0.10 m&lt;/code&gt; nach oben und trifft auf eine Feder mit &lt;code&gt;k=250 N/m&lt;/code&gt;; &lt;code&gt;g=9.8 m/s²&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;Vor dem Bodenkontakt ist das Seil gespannt und es gibt kein Schlupfen. Die äquivalente Trägheitsmasse der Rolle ist &lt;code&gt;I/R²=(1/2)M_p=0.60 kg&lt;/code&gt;. Aus der gemeinsamen Bewegung von beiden Massen und der Rotationsgleichung der Rolle folgt:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;a  ≈ 0.847 m/s²
v1 ≈ 1.59 m/s
v2 ≈ 1.18 m/s
x  ≈ 0.0835 m = 8.35 cm
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Nach dem Bodenkontakt ändert sich die Geschwindigkeit von B durch den Aufprall am Boden, A besitzt weiterhin eine Geschwindigkeit entlang der schiefen Ebene nach oben, und auch die Rolle kann sich noch weiterdrehen. Da die Aufgabe ausdrücklich sagt, dass das Seil sofort locker wird, darf man &lt;code&gt;v_A=v_B=Rω&lt;/code&gt; nicht einfach weiterverwenden. Danach ist nur noch A separat zu betrachten:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;v2² = v1² - 2g(sinθ + μ_k cosθ)d
1/2 m_A v2² = 1/2 kx² + m_A g(sinθ + μ_k cosθ)x
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;GPT-5.6-SOL prüfte zusätzlich die Dimensionen, die Stoppstrecke ohne Feder sowie die Konsistenz zwischen Federenergie und den Verlusten durch Reibung und Gewichtskraft. Die Zahlen stimmen in sich. Kimi erzeugte in der ersten Runde keine sichtbare Antwort, daher gibt es keinen Vergleich der Zwischenschritte.&lt;/p&gt;

&lt;h2&gt;
  
  
  Programmieraufgabe: Der Algorithmuskern ist nach unabhängiger Prüfung ok, aber das Modell brachte einen fehlerhaften eigenen Test mit
&lt;/h2&gt;

&lt;p&gt;Die Programmieraufgabe verlangte die Implementierung von &lt;code&gt;optimize_release_plan(items, capacity_by_day, dependencies)&lt;/code&gt;. Berücksichtigt werden mussten Tageskapazitäten, Kapazität &lt;code&gt;0&lt;/code&gt; für nicht konfigurierte Tage, transitive Dependency-Closure, ungültige Abhängigkeiten und Zyklenerkennung sowie ein dreistufiger Tie-Break über &lt;code&gt;value → risk → sortierte id-Liste&lt;/code&gt;. Da &lt;code&gt;items &amp;lt;= 18&lt;/code&gt; ist, ist eine Bitmasken-Enumeration ein vernünftiger Ausgangspunkt.&lt;/p&gt;

&lt;p&gt;GPT-5.6-SOL verwendete gecachte Dependency-Closure und eine &lt;code&gt;2^n&lt;/code&gt;-Teilmenge-Enumeration. Wir haben den Code herausgelöst und in Python 3.11 unabhängig geprüft: Dependency-Closure, Mehrtages-Kapazitätsbeispiele, die dreistufige Tie-Break-Reihenfolge &lt;code&gt;value/risk/id&lt;/code&gt;, nicht konfigurierte Tageskapazität, nicht vorhandene Abhängigkeiten und Zyklusabhängigkeiten – alle 6 Prüfungen bestanden.&lt;/p&gt;

&lt;p&gt;Allerdings schlug die erste im Code angehängte Assertion fehl: Dort stand &lt;code&gt;A -&amp;gt; B -&amp;gt; C&lt;/code&gt;, gleichzeitig war aber noch &lt;code&gt;X&lt;/code&gt; mit Wert 11 enthalten. Unter der gegebenen Kapazität beträgt der Gesamtwert von &lt;code&gt;B + C + X&lt;/code&gt; 13 und liegt damit über &lt;code&gt;A + B + C&lt;/code&gt; mit 12. Daher ist &lt;code&gt;['B', 'C', 'X']&lt;/code&gt; korrekt; die Assertion mit &lt;code&gt;['A', 'B', 'C']&lt;/code&gt; war ein Fehler im Test-Setup.&lt;/p&gt;

&lt;p&gt;Dieses Detail ist sehr typisch: Bei Codeaufgaben darf man nicht nur auf die Funktionslogik schauen, und man sollte auch nicht allein wegen „8 beigefügten Assertions“ die Tests für vertrauenswürdig halten. Auch vom Modell erzeugte Testdaten brauchen eine manuelle oder referenzbasierte Gegenprüfung. Der Programmier-Request von Kimi K3 lief nach rund 245 Sekunden in einen Read-Timeout, sodass kein vollständiger Code vorlag.&lt;/p&gt;

&lt;h2&gt;
  
  
  Gesamtbewertung
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Dimension&lt;/th&gt;
&lt;th&gt;kimi-k3&lt;/th&gt;
&lt;th&gt;gpt-5.6-sol&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Mathematische Vollständigkeit&lt;/td&gt;
&lt;td&gt;bei &lt;code&gt;6500/10000&lt;/code&gt; Token jeweils abgeschnitten, keine Abnahme möglich&lt;/td&gt;
&lt;td&gt;Erwartungswert, zweites Moment, Varianz und Sanity Check vollständig&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Physikalisches Modellieren&lt;/td&gt;
&lt;td&gt;in Runde 1 abgeschnitten&lt;/td&gt;
&lt;td&gt;Rolle mit Trägheit, Seilentspannung und Federphase korrekt behandelt&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Code-Lieferung&lt;/td&gt;
&lt;td&gt;in dieser Runde Timeout&lt;/td&gt;
&lt;td&gt;Kernlogik bestand unabhängige Prüfung, aber eine beigefügte Assertion war falsch&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Ausgabe-Stabilität&lt;/td&gt;
&lt;td&gt;hoher Reasoning-Verbrauch, sichtbare Antwort oft nicht verfügbar&lt;/td&gt;
&lt;td&gt;bei allen drei Aufgaben sequenzieller Retry mit &lt;code&gt;stop&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Reaktionsgeschwindigkeit&lt;/td&gt;
&lt;td&gt;ca. 187–246 s, dazu Abschneiden/Timeout&lt;/td&gt;
&lt;td&gt;erfolgreiche Requests ca. 88–236 s; in der ersten parallelen Runde HTTP 408&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Die treffendere Schlussfolgerung lautet also nicht „ein Modell ist generell klüger“, sondern:&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;Unter diesem Router und Budget bringt GPT-5.6-SOL komplexes Reasoning eher bis zu einer finalen Antwort und eignet sich damit besser für Workflows, die sofort lesbare Herleitungen oder Code benötigen.&lt;/li&gt;
&lt;li&gt;Das Hauptproblem von Kimi K3 liegt in der Umwandlung von Reasoning-Budget in sichtbare Ausgabe; selbst bei &lt;code&gt;10000&lt;/code&gt; Tokens in der Matheaufgabe kam kein Abschluss zustande.&lt;/li&gt;
&lt;li&gt;Auch GPT-5.6-SOL darf man beim Code nicht blind vertrauen. Die Funktionslogik war unabhängig korrekt, aber das mitgelieferte Test-Setup hatte einen Fehler bei der Wertberechnung.&lt;/li&gt;
&lt;li&gt;Für eine belastbare Produktionsentscheidung sollten &lt;code&gt;finish_reason&lt;/code&gt;, reasoning tokens, Latenz und lokale Testergebnisse immer gemeinsam erfasst werden. Es reicht nicht, nur den letzten Satz „Antwort ist korrekt“ zu betrachten.&lt;/li&gt;
&lt;/ol&gt;

&lt;h2&gt;
  
  
  Reproduktion
&lt;/h2&gt;

&lt;p&gt;Die Testskripte und die Ergebnisse der sequenziellen Retries sind hier abgelegt (inklusive des in der ersten parallelen Runde erzeugten Summaries im Skript-Output):&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;.tmp/kimi_k3_vs_gpt56sol_test.py
.tmp/kimi-k3-vs-gpt56sol-results.json
.tmp/retry-gpt56sol-math.json
.tmp/retry-gpt56sol-physics.json
.tmp/retry-gpt56sol-programming.json
.tmp/retry-kimi-k3-math.json
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Für eine erneute Messung empfiehlt es sich, Modell-ID, Prompt, temperature, &lt;code&gt;max_tokens&lt;/code&gt; und Parallelitätsgrad zu fixieren und jede Ausgabe separat zu speichern. Last auf dem Upstream-Kanal, Cache-Treffer und Rate-Limiting-Zustand beeinflussen die Latenz; in diesem Artikel wurden HTTP 408, &lt;code&gt;length&lt;/code&gt; und Read-Timeout ausdrücklich als Teil des Testergebnisses protokolliert und nicht ausgeblendet.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fqcy6bhsrcy6nd1s4g0bw.webp" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fqcy6bhsrcy6nd1s4g0bw.webp" alt="de comparison chart" width="800" height="457"&gt;&lt;/a&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>benchmark</category>
    </item>
    <item>
      <title>Kimi K3 と GPT-5.6-SOL の比較：数学・物理・プログラミングの高難度実測</title>
      <dc:creator>Jenny Met</dc:creator>
      <pubDate>Sat, 18 Jul 2026 01:14:30 +0000</pubDate>
      <link>https://dev.to/xujfcn/kimi-k3-to-gpt-56-sol-nobi-jiao-shu-xue-wu-li-puroguramingunogao-nan-du-shi-ce-421o</link>
      <guid>https://dev.to/xujfcn/kimi-k3-to-gpt-56-sol-nobi-jiao-shu-xue-wu-li-puroguramingunogao-nan-du-shi-ce-421o</guid>
      <description>&lt;h1&gt;
  
  
  Kimi K3 と GPT-5.6-SOL の比較：数学・物理・プログラミングの高難度実測
&lt;/h1&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2F0b11gmmsrzgxt2nrnvgu.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2F0b11gmmsrzgxt2nrnvgu.png" alt="ja benchmark overview" width="800" height="450"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;今回は簡単なQ&amp;amp;Aではなく、連続推論が必要な3問に固定しました。具体的には、パターン重なりと二次モーメントを含む確率問題、滑車の回転慣性と糸のたるみへの切り替えが入る物理問題、そして closure、多日容量、3段階の tie-break に依存する Python 問題です。両モデルには同じインターフェース、同じプロンプト、近い出力上限を使い、ツールもネット接続も有効化していません。&lt;/p&gt;

&lt;p&gt;先に結論だけまとめます。&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;gpt-5.6-sol&lt;/code&gt; は3問すべてで完全な可視回答を返し、数学と物理の参照結果も正しかったです。&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;kimi-k3&lt;/code&gt; は初回の &lt;code&gt;6500&lt;/code&gt; token 上限では、数学と物理のどちらも &lt;code&gt;finish_reason=length&lt;/code&gt; で終了し、可視回答は空でした。数学は上限を &lt;code&gt;10000&lt;/code&gt; に上げてもなお途中で切れました。プログラミング問題は約 245 秒後に read timeout になりました。&lt;/li&gt;
&lt;li&gt;GPT-5.6-SOL のプログラミング実装は、依存関係の閉包、多日容量、tie-break、無効な依存、循環依存の独立追加チェックをすべて通過しましたが、自身が添付した最初の assert サンプルには期待値の誤りがありました。つまり、「コード本体が正しい」ことと「サンプルテストも全部正しい」ことは分けて評価する必要があります。&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;なお、ここでの遅延は今回のリクエストで観測された値であり、固定SLAを意味しません。初回の並列リクエストでは GPT の数学と物理が HTTP 408 を返したため、その後は順次リトライに切り替えました。したがって速度はあくまで呼び出し体験の観測値であり、絶対的な順位づけには使っていません。&lt;/p&gt;

&lt;h2&gt;
  
  
  テスト設定
&lt;/h2&gt;

&lt;p&gt;テスト日時は北京時間 &lt;code&gt;2026-07-17&lt;/code&gt; から &lt;code&gt;2026-07-18&lt;/code&gt;、インターフェースは以下です。&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;POST https://cn.crazyrouter.com/v1/chat/completions
model: kimi-k3 / gpt-5.6-sol
temperature: 0.2
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;初回は共通で、数学と物理は &lt;code&gt;max_tokens=6500&lt;/code&gt;、プログラミングは &lt;code&gt;max_tokens=7500&lt;/code&gt; としました。各問題では、検算可能な導出または実行可能コードの提示を求め、&lt;code&gt;finish_reason&lt;/code&gt;、completion/reasoning token、リクエスト遅延、数値の正しさ、そしてコードが Python 3.11 で独立実行できるかを記録しました。&lt;/p&gt;

&lt;h2&gt;
  
  
  結果サマリー
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;タスク&lt;/th&gt;
&lt;th&gt;kimi-k3&lt;/th&gt;
&lt;th&gt;gpt-5.6-sol&lt;/th&gt;
&lt;th&gt;判定&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;数学：HHTH の期待値と分散&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;length&lt;/code&gt;，186.98 s，6500 tokens；可視内容は空&lt;/td&gt;
&lt;td&gt;順次リトライ &lt;code&gt;stop&lt;/code&gt;，236.07 s，6872 tokens&lt;/td&gt;
&lt;td&gt;GPT は完全回答；Kimi は初回で答案形成に至らず&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;物理：滑車、着地、ばね&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;length&lt;/code&gt;，202.05 s，6500 tokens；可視内容は空&lt;/td&gt;
&lt;td&gt;順次リトライ &lt;code&gt;stop&lt;/code&gt;，156.29 s，4501 tokens&lt;/td&gt;
&lt;td&gt;GPT は完全で数値も正確&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;プログラミング：依存閉包バックパック&lt;/td&gt;
&lt;td&gt;245.54 s 後に &lt;code&gt;TimeoutError&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;stop&lt;/code&gt;，87.96 s，4514 tokens&lt;/td&gt;
&lt;td&gt;GPT のコードは実行可能；Kimi は完全なコードを返さず&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Kimi 数学再測定&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;length&lt;/code&gt;，286.99 s，10000 tokens&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;予算を増やしても終了せず&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Kimi の数学と物理のリクエストでは、インターフェース上の reasoning token がそれぞれ &lt;code&gt;6497&lt;/code&gt; 前後でした。数学再測定では reasoning token が &lt;code&gt;9997&lt;/code&gt; 前後でした。これは Kimi に推論力がないという意味ではなく、この問題設定と現在のルーティングでは推論予算を使い切りやすく、呼び出し側が最終答案を受け取れないことを示しています。&lt;/p&gt;

&lt;h2&gt;
  
  
  数学問題：パターン重なりは期待値だけでなく分散にも効く
&lt;/h2&gt;

&lt;p&gt;問題は、正面確率 &lt;code&gt;p=3/5&lt;/code&gt;、裏面確率 &lt;code&gt;q=2/5&lt;/code&gt; のコインを投げ続け、&lt;code&gt;HHTH&lt;/code&gt; が初めて現れるまでの回数を &lt;code&gt;T&lt;/code&gt; としたときの &lt;code&gt;E[T]&lt;/code&gt; と &lt;code&gt;Var(T)&lt;/code&gt; を求めるものです。パターン重なりは許されます。&lt;/p&gt;

&lt;p&gt;正しい前方オートマトンの状態は &lt;code&gt;S0=空前缀&lt;/code&gt;、&lt;code&gt;S1=H&lt;/code&gt;、&lt;code&gt;S2=HH&lt;/code&gt;、&lt;code&gt;S3=HHT&lt;/code&gt;、&lt;code&gt;S4=HHTH（吸収状態）&lt;/code&gt; です。重要なのは &lt;code&gt;S2 --H--&amp;gt; S2&lt;/code&gt; という遷移で、&lt;code&gt;HH&lt;/code&gt; の後にさらに &lt;code&gt;H&lt;/code&gt; が出ても、最長接尾辞は依然として &lt;code&gt;HH&lt;/code&gt; であり、誤って空状態へ戻してはいけません。&lt;/p&gt;

&lt;p&gt;GPT-5.6-SOL が立てた一次モーメント方程式は次のとおりです。&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;M0 = 1 + p M1 + q M0
M1 = 1 + p M2 + q M0
M2 = 1 + p M2 + q M3
M3 = 1 + q M0
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;さらに二次モーメント方程式を立てると、次が得られます。&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;E[T]   = 715/54       ≈ 13.2407407407
E[T²]  = 195335/729   ≈ 267.9492455418
Var(T) = 270115/2916  ≈ 92.6320301783
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;期待値は境界公式でも独立に検算できます。&lt;code&gt;HHTH&lt;/code&gt; の非空真の境界は単一文字 &lt;code&gt;H&lt;/code&gt; なので、&lt;code&gt;E[T] = 1/p + 1/(p³q) = 715/54&lt;/code&gt; です。GPT の完全回答は、状態遷移、二次モーメントの展開、sanity check まで一通り含んでいました。Kimi は &lt;code&gt;6500&lt;/code&gt; と &lt;code&gt;10000&lt;/code&gt; のどちらの上限でも可視的な導出を出せなかったため、今回は数学の正確性を採点できず、「予算内で未完了」と記録しています。&lt;/p&gt;

&lt;h2&gt;
  
  
  物理問題：着地後は拘束が切れるので、同じエネルギー方程式をそのまま延長してはいけない
&lt;/h2&gt;

&lt;p&gt;設定は次のとおりです。&lt;code&gt;m_A=4.0 kg&lt;/code&gt; は &lt;code&gt;25°&lt;/code&gt; の粗い斜面上、&lt;code&gt;μ_k=0.18&lt;/code&gt;。&lt;code&gt;m_B=3.0 kg&lt;/code&gt; は吊り下げ。滑車は &lt;code&gt;M_p=1.2 kg&lt;/code&gt;、&lt;code&gt;R=0.10 m&lt;/code&gt;。B が &lt;code&gt;1.50 m&lt;/code&gt; 下降したあとに地面へ接触し、糸は直ちにたるみます。その後 A はさらに &lt;code&gt;0.10 m&lt;/code&gt; だけ斜面上方へ滑って &lt;code&gt;k=250 N/m&lt;/code&gt; のばねに接触します。&lt;code&gt;g=9.8 m/s²&lt;/code&gt; です。&lt;/p&gt;

&lt;p&gt;着地前は、糸は張っていて滑りなしなので、滑車の等価慣性質量は &lt;code&gt;I/R²=(1/2)M_p=0.60 kg&lt;/code&gt; です。2物体と滑車の回転方程式を連立すると、次のようになります。&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;a  ≈ 0.847 m/s²
v1 ≈ 1.59 m/s
v2 ≈ 1.18 m/s
x  ≈ 0.0835 m = 8.35 cm
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;着地後は、B の速度は地面との衝突で変化し、A はなお斜面上向きの速度を持ち、滑車も回転を続ける可能性があります。しかし問題文では糸が直ちにたるむと明記されているため、&lt;code&gt;v_A=v_B=Rω&lt;/code&gt; はもう使えません。以後は A のみを解析すべきです。&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;v2² = v1² - 2g(sinθ + μ_k cosθ)d
1/2 m_A v2² = 1/2 kx² + m_A g(sinθ + μ_k cosθ)x
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;GPT-5.6-SOL は、次元整合性、ばねなしでの停止距離、ばねのエネルギーと摩擦・重力損失の和まで確認しており、数値的にも整合していました。Kimi は初回で可視回答を出せなかったため、中間のモデリング品質は比較できませんでした。&lt;/p&gt;

&lt;h2&gt;
  
  
  プログラミング問題：アルゴリズム本体は独立検証で通過、ただしモデル付属サンプルにバグあり
&lt;/h2&gt;

&lt;p&gt;この問題は &lt;code&gt;optimize_release_plan(items, capacity_by_day, dependencies)&lt;/code&gt; を実装し、日別容量、未設定日の容量は 0、直接・間接依存の閉包、無効な依存と循環検出、さらに &lt;code&gt;value → risk → ソート済み id 列表&lt;/code&gt; の3段階 tie-break を扱う必要があります。&lt;code&gt;items &amp;lt;= 18&lt;/code&gt; なので、bitmask 総当たりは妥当なベースラインです。&lt;/p&gt;

&lt;p&gt;GPT-5.6-SOL は依存閉包キャッシュと &lt;code&gt;2^n&lt;/code&gt; の部分集合列挙を使っていました。コードを抽出し、Python 3.11 で独立検査を行ったところ、依存閉包、多日容量サンプル、value/risk/id の3段階 tie-break、未設定日の容量、依存なしケース、循環依存の6組すべてが通過しました。&lt;/p&gt;

&lt;p&gt;ただし、モデルがコード末尾に付けた最初の assert は失敗しました。そこでは &lt;code&gt;A -&amp;gt; B -&amp;gt; C&lt;/code&gt; を前提にしつつ、価値 11 の &lt;code&gt;X&lt;/code&gt; も入れていました。与えられた容量では、&lt;code&gt;B + C + X&lt;/code&gt; の総価値は 13 で、&lt;code&gt;A + B + C&lt;/code&gt; の 12 より大きいので、関数が &lt;code&gt;['B', 'C', 'X']&lt;/code&gt; を返すのが正解です。&lt;code&gt;['A', 'B', 'C']&lt;/code&gt; と書かれた assert はテストフィクスチャの誤りです。&lt;/p&gt;

&lt;p&gt;この点はかなり示唆的です。コード問題は関数本体だけ見ればよいわけでもなく、逆に「8個のassertが付いているからテストも正しい」とは限りません。モデル生成のテストデータも、人手または参照実装で検証する必要があります。Kimi K3 のプログラミングリクエストは約 245 秒後に read timeout となり、完全なコードは取得できませんでした。&lt;/p&gt;

&lt;h2&gt;
  
  
  総合評価
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;観点&lt;/th&gt;
&lt;th&gt;kimi-k3&lt;/th&gt;
&lt;th&gt;gpt-5.6-sol&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;数学の完全性&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;6500/10000&lt;/code&gt; token ともに途中終了、検収不可&lt;/td&gt;
&lt;td&gt;期待値、二次モーメント、分散、sanity check が揃っている&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;物理モデリング&lt;/td&gt;
&lt;td&gt;初回で途中終了&lt;/td&gt;
&lt;td&gt;滑車慣性、糸のたるみ、ばね段階を正しく処理&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;プログラミング納品&lt;/td&gt;
&lt;td&gt;今回は timeout&lt;/td&gt;
&lt;td&gt;コード本体は独立検査を通過したが、付属の assert に誤りあり&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;出力安定性&lt;/td&gt;
&lt;td&gt;reasoning 消費が大きく、可視回答を得にくい&lt;/td&gt;
&lt;td&gt;3問すべて順次リトライで &lt;code&gt;stop&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;応答速度&lt;/td&gt;
&lt;td&gt;約 187–246 s で、しかも途中終了/timeout あり&lt;/td&gt;
&lt;td&gt;成功したリクエストは約 88–236 s；並列初回は 408 あり&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;より正確に言うと、結論は「どちらか一方が絶対的に賢い」という話ではありません。&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;今回のルーティングと予算では、GPT-5.6-SOL のほうが複雑な推論を最終答案までまとめやすく、すぐ読める導出やコードが必要なワークフローに向いています。&lt;/li&gt;
&lt;li&gt;Kimi K3 の主な課題は、推論予算を可視出力へ変換する効率です。数学問題で &lt;code&gt;10000&lt;/code&gt; token に増やしても、なお完了しませんでした。&lt;/li&gt;
&lt;li&gt;GPT-5.6-SOL のコードも盲信は禁物です。関数ロジックは独立検査を通っても、付属テストフィクスチャに価値計算ミスがありました。&lt;/li&gt;
&lt;li&gt;本番導入の選定では、&lt;code&gt;finish_reason&lt;/code&gt;、reasoning token、遅延、ローカルテスト結果を併記して記録すべきで、最後の一文が「答えは正しい」だけでは不十分です。&lt;/li&gt;
&lt;/ol&gt;

&lt;h2&gt;
  
  
  再現実験
&lt;/h2&gt;

&lt;p&gt;今回のテストスクリプトと順次リトライ結果は以下に保存しています（並列初回の要約もスクリプト出力に書き込んであります）。&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;.tmp/kimi_k3_vs_gpt56sol_test.py
.tmp/kimi-k3-vs-gpt56sol-results.json
.tmp/retry-gpt56sol-math.json
.tmp/retry-gpt56sol-physics.json
.tmp/retry-gpt56sol-programming.json
.tmp/retry-kimi-k3-math.json
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;再測定時は、モデル ID、プロンプト、temperature、&lt;code&gt;max_tokens&lt;/code&gt;、並列度を固定し、毎回の出力を別ファイルとして保存するのがおすすめです。上流の負荷、キャッシュヒット、レート制限の状態は遅延に影響します。本記事では HTTP 408、&lt;code&gt;length&lt;/code&gt;、read timeout をいずれもテスト結果の一部として記録し、意図的に隠していません。&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fflry581v81wkct0tmik6.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fflry581v81wkct0tmik6.png" alt="ja comparison chart" width="800" height="672"&gt;&lt;/a&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>benchmark</category>
    </item>
    <item>
      <title>Kimi K3 对比 GPT-5.6-SOL：数学、物理与编程高难度实测</title>
      <dc:creator>Jenny Met</dc:creator>
      <pubDate>Sat, 18 Jul 2026 01:13:07 +0000</pubDate>
      <link>https://dev.to/xujfcn/kimi-k3-dui-bi-gpt-56-solshu-xue-wu-li-yu-bian-cheng-gao-nan-du-shi-ce-3m39</link>
      <guid>https://dev.to/xujfcn/kimi-k3-dui-bi-gpt-56-solshu-xue-wu-li-yu-bian-cheng-gao-nan-du-shi-ce-3m39</guid>
      <description>&lt;h1&gt;
  
  
  Kimi K3 对比 GPT-5.6-SOL：数学、物理与编程高难度实测
&lt;/h1&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fsffrw3qwb04h4wr1xypr.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fsffrw3qwb04h4wr1xypr.png" alt="模型对比测试总览" width="800" height="672"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;这次不测简单问答，而是固定三道需要连续推理的题：带模式重叠和二阶矩的概率题、带滑轮转动惯量与绳松弛切换的物理题，以及依赖闭包、多日容量和三层 tie-break 的 Python 题。两个模型使用同一接口、同一提示词和相近的输出上限，不启用工具和联网。&lt;/p&gt;

&lt;p&gt;先给结论：&lt;/p&gt;

&lt;ul&gt;
&lt;li&gt;
&lt;code&gt;gpt-5.6-sol&lt;/code&gt; 在三道题上都拿到了完整可见回答，数学和物理的参考结果正确。&lt;/li&gt;
&lt;li&gt;
&lt;code&gt;kimi-k3&lt;/code&gt; 在首轮 &lt;code&gt;6500&lt;/code&gt; token 上限下，数学和物理都以 &lt;code&gt;finish_reason=length&lt;/code&gt; 结束，可见答案为空；数学题把上限提高到 &lt;code&gt;10000&lt;/code&gt; 后仍然截断。编程题则在约 245 秒后读超时。&lt;/li&gt;
&lt;li&gt;GPT-5.6-SOL 的编程实现通过了独立补充的依赖闭包、容量、tie-break、非法依赖和循环依赖检查，但它自己附带的第一条断言样例有预期值错误。这说明“代码主体正确”和“示例测试全对”需要分开验收。&lt;/li&gt;
&lt;/ul&gt;

&lt;p&gt;本文的延迟是本次请求的观测值，不代表固定 SLA。首轮并发请求中 GPT 的数学和物理请求收到过 HTTP 408，随后改为顺序重试；因此速度只用于观察调用体验，不用于宣称绝对排名。&lt;/p&gt;

&lt;h2&gt;
  
  
  测试设置
&lt;/h2&gt;

&lt;p&gt;测试时间为北京时间 &lt;code&gt;2026-07-17&lt;/code&gt; 至 &lt;code&gt;2026-07-18&lt;/code&gt;，接口为：&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;POST https://cn.crazyrouter.com/v1/chat/completions
model: kimi-k3 / gpt-5.6-sol
temperature: 0.2
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;第一轮统一使用：数学和物理 &lt;code&gt;max_tokens=6500&lt;/code&gt;，编程 &lt;code&gt;max_tokens=7500&lt;/code&gt;。每道题都要求模型给出可复核推导或可运行代码，并记录 &lt;code&gt;finish_reason&lt;/code&gt;、completion/reasoning token、请求延迟、数值正确性和代码能否在 Python 3.11 中独立运行。&lt;/p&gt;

&lt;h2&gt;
  
  
  结果总表
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;任务&lt;/th&gt;
&lt;th&gt;kimi-k3&lt;/th&gt;
&lt;th&gt;gpt-5.6-sol&lt;/th&gt;
&lt;th&gt;判定&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;数学：HHTH 的期望与方差&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;length&lt;/code&gt;，186.98 s，6500 tokens；可见内容为空&lt;/td&gt;
&lt;td&gt;顺序重试 &lt;code&gt;stop&lt;/code&gt;，236.07 s，6872 tokens&lt;/td&gt;
&lt;td&gt;GPT 完整作答；Kimi 首轮未形成答案&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;物理：滑轮、碰地、弹簧&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;length&lt;/code&gt;，202.05 s，6500 tokens；可见内容为空&lt;/td&gt;
&lt;td&gt;顺序重试 &lt;code&gt;stop&lt;/code&gt;，156.29 s，4501 tokens&lt;/td&gt;
&lt;td&gt;GPT 完整且数值正确&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;编程：依赖闭包背包&lt;/td&gt;
&lt;td&gt;245.54 s 后 &lt;code&gt;TimeoutError&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;stop&lt;/code&gt;，87.96 s，4514 tokens&lt;/td&gt;
&lt;td&gt;GPT 代码可运行；Kimi 未返回完整代码&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Kimi 数学复测&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;length&lt;/code&gt;，286.99 s，10000 tokens&lt;/td&gt;
&lt;td&gt;—&lt;/td&gt;
&lt;td&gt;增加预算仍未结束&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Kimi 的数学和物理请求中，接口报告的 reasoning token 分别接近 &lt;code&gt;6497&lt;/code&gt;；数学复测的 reasoning token 接近 &lt;code&gt;9997&lt;/code&gt;。这不是说 Kimi 没有推理能力，而是说明在本题提示词和当前路由下，推理预算很容易被耗尽，调用方拿不到最终答案。&lt;/p&gt;

&lt;h2&gt;
  
  
  数学题：模式重叠不仅影响期望，也影响方差
&lt;/h2&gt;

&lt;p&gt;题目是：正面概率 &lt;code&gt;p=3/5&lt;/code&gt;、反面概率 &lt;code&gt;q=2/5&lt;/code&gt;，不断投掷直到第一次出现 &lt;code&gt;HHTH&lt;/code&gt;，允许模式重叠，求 &lt;code&gt;E[T]&lt;/code&gt; 和 &lt;code&gt;Var(T)&lt;/code&gt;。&lt;/p&gt;

&lt;p&gt;正确的前缀自动机状态为 &lt;code&gt;S0=空前缀&lt;/code&gt;、&lt;code&gt;S1=H&lt;/code&gt;、&lt;code&gt;S2=HH&lt;/code&gt;、&lt;code&gt;S3=HHT&lt;/code&gt;、&lt;code&gt;S4=HHTH（吸收态）&lt;/code&gt;。关键转移是 &lt;code&gt;S2 --H--&amp;gt; S2&lt;/code&gt;：已有 &lt;code&gt;HH&lt;/code&gt; 后再次出现 &lt;code&gt;H&lt;/code&gt;，最长后缀仍是 &lt;code&gt;HH&lt;/code&gt;，不能错误地退回空状态。&lt;/p&gt;

&lt;p&gt;GPT-5.6-SOL 建立的一阶矩方程为：&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;M0 = 1 + p M1 + q M0
M1 = 1 + p M2 + q M0
M2 = 1 + p M2 + q M3
M3 = 1 + q M0
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;继续建立二阶矩方程，得到：&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;E[T]   = 715/54       ≈ 13.2407407407
E[T²]  = 195335/729   ≈ 267.9492455418
Var(T) = 270115/2916  ≈ 92.6320301783
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;期望还可用边界公式独立复核。&lt;code&gt;HHTH&lt;/code&gt; 的非空真边界是单字符 &lt;code&gt;H&lt;/code&gt;，所以 &lt;code&gt;E[T] = 1/p + 1/(p³q) = 715/54&lt;/code&gt;。GPT 的完整回答同时覆盖了状态转移、二阶矩展开和 sanity check。Kimi 在 &lt;code&gt;6500&lt;/code&gt; 和 &lt;code&gt;10000&lt;/code&gt; 上限下都没有输出可见推导，因此本轮无法对其数学正确性打分，只能记录为“预算内未完成”。&lt;/p&gt;

&lt;h2&gt;
  
  
  物理题：碰地后约束断开，不能继续套同一套能量方程
&lt;/h2&gt;

&lt;p&gt;题目设置为：&lt;code&gt;m_A=4.0 kg&lt;/code&gt; 位于 &lt;code&gt;25°&lt;/code&gt; 粗糙斜面，&lt;code&gt;μ_k=0.18&lt;/code&gt;；&lt;code&gt;m_B=3.0 kg&lt;/code&gt; 悬挂；滑轮 &lt;code&gt;M_p=1.2 kg&lt;/code&gt;、&lt;code&gt;R=0.10 m&lt;/code&gt;；B 下降 &lt;code&gt;1.50 m&lt;/code&gt; 后碰地，绳立即松弛；A 再上滑 &lt;code&gt;0.10 m&lt;/code&gt; 接触 &lt;code&gt;k=250 N/m&lt;/code&gt; 弹簧；&lt;code&gt;g=9.8 m/s²&lt;/code&gt;。&lt;/p&gt;

&lt;p&gt;碰地前，绳绷紧且无滑动，滑轮的等效惯性质量为 &lt;code&gt;I/R²=(1/2)M_p=0.60 kg&lt;/code&gt;。联立两块物体和滑轮转动方程，得到：&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;a  ≈ 0.847 m/s²
v1 ≈ 1.59 m/s
v2 ≈ 1.18 m/s
x  ≈ 0.0835 m = 8.35 cm
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;碰地后，B 的速度被地面碰撞改变，A 仍有沿斜面向上的速度，滑轮也可能继续转动；题目又明确绳立即松弛，所以不能继续使用 &lt;code&gt;v_A=v_B=Rω&lt;/code&gt;。后续应只分析 A：&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;v2² = v1² - 2g(sinθ + μ_k cosθ)d
1/2 m_A v2² = 1/2 kx² + m_A g(sinθ + μ_k cosθ)x
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;GPT-5.6-SOL 还检查了量纲、无弹簧停止距离以及弹簧能量与摩擦/重力损失之和，数值自洽。Kimi 在首轮没有形成可见答案，因此无法比较中间建模质量。&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fflry581v81wkct0tmik6.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fflry581v81wkct0tmik6.png" alt="模型输出稳定性对比" width="800" height="672"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  编程题：算法主体通过独立检查，但模型自带样例有 bug
&lt;/h2&gt;

&lt;p&gt;编程题要求实现 &lt;code&gt;optimize_release_plan(items, capacity_by_day, dependencies)&lt;/code&gt;，处理每天容量、未配置日期容量为 0、直接和间接依赖闭包、非法依赖与循环检测，以及 &lt;code&gt;value → risk → 排序后的 id 列表&lt;/code&gt; 三层 tie-break。&lt;code&gt;items &amp;lt;= 18&lt;/code&gt;，所以 bitmask 穷举是合理基线。&lt;/p&gt;

&lt;p&gt;GPT-5.6-SOL 使用依赖闭包缓存和 &lt;code&gt;2^n&lt;/code&gt; 子集枚举。我们把代码提取出来，在 Python 3.11 中做了独立检查：依赖闭包、多日容量样例、value/risk/id 三层 tie-break、未配置日期容量、不存在依赖和循环依赖，共 6 组检查全部通过。&lt;/p&gt;

&lt;p&gt;但模型在代码末尾附带的第一条断言失败：它写的是 &lt;code&gt;A -&amp;gt; B -&amp;gt; C&lt;/code&gt;，同时还放入了价值为 11 的 &lt;code&gt;X&lt;/code&gt;。在给定容量下，&lt;code&gt;B + C + X&lt;/code&gt; 的总价值为 13，高于 &lt;code&gt;A + B + C&lt;/code&gt; 的 12，因此函数返回 &lt;code&gt;['B', 'C', 'X']&lt;/code&gt; 才是正确的，断言写成 &lt;code&gt;['A', 'B', 'C']&lt;/code&gt; 是测试夹具错误。&lt;/p&gt;

&lt;p&gt;这个细节很有代表性：代码题不能只看函数主体，也不能因为“附带了 8 个断言”就默认测试可信。模型生成的测试数据同样需要人工或参考实现复核。Kimi K3 的编程请求在约 245 秒后读超时，未能拿到完整代码。&lt;/p&gt;

&lt;h2&gt;
  
  
  综合评价
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;维度&lt;/th&gt;
&lt;th&gt;kimi-k3&lt;/th&gt;
&lt;th&gt;gpt-5.6-sol&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;数学完整性&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;6500/10000&lt;/code&gt; token 均截断，无法验收&lt;/td&gt;
&lt;td&gt;期望、二阶矩、方差和 sanity check 完整&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;物理建模&lt;/td&gt;
&lt;td&gt;首轮截断&lt;/td&gt;
&lt;td&gt;正确处理滑轮惯性、绳松弛和弹簧阶段&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;编程交付&lt;/td&gt;
&lt;td&gt;本轮超时&lt;/td&gt;
&lt;td&gt;代码主体通过独立检查，但自带一条错误断言&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;输出稳定性&lt;/td&gt;
&lt;td&gt;高 reasoning 占用，容易拿不到可见答案&lt;/td&gt;
&lt;td&gt;三道题顺序重试均 &lt;code&gt;stop&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;响应速度&lt;/td&gt;
&lt;td&gt;约 187–246 s，且有截断/超时&lt;/td&gt;
&lt;td&gt;成功请求约 88–236 s；并发首轮有 408&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;更准确的结论不是“某个模型绝对更聪明”，而是：&lt;/p&gt;

&lt;ol&gt;
&lt;li&gt;在本次路由和预算下，GPT-5.6-SOL 更容易把复杂推理收束成最终答案，适合需要立即拿到可读推导或代码的工作流。&lt;/li&gt;
&lt;li&gt;Kimi K3 的主要问题是推理预算和可见输出之间的转换效率；即使数学题提高到 &lt;code&gt;10000&lt;/code&gt; token，仍未结束。&lt;/li&gt;
&lt;li&gt;GPT-5.6-SOL 的代码也不能盲信。它的函数逻辑通过了独立检查，但随附测试夹具存在价值计算错误。&lt;/li&gt;
&lt;li&gt;对生产选型，应该同时记录 &lt;code&gt;finish_reason&lt;/code&gt;、reasoning token、延迟和本地测试结果，不能只看最终一句“答案正确”。&lt;/li&gt;
&lt;/ol&gt;

&lt;h2&gt;
  
  
  复现实验
&lt;/h2&gt;

&lt;p&gt;本次测试脚本和顺序重试结果保存在（并发首轮的摘要也已写入脚本输出）：&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;.tmp/kimi_k3_vs_gpt56sol_test.py
.tmp/kimi-k3-vs-gpt56sol-results.json
.tmp/retry-gpt56sol-math.json
.tmp/retry-gpt56sol-physics.json
.tmp/retry-gpt56sol-programming.json
.tmp/retry-kimi-k3-math.json
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;复测时建议固定模型 ID、提示词、temperature、&lt;code&gt;max_tokens&lt;/code&gt; 和并发度，并把每次输出另存为独立文件。上游渠道负载、缓存命中和限流状态都会影响延迟；本文把 HTTP 408、&lt;code&gt;length&lt;/code&gt; 和读超时都作为测试结果的一部分记录，而没有将其隐去。&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>benchmark</category>
    </item>
    <item>
      <title>Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?</title>
      <dc:creator>Jenny Met</dc:creator>
      <pubDate>Fri, 17 Jul 2026 17:11:18 +0000</pubDate>
      <link>https://dev.to/xujfcn/kimi-k3-so-voi-claude-fable-5-mo-hinh-nao-phu-hop-hon-cho-tac-vu-can-kiem-chung-ab7</link>
      <guid>https://dev.to/xujfcn/kimi-k3-so-voi-claude-fable-5-mo-hinh-nao-phu-hop-hon-cho-tac-vu-can-kiem-chung-ab7</guid>
      <description>&lt;h1&gt;
  
  
  Kimi K3 so với Claude Fable 5: mô hình nào phù hợp hơn cho tác vụ cần kiểm chứng?
&lt;/h1&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fp7hgfnnhjgzfttjaos06.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fp7hgfnnhjgzfttjaos06.png" alt="Kimi K3 so với Claude Fable 5" width="800" height="450"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Trong hệ thống thật, một phản hồi thành công chưa chắc là một kết quả dùng được. Bài test này kiểm tra cả bước tính trung gian, finish_reason và khả năng chạy của mã Python.&lt;/p&gt;

&lt;h2&gt;
  
  
  Khác biệt chính
&lt;/h2&gt;

&lt;p&gt;Fable 5 có độ trễ trung bình 37,1 giây, trong khi Kimi K3 là 108,0 giây. Đổi lại, Kimi K3 tạo chuỗi kiểm chứng toán học nhất quán hơn.&lt;/p&gt;

&lt;h2&gt;
  
  
  Lập trình: ngân sách đầu ra quyết định tính hoàn chỉnh
&lt;/h2&gt;

&lt;p&gt;Hàm Python phải gộp retry theo &lt;code&gt;request_id&lt;/code&gt;, đọc thời gian ISO-8601, lọc khoảng nửa kín &lt;code&gt;[start,end)&lt;/code&gt;, tổng hợp token và độ trễ, rồi sắp xếp theo nhiều khóa.&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Round 1, max_tokens=4000:
Kimi K3 finish_reason=length
Fable 5 finish_reason=length

Retry, max_tokens=7000:
Kimi K3: 145.2 s, 5199 completion tokens, 8/8 assertions
Fable 5: 46.6 s, 3710 completion tokens, 8/8 assertions
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Ở mức 4.000 tokens, cả hai kết thúc với length. Khi tăng lên 7.000, hai chương trình Python đều vượt qua tám assert giống nhau.&lt;/p&gt;

&lt;h2&gt;
  
  
  Thiết kế bài test
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Test date: 2026-07-17
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: kimi-k3, claude-fable-5
temperature: 0.2
Round 1 max_tokens: 4000
Coding retry max_tokens: 7000
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Hai mô hình nhận cùng prompt và cùng tiêu chí nghiệm thu. HTTP 200 không được xem là đủ: chúng tôi kiểm tra giá trị cuối, trạng thái trung gian, &lt;code&gt;finish_reason&lt;/code&gt;, Python có thể chạy và cùng một bộ assertion.&lt;/p&gt;

&lt;h2&gt;
  
  
  Kết quả tổng hợp
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Tác vụ&lt;/th&gt;
&lt;th&gt;Kimi K3&lt;/th&gt;
&lt;th&gt;Claude Fable 5&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Xác suất HHTH&lt;/td&gt;
&lt;td&gt;Đạt&lt;/td&gt;
&lt;td&gt;Kết quả cuối đúng; sai số học ở bước trung gian&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Va chạm và lò xo&lt;/td&gt;
&lt;td&gt;Đạt&lt;/td&gt;
&lt;td&gt;Đạt&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Tổng hợp Python&lt;/td&gt;
&lt;td&gt;Bị cắt ở 4k; đạt ở 7k&lt;/td&gt;
&lt;td&gt;Bị cắt ở 4k; đạt ở 7k&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Lịch ràng buộc&lt;/td&gt;
&lt;td&gt;Đạt&lt;/td&gt;
&lt;td&gt;Đạt&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Độ trễ trung bình — Kimi K3: 108.0 s
Độ trễ trung bình — Claude Fable 5: 37.1 s
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  Bài toán: đáp án cuối đúng chưa đủ
&lt;/h2&gt;

&lt;p&gt;Bài toán đồng xu lệch yêu cầu tính số lần tung kỳ vọng trước lần xuất hiện đầu tiên của &lt;code&gt;HHTH&lt;/code&gt;, với &lt;code&gt;P(H)=3/5&lt;/code&gt; và cho phép chồng lấn. Kết quả đúng là:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;E[T] = 715/54 ≈ 13.2407407407
E1 = 625/54
E2 = 475/54
E3 = 170/27
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Kimi K3 đối chiếu phương trình trạng thái với hai cách kiểm tra độc lập. Fable 5 có đáp án cuối đúng nhưng hai giá trị trung gian không khớp với chính phương trình của nó.&lt;/p&gt;

&lt;h2&gt;
  
  
  Vật lý: cả hai mô hình đều đúng
&lt;/h2&gt;

&lt;p&gt;Bài vật lý kết hợp va chạm hoàn toàn không đàn hồi, ma sát và nén lò xo. Cả hai mô hình đều cho:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Post-collision speed: 2.4 m/s
Energy lost in collision: 21.6 J
Maximum compression: about 0.2212 m
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Cả hai tính được độ nén lò xo khoảng 0,2212 m và lịch duy nhất Eli, Bo, Ada, Cici, Deng.&lt;/p&gt;

&lt;h2&gt;
  
  
  Ý nghĩa của reasoning tokens khi vận hành
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Kimi K3 completion tokens: 13,975
Kimi K3 reasoning tokens: about 12,500
Fable 5 completion tokens: 10,187
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Kimi K3 báo cáo khoảng 12.500 reasoning tokens. Việc suy luận sâu hơn đi cùng độ trễ cao hơn và ít không gian hơn cho mã hiển thị.&lt;/p&gt;

&lt;h2&gt;
  
  
  Suy luận ràng buộc: cùng một nghiệm duy nhất
&lt;/h2&gt;

&lt;p&gt;Cả hai mô hình đều tìm được lịch làm việc duy nhất:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Thứ hai&lt;/th&gt;
&lt;th&gt;Thứ ba&lt;/th&gt;
&lt;th&gt;Thứ tư&lt;/th&gt;
&lt;th&gt;Thứ năm&lt;/th&gt;
&lt;th&gt;Thứ sáu&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Eli&lt;/td&gt;
&lt;td&gt;Bo&lt;/td&gt;
&lt;td&gt;Ada&lt;/td&gt;
&lt;td&gt;Cici&lt;/td&gt;
&lt;td&gt;Deng&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Cả hai tính được độ nén lò xo khoảng 0,2212 m và lịch duy nhất Eli, Bo, Ada, Cici, Deng.&lt;/p&gt;

&lt;h2&gt;
  
  
  Gợi ý định tuyến mô hình
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;Dùng Fable 5 trước cho mã có thể test tự động&lt;/li&gt;
&lt;li&gt;Giữ Kimi K3 cho suy luận toán chính xác&lt;/li&gt;
&lt;li&gt;Luôn kiểm tra finish_reason và chạy test&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Giới hạn của phép thử
&lt;/h2&gt;

&lt;p&gt;Đây là mẫu thử nhỏ, không phải bảng xếp hạng phổ quát. Đánh giá production nên lặp mỗi nhóm 20–50 lần và đo tỷ lệ thành công, tỷ lệ bị cắt, thời gian tới token đầu tiên, P50/P95/P99, completion tokens và chi phí cho mỗi kết quả được chấp nhận.&lt;/p&gt;

&lt;h2&gt;
  
  
  Kết luận
&lt;/h2&gt;

&lt;p&gt;Trong lần thử này, Fable 5 là tuyến phản hồi nhanh; Kimi K3 là tuyến thận trọng hơn cho các bước toán trung gian.&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;YOUR_API_KEY&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://cn.crazyrouter.com/v1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;temperature&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;0.2&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;4000&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;YOUR_TEST_PROMPT&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}],&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;finish_reason&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;usage&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Bài đầy đủ:  &lt;a href="https://crazyrouter.com/vi/blog/kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-vi" rel="noopener noreferrer"&gt;https://crazyrouter.com/vi/blog/kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-vi&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;API:  &lt;a href="https://crazyrouter.com/register?utm_source=crazyrouter_blog&amp;amp;utm_medium=article&amp;amp;utm_campaign=kimi_k3_fable5_multilingual_20260718&amp;amp;utm_content=kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-vi__body_cta&amp;amp;utm_term=kimi-k3+claude-fable-5+benchmark" rel="noopener noreferrer"&gt;https://crazyrouter.com/register?utm_source=crazyrouter_blog&amp;amp;utm_medium=article&amp;amp;utm_campaign=kimi_k3_fable5_multilingual_20260718&amp;amp;utm_content=kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-vi__body_cta&amp;amp;utm_term=kimi-k3+claude-fable-5+benchmark&lt;/a&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>benchmark</category>
    </item>
    <item>
      <title>Kimi K3 vs. Claude Fable 5: Ein API-Test zu Prüfbarkeit, Code-Abbruch und Latenz</title>
      <dc:creator>Jenny Met</dc:creator>
      <pubDate>Fri, 17 Jul 2026 17:10:29 +0000</pubDate>
      <link>https://dev.to/xujfcn/kimi-k3-vs-claude-fable-5-ein-api-test-zu-prufbarkeit-code-abbruch-und-latenz-3g6j</link>
      <guid>https://dev.to/xujfcn/kimi-k3-vs-claude-fable-5-ein-api-test-zu-prufbarkeit-code-abbruch-und-latenz-3g6j</guid>
      <description>&lt;h1&gt;
  
  
  Kimi K3 vs. Claude Fable 5: Ein API-Test zu Prüfbarkeit, Code-Abbruch und Latenz
&lt;/h1&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fgvw53dv7ljnc1tusfvg1.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fgvw53dv7ljnc1tusfvg1.png" alt="Kimi K3 vs. Claude Fable 5" width="800" height="450"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;Ein belastbarer Modelltest muss mehr prüfen als die letzte Antwortzeile. Deshalb wurden Zwischenwerte zurück in Gleichungen eingesetzt, generierter Code ausgeführt und abgeschnittene Antworten separat bewertet.&lt;/p&gt;

&lt;h2&gt;
  
  
  Versuchsaufbau
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Test date: 2026-07-17
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: kimi-k3, claude-fable-5
temperature: 0.2
Round 1 max_tokens: 4000
Coding retry max_tokens: 7000
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Beide Modelle erhielten identische Prompts und Abnahmekriterien. HTTP 200 allein galt nicht als Erfolg: Endwerte, Zwischenzustände, &lt;code&gt;finish_reason&lt;/code&gt;, ausführbares Python und dieselben Assertions wurden geprüft.&lt;/p&gt;

&lt;h2&gt;
  
  
  Das technische Spannungsfeld
&lt;/h2&gt;

&lt;p&gt;Fable 5 antwortete im Mittel nach 37,1 Sekunden, Kimi K3 nach 108,0 Sekunden. Kimi K3 lieferte jedoch die konsistentere mathematische Verifikation.&lt;/p&gt;

&lt;h2&gt;
  
  
  Messwerte im Überblick
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Aufgabe&lt;/th&gt;
&lt;th&gt;Kimi K3&lt;/th&gt;
&lt;th&gt;Claude Fable 5&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;HHTH-Wahrscheinlichkeit&lt;/td&gt;
&lt;td&gt;Bestanden&lt;/td&gt;
&lt;td&gt;Endwert korrekt; Zwischenrechnung fehlerhaft&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Kollision und Feder&lt;/td&gt;
&lt;td&gt;Bestanden&lt;/td&gt;
&lt;td&gt;Bestanden&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Python-Aggregation&lt;/td&gt;
&lt;td&gt;Bei 4k gekürzt; bei 7k bestanden&lt;/td&gt;
&lt;td&gt;Bei 4k gekürzt; bei 7k bestanden&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Dienstplanlogik&lt;/td&gt;
&lt;td&gt;Bestanden&lt;/td&gt;
&lt;td&gt;Bestanden&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Mittlere Latenz — Kimi K3: 108.0 s
Mittlere Latenz — Claude Fable 5: 37.1 s
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  Mathematik: Konsistenz der Zwischenwerte
&lt;/h2&gt;

&lt;p&gt;Die Aufgabe zur verzerrten Münze fragte nach der erwarteten Zahl der Würfe bis zum ersten &lt;code&gt;HHTH&lt;/code&gt; bei &lt;code&gt;P(H)=3/5&lt;/code&gt; und erlaubter Überlappung. Das korrekte Ergebnis lautet:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;E[T] = 715/54 ≈ 13.2407407407
E1 = 625/54
E2 = 475/54
E3 = 170/27
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Kimi K3 prüfte den Zustandsautomaten mit zwei unabhängigen Methoden. Fable 5 fand das richtige Endergebnis, meldete aber zwei Zwischenwerte, die nicht zu den eigenen Gleichungen passten.&lt;/p&gt;

&lt;h2&gt;
  
  
  Physik: korrekte Trennung der Energiephasen
&lt;/h2&gt;

&lt;p&gt;Die Physikaufgabe kombinierte einen vollständig unelastischen Stoß mit Reibung und Federkompression. Beide Modelle erhielten:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Post-collision speed: 2.4 m/s
Energy lost in collision: 21.6 J
Maximum compression: about 0.2212 m
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Beide Modelle berechneten etwa 0,2212 m Federkompression und denselben eindeutigen Dienstplan.&lt;/p&gt;

&lt;h2&gt;
  
  
  Code: ein Output-Limit ist ein Qualitätsparameter
&lt;/h2&gt;

&lt;p&gt;Die Python-Funktion musste Retries nach &lt;code&gt;request_id&lt;/code&gt; zusammenführen, ISO-8601-Zeitstempel verarbeiten, das Halbintervall &lt;code&gt;[start,end)&lt;/code&gt; filtern, Token und Latenz aggregieren und mehrstufig sortieren.&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Round 1, max_tokens=4000:
Kimi K3 finish_reason=length
Fable 5 finish_reason=length

Retry, max_tokens=7000:
Kimi K3: 145.2 s, 5199 completion tokens, 8/8 assertions
Fable 5: 46.6 s, 3710 completion tokens, 8/8 assertions
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Bei 4.000 Tokens wurden beide Antworten mit length beendet. Mit 7.000 Tokens bestanden beide Python-Programme dieselben acht Assertions.&lt;/p&gt;

&lt;h2&gt;
  
  
  Reasoning-Tokens und sichtbare Ausgabe
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Kimi K3 completion tokens: 13,975
Kimi K3 reasoning tokens: about 12,500
Fable 5 completion tokens: 10,187
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Kimi K3 meldete rund 12.500 Reasoning-Tokens. Das verbessert in diesem Beispiel die Kontrolle, erhöht aber Latenz und Kürzungsrisiko bei langem Code.&lt;/p&gt;

&lt;h2&gt;
  
  
  Empfohlene Aufgabenverteilung
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;Fable 5 für häufige, automatisiert testbare Aufgaben&lt;/li&gt;
&lt;li&gt;Kimi K3 für exakte Herleitungen und Zwischenwert-Audits&lt;/li&gt;
&lt;li&gt;Langen Code nur mit finish_reason- und Laufzeittest akzeptieren&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  Constraint-Reasoning: identische eindeutige Lösung
&lt;/h2&gt;

&lt;p&gt;Beide Modelle fanden denselben eindeutig bestimmten Wochenplan:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Montag&lt;/th&gt;
&lt;th&gt;Dienstag&lt;/th&gt;
&lt;th&gt;Mittwoch&lt;/th&gt;
&lt;th&gt;Donnerstag&lt;/th&gt;
&lt;th&gt;Freitag&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Eli&lt;/td&gt;
&lt;td&gt;Bo&lt;/td&gt;
&lt;td&gt;Ada&lt;/td&gt;
&lt;td&gt;Cici&lt;/td&gt;
&lt;td&gt;Deng&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Beide Modelle berechneten etwa 0,2212 m Federkompression und denselben eindeutigen Dienstplan.&lt;/p&gt;

&lt;h2&gt;
  
  
  Grenzen des Tests
&lt;/h2&gt;

&lt;p&gt;Dies ist ein kleiner Test und keine allgemeine Rangliste. Für den Betrieb sollten alle Kategorien 20–50 Mal wiederholt und Erfolgsrate, Abbruchrate, Time-to-first-token, P50/P95/P99-Latenz, completion tokens und Kosten pro akzeptiertem Ergebnis erfasst werden.&lt;/p&gt;

&lt;h2&gt;
  
  
  Fazit
&lt;/h2&gt;

&lt;p&gt;Fable 5 war der schnelle Ausführungspfad; Kimi K3 war in diesem kleinen Test der sorgfältigere mathematische Prüfpfad.&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;YOUR_API_KEY&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://cn.crazyrouter.com/v1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;temperature&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;0.2&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;4000&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;YOUR_TEST_PROMPT&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}],&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;finish_reason&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;usage&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Vollständiger Artikel:  &lt;a href="https://crazyrouter.com/de/blog/kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-de" rel="noopener noreferrer"&gt;https://crazyrouter.com/de/blog/kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-de&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;API:  &lt;a href="https://crazyrouter.com/register?utm_source=crazyrouter_blog&amp;amp;utm_medium=article&amp;amp;utm_campaign=kimi_k3_fable5_multilingual_20260718&amp;amp;utm_content=kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-de__body_cta&amp;amp;utm_term=kimi-k3+claude-fable-5+benchmark" rel="noopener noreferrer"&gt;https://crazyrouter.com/register?utm_source=crazyrouter_blog&amp;amp;utm_medium=article&amp;amp;utm_campaign=kimi_k3_fable5_multilingual_20260718&amp;amp;utm_content=kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-de__body_cta&amp;amp;utm_term=kimi-k3+claude-fable-5+benchmark&lt;/a&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>benchmark</category>
    </item>
    <item>
      <title>Kimi K3 と Claude Fable 5 を実測比較：差が出たのは推論力より出力予算と検証性</title>
      <dc:creator>Jenny Met</dc:creator>
      <pubDate>Fri, 17 Jul 2026 17:09:34 +0000</pubDate>
      <link>https://dev.to/xujfcn/kimi-k3-to-claude-fable-5-woshi-ce-bi-jiao-chai-gachu-tanohatui-lun-li-yorichu-li-yu-suan-tojian-zheng-xing-3f6d</link>
      <guid>https://dev.to/xujfcn/kimi-k3-to-claude-fable-5-woshi-ce-bi-jiao-chai-gachu-tanohatui-lun-li-yorichu-li-yu-suan-tojian-zheng-xing-3f6d</guid>
      <description>&lt;h1&gt;
  
  
  Kimi K3 と Claude Fable 5 を実測比較：差が出たのは推論力より出力予算と検証性
&lt;/h1&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2F0b11gmmsrzgxt2nrnvgu.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2F0b11gmmsrzgxt2nrnvgu.png" alt="Kimi K3 と Claude Fable 5" width="800" height="450"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;モデル比較で見落とされやすいのは、HTTP 200 と成果物の完成が同じではない点です。本稿では最終回答だけでなく、finish_reason、途中計算、実行可能コードまで確認しました。&lt;/p&gt;

&lt;h2&gt;
  
  
  運用上の差はどこに出たか
&lt;/h2&gt;

&lt;p&gt;Fable 5 の平均応答は 37.1 秒、Kimi K3 は 108.0 秒でした。一方、確率問題の途中計算は Kimi K3 の方が一貫していました。&lt;/p&gt;

&lt;h2&gt;
  
  
  検証条件
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Test date: 2026-07-17
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: kimi-k3, claude-fable-5
temperature: 0.2
Round 1 max_tokens: 4000
Coding retry max_tokens: 7000
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;両モデルには同じプロンプトと検証条件を与えました。HTTP 200 だけを成功とはせず、最終値、途中状態、&lt;code&gt;finish_reason&lt;/code&gt;、実行可能な Python、同じ assert を確認しました。&lt;/p&gt;

&lt;h2&gt;
  
  
  4000 tokens では両方が打ち切り
&lt;/h2&gt;

&lt;p&gt;Python 関数では &lt;code&gt;request_id&lt;/code&gt; ごとのリトライ統合、ISO-8601 時刻、半開区間 &lt;code&gt;[start,end)&lt;/code&gt;、token と遅延の集計、多段ソートを扱いました。&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Round 1, max_tokens=4000:
Kimi K3 finish_reason=length
Fable 5 finish_reason=length

Retry, max_tokens=7000:
Kimi K3: 145.2 s, 5199 completion tokens, 8/8 assertions
Fable 5: 46.6 s, 3710 completion tokens, 8/8 assertions
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;max_tokens=4000 では両方とも length で終了しました。7000 に増やすと、両方の Python 実装が同じ8個の assert を通過しました。&lt;/p&gt;

&lt;h2&gt;
  
  
  結果一覧
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;課題&lt;/th&gt;
&lt;th&gt;Kimi K3&lt;/th&gt;
&lt;th&gt;Claude Fable 5&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;HHTH 確率問題&lt;/td&gt;
&lt;td&gt;通過&lt;/td&gt;
&lt;td&gt;最終値は正しいが、途中計算に誤り&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;衝突とばね&lt;/td&gt;
&lt;td&gt;通過&lt;/td&gt;
&lt;td&gt;通過&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Python 集計&lt;/td&gt;
&lt;td&gt;4000で打ち切り、7000で通過&lt;/td&gt;
&lt;td&gt;4000で打ち切り、7000で通過&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;勤務表推論&lt;/td&gt;
&lt;td&gt;通過&lt;/td&gt;
&lt;td&gt;通過&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;平均応答 — Kimi K3: 108.0 s
平均応答 — Claude Fable 5: 37.1 s
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  数式では最終値より途中状態を確認
&lt;/h2&gt;

&lt;p&gt;偏ったコインで &lt;code&gt;P(H)=3/5&lt;/code&gt;、パターンの重複を許し、&lt;code&gt;HHTH&lt;/code&gt; が初めて現れるまでの期待投数を求めました。正しい結果は次の通りです。&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;E[T] = 715/54 ≈ 13.2407407407
E1 = 625/54
E2 = 475/54
E3 = 170/27
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Kimi K3 は状態方程式、border 公式、公平なコインの特殊例を照合しました。Fable 5 は最終値は正しいものの、2つの途中状態に算術的不整合がありました。&lt;/p&gt;

&lt;h2&gt;
  
  
  reasoning tokens と可視出力の関係
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Kimi K3 completion tokens: 13,975
Kimi K3 reasoning tokens: about 12,500
Fable 5 completion tokens: 10,187
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Kimi K3 は初回に約 12,500 reasoning tokens を報告しました。検証は厚い一方、待ち時間と長いコードの可視出力に影響します。&lt;/p&gt;

&lt;h2&gt;
  
  
  物理問題は両モデルが正解
&lt;/h2&gt;

&lt;p&gt;物理問題は完全非弾性衝突、摩擦、ばね圧縮の2段階で構成しました。両モデルの結果は次の通りです。&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Post-collision speed: 2.4 m/s
Energy lost in collision: 21.6 J
Maximum compression: about 0.2212 m
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;物理問題の最大圧縮量は約 0.2212 m、勤務表の一意解は Eli、Bo、Ada、Cici、Deng でした。&lt;/p&gt;

&lt;h2&gt;
  
  
  制約推論は同じ一意解
&lt;/h2&gt;

&lt;p&gt;両モデルは同じ一意の平日スケジュールを導きました。&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;月曜&lt;/th&gt;
&lt;th&gt;火曜&lt;/th&gt;
&lt;th&gt;水曜&lt;/th&gt;
&lt;th&gt;木曜&lt;/th&gt;
&lt;th&gt;金曜&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Eli&lt;/td&gt;
&lt;td&gt;Bo&lt;/td&gt;
&lt;td&gt;Ada&lt;/td&gt;
&lt;td&gt;Cici&lt;/td&gt;
&lt;td&gt;Deng&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;物理問題の最大圧縮量は約 0.2212 m、勤務表の一意解は Eli、Bo、Ada、Cici、Deng でした。&lt;/p&gt;

&lt;h2&gt;
  
  
  実装時のモデル振り分け
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;高速な検証可能コードは Fable 5 から試す&lt;/li&gt;
&lt;li&gt;厳密な数式展開には Kimi K3 を残す&lt;/li&gt;
&lt;li&gt;長い生成では finish_reason と実行テストを必須にする&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  小規模テストとしての注意点
&lt;/h2&gt;

&lt;p&gt;これは小規模な実測であり、普遍的なランキングではありません。実運用では各カテゴリを20〜50回繰り返し、成功率、途中打ち切り率、初回 token 時間、P50/P95/P99 遅延、completion tokens、採用結果あたりのコストを計測する必要があります。&lt;/p&gt;

&lt;h2&gt;
  
  
  結論
&lt;/h2&gt;

&lt;p&gt;本テストでは Fable 5 が高速な実務ルート、Kimi K3 が数式の途中整合性を重視するルートという違いが見えました。&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;YOUR_API_KEY&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://cn.crazyrouter.com/v1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;temperature&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;0.2&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;4000&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;YOUR_TEST_PROMPT&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}],&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;finish_reason&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;usage&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;サイト内原文： &lt;a href="https://crazyrouter.com/ja/blog/kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-ja" rel="noopener noreferrer"&gt;https://crazyrouter.com/ja/blog/kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-ja&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;API エンドポイント： &lt;a href="https://crazyrouter.com/register?utm_source=crazyrouter_blog&amp;amp;utm_medium=article&amp;amp;utm_campaign=kimi_k3_fable5_multilingual_20260718&amp;amp;utm_content=kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-ja__body_cta&amp;amp;utm_term=kimi-k3+claude-fable-5+benchmark" rel="noopener noreferrer"&gt;https://crazyrouter.com/register?utm_source=crazyrouter_blog&amp;amp;utm_medium=article&amp;amp;utm_campaign=kimi_k3_fable5_multilingual_20260718&amp;amp;utm_content=kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026-ja__body_cta&amp;amp;utm_term=kimi-k3+claude-fable-5+benchmark&lt;/a&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>benchmark</category>
    </item>
    <item>
      <title>Kimi K3 对比 Claude Fable 5：数学更稳，还是响应更快？</title>
      <dc:creator>Jenny Met</dc:creator>
      <pubDate>Fri, 17 Jul 2026 17:08:51 +0000</pubDate>
      <link>https://dev.to/xujfcn/kimi-k3-dui-bi-claude-fable-5shu-xue-geng-wen-huan-shi-xiang-ying-geng-kuai--4a70</link>
      <guid>https://dev.to/xujfcn/kimi-k3-dui-bi-claude-fable-5shu-xue-geng-wen-huan-shi-xiang-ying-geng-kuai--4a70</guid>
      <description>&lt;h1&gt;
  
  
  Kimi K3 对比 Claude Fable 5：数学更稳，还是响应更快？
&lt;/h1&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fwrkpul2rqkr3hlpnfic0.png" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fwrkpul2rqkr3hlpnfic0.png" alt="Kimi K3 对比 Claude Fable 5" width="800" height="450"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;这不是一篇只看最终答案的模型排行榜。四道题分别检查数学中间状态、物理阶段划分、可执行 Python 和约束推理，并把输出截断与模型能力分开判断。&lt;/p&gt;

&lt;h2&gt;
  
  
  先看工程结论
&lt;/h2&gt;

&lt;p&gt;本轮 Fable 5 的平均延迟约为 37.1 秒，Kimi K3 约为 108.0 秒。Kimi K3 在概率题中给出了完全一致的状态回代；Fable 5 最终值正确，但两个中间状态存在算术错误。&lt;/p&gt;

&lt;h2&gt;
  
  
  测试方法
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Test date: 2026-07-17
Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: kimi-k3, claude-fable-5
temperature: 0.2
Round 1 max_tokens: 4000
Coding retry max_tokens: 7000
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;两个模型使用完全相同的提示词和验收标准。HTTP 200 只能说明请求完成，本文还检查最终数值、中间状态、&lt;code&gt;finish_reason&lt;/code&gt;、可执行 Python 和相同的断言。&lt;/p&gt;

&lt;h2&gt;
  
  
  结果总览
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;任务&lt;/th&gt;
&lt;th&gt;Kimi K3&lt;/th&gt;
&lt;th&gt;Claude Fable 5&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;HHTH 概率题&lt;/td&gt;
&lt;td&gt;通过&lt;/td&gt;
&lt;td&gt;最终值通过；中间算术错误&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;碰撞与弹簧&lt;/td&gt;
&lt;td&gt;通过&lt;/td&gt;
&lt;td&gt;通过&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Python 日志聚合&lt;/td&gt;
&lt;td&gt;4000 截断；7000 通过&lt;/td&gt;
&lt;td&gt;4000 截断；7000 通过&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;排班推理&lt;/td&gt;
&lt;td&gt;通过&lt;/td&gt;
&lt;td&gt;通过&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;平均延迟 — Kimi K3: 108.0 s
平均延迟 — Claude Fable 5: 37.1 s
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  数学题揭示了中间验证的重要性
&lt;/h2&gt;

&lt;p&gt;偏置硬币题要求计算在 &lt;code&gt;P(H)=3/5&lt;/code&gt;、允许模式重叠时首次出现 &lt;code&gt;HHTH&lt;/code&gt; 的期望投掷次数。正确结果为：&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;E[T] = 715/54 ≈ 13.2407407407
E1 = 625/54
E2 = 475/54
E3 = 170/27
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Kimi K3 同时用状态方程、模式 border 和公平硬币特例交叉验证。Fable 5 的最终答案虽然正确，但局部回代不一致，因此需要外部校验。&lt;/p&gt;

&lt;h2&gt;
  
  
  代码题首先考验的是输出预算
&lt;/h2&gt;

&lt;p&gt;Python 函数需要按 &lt;code&gt;request_id&lt;/code&gt; 去重重试，解析 ISO-8601 时间，过滤半开区间 &lt;code&gt;[start,end)&lt;/code&gt;，汇总 token 与延迟，并执行多级排序。&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Round 1, max_tokens=4000:
Kimi K3 finish_reason=length
Fable 5 finish_reason=length

Retry, max_tokens=7000:
Kimi K3: 145.2 s, 5199 completion tokens, 8/8 assertions
Fable 5: 46.6 s, 3710 completion tokens, 8/8 assertions
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;max_tokens 为 4000 时两者都以 length 结束；提高到 7000 后，两份代码均通过八个断言。HTTP 200 不能替代完整性检查。&lt;/p&gt;

&lt;h2&gt;
  
  
  物理题两者都正确拆分阶段
&lt;/h2&gt;

&lt;p&gt;物理题包含完全非弹性碰撞、摩擦和弹簧压缩两个阶段。两款模型都得到：&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Post-collision speed: 2.4 m/s
Energy lost in collision: 21.6 J
Maximum compression: about 0.2212 m
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;碰撞压簧题的最大压缩量约为 0.2212 米；排班题的唯一顺序为 Eli、Bo、Ada、Cici、Deng。两款模型均通过。&lt;/p&gt;

&lt;h2&gt;
  
  
  文本约束题得到同一唯一解
&lt;/h2&gt;

&lt;p&gt;两款模型都找到了同一个唯一的工作日排班：&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;周一&lt;/th&gt;
&lt;th&gt;周二&lt;/th&gt;
&lt;th&gt;周三&lt;/th&gt;
&lt;th&gt;周四&lt;/th&gt;
&lt;th&gt;周五&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Eli&lt;/td&gt;
&lt;td&gt;Bo&lt;/td&gt;
&lt;td&gt;Ada&lt;/td&gt;
&lt;td&gt;Cici&lt;/td&gt;
&lt;td&gt;Deng&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;碰撞压簧题的最大压缩量约为 0.2212 米；排班题的唯一顺序为 Eli、Bo、Ada、Cici、Deng。两款模型均通过。&lt;/p&gt;

&lt;h2&gt;
  
  
  延迟与 reasoning token 的工程含义
&lt;/h2&gt;



&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Kimi K3 completion tokens: 13,975
Kimi K3 reasoning tokens: about 12,500
Fable 5 completion tokens: 10,187
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Kimi K3 第一轮报告约 12,500 个 reasoning tokens，这与更长延迟和代码可见输出空间不足同时出现。&lt;/p&gt;

&lt;h2&gt;
  
  
  如何选择和路由
&lt;/h2&gt;

&lt;ul&gt;
&lt;li&gt;高频可测试代码优先评估 Fable 5&lt;/li&gt;
&lt;li&gt;精确数学推导保留 Kimi K3&lt;/li&gt;
&lt;li&gt;所有长代码检查 finish_reason 并执行测试&lt;/li&gt;
&lt;/ul&gt;

&lt;h2&gt;
  
  
  测试边界
&lt;/h2&gt;

&lt;p&gt;这是一组小样本测试，不是通用排行榜。正式评估应将每类任务重复 20–50 次，并统计成功率、截断率、首 token 时间、P50/P95/P99 延迟、completion tokens 和每个通过结果的成本。&lt;/p&gt;

&lt;h2&gt;
  
  
  结论
&lt;/h2&gt;

&lt;p&gt;更准确的判断不是谁全面胜出，而是 Fable 5 更适合速度敏感的可验证任务，Kimi K3 更适合允许较长等待、重视推导一致性的任务。&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight python"&gt;&lt;code&gt;&lt;span class="kn"&gt;from&lt;/span&gt; &lt;span class="n"&gt;openai&lt;/span&gt; &lt;span class="kn"&gt;import&lt;/span&gt; &lt;span class="n"&gt;OpenAI&lt;/span&gt;

&lt;span class="n"&gt;client&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="nc"&gt;OpenAI&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;api_key&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;YOUR_API_KEY&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;base_url&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;https://cn.crazyrouter.com/v1&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="n"&gt;response&lt;/span&gt; &lt;span class="o"&gt;=&lt;/span&gt; &lt;span class="n"&gt;client&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;chat&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;completions&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="nf"&gt;create&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;
    &lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;kimi-k3&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;temperature&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mf"&gt;0.2&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;max_tokens&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="mi"&gt;4000&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;
    &lt;span class="n"&gt;messages&lt;/span&gt;&lt;span class="o"&gt;=&lt;/span&gt;&lt;span class="p"&gt;[{&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;role&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;user&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;content&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt; &lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="s"&gt;YOUR_TEST_PROMPT&lt;/span&gt;&lt;span class="sh"&gt;"&lt;/span&gt;&lt;span class="p"&gt;}],&lt;/span&gt;
&lt;span class="p"&gt;)&lt;/span&gt;
&lt;span class="nf"&gt;print&lt;/span&gt;&lt;span class="p"&gt;(&lt;/span&gt;&lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;model&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;choices&lt;/span&gt;&lt;span class="p"&gt;[&lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;].&lt;/span&gt;&lt;span class="n"&gt;finish_reason&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt; &lt;span class="n"&gt;response&lt;/span&gt;&lt;span class="p"&gt;.&lt;/span&gt;&lt;span class="n"&gt;usage&lt;/span&gt;&lt;span class="p"&gt;)&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;站内原文： &lt;a href="https://crazyrouter.com/zh/blog/kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026" rel="noopener noreferrer"&gt;https://crazyrouter.com/zh/blog/kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026&lt;/a&gt;&lt;/p&gt;

&lt;p&gt;API 入口： &lt;a href="https://crazyrouter.com/register?utm_source=crazyrouter_blog&amp;amp;utm_medium=article&amp;amp;utm_campaign=kimi_k3_fable5_multilingual_20260718&amp;amp;utm_content=kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026__body_cta&amp;amp;utm_term=kimi-k3+claude-fable-5+benchmark" rel="noopener noreferrer"&gt;https://crazyrouter.com/register?utm_source=crazyrouter_blog&amp;amp;utm_medium=article&amp;amp;utm_campaign=kimi_k3_fable5_multilingual_20260718&amp;amp;utm_content=kimi-k3-vs-claude-fable-5-hard-reasoning-benchmark-2026__body_cta&amp;amp;utm_term=kimi-k3+claude-fable-5+benchmark&lt;/a&gt;&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>benchmark</category>
    </item>
    <item>
      <title>Why High-Concurrency AI Apps Should Care About Gemini 2.5 Flash-Lite, Not Only the Strongest Model</title>
      <dc:creator>Jenny Met</dc:creator>
      <pubDate>Thu, 09 Jul 2026 07:34:34 +0000</pubDate>
      <link>https://dev.to/xujfcn/why-high-concurrency-ai-apps-should-care-about-gemini-25-flash-lite-not-only-the-strongest-model-5f92</link>
      <guid>https://dev.to/xujfcn/why-high-concurrency-ai-apps-should-care-about-gemini-25-flash-lite-not-only-the-strongest-model-5f92</guid>
      <description>&lt;h1&gt;
  
  
  Why High-Concurrency AI Apps Should Care About Gemini 2.5 Flash-Lite, Not Only the Strongest Model
&lt;/h1&gt;

&lt;p&gt;The short answer: if you are only building a demo, choosing the strongest model for every request is fine. Once the product reaches production traffic, the question changes.&lt;/p&gt;

&lt;p&gt;You no longer ask only:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Which model gives the best single answer?
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;You start asking:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Can the API absorb traffic spikes?
What happens when requests per minute go up?
Do lightweight steps really need the most expensive model?
How much do retries add to the bill?
Can the application switch models without rewriting business logic?
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;That is why I care about &lt;code&gt;gemini-2.5-flash-lite&lt;/code&gt; and &lt;code&gt;gemini-2.5-flash&lt;/code&gt;. They are not interesting only because they are Gemini models. They are interesting because they fit a production routing pattern: cheap high-frequency steps first, stronger models only where they are actually needed.&lt;/p&gt;

&lt;h2&gt;
  
  
  The cost of an AI product is often hidden in small steps
&lt;/h2&gt;

&lt;p&gt;Take a customer-support assistant. A user sends one message:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;I want to cancel my order, but can I keep the coupon?
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;From the user's point of view, this is one question. From the backend's point of view, it may become several model calls:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Detect language
Classify intent
Check whether this is an order-cancellation case
Decide whether a human agent is needed
Generate an internal summary
Retrieve policy context
Draft the reply
Run a lightweight risk check
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;If every step uses the strongest model, cost grows fast. A more practical design is:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;High-frequency lightweight steps: gemini-2.5-flash-lite
Medium-generation steps: gemini-2.5-flash
Rare complex tasks: stronger reasoning or coding models
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;This is not about sacrificing quality blindly. It is about matching task difficulty to model cost and throughput.&lt;/p&gt;

&lt;h2&gt;
  
  
  Flash-Lite is not for every task. It is for many small tasks.
&lt;/h2&gt;

&lt;p&gt;&lt;code&gt;gemini-2.5-flash-lite&lt;/code&gt; is best used for work such as:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Text classification
Intent detection
Short summaries
Query rewriting
Tag extraction
Structured field extraction
Agent intermediate decisions
Low-risk content pre-screening
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;These jobs usually have four traits:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;High volume
Short input
Short output
Limited reasoning depth
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;The failure mode in this layer is rarely "the answer was not poetic enough." The real problems are:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Queueing under concurrency
More 429s
Retry amplification
Higher P95 latency
Unpredictable monthly cost
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Flash-Lite is valuable because it can sit in front of the workflow and absorb these repeated, lightweight operations.&lt;/p&gt;

&lt;h2&gt;
  
  
  Flash belongs one layer higher
&lt;/h2&gt;

&lt;p&gt;&lt;code&gt;gemini-2.5-flash&lt;/code&gt; is better suited for:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Reply drafts
Medium-length summaries
Multi-paragraph merging
Content rewriting
Light code explanation
Main responses in conversational flows
Longer context understanding
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;A simple routing table can start like this:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Layer&lt;/th&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;Tasks&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Lightweight high-frequency layer&lt;/td&gt;
&lt;td&gt;&lt;code&gt;gemini-2.5-flash-lite&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Classification, short summaries, extraction, routing&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Medium-generation layer&lt;/td&gt;
&lt;td&gt;&lt;code&gt;gemini-2.5-flash&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Draft replies, medium summaries, rewriting&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Specialist layer&lt;/td&gt;
&lt;td&gt;Stronger reasoning/code models&lt;/td&gt;
&lt;td&gt;Deep reasoning, long code, high-risk decisions&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Many teams do not have a model problem. They have a routing problem: every task goes to the same model.&lt;/p&gt;

&lt;h2&gt;
  
  
  Why RPM matters
&lt;/h2&gt;

&lt;p&gt;RPM, or requests per minute, does not matter much in a manual demo. It matters a lot in production.&lt;/p&gt;

&lt;p&gt;A real AI application has:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;User concurrency
Background batch jobs
Multi-step agents
Retries after transient failures
Scheduled jobs firing at the same time
Multiple model calls per user action
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;When this happens, model choice affects the entire system:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Queue time
429 rate
5xx recovery
P95 latency
Retry count
Total workflow cost
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;So I evaluate models together with endpoint compatibility, routing flexibility, unit cost, and observed reliability.&lt;/p&gt;

&lt;h2&gt;
  
  
  Current endpoint shape and pricing snapshot
&lt;/h2&gt;

&lt;p&gt;At the time this article was prepared, Crazyrouter listed both &lt;code&gt;gemini-2.5-flash&lt;/code&gt; and &lt;code&gt;gemini-2.5-flash-lite&lt;/code&gt; with &lt;code&gt;openai&lt;/code&gt; and &lt;code&gt;gemini&lt;/code&gt; endpoint support.&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;supported_endpoint_types&lt;/th&gt;
&lt;th&gt;public_endpoint_types&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;gemini-2.5-flash&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;gemini&lt;/code&gt;, &lt;code&gt;openai&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;gemini&lt;/code&gt;, &lt;code&gt;openai&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;gemini-2.5-flash-lite&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;gemini&lt;/code&gt;, &lt;code&gt;openai&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;gemini&lt;/code&gt;, &lt;code&gt;openai&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;The pricing API snapshot used in the original Chinese article returned:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Model&lt;/th&gt;
&lt;th&gt;model_ratio&lt;/th&gt;
&lt;th&gt;completion_ratio&lt;/th&gt;
&lt;th&gt;cache_ratio&lt;/th&gt;
&lt;th&gt;cache_creation_ratio&lt;/th&gt;
&lt;th&gt;discount&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;gemini-2.5-flash-lite&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;0.05&lt;/td&gt;
&lt;td&gt;4&lt;/td&gt;
&lt;td&gt;0.25&lt;/td&gt;
&lt;td&gt;1.25&lt;/td&gt;
&lt;td&gt;0.55&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;gemini-2.5-flash&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;0.15&lt;/td&gt;
&lt;td&gt;8.3333&lt;/td&gt;
&lt;td&gt;0.2667&lt;/td&gt;
&lt;td&gt;1.25&lt;/td&gt;
&lt;td&gt;0.55&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;This is a publication-time snapshot, not a permanent price promise. Always check current pricing before a large deployment.&lt;/p&gt;

&lt;h2&gt;
  
  
  OpenAI-compatible request example
&lt;/h2&gt;

&lt;p&gt;If your stack already uses an OpenAI-compatible client, the lightweight classification step can look like this:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl https://cn.crazyrouter.com/v1/chat/completions &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Authorization: Bearer &lt;/span&gt;&lt;span class="nv"&gt;$CRAZYROUTER_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "model": "gemini-2.5-flash-lite",
    "messages": [
      {
        "role": "system",
        "content": "You are a high-throughput classifier. Return JSON only."
      },
      {
        "role": "user",
        "content": "Classify this support message: I want to cancel my order but keep the coupon."
      }
    ],
    "temperature": 0.1,
    "max_tokens": 200
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Then use &lt;code&gt;gemini-2.5-flash&lt;/code&gt; for the user-facing draft:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl https://cn.crazyrouter.com/v1/chat/completions &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Authorization: Bearer &lt;/span&gt;&lt;span class="nv"&gt;$CRAZYROUTER_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "model": "gemini-2.5-flash",
    "messages": [
      {
        "role": "system",
        "content": "You are a support assistant. Keep the answer concise and actionable."
      },
      {
        "role": "user",
        "content": "The user wants to cancel an order but keep the coupon. Draft a reply."
      }
    ],
    "temperature": 0.3,
    "max_tokens": 500
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;The important idea is not the exact prompt. It is the routing pattern:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Structured judgment: Lite
Natural language draft: Flash
Complex cases: upgrade only when needed
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  Cost should be calculated per workflow
&lt;/h2&gt;

&lt;p&gt;Many teams estimate AI cost by asking:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;How much is one API call?
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;In production, the better question is:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;How many model calls does one user action trigger?
Which model handles each step?
How many tokens does each step use?
How many retries happen?
Did the workflow eventually succeed?
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;If one user action triggers five model calls and three of them are lightweight, moving those three calls to Flash-Lite can make the total workflow cost much healthier.&lt;/p&gt;

&lt;h2&gt;
  
  
  Common mistakes
&lt;/h2&gt;

&lt;p&gt;The first mistake is using the strongest model for everything. It is simple, but expensive at scale.&lt;/p&gt;

&lt;p&gt;The second mistake is using the cheapest model for everything. This often increases retries and manual correction.&lt;/p&gt;

&lt;p&gt;The third mistake is not logging &lt;code&gt;finish_reason&lt;/code&gt;, token usage, latency, and retry count. Without those fields, you cannot tell whether the cost problem comes from the model, the task design, or retry behavior.&lt;/p&gt;

&lt;p&gt;The fourth mistake is having no fallback. If one model is rate-limited or degraded, the application has no operational room.&lt;/p&gt;

&lt;h2&gt;
  
  
  Where Crazyrouter fits
&lt;/h2&gt;

&lt;p&gt;Crazyrouter is useful here as a unified API gateway when you need:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;High RPM
Low-cost routing
OpenAI-compatible access
Gemini endpoint support
Multiple models behind one integration layer
Future model switching without changing business logic everywhere
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;Try it here:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;https://crazyrouter.com/register?utm_source=devto&amp;amp;utm_medium=article&amp;amp;utm_campaign=gemini_flash_lite_high_rpm_20260709&amp;amp;utm_content=gemini-25-flash-lite-high-rpm-production-ai-routing-en_devto
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;API base URL:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;https://cn.crazyrouter.com/v1
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;h2&gt;
  
  
  Final judgment
&lt;/h2&gt;

&lt;p&gt;If you only call an AI model occasionally, Flash-Lite may not look special. If your application has high volume, many workflow steps, many lightweight tasks, and cost pressure, it becomes very relevant.&lt;/p&gt;

&lt;p&gt;&lt;code&gt;gemini-2.5-flash-lite&lt;/code&gt; handles the high-frequency layer. &lt;code&gt;gemini-2.5-flash&lt;/code&gt; handles medium-generation work. Stronger models should be reserved for the small set of tasks that actually need them.&lt;/p&gt;

&lt;p&gt;High-concurrency AI model selection is not about choosing the strongest model for every prompt. It is about building a routing system that can keep quality, throughput, and cost under control.&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>gemini</category>
    </item>
    <item>
      <title>GLM-5.2 vs Claude Fable 5: presupuesto de salida, reasoning_tokens y discount 0.8</title>
      <dc:creator>Jenny Met</dc:creator>
      <pubDate>Mon, 06 Jul 2026 16:13:18 +0000</pubDate>
      <link>https://dev.to/xujfcn/glm-52-vs-claude-fable-5-presupuesto-de-salida-reasoningtokens-y-discount-08-2ed8</link>
      <guid>https://dev.to/xujfcn/glm-52-vs-claude-fable-5-presupuesto-de-salida-reasoningtokens-y-discount-08-2ed8</guid>
      <description>&lt;h1&gt;
  
  
  GLM-5.2 vs Claude Fable 5: la diferencia estuvo en el presupuesto de salida
&lt;/h1&gt;

&lt;p&gt;Este no es un ranking genérico de modelos. En esta prueba real de API, GLM-5.2 resolvió las tareas de razonamiento cuando se aumentó el presupuesto de salida, pero con límites bajos podía devolver HTTP 200 sin contenido visible. Claude Fable 5 fue más estable con presupuestos bajos y más fiable en la tarea de HTML largo.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Flxn0ppblanrxjtwe3jsf.webp" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Flxn0ppblanrxjtwe3jsf.webp" alt="GLM-5.2 vs Claude Fable 5 benchmark" width="800" height="457"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  Por qué importa esta prueba
&lt;/h2&gt;

&lt;p&gt;The test used the Crazyrouter OpenAI-compatible API rather than a chat UI. That matters because the result was not judged only by prose quality. Each response was checked with operational metadata:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;The important fields were &lt;code&gt;max_tokens&lt;/code&gt;, &lt;code&gt;completion_tokens&lt;/code&gt;, &lt;code&gt;reasoning_tokens&lt;/code&gt;, &lt;code&gt;finish_reason&lt;/code&gt;, visible content length, whether the generated HTML was closed, and whether the animation actually moved in a browser.&lt;/p&gt;

&lt;h2&gt;
  
  
  Diseño de la prueba
&lt;/h2&gt;

&lt;p&gt;The benchmark deliberately mixed three task types:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th&gt;Purpose&lt;/th&gt;
&lt;th&gt;Reference result&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;MATH-003&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;State-based expectation reasoning&lt;/td&gt;
&lt;td&gt;Expected flips until HH = &lt;code&gt;6&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;PHYS-003&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Momentum plus energy accounting&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;V = 3.0 m/s&lt;/code&gt;, &lt;code&gt;x ≈ 0.148 m&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;CODE-003-ANIM&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Long runnable artifact generation&lt;/td&gt;
&lt;td&gt;Complete 800x500 Canvas animation HTML&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;The first two tasks measured reasoning. The third task measured whether a model can produce a complete artifact, not merely a convincing partial code block.&lt;/p&gt;

&lt;h2&gt;
  
  
  Resultados observados
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th&gt;&lt;code&gt;glm-5.2&lt;/code&gt;&lt;/th&gt;
&lt;th&gt;&lt;code&gt;claude-fable-5&lt;/code&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Math, original budget&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;finish_reason=length&lt;/code&gt;, &lt;code&gt;completion_tokens=1601&lt;/code&gt;, &lt;code&gt;reasoning_tokens=1600&lt;/code&gt;, visible body empty&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;finish_reason=stop&lt;/code&gt;, complete and correct&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Math, retest&lt;/td&gt;
&lt;td&gt;Correct after &lt;code&gt;max_tokens=3200&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Retest not needed&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Physics, original budget&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;finish_reason=length&lt;/code&gt;, visible body empty&lt;/td&gt;
&lt;td&gt;Complete and correct&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Physics, retest&lt;/td&gt;
&lt;td&gt;Correct after &lt;code&gt;max_tokens=8000&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Retest not needed&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Animation, original budget&lt;/td&gt;
&lt;td&gt;Empty visible HTML at &lt;code&gt;max_tokens=3200&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Partial HTML, truncated&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Animation, retest&lt;/td&gt;
&lt;td&gt;Still truncated at &lt;code&gt;max_tokens=8000&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Complete HTML; browser validation passed&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;The most important observation is that GLM-5.2 was not failing the reasoning itself. In the math and physics tasks, it produced correct answers after a larger output budget. The problem was visibility and completion: a request could return HTTP 200 while the user-facing content was empty or incomplete.&lt;/p&gt;

&lt;p&gt;For the long Canvas animation, the difference was sharper. GLM-5.2 produced a visible HTML fragment at &lt;code&gt;max_tokens=8000&lt;/code&gt;, but it stopped inside JavaScript and did not close the file. Claude Fable 5 completed the HTML at &lt;code&gt;max_tokens=8000&lt;/code&gt;; browser validation showed no console errors, an 800x500 canvas, controls, a speed slider, and &lt;code&gt;changedPixels=55090&lt;/code&gt; after 700 ms.&lt;/p&gt;

&lt;h2&gt;
  
  
  Lectura de coste-beneficio
&lt;/h2&gt;

&lt;p&gt;En el momento de escribir, la pricing API de Crazyrouter lista &lt;code&gt;glm-5.2&lt;/code&gt; con &lt;code&gt;discount: 0.8&lt;/code&gt;. Eso la vuelve muy interesante en coste si tu aplicación puede asignar más presupuesto de salida y registrar &lt;code&gt;reasoning_tokens&lt;/code&gt; correctamente.&lt;/p&gt;

&lt;p&gt;This is the practical tradeoff:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Workload&lt;/th&gt;
&lt;th&gt;Better fit from this test&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Short reasoning with enough output budget&lt;/td&gt;
&lt;td&gt;GLM-5.2 can be a cost-effective option&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Low-budget reasoning responses&lt;/td&gt;
&lt;td&gt;Claude Fable 5 was steadier&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Long single-file code generation&lt;/td&gt;
&lt;td&gt;Claude Fable 5 was stronger in this run&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Batch evaluations where metadata is logged&lt;/td&gt;
&lt;td&gt;GLM-5.2 becomes easier to operate safely&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Do not treat the &lt;code&gt;0.8&lt;/code&gt; multiplier as a permanent universal price. It is a pricing-data snapshot from Crazyrouter at publication time and should be checked again before a large deployment.&lt;/p&gt;

&lt;h2&gt;
  
  
  Notas de integración
&lt;/h2&gt;

&lt;p&gt;Minimal request:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl https://cn.crazyrouter.com/v1/chat/completions &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Authorization: Bearer &lt;/span&gt;&lt;span class="nv"&gt;$CRAZYROUTER_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "user",
        "content": "Solve the HH expected-flips problem with state equations."
      }
    ],
    "temperature": 0.2,
    "max_tokens": 3200
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;To compare Claude Fable 5, keep the same payload and change only the model:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"claude-fable-5"&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;For production-style evaluations, log this shape for every request:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"glm-5.2"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"max_tokens"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;3200&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"finish_reason"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"length"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"completion_tokens"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;3200&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"reasoning_tokens"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;3178&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"visible_content_chars"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"html_closed"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="kc"&gt;false&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"browser_validation"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"not_run_incomplete_html"&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;API endpoints should stay clean. Do not add UTM parameters to &lt;code&gt;https://cn.crazyrouter.com/v1&lt;/code&gt;. Use tracking only on human-facing article or registration links.&lt;/p&gt;

&lt;p&gt;Puedes ejecutar la misma solicitud compatible con OpenAI en Crazyrouter y comparar los modelos con tus propios prompts.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://crazyrouter.com/register?utm_source=devto&amp;amp;utm_medium=article&amp;amp;utm_campaign=glm52_fable5_budget_cost_20260706&amp;amp;utm_content=devto_glm-52-vs-claude-fable-5-output-budget-cost-es_20260706__bottom&amp;amp;utm_term=glm-5.2+claude+fable+5+benchmark" rel="noopener noreferrer"&gt;https://crazyrouter.com/register?utm_source=devto&amp;amp;utm_medium=article&amp;amp;utm_campaign=glm52_fable5_budget_cost_20260706&amp;amp;utm_content=devto_glm-52-vs-claude-fable-5-output-budget-cost-es_20260706__bottom&amp;amp;utm_term=glm-5.2+claude+fable+5+benchmark&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Did GLM-5.2 fail the reasoning tasks?
&lt;/h3&gt;

&lt;p&gt;No. In this run, GLM-5.2 solved the math task after &lt;code&gt;max_tokens=3200&lt;/code&gt; and the physics task after &lt;code&gt;max_tokens=8000&lt;/code&gt;. The issue was that lower budgets were consumed mostly by reasoning tokens before visible content appeared.&lt;/p&gt;

&lt;h3&gt;
  
  
  Why not score HTTP 200 as success?
&lt;/h3&gt;

&lt;p&gt;Because HTTP 200 only means the API call returned. A benchmark answer can still be unusable if &lt;code&gt;finish_reason=length&lt;/code&gt;, visible content is empty, or generated code is incomplete.&lt;/p&gt;

&lt;h3&gt;
  
  
  Why was the animation task included?
&lt;/h3&gt;

&lt;p&gt;Long code generation exposes a different failure mode. A model can write a convincing first half of a file and still fail if the HTML or JavaScript is cut off.&lt;/p&gt;

&lt;h3&gt;
  
  
  Is GLM-5.2 still worth testing?
&lt;/h3&gt;

&lt;p&gt;Yes. The current &lt;code&gt;0.8&lt;/code&gt; discount multiplier makes it attractive for workloads where you can allocate enough output budget and monitor response metadata.&lt;/p&gt;

&lt;h3&gt;
  
  
  What should be recorded in future comparisons?
&lt;/h3&gt;

&lt;p&gt;At minimum: &lt;code&gt;max_tokens&lt;/code&gt;, &lt;code&gt;completion_tokens&lt;/code&gt;, &lt;code&gt;reasoning_tokens&lt;/code&gt;, &lt;code&gt;finish_reason&lt;/code&gt;, visible output length, artifact completeness, and runtime validation.&lt;/p&gt;

&lt;h2&gt;
  
  
  Final verdict
&lt;/h2&gt;

&lt;p&gt;La conclusión práctica: GLM-5.2 puede ser muy rentable y razonar bien, pero necesita control estricto de salida. Claude Fable 5 fue más seguro para respuestas compactas y para entregar un HTML completo.&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>benchmark</category>
    </item>
    <item>
      <title>GLM-5.2 vs Claude Fable 5: orçamento de saída, reasoning_tokens e discount 0.8</title>
      <dc:creator>Jenny Met</dc:creator>
      <pubDate>Mon, 06 Jul 2026 16:12:29 +0000</pubDate>
      <link>https://dev.to/xujfcn/glm-52-vs-claude-fable-5-orcamento-de-saida-reasoningtokens-e-discount-08-5ggp</link>
      <guid>https://dev.to/xujfcn/glm-52-vs-claude-fable-5-orcamento-de-saida-reasoningtokens-e-discount-08-5ggp</guid>
      <description>&lt;h1&gt;
  
  
  GLM-5.2 vs Claude Fable 5: a diferença apareceu no orçamento de saída
&lt;/h1&gt;

&lt;p&gt;Este texto não é um ranking genérico de modelos. No teste real via API, o GLM-5.2 resolveu as tarefas de raciocínio depois que aumentamos o orçamento de saída, mas em limites baixos podia retornar HTTP 200 sem conteúdo visível. O Claude Fable 5 foi mais estável em orçamentos menores e melhor na entrega de um HTML longo e executável.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fgolptcw6d4yigxv738fe.webp" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fgolptcw6d4yigxv738fe.webp" alt="GLM-5.2 vs Claude Fable 5 benchmark" width="800" height="457"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  Por que este teste importa
&lt;/h2&gt;

&lt;p&gt;The test used the Crazyrouter OpenAI-compatible API rather than a chat UI. That matters because the result was not judged only by prose quality. Each response was checked with operational metadata:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;The important fields were &lt;code&gt;max_tokens&lt;/code&gt;, &lt;code&gt;completion_tokens&lt;/code&gt;, &lt;code&gt;reasoning_tokens&lt;/code&gt;, &lt;code&gt;finish_reason&lt;/code&gt;, visible content length, whether the generated HTML was closed, and whether the animation actually moved in a browser.&lt;/p&gt;

&lt;h2&gt;
  
  
  Como o teste foi desenhado
&lt;/h2&gt;

&lt;p&gt;The benchmark deliberately mixed three task types:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th&gt;Purpose&lt;/th&gt;
&lt;th&gt;Reference result&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;MATH-003&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;State-based expectation reasoning&lt;/td&gt;
&lt;td&gt;Expected flips until HH = &lt;code&gt;6&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;PHYS-003&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Momentum plus energy accounting&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;V = 3.0 m/s&lt;/code&gt;, &lt;code&gt;x ≈ 0.148 m&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;CODE-003-ANIM&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Long runnable artifact generation&lt;/td&gt;
&lt;td&gt;Complete 800x500 Canvas animation HTML&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;The first two tasks measured reasoning. The third task measured whether a model can produce a complete artifact, not merely a convincing partial code block.&lt;/p&gt;

&lt;h2&gt;
  
  
  Resultados observados
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th&gt;&lt;code&gt;glm-5.2&lt;/code&gt;&lt;/th&gt;
&lt;th&gt;&lt;code&gt;claude-fable-5&lt;/code&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Math, original budget&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;finish_reason=length&lt;/code&gt;, &lt;code&gt;completion_tokens=1601&lt;/code&gt;, &lt;code&gt;reasoning_tokens=1600&lt;/code&gt;, visible body empty&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;finish_reason=stop&lt;/code&gt;, complete and correct&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Math, retest&lt;/td&gt;
&lt;td&gt;Correct after &lt;code&gt;max_tokens=3200&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Retest not needed&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Physics, original budget&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;finish_reason=length&lt;/code&gt;, visible body empty&lt;/td&gt;
&lt;td&gt;Complete and correct&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Physics, retest&lt;/td&gt;
&lt;td&gt;Correct after &lt;code&gt;max_tokens=8000&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Retest not needed&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Animation, original budget&lt;/td&gt;
&lt;td&gt;Empty visible HTML at &lt;code&gt;max_tokens=3200&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Partial HTML, truncated&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Animation, retest&lt;/td&gt;
&lt;td&gt;Still truncated at &lt;code&gt;max_tokens=8000&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Complete HTML; browser validation passed&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;The most important observation is that GLM-5.2 was not failing the reasoning itself. In the math and physics tasks, it produced correct answers after a larger output budget. The problem was visibility and completion: a request could return HTTP 200 while the user-facing content was empty or incomplete.&lt;/p&gt;

&lt;p&gt;For the long Canvas animation, the difference was sharper. GLM-5.2 produced a visible HTML fragment at &lt;code&gt;max_tokens=8000&lt;/code&gt;, but it stopped inside JavaScript and did not close the file. Claude Fable 5 completed the HTML at &lt;code&gt;max_tokens=8000&lt;/code&gt;; browser validation showed no console errors, an 800x500 canvas, controls, a speed slider, and &lt;code&gt;changedPixels=55090&lt;/code&gt; after 700 ms.&lt;/p&gt;

&lt;h2&gt;
  
  
  Leitura de custo-benefício
&lt;/h2&gt;

&lt;p&gt;No momento da publicação, a pricing API da Crazyrouter retorna &lt;code&gt;discount: 0.8&lt;/code&gt; para &lt;code&gt;glm-5.2&lt;/code&gt;. Isso torna o modelo bem competitivo em custo quando sua aplicação consegue monitorar &lt;code&gt;reasoning_tokens&lt;/code&gt;, &lt;code&gt;finish_reason&lt;/code&gt; e ajustar &lt;code&gt;max_tokens&lt;/code&gt; corretamente.&lt;/p&gt;

&lt;p&gt;This is the practical tradeoff:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Workload&lt;/th&gt;
&lt;th&gt;Better fit from this test&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Short reasoning with enough output budget&lt;/td&gt;
&lt;td&gt;GLM-5.2 can be a cost-effective option&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Low-budget reasoning responses&lt;/td&gt;
&lt;td&gt;Claude Fable 5 was steadier&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Long single-file code generation&lt;/td&gt;
&lt;td&gt;Claude Fable 5 was stronger in this run&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Batch evaluations where metadata is logged&lt;/td&gt;
&lt;td&gt;GLM-5.2 becomes easier to operate safely&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Do not treat the &lt;code&gt;0.8&lt;/code&gt; multiplier as a permanent universal price. It is a pricing-data snapshot from Crazyrouter at publication time and should be checked again before a large deployment.&lt;/p&gt;

&lt;h2&gt;
  
  
  Notas de integração
&lt;/h2&gt;

&lt;p&gt;Minimal request:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl https://cn.crazyrouter.com/v1/chat/completions &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Authorization: Bearer &lt;/span&gt;&lt;span class="nv"&gt;$CRAZYROUTER_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "user",
        "content": "Solve the HH expected-flips problem with state equations."
      }
    ],
    "temperature": 0.2,
    "max_tokens": 3200
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;To compare Claude Fable 5, keep the same payload and change only the model:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"claude-fable-5"&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;For production-style evaluations, log this shape for every request:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"glm-5.2"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"max_tokens"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;3200&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"finish_reason"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"length"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"completion_tokens"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;3200&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"reasoning_tokens"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;3178&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"visible_content_chars"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"html_closed"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="kc"&gt;false&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"browser_validation"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"not_run_incomplete_html"&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;API endpoints should stay clean. Do not add UTM parameters to &lt;code&gt;https://cn.crazyrouter.com/v1&lt;/code&gt;. Use tracking only on human-facing article or registration links.&lt;/p&gt;

&lt;p&gt;Você pode rodar a mesma chamada compatível com OpenAI na Crazyrouter e comparar os modelos nos seus próprios prompts.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://crazyrouter.com/register?utm_source=devto&amp;amp;utm_medium=article&amp;amp;utm_campaign=glm52_fable5_budget_cost_20260706&amp;amp;utm_content=devto_glm-52-vs-claude-fable-5-output-budget-cost-pt_20260706__bottom&amp;amp;utm_term=glm-5.2+claude+fable+5+benchmark" rel="noopener noreferrer"&gt;https://crazyrouter.com/register?utm_source=devto&amp;amp;utm_medium=article&amp;amp;utm_campaign=glm52_fable5_budget_cost_20260706&amp;amp;utm_content=devto_glm-52-vs-claude-fable-5-output-budget-cost-pt_20260706__bottom&amp;amp;utm_term=glm-5.2+claude+fable+5+benchmark&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Did GLM-5.2 fail the reasoning tasks?
&lt;/h3&gt;

&lt;p&gt;No. In this run, GLM-5.2 solved the math task after &lt;code&gt;max_tokens=3200&lt;/code&gt; and the physics task after &lt;code&gt;max_tokens=8000&lt;/code&gt;. The issue was that lower budgets were consumed mostly by reasoning tokens before visible content appeared.&lt;/p&gt;

&lt;h3&gt;
  
  
  Why not score HTTP 200 as success?
&lt;/h3&gt;

&lt;p&gt;Because HTTP 200 only means the API call returned. A benchmark answer can still be unusable if &lt;code&gt;finish_reason=length&lt;/code&gt;, visible content is empty, or generated code is incomplete.&lt;/p&gt;

&lt;h3&gt;
  
  
  Why was the animation task included?
&lt;/h3&gt;

&lt;p&gt;Long code generation exposes a different failure mode. A model can write a convincing first half of a file and still fail if the HTML or JavaScript is cut off.&lt;/p&gt;

&lt;h3&gt;
  
  
  Is GLM-5.2 still worth testing?
&lt;/h3&gt;

&lt;p&gt;Yes. The current &lt;code&gt;0.8&lt;/code&gt; discount multiplier makes it attractive for workloads where you can allocate enough output budget and monitor response metadata.&lt;/p&gt;

&lt;h3&gt;
  
  
  What should be recorded in future comparisons?
&lt;/h3&gt;

&lt;p&gt;At minimum: &lt;code&gt;max_tokens&lt;/code&gt;, &lt;code&gt;completion_tokens&lt;/code&gt;, &lt;code&gt;reasoning_tokens&lt;/code&gt;, &lt;code&gt;finish_reason&lt;/code&gt;, visible output length, artifact completeness, and runtime validation.&lt;/p&gt;

&lt;h2&gt;
  
  
  Final verdict
&lt;/h2&gt;

&lt;p&gt;Conclusão prática: GLM-5.2 é atraente em custo e pode raciocinar bem, mas exige controle de orçamento de saída. Claude Fable 5 foi mais previsível para respostas curtas e para gerar um HTML completo.&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>benchmark</category>
    </item>
    <item>
      <title>GLM-5.2 против Claude Fable 5: лимит вывода, reasoning_tokens и коэффициент discount 0.8</title>
      <dc:creator>Jenny Met</dc:creator>
      <pubDate>Mon, 06 Jul 2026 16:11:49 +0000</pubDate>
      <link>https://dev.to/xujfcn/glm-52-protiv-claude-fable-5-limit-vyvoda-reasoningtokens-i-koeffitsiient-discount-08-4aem</link>
      <guid>https://dev.to/xujfcn/glm-52-protiv-claude-fable-5-limit-vyvoda-reasoningtokens-i-koeffitsiient-discount-08-4aem</guid>
      <description>&lt;h1&gt;
  
  
  GLM-5.2 vs Claude Fable 5: главным фактором оказался лимит вывода
&lt;/h1&gt;

&lt;p&gt;Это не универсальный рейтинг моделей. В этом тесте GLM-5.2 справлялась с задачами на рассуждение после увеличения бюджета вывода, но при низком &lt;code&gt;max_tokens&lt;/code&gt; видимая часть ответа могла быть пустой. Claude Fable 5 чаще завершала ответ компактно и лучше справилась с длинным HTML-артефактом.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fvdzgvw7x0qqz1uffew6u.webp" class="article-body-image-wrapper"&gt;&lt;img src="https://media2.dev.to/dynamic/image/width=800%2Cheight=%2Cfit=scale-down%2Cgravity=auto%2Cformat=auto/https%3A%2F%2Fdev-to-uploads.s3.us-east-2.amazonaws.com%2Fuploads%2Farticles%2Fvdzgvw7x0qqz1uffew6u.webp" alt="GLM-5.2 vs Claude Fable 5 benchmark" width="800" height="457"&gt;&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  Почему этот тест важен
&lt;/h2&gt;

&lt;p&gt;The test used the Crazyrouter OpenAI-compatible API rather than a chat UI. That matters because the result was not judged only by prose quality. Each response was checked with operational metadata:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight plaintext"&gt;&lt;code&gt;Base URL: https://cn.crazyrouter.com/v1
Endpoint: POST /v1/chat/completions
Models: glm-5.2, claude-fable-5
temperature: 0.2
Test date: 2026-07-06
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;The important fields were &lt;code&gt;max_tokens&lt;/code&gt;, &lt;code&gt;completion_tokens&lt;/code&gt;, &lt;code&gt;reasoning_tokens&lt;/code&gt;, &lt;code&gt;finish_reason&lt;/code&gt;, visible content length, whether the generated HTML was closed, and whether the animation actually moved in a browser.&lt;/p&gt;

&lt;h2&gt;
  
  
  Что проверялось
&lt;/h2&gt;

&lt;p&gt;The benchmark deliberately mixed three task types:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th&gt;Purpose&lt;/th&gt;
&lt;th&gt;Reference result&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;MATH-003&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;State-based expectation reasoning&lt;/td&gt;
&lt;td&gt;Expected flips until HH = &lt;code&gt;6&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;PHYS-003&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Momentum plus energy accounting&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;V = 3.0 m/s&lt;/code&gt;, &lt;code&gt;x ≈ 0.148 m&lt;/code&gt;
&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;&lt;code&gt;CODE-003-ANIM&lt;/code&gt;&lt;/td&gt;
&lt;td&gt;Long runnable artifact generation&lt;/td&gt;
&lt;td&gt;Complete 800x500 Canvas animation HTML&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;The first two tasks measured reasoning. The third task measured whether a model can produce a complete artifact, not merely a convincing partial code block.&lt;/p&gt;

&lt;h2&gt;
  
  
  Наблюдаемые результаты
&lt;/h2&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Task&lt;/th&gt;
&lt;th&gt;&lt;code&gt;glm-5.2&lt;/code&gt;&lt;/th&gt;
&lt;th&gt;&lt;code&gt;claude-fable-5&lt;/code&gt;&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Math, original budget&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;finish_reason=length&lt;/code&gt;, &lt;code&gt;completion_tokens=1601&lt;/code&gt;, &lt;code&gt;reasoning_tokens=1600&lt;/code&gt;, visible body empty&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;finish_reason=stop&lt;/code&gt;, complete and correct&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Math, retest&lt;/td&gt;
&lt;td&gt;Correct after &lt;code&gt;max_tokens=3200&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Retest not needed&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Physics, original budget&lt;/td&gt;
&lt;td&gt;
&lt;code&gt;finish_reason=length&lt;/code&gt;, visible body empty&lt;/td&gt;
&lt;td&gt;Complete and correct&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Physics, retest&lt;/td&gt;
&lt;td&gt;Correct after &lt;code&gt;max_tokens=8000&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Retest not needed&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Animation, original budget&lt;/td&gt;
&lt;td&gt;Empty visible HTML at &lt;code&gt;max_tokens=3200&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Partial HTML, truncated&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Animation, retest&lt;/td&gt;
&lt;td&gt;Still truncated at &lt;code&gt;max_tokens=8000&lt;/code&gt;
&lt;/td&gt;
&lt;td&gt;Complete HTML; browser validation passed&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;The most important observation is that GLM-5.2 was not failing the reasoning itself. In the math and physics tasks, it produced correct answers after a larger output budget. The problem was visibility and completion: a request could return HTTP 200 while the user-facing content was empty or incomplete.&lt;/p&gt;

&lt;p&gt;For the long Canvas animation, the difference was sharper. GLM-5.2 produced a visible HTML fragment at &lt;code&gt;max_tokens=8000&lt;/code&gt;, but it stopped inside JavaScript and did not close the file. Claude Fable 5 completed the HTML at &lt;code&gt;max_tokens=8000&lt;/code&gt;; browser validation showed no console errors, an 800x500 canvas, controls, a speed slider, and &lt;code&gt;changedPixels=55090&lt;/code&gt; after 700 ms.&lt;/p&gt;

&lt;h2&gt;
  
  
  Стоимость и практическая выгода
&lt;/h2&gt;

&lt;p&gt;На момент публикации pricing API Crazyrouter возвращает для &lt;code&gt;glm-5.2&lt;/code&gt; значение &lt;code&gt;discount: 0.8&lt;/code&gt;. Поэтому модель выглядит очень конкурентной по цене, если в вашей интеграции есть контроль &lt;code&gt;reasoning_tokens&lt;/code&gt;, &lt;code&gt;finish_reason&lt;/code&gt; и достаточного &lt;code&gt;max_tokens&lt;/code&gt;.&lt;/p&gt;

&lt;p&gt;This is the practical tradeoff:&lt;/p&gt;

&lt;div class="table-wrapper-paragraph"&gt;&lt;table&gt;
&lt;thead&gt;
&lt;tr&gt;
&lt;th&gt;Workload&lt;/th&gt;
&lt;th&gt;Better fit from this test&lt;/th&gt;
&lt;/tr&gt;
&lt;/thead&gt;
&lt;tbody&gt;
&lt;tr&gt;
&lt;td&gt;Short reasoning with enough output budget&lt;/td&gt;
&lt;td&gt;GLM-5.2 can be a cost-effective option&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Low-budget reasoning responses&lt;/td&gt;
&lt;td&gt;Claude Fable 5 was steadier&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Long single-file code generation&lt;/td&gt;
&lt;td&gt;Claude Fable 5 was stronger in this run&lt;/td&gt;
&lt;/tr&gt;
&lt;tr&gt;
&lt;td&gt;Batch evaluations where metadata is logged&lt;/td&gt;
&lt;td&gt;GLM-5.2 becomes easier to operate safely&lt;/td&gt;
&lt;/tr&gt;
&lt;/tbody&gt;
&lt;/table&gt;&lt;/div&gt;

&lt;p&gt;Do not treat the &lt;code&gt;0.8&lt;/code&gt; multiplier as a permanent universal price. It is a pricing-data snapshot from Crazyrouter at publication time and should be checked again before a large deployment.&lt;/p&gt;

&lt;h2&gt;
  
  
  Интеграционные заметки
&lt;/h2&gt;

&lt;p&gt;Minimal request:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight shell"&gt;&lt;code&gt;curl https://cn.crazyrouter.com/v1/chat/completions &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Authorization: Bearer &lt;/span&gt;&lt;span class="nv"&gt;$CRAZYROUTER_API_KEY&lt;/span&gt;&lt;span class="s2"&gt;"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-H&lt;/span&gt; &lt;span class="s2"&gt;"Content-Type: application/json"&lt;/span&gt; &lt;span class="se"&gt;\&lt;/span&gt;
  &lt;span class="nt"&gt;-d&lt;/span&gt; &lt;span class="s1"&gt;'{
    "model": "glm-5.2",
    "messages": [
      {
        "role": "user",
        "content": "Solve the HH expected-flips problem with state equations."
      }
    ],
    "temperature": 0.2,
    "max_tokens": 3200
  }'&lt;/span&gt;
&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;To compare Claude Fable 5, keep the same payload and change only the model:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"claude-fable-5"&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;For production-style evaluations, log this shape for every request:&lt;br&gt;
&lt;/p&gt;

&lt;div class="highlight js-code-highlight"&gt;
&lt;pre class="highlight json"&gt;&lt;code&gt;&lt;span class="p"&gt;{&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"model"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"glm-5.2"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"max_tokens"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;3200&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"finish_reason"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"length"&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"completion_tokens"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;3200&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"reasoning_tokens"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;3178&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"visible_content_chars"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="mi"&gt;0&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"html_closed"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="kc"&gt;false&lt;/span&gt;&lt;span class="p"&gt;,&lt;/span&gt;&lt;span class="w"&gt;
  &lt;/span&gt;&lt;span class="nl"&gt;"browser_validation"&lt;/span&gt;&lt;span class="p"&gt;:&lt;/span&gt;&lt;span class="w"&gt; &lt;/span&gt;&lt;span class="s2"&gt;"not_run_incomplete_html"&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;span class="p"&gt;}&lt;/span&gt;&lt;span class="w"&gt;
&lt;/span&gt;&lt;/code&gt;&lt;/pre&gt;

&lt;/div&gt;



&lt;p&gt;API endpoints should stay clean. Do not add UTM parameters to &lt;code&gt;https://cn.crazyrouter.com/v1&lt;/code&gt;. Use tracking only on human-facing article or registration links.&lt;/p&gt;

&lt;p&gt;Тот же OpenAI-compatible запрос можно запустить через Crazyrouter и проверить обе модели на своих задачах.&lt;/p&gt;

&lt;p&gt;&lt;a href="https://crazyrouter.com/register?utm_source=devto&amp;amp;utm_medium=article&amp;amp;utm_campaign=glm52_fable5_budget_cost_20260706&amp;amp;utm_content=devto_glm-52-vs-claude-fable-5-output-budget-cost-ru_20260706__bottom&amp;amp;utm_term=glm-5.2+claude+fable+5+benchmark" rel="noopener noreferrer"&gt;https://crazyrouter.com/register?utm_source=devto&amp;amp;utm_medium=article&amp;amp;utm_campaign=glm52_fable5_budget_cost_20260706&amp;amp;utm_content=devto_glm-52-vs-claude-fable-5-output-budget-cost-ru_20260706__bottom&amp;amp;utm_term=glm-5.2+claude+fable+5+benchmark&lt;/a&gt;&lt;/p&gt;

&lt;h2&gt;
  
  
  FAQ
&lt;/h2&gt;

&lt;h3&gt;
  
  
  Did GLM-5.2 fail the reasoning tasks?
&lt;/h3&gt;

&lt;p&gt;No. In this run, GLM-5.2 solved the math task after &lt;code&gt;max_tokens=3200&lt;/code&gt; and the physics task after &lt;code&gt;max_tokens=8000&lt;/code&gt;. The issue was that lower budgets were consumed mostly by reasoning tokens before visible content appeared.&lt;/p&gt;

&lt;h3&gt;
  
  
  Why not score HTTP 200 as success?
&lt;/h3&gt;

&lt;p&gt;Because HTTP 200 only means the API call returned. A benchmark answer can still be unusable if &lt;code&gt;finish_reason=length&lt;/code&gt;, visible content is empty, or generated code is incomplete.&lt;/p&gt;

&lt;h3&gt;
  
  
  Why was the animation task included?
&lt;/h3&gt;

&lt;p&gt;Long code generation exposes a different failure mode. A model can write a convincing first half of a file and still fail if the HTML or JavaScript is cut off.&lt;/p&gt;

&lt;h3&gt;
  
  
  Is GLM-5.2 still worth testing?
&lt;/h3&gt;

&lt;p&gt;Yes. The current &lt;code&gt;0.8&lt;/code&gt; discount multiplier makes it attractive for workloads where you can allocate enough output budget and monitor response metadata.&lt;/p&gt;

&lt;h3&gt;
  
  
  What should be recorded in future comparisons?
&lt;/h3&gt;

&lt;p&gt;At minimum: &lt;code&gt;max_tokens&lt;/code&gt;, &lt;code&gt;completion_tokens&lt;/code&gt;, &lt;code&gt;reasoning_tokens&lt;/code&gt;, &lt;code&gt;finish_reason&lt;/code&gt;, visible output length, artifact completeness, and runtime validation.&lt;/p&gt;

&lt;h2&gt;
  
  
  Final verdict
&lt;/h2&gt;

&lt;p&gt;Практический вывод: GLM-5.2 интересна по стоимости и способна решать задачи, но требует внимательного контроля бюджета вывода. Claude Fable 5 оказалась стабильнее для коротких ответов и полного HTML-файла.&lt;/p&gt;

</description>
      <category>ai</category>
      <category>api</category>
      <category>llm</category>
      <category>benchmark</category>
    </item>
  </channel>
</rss>
