DEV Community

Cover image for So sánh Gemini 3.8 Flash, Claude Fable 5.1 và GPT-5.6 Sol: API nào nhà phát triển nên chọn?
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

So sánh Gemini 3.8 Flash, Claude Fable 5.1 và GPT-5.6 Sol: API nào nhà phát triển nên chọn?

Gemini 3.8 Flash vs Claude Fable 5.1 vs GPT-5.6 Sol: So sánh hiệu năng và chi phí API

Ba API tiên phong đã được phát hành hoặc điều chỉnh giá trong vòng một tuần, chia thành ba phân khúc rõ rệt. Google phát hành Gemini 3.8 Flash ngày 2 tháng 9 năm 2026 với giá 0,75 USD cho mỗi triệu token đầu vào3,75 USD cho mỗi triệu token đầu ra. Một ngày trước đó, Anthropic phát hành Claude Fable 5.1 với giá 10 USD / 50 USD. GPT-5.6 Sol của OpenAI nằm giữa với giá 5 USD / 30 USD.

Trên Intelligence Index độc lập của Artificial Analysis, ba mô hình lần lượt đạt 59, 57 và 59 điểm. Tóm lại: Gemini 3.8 Flash có giá chỉ khoảng một phần mười ba so với mô hình cao cấp nhất nhưng vẫn đạt điểm tương đương trên cùng một chỉ số.

Dùng thử Apidog ngay

Tuy nhiên, “điểm số” và “hóa đơn” đo hai thứ khác nhau. Bài kiểm tra đếm số câu trả lời hoàn thành trên mỗi tác vụ, còn hóa đơn tính số token. Gemini 3.8 Flash được thiết kế để sử dụng nhiều token hơn cho các tác vụ phức tạp.

Bài viết này so sánh ba mô hình về:

  • Thông số kỹ thuật.
  • Benchmark do Google công bố.
  • Số liệu độc lập từ Artificial Analysis.
  • Chi phí theo token và theo tác vụ.
  • Khối lượng công việc phù hợp với từng API.

Xem thêm bài phân tích Gemini 3.8 Flashbài đăng ra mắt của Google để đọc nguồn chi tiết.

Lưu ý về thời điểm: Bài so sánh Gemini 3.7 Flash vs Claude vs GPT từ tháng 8 sử dụng Claude Fable 5, không phải 5.1. Anthropic thay thế mô hình này vào ngày 1 tháng 9, nên đây là một tổ hợp so sánh mới.

Thông số kỹ thuật

Thông số Gemini 3.8 Flash Claude Fable 5.1 GPT-5.6 Sol
Nhà cung cấp Google Anthropic OpenAI
Cửa sổ ngữ cảnh 1.048.576 token 1M token 1M token
Đầu ra tối đa 65.536 token 128K token 128K token
Giá đầu vào / 1M token 0,75 USD giới thiệu; 1,50 USD từ 01/01/2027 10 USD 5 USD
Giá đầu ra / 1M token 3,75 USD giới thiệu; 7,50 USD từ 01/01/2027 50 USD 30 USD
Đọc bộ nhớ đệm / 1M token 0,075 USD giới thiệu; 0,15 USD từ 01/01/2027 0,25 USD 0,50 USD
Cắt giảm kiến thức Tháng 3/2026 Tháng 6/2026 Không được liệt kê
Kiểm soát suy luận thinking_level: thấp / trung bình / cao; trung bình mặc định Suy luận mở rộng, luôn bật Mức độ nỗ lực đến xhigh
Artificial Analysis 59 điểm ở mức cao 57 điểm ở mức trung bình 59 điểm ở mức xhigh

Hai điểm cần chú ý trước khi xem benchmark:

  1. Gemini 3.8 Flash có giới hạn đầu ra bằng một nửa hai mô hình còn lại: 65.536 so với 128K token. Điều này quan trọng với tài liệu dài trong một lần chạy, nhưng ít ảnh hưởng hơn với các vòng lặp tác tử tạo ra từng bước ngắn.
  2. Giá giới thiệu của Gemini kết thúc ngày 31/12/2026. Từ ngày 01/01/2027, cả giá đầu vào và đầu ra đều tăng gấp đôi.

Xem hướng dẫn định giá Gemini 3.8 Flash để biết thêm về bộ nhớ đệm, xử lý hàng loạt và tỷ lệ nền tảng.

Số liệu độc lập: 59, 57 và 59

Artificial Analysis chạy cùng chín bài đánh giá trên mọi mô hình và công bố điểm Intelligence Index:

  • Gemini 3.8 Flash, mức suy luận cao: 59 điểm.
  • GPT-5.6 Sol, mức nỗ lực xhigh: 59 điểm.
  • Claude Fable 5.1, mức nỗ lực trung bình: 57 điểm.

Gemini 3.8 Flash tăng từ 56 điểm của Gemini 3.7 Flash và 52 điểm của Gemini 3.6 Flash. Các mô hình khác đạt 59 điểm gồm Grok 4.6 ở mức trung bình. Claude Fable 5.1 ở mức trung bình cũng ngang bằng GPT-5.6 Terra ở mức tối đa và Muse Spark 1.2 ở mức xhigh.

Đừng bỏ qua mức suy luận

Fable 5.1 được thử nghiệm ở mức trung bình, không phải mức cao nhất. Sol được thử nghiệm ở xhigh, mức cao nhất của nó. Vì vậy, chênh lệch hai điểm không thể được xem là một bảng xếp hạng công bằng giữa các cấu hình khác nhau.

Kết luận thận trọng hơn là: ở các cấu hình đã thử nghiệm, Gemini 3.8 Flash đạt điểm tương đương hai mô hình cao cấp và là mô hình rẻ nhất trong nhóm đạt 59 điểm.

Chi phí thực tế trên Artificial Analysis

Artificial Analysis cũng đo chi phí để đạt điểm số đó:

  • Gemini 3.8 Flash mức cao sử dụng trung bình 48.000 token đầu ra mỗi tác vụ.
  • Con số này cao hơn 30% so với Gemini 3.7 Flash.
  • Chi phí API trung bình: 0,58 USD mỗi tác vụ.
  • Thời gian mỗi tác vụ: 2,5 phút.
  • Tốc độ đầu ra: khoảng 300 token/giây.
  • Thời gian đến token đầu tiên: 13,3 giây.
  • Điểm trên τ³-Banking, benchmark sử dụng công cụ: 45%, cao hơn Gemini 3.7 Flash 12 điểm phần trăm.

Vì vậy, mức giá mỗi token rất thấp không đồng nghĩa chi phí mỗi tác vụ cũng thấp tương ứng.

Benchmark của Google và phần còn thiếu

Trang Gemini Flash của Google công bố ba hàng benchmark so sánh nhiều nhà cung cấp. Claude Fable 5.1 không xuất hiện vì được phát hành một ngày sau khi bảng được công bố.

Cột Anthropic dưới đây là Claude Opus 5Claude Sonnet 5, không phải Fable 5.1:

Benchmark do Google thực hiện Gemini 3.8 Flash Claude Opus 5 Claude Sonnet 5 GPT-5.6 Sol GPT-5.6 Terra
HLE-Verified 54,9% 54,4% 31,0% 54,5% 51,1%
Vals Finance Agent v2 61,4% 58,6% 53,9% 53,8% 54,4%
Harvey Legal Agent Benchmark 10,0% 6,7% 5,0% 2,5% 0,8%

Cách đọc các kết quả

  • HLE-Verified: Gần như hòa ba chiều giữa Gemini 3.8 Flash, Opus 5 và Sol. Ba mô hình lần lượt đạt 54,9%, 54,4% và 54,5%.
  • Vals Finance Agent v2: Gemini 3.8 Flash dẫn đầu, cao hơn Opus 5 2,8 điểm và Sol 7,6 điểm.
  • Harvey Legal: Tất cả mô hình đều dưới 11%, vì vậy thứ tự quan trọng hơn khoảng cách tuyệt đối.

Google không công bố dưới dạng văn bản các số liệu cho:

  • SWE-Bench Pro.
  • Terminal-bench.
  • OSWorld.
  • DeepSWE v1.1 — chỉ có tuyên bố Gemini 3.8 Flash “vượt trội hơn hầu hết các mô hình tiên phong lớn hơn” với “một phần nhỏ chi phí”, còn con số nằm trong hình ảnh.

Các benchmark mã hóa và sử dụng máy tính của Anthropic và OpenAI cũng không chạy mô hình đối thủ. Do đó, Artificial Analysis vẫn là nguồn duy nhất trong bài này cung cấp so sánh trực tiếp giữa cả ba mô hình.

Bạn có thể xem thêm benchmark Claude Fable 5.1benchmark GPT-5.6 Sol.

So sánh giá theo từng dòng

Ở mức giá giới thiệu:

  • Giá đầu vào của Fable 5.1 cao 13,3 lần Gemini 3.8 Flash.
  • Giá đầu ra của Fable 5.1 cũng cao 13,3 lần.
  • Sol cao 6,7 lần Gemini ở đầu vào.
  • Sol cao 8 lần Gemini ở đầu ra.
  • Đọc bộ nhớ đệm của Fable 5.1 là 0,25 USD, cao 3,3 lần Gemini.
  • Đọc bộ nhớ đệm của Sol là 0,50 USD, cao 6,7 lần Gemini.
  • Fable 5.1 là trường hợp duy nhất mà mô hình có giá niêm yết cao nhất không có phí đọc bộ nhớ đệm cao nhất.

Ví dụ: 1 triệu token đầu vào và 200.000 token đầu ra

Giả sử toàn bộ token không được lưu vào bộ nhớ đệm:

  • Gemini 3.8 Flash: 0,75 USD + 0,75 USD = 1,50 USD
  • GPT-5.6 Sol: 5,00 USD + 6,00 USD = 11,00 USD
  • Claude Fable 5.1: 10,00 USD + 10,00 USD = 20,00 USD

Từ ngày 01/01/2027, cùng một lần chạy Gemini có giá:

  • 1,50 USD đầu vào.
  • 1,50 USD đầu ra.
  • Tổng cộng 3,00 USD.

Khi đó, Gemini vẫn rẻ hơn Sol 3,7 lần và Fable 5.1 6,7 lần. Việc tăng giá cũng áp dụng cho Gemini 3.6 Flash và 3.7 Flash, nên không còn phiên bản Gemini Flash rẻ hơn để chuyển sang.

Tham khảo bảng giá Anthropic, hướng dẫn định giá Claude Fable 5.1hướng dẫn định giá GPT-5.6.

Hãy tính chi phí mỗi tác vụ, không chỉ mỗi token

Google cho biết Gemini 3.8 Flash có thể sử dụng nhiều token hơn và chạy lâu hơn cho các tác vụ phức tạp. Mô hình chia nhỏ quá trình suy luận, tự kiểm tra kết quả và gọi công cụ nhiều lần.

Artificial Analysis đo được:

Cấu hình Gemini 3.8 Flash Chi phí trung bình mỗi tác vụ
Cao 0,58 USD
Trung bình 0,41 USD
Thấp 0,24 USD

Ở mức cao, mô hình sử dụng khoảng 48.000 token đầu ra mỗi tác vụ. Chi phí của Gemini 3.7 Flash là 0,40 USD mỗi tác vụ, còn 3.8 Flash là 0,58 USD, dù giá mỗi token không đổi.

Điều này dẫn đến hai hệ quả:

  1. Khoảng cách 13,3 lần mỗi token không nhất thiết trở thành khoảng cách hóa đơn 13,3 lần. Mô hình cao cấp có thể hoàn thành tác vụ bằng ít token hoặc ít lượt gọi công cụ hơn.
  2. Trên Gemini, thinking_level là một đòn bẩy chi phí quan trọng. Trong bộ dữ liệu của Artificial Analysis, giảm từ mức cao xuống thấp đã giảm hơn một nửa chi phí mỗi tác vụ.

Artificial Analysis chưa công bố số liệu chi phí mỗi tác vụ tương đương cho Fable 5.1 và Sol trong phần dữ liệu được sử dụng ở đây. Hãy đo trực tiếp trên các prompt của bạn trước khi áp dụng bất kỳ hệ số nhân nào.

Xem thêm hướng dẫn các cấp độ suy luận Geminiso sánh Gemini 3.8 Flash với 3.7 Flash. Trong một số trường hợp, Gemini 3.7 Flash vẫn phù hợp hơn vì chi phí mỗi tác vụ thấp hơn 31%.

Nên chọn mô hình nào?

Chọn Gemini 3.8 Flash cho khối lượng lớn và tác tử tiết kiệm chi phí

Gemini 3.8 Flash là lựa chọn mặc định nếu bạn chạy hàng nghìn tác vụ tác tử mỗi ngày. Mô hình:

  • Đạt điểm tương đương các mô hình cao cấp trên chỉ số độc lập.
  • Dẫn đầu các benchmark tài chính và pháp lý của Google.
  • Có giá mỗi token thấp hơn đáng kể, ngay cả sau khi tăng giá.
  • Hỗ trợ tự nhiên video, âm thanh và PDF.
  • Có Batch giảm 50%.
  • Bao gồm 5.000 yêu cầu nền tảng Google Search miễn phí mỗi tháng.
  • Có cấp miễn phí để tạo nguyên mẫu.

Đánh đổi:

  • Chỉ tạo đầu ra văn bản.
  • Không có Live API.
  • Giới hạn đầu ra 65.536 token.
  • Có thể tiêu thụ nhiều token suy luận hơn dự kiến.

Chọn Claude Fable 5.1 cho suy luận khó và ngữ cảnh dài

Fable 5.1 phù hợp để nâng cấp sau khi các mô hình rẻ hơn không đạt yêu cầu. Hãy cân nhắc mô hình này cho:

  • Tác tử nghiên cứu chạy nhiều giờ.
  • Phiên terminal dài.
  • Chuỗi suy luận mà lỗi có chi phí cao hơn tiền token.
  • Tác vụ cần đầu ra đến 128K token.
  • Vòng lặp tác tử tái sử dụng cùng một ngữ cảnh lớn.

Phí đọc bộ nhớ đệm 0,25 USD giúp giảm đáng kể chi phí hiệu dụng trong các phiên sử dụng lại tiền tố lớn. Xem Claude Fable 5.1 là gì để biết thêm thông số.

Chọn GPT-5.6 Sol nếu hệ sinh thái của bạn là OpenAI

Sol đạt 59 điểm ở mức xhigh, ngang Gemini 3.8 Flash trên HLE-Verified, đồng thời cung cấp đầu ra 128K token với giá 5 USD / 30 USD.

Sol phù hợp khi:

  • Tác tử, đánh giá và công cụ của bạn đã nằm trong OpenAI.
  • Bạn muốn một mô hình cao cấp mà không cần thêm nhà cung cấp.
  • Phần lớn lần chạy sử dụng ngữ cảnh mới.

Sol có phí đọc bộ nhớ đệm cao nhất trong ba mô hình, nên kém phù hợp hơn với các phiên dài tái sử dụng nhiều ngữ cảnh. Xem so sánh Grok 4.6, GPT-5.6 và Claude Fable 5 để biết thêm.

Kiểm thử cả ba API trong Apidog

Cuối cùng, hãy đo lường trên prompt thực tế của bạn thay vì chỉ dựa vào giá niêm yết.

Apidog là ứng dụng khách API và nền tảng kiểm thử. Apidog không chạy các mô hình này, nhưng cho phép gửi cùng một request đến cả ba nhà cung cấp và so sánh kết quả.

1. Tạo ba môi trường

Tạo một project với ba environment:

  • Google: https://generativelanguage.googleapis.com và biến GEMINI_API_KEY.
  • Anthropic: base URL của Anthropic và biến khóa Claude.
  • OpenAI: base URL của OpenAI và biến khóa OpenAI.

Lưu khóa trong biến môi trường, không đặt trực tiếp trong request body hoặc collection được chia sẻ.

2. Gửi cùng một prompt

Tạo một kịch bản gồm ba request dùng cùng một prompt. Request Gemini:

POST /v1beta/interactions
Enter fullscreen mode Exit fullscreen mode
{
  "model": "gemini-3.8-flash",
  "thinking_level": "medium"
}
Enter fullscreen mode Exit fullscreen mode

Hai request còn lại gửi đến chat hoặc message endpoint tương ứng của Anthropic và OpenAI.

3. Thêm assertion để kiểm soát chi phí

Trên mỗi request, thêm các assertion sau:

  • HTTP status là 200.
  • Một JSON path xác nhận câu trả lời tồn tại.
  • Giới hạn trên cho trường sử dụng token.

Với endpoint cũ của Gemini, trường cần theo dõi là:

usageMetadata.thoughtsTokenCount
Enter fullscreen mode Exit fullscreen mode

Với Anthropic và OpenAI, xác nhận trường usage tương đương của từng API. Nếu một mô hình đột nhiên tăng gấp đôi số token suy luận, test phải thất bại rõ ràng.

4. Chạy định kỳ

Chạy collection với một bộ prompt chuẩn, sau đó lên lịch chạy hằng ngày. Khi nhà cung cấp thay đổi mặc định hoặc mô hình bắt đầu tiêu tốn nhiều token hơn, assertion sẽ cảnh báo trước khi hóa đơn tăng.

Câu hỏi thường gặp

Gemini 3.8 Flash có tốt hơn Claude Fable 5.1 không?

Trên Intelligence Index của Artificial Analysis, Gemini 3.8 Flash ở mức cao đạt 59 điểm, còn Fable 5.1 ở mức trung bình đạt 57 điểm. Hai mô hình gần tương đương ở các cấu hình đã thử nghiệm.

Tuy nhiên, benchmark của Google không bao gồm Fable 5.1 và benchmark của Anthropic không bao gồm Gemini 3.8 Flash, nên chưa có đối đầu trực tiếp trên một bộ benchmark rộng hơn. Ở mức giá giới thiệu, Gemini rẻ hơn Fable 5.1 13,3 lần mỗi token.

Mô hình nào rẻ nhất cho khối lượng công việc tác tử?

Gemini 3.8 Flash rẻ nhất theo token, với giá 0,75 USD / 3,75 USD đến ngày 31/12/2026. Artificial Analysis đo được chi phí mỗi tác vụ là:

  • 0,58 USD ở mức cao.
  • 0,41 USD ở mức trung bình.
  • 0,24 USD ở mức thấp.

Hãy đo chi phí trên mỗi tác vụ hoàn thành, không chỉ giá mỗi token, trước khi quyết định.

Cả ba có cửa sổ ngữ cảnh 1 triệu token không?

Có:

  • Gemini 3.8 Flash: 1.048.576 token.
  • Claude Fable 5.1: 1M token.
  • GPT-5.6 Sol: 1M token.

Giới hạn đầu ra khác nhau: Gemini tối đa 65.536 token, còn Fable 5.1 và Sol tối đa 128K token.

Vì sao Claude Fable 5.1 không có trong benchmark của Google?

Google công bố các cột Claude Opus 5 và Claude Sonnet 5. Fable 5.1 được phát hành ngày 1 tháng 9, một ngày trước Gemini 3.8 Flash, nên không kịp xuất hiện trong bảng.

Để xem số liệu do Anthropic tự chạy, đọc so sánh Claude Fable 5.1 với Opus 5.

Lợi thế giá của Gemini có còn sau năm 2027 không?

Có, nhưng nhỏ hơn. Từ ngày 01/01/2027, Gemini chuyển sang giá 1,50 USD / 7,50 USD:

  • Fable 5.1 đắt hơn 6,7 lần ở cả đầu vào và đầu ra.
  • Sol đắt hơn 3,3 lần ở đầu vào.
  • Sol đắt hơn 4 lần ở đầu ra.

Gemini vẫn rẻ hơn, nhưng khoảng cách giảm khoảng một nửa.

Nên gọi mô hình nào trước?

Bắt đầu với Gemini 3.8 Flash cho các tác vụ khối lượng lớn. Đặt thinking_level cho từng tuyến và theo dõi token trên mỗi tác vụ.

Nâng cấp lên Claude Fable 5.1 khi các mô hình rẻ hơn không đạt yêu cầu, đặc biệt nếu tác tử tái sử dụng ngữ cảnh qua nhiều lượt. Chọn GPT-5.6 Sol khi phần còn lại của hệ thống đã dùng OpenAI.

Dù chọn mô hình nào, hãy gửi cùng một bộ prompt qua cả ba trong một kịch bản kiểm thử. Giá niêm yết là dữ liệu công khai; chi phí thực tế trên prompt của bạn phải được đo lường.

Tài liệu tham khảo

Top comments (0)