Grok 4.6 ra mắt vào ngày 12 tháng 8 với tuyên bố định hình lại quyết định về mô hình tiên phong: khả năng thông minh ngang ngửa GPT-5.6 Sol trên Chỉ số Phân tích Nhân tạo, với giá 6 đô la cho mỗi triệu token đầu ra thay vì 30 đô la. Hầu hết các bài viết so sánh bạn sẽ tìm thấy vẫn đánh giá Grok 4.5, vốn bị tụt hậu đáng kể so với mô hình tiên phong đến mức giá không còn quan trọng. Tình hình không còn như vậy nữa, vì vậy bài so sánh này bắt đầu lại với các số liệu của 4.6.
Câu trả lời ngắn gọn: GPT-5.6 Sol vẫn là lựa chọn mạnh mẽ nhất cho các tác nhân mã hóa quy mô kho lưu trữ, Claude Fable 5 dẫn đầu công việc tự động hóa dài hạn trong gang tấc, và Grok 4.6 hiện là lựa chọn giá trị có khả năng đủ gần để khiến hai lựa chọn kia phải biện minh cho mức giá của chúng. Lựa chọn đúng đắn phụ thuộc vào khối lượng công việc của bạn, vì vậy dưới đây là các con số, các cân nhắc về API và một cách có thể tái tạo để kiểm tra cả ba trên ngăn xếp của riêng bạn. Nếu bạn muốn chạy thử nghiệm đó ngay hôm nay, Apidog cho phép bạn truy cập cả ba API song song từ một không gian làm việc, miễn phí.
TL;DR
- Chỉ số thông minh: Claude Fable 5 dẫn đầu ở mức 62; Grok 4.6 và GPT-5.6 Sol hòa ở mức 61.
- Giá đầu ra trên mỗi 1 triệu token: Grok 4.6 ở mức 6 đô la, Claude Opus 4.8 ở mức 25 đô la, GPT-5.6 Sol ở mức 30 đô la — chênh lệch gấp 5 lần.
- Context: GPT-5.6 Sol 1,05M token, Claude Fable 5 1M, Grok 4.6 500K.
- Mã hóa: Sol Max dẫn đầu DeepSWE (73,0% so với 65,9% của Grok); Fable 5 Max dẫn đầu FrontierCode (63,6% so với 61,3%).
- Tác nhân: Fable 5 Max dẫn đầu APEX-Agents ở mức 59,2%; Grok 4.6 (57,5%) vượt Sol Max (56,7%).
- Chi phí trên mỗi tác vụ hoàn thành: Grok 4.6 được Artificial Analysis đo ở mức 0,84 đô la — thấp nhất trong số các mô hình tiên phong.
- Đừng chỉ dựa vào benchmark: hãy chạy bài kiểm tra 20 prompt trên chính khối lượng công việc của bạn.
Thông số kỹ thuật và giá cả song song
| Grok 4.6 | GPT-5.6 Sol | Claude Fable 5 | |
|---|---|---|---|
| Nhà phát triển | xAI | OpenAI | Anthropic |
| Chỉ số thông minh | 61 | 61 | 62 |
| Cửa sổ ngữ cảnh | 500K | 1,05M | 1M |
| Giá đầu vào / 1M | $2 | $12 | $10 |
| Giá đầu ra / 1M | $6 | $30 | $25* |
| Biến thể nhanh/cao cấp | Giá gấp 2 lần | Phiên bản Sol Max | Phiên bản Fable 5 Max |
| Phong cách API | Tương thích OpenAI | OpenAI gốc | Tin nhắn Anthropic |
| Cắt giảm kiến thức | Tháng 2 năm 2026 |
* Giá Claude hiển thị cho Opus 4.8; giá phiên bản Fable 5 thay đổi tùy theo cài đặt nỗ lực. Xem hướng dẫn giá GPT-5.6 và phân tích giảm chi phí Claude để biết các ma trận đầy đủ.
Sự bất đối xứng về giá là điểm đáng chú ý. Ở phía đầu vào, Grok tính phí bằng một phần sáu so với OpenAI; ở phía đầu ra là một phần năm. Đối với khối lượng công việc trò chuyện thì điều này rất tốt; đối với khối lượng công việc tác nhân, nơi một tác vụ duy nhất có thể tạo ra hàng tá lệnh gọi mô hình và bản ghi sử dụng công cụ dài, điều này cộng dồn thành sự khác biệt giữa tác nhân 50 đô la/ngày và 250 đô la/ngày.
Điểm chuẩn mã hóa: Sol cho độ sâu, Grok cho giá trị
Dựa trên các con số ra mắt, mỗi mô hình đều có lãnh thổ riêng:
| Điểm chuẩn | Grok 4.6 | GPT-5.6 Sol Max | Claude Fable 5 Max |
|---|---|---|---|
| DeepSWE v1.1 (sửa lỗi quy mô kho lưu trữ) | 65,9% | 73,0% | |
| FrontierCode v1.1 Mở rộng | 61,3% | 60,6% | 63,6% |
| CursorBench v3.2 | 69,9% | ||
| APEX-Agents | 57,5% | 56,7% | 59,2% |
| Terminal-Bench v2.1 | 88,4% |
Diễn giải các số liệu này như sau:
- GPT-5.6 Sol Max phù hợp khi sửa lỗi quy mô kho lưu trữ. Lợi thế 7 điểm trên DeepSWE là thực tế và quan trọng. Nếu tác nhân của bạn làm việc trên codebase lớn hiện có với mức giám sát tối thiểu, Sol vẫn là lựa chọn an toàn nhất. Xem bài so sánh GPT-5.6 Sol vs Claude Fable 5 để biết thêm chi tiết.
- Claude Fable 5 phù hợp khi cần tính nhất quán. Mô hình này dẫn đầu chỉ số tổng hợp, FrontierCode và APEX-Agents. Nó hiếm khi tệ hơn vị trí thứ hai, phù hợp với tự động hóa dài hạn nơi một bước sai có thể làm hỏng một giờ tiến độ.
- Grok 4.6 phù hợp làm mô hình mặc định theo chi phí. Nó dẫn đầu CursorBench và Terminal-Bench, đồng thời giữ khoảng cách gần với các mô hình khác ở mức chi phí thấp hơn đáng kể. Đây là hồ sơ phù hợp để định tuyến phần lớn lưu lượng truy cập vào Grok và chỉ nâng cấp các trường hợp khó.
Một lưu ý quan trọng: đây là các con số ra mắt tuần đầu, phần lớn do nhà cung cấp báo cáo. Điểm chuẩn ra mắt của Grok 4.5 cần được đọc kỹ, và sự thận trọng tương tự áp dụng cho mọi nhà cung cấp ở đây.
Chi phí cho mỗi tác vụ, không phải chi phí cho mỗi token
Giá token có thể gây hiểu lầm khi các mô hình khác nhau về độ dài phản hồi và tỷ lệ thử lại. Một mô hình rẻ nhưng thất bại ở lần chạy cuối cùng có thể tạo thêm chi phí xem xét và sửa chữa lớn hơn số token đã tiết kiệm.
Chỉ số hữu ích hơn là chi phí trên mỗi tác vụ hoàn thành. Theo phép đo độc lập của Artificial Analysis, Grok 4.6 có mức trung bình 0,84 đô la cho mỗi tác vụ trên các đánh giá tác nhân của họ — thấp nhất trong số các mô hình tiên phong. Lợi thế này đến từ việc sử dụng token tương đối kỷ luật, không chỉ từ giá niêm yết thấp.
Ví dụ, giả sử tác nhân mã hóa của bạn dùng trung bình 500K token đầu vào và 100K token đầu ra cho mỗi tác vụ hoàn thành:
| Mô hình | Chi phí đầu vào | Chi phí đầu ra | Mỗi tác vụ |
|---|---|---|---|
| Grok 4.6 | $1,00 | $0,60 | $1,60 |
| Claude Opus 4.8 | $5,00 | $2,50 | $7,50 |
| GPT-5.6 Sol | $6,00 | $3,00 | $9,00 |
Với 1.000 tác vụ mỗi tháng, Grok tiết kiệm khoảng 6.000–7.400 đô la so với các lựa chọn thay thế — nếu tỷ lệ thành công trên khối lượng công việc của bạn được duy trì. Đây là điều cần kiểm tra trước khi cam kết.
Khả năng sử dụng API: chi phí thực sự của việc tích hợp
-
Grok 4.6 tương thích OpenAI. Nếu client của bạn đã hỗ trợ kiểu OpenAI, chỉ cần trỏ
base_urltớihttps://api.x.ai/v1.
from openai import OpenAI
client = OpenAI(
api_key="XAI_API_KEY",
base_url="https://api.x.ai/v1",
)
response = client.chat.completions.create(
model="grok-4.6",
messages=[
{"role": "user", "content": "Tóm tắt thay đổi trong pull request này."}
],
)
print(response.choices[0].message.content)
Grok cũng có sẵn trên OpenRouter, Vercel và Cloudflare cho người dùng gateway.
GPT-5.6 Sol có hệ sinh thái tích hợp sâu nhất. OpenAI cung cấp API Responses, gọi công cụ theo chương trình và SDK chính hãng rộng rãi. Xem cách sử dụng API GPT-5.6 để biết cấu trúc cấp bậc.
Claude Fable 5 dùng API Messages của Anthropic. API này có hình dạng yêu cầu khác, độ tin cậy sử dụng công cụ tốt và tham số
effortđể cân bằng chi phí với năng lực trong cùng một mô hình.
Ma sát di chuyển thấp nhất giữa Grok và OpenAI vì dùng định dạng chung. Ma sát cao hơn khi di chuyển đến hoặc từ Anthropic. Nếu bạn dự đoán cần chuyển đổi hoặc định tuyến giữa nhiều mô hình, hãy đưa khác biệt này vào quyết định kiến trúc ngay từ đầu.
Cửa sổ ngữ cảnh: khi 500K là đủ
Trên lý thuyết, cửa sổ 1,05M token của GPT-5.6 Sol gấp đôi 500K của Grok 4.6, còn Claude Fable 5 có 1M token. Trong thực tế, câu hỏi là khối lượng công việc của bạn thực sự cần bao nhiêu ngữ cảnh.
Cửa sổ 500K chứa khoảng 350.000 từ: toàn bộ codebase của một dịch vụ cỡ trung, bản ghi hỗ trợ một năm hoặc vài trăm trang tài liệu pháp lý. Phần lớn tác vụ tác nhân không bao giờ đạt đến mức này.
Các workload thực sự cần một triệu token thường gồm:
- Phân tích toàn bộ monorepo.
- Bản ghi tác nhân nhiều phiên rất dài mà bạn không tóm tắt.
- Xử lý một lần các bộ tài liệu lớn.
Đừng chỉ chọn mô hình dựa trên kích thước context window:
- Chất lượng giảm khi ngữ cảnh đầy. Chất lượng truy xuất ở mức 80% dung lượng kém hơn đáng kể so với mức 20% trên cả ba mô hình.
- Token đầu vào làm cạn ngân sách nhanh. Điền đầy cửa sổ Sol tốn khoảng 12,60 đô la mỗi yêu cầu theo giá niêm yết, trong khi Grok tốn 1 đô la.
Nếu prompt thường xuyên vượt 400K token, bạn không chỉ cần cửa sổ lớn hơn. Bạn cần chiến lược lưu trữ, chunking và truy xuất chọn lọc, bất kể chọn nhà cung cấp nào.
Giới hạn kiến thức và độ chín muồi của hệ sinh thái
Grok 4.6 ra mắt với giới hạn kiến thức ngày 1 tháng 2 năm 2026, mới nhất trong ba mô hình. Điều này có ích cho tác nhân mã hóa tham chiếu framework thay đổi nhanh, nhưng là lợi thế nhỏ: một stack tác nhân nghiêm túc vẫn nên dựa vào công cụ truy xuất và tài liệu thay vì chỉ tin vào kiến thức tham số.
Hệ sinh thái lại cho kết quả ngược lại:
- OpenAI có bề mặt tích hợp bên thứ ba sâu rộng nhất.
- Anthropic có thị phần framework tác nhân mạnh.
- xAI là người mới và dựa vào khả năng tương thích OpenAI để tận dụng hệ sinh thái hiện có.
Lợi thế của Grok là phần lớn client dùng định dạng chat completions đã có thể chạy ngay. Gateway qua OpenRouter, Vercel và Cloudflare cũng giúp áp dụng mà không cần thay đổi cơ sở hạ tầng.
Đổi lại, bạn phải cân nhắc mức độ hoàn thiện từ bên thứ nhất, API hàng loạt, các cấp bộ nhớ đệm và khả năng kiểm soát sử dụng chi tiết, vốn ít trưởng thành hơn so với các nhà cung cấp hiện tại.
Mô hình nào cho công việc nào
- Tác nhân mã hóa tự động trên codebase lớn, ưu tiên chất lượng: GPT-5.6 Sol. Lợi thế DeepSWE giúp giảm lỗi trên kho mã lớn.
- Công việc tri thức dài hạn và phiên tác nhân kéo dài nhiều giờ: Claude Fable 5. Mô hình này có điểm tổng hợp, benchmark tác nhân và hồ sơ ổn định tốt nhất.
- Lưu lượng tác nhân lớn, sản phẩm nhạy cảm chi phí hoặc mô hình mặc định của router: Grok 4.6. Dùng Grok cho phần lớn tác vụ và chỉ mở rộng khoảng 10% trường hợp khó nhất sang Sol hoặc Fable.
- Mã hóa tương tác trong IDE: Lợi thế CursorBench của Grok 4.6 và biến thể nhanh giá gấp 2 lần khiến nó là đối thủ đáng cân nhắc, đặc biệt sau khi được đào tạo trên các phiên Cursor thực tế.
Kiểm tra cả ba trên ngăn xếp của bạn trong một buổi chiều
Các benchmark dự đoán mức trung bình, không phải workload cụ thể của bạn. Dưới đây là quy trình kiểm tra có thể tái tạo bằng Apidog.
Tạo một dự án với ba environment.
Tạo environment cho xAI (api.x.ai/v1), OpenAI và Anthropic; mỗi environment có thông tin xác thực riêng. Cùng một request có thể chuyển nhà cung cấp bằng menu thả xuống.Thu thập 20 prompt thực tế.
Lấy tác vụ từ sản phẩm của bạn, không dùng câu hỏi mẫu nhỏ. Bao gồm prompt hệ thống, định nghĩa công cụ nếu dùng function calling, và ít nhất năm trường hợp khó đã biết.-
Thêm assertion cho các chỉ số quan trọng.
Xác nhận:- Phản hồi hợp lệ.
- Mức sử dụng token từ đối tượng
usage. - Ngưỡng độ trễ.
- Với workload gọi công cụ: JSON tool call parse được và khớp schema.
Các mô hình thường thất bại ở bước tool calling thường xuyên hơn so với văn xuôi.
-
Chạy dưới dạng test scenario, ba lần cho mỗi mô hình.
Đầu ra LLM biến thiên; ba lần chạy cho thấy khác biệt mà một bản demo đơn lẻ có thể che giấu. Xuất kết quả và so sánh:
- Tỷ lệ thành công.
- Độ trễ.
- Chi phí trên mỗi lần thành công.
Đừng chỉ so sánh chi phí trên mỗi token.
- Giữ lại bộ kiểm thử. Khi phiên bản mô hình tiếp theo ra mắt, hãy chạy lại cùng bộ prompt. Lựa chọn mô hình giờ là quyết định theo quý; đội có hệ thống đánh giá cố định thường chuyển đổi nhanh hơn vài tuần so với đội quyết định lại dựa trên giai thoại.
FAQ
Grok 4.6 có tốt hơn GPT-5.6 Sol không?
Chúng hòa nhau trên chỉ số tổng hợp ở mức 61. Sol rõ ràng dẫn đầu về mã hóa quy mô kho lưu trữ trên DeepSWE (73,0% so với 65,9%). Grok dẫn đầu CursorBench và Terminal-Bench, đồng thời chi phí đầu ra thấp hơn 5 lần. Lựa chọn phụ thuộc workload của bạn giống DeepSWE hay giống phiên IDE hơn.
Grok 4.6 có tốt hơn Claude Fable 5 không?
Fable 5 dẫn đầu về chỉ số (62 so với 61), FrontierCode và APEX-Agents, dù chênh lệch nhỏ. Lợi thế chính của Grok là giá. Với tự động hóa cần độ chính xác cao, chọn Fable 5; với workload nhạy cảm chi phí, chọn Grok.
Mô hình AI nào rẻ nhất ở cấp độ tiên phong vào năm 2026?
Grok 4.6, với giá 2 đô la/6 đô la trên mỗi triệu token và chi phí tác vụ tác nhân được đo độc lập là 0,84 đô la. Token đầu ra của đối thủ tiên phong gần nhất có chi phí cao hơn khoảng 4 lần.
Tôi có nên chuyển tác nhân production sang Grok 4.6 không?
Không nên chỉ dựa vào benchmark. Hãy chạy bài kiểm tra trên workload thực tế trước. Khoảng cách giá gấp 5 lần chỉ có ý nghĩa nếu tỷ lệ thành công được duy trì trên các tác vụ của bạn.
Tôi có thể dùng cả ba mô hình sau một định dạng API không?
Phần lớn là có. Grok 4.6 hỗ trợ định dạng chat completions của OpenAI nên có thể dùng chung mã client với GPT-5.6. Claude yêu cầu API Messages của Anthropic, hoặc một gateway như OpenRouter để chuẩn hóa cả ba qua một giao diện duy nhất với một mức tăng nhỏ.
Cửa sổ ngữ cảnh nhỏ hơn của Grok 4.6 có quan trọng không?
Với phần lớn workload tác nhân và trò chuyện, không. 500K token vượt xa mức sử dụng điển hình và cả ba mô hình đều suy giảm khi gần giới hạn context. Khác biệt này đáng kể nếu bạn thường xuyên xử lý toàn bộ monorepo hoặc bộ tài liệu lớn trong một lần gọi, nơi cửa sổ 1,05M của Sol có lợi thế thực sự.


Top comments (0)