DEV Community

Cover image for Grok 4.6 là gì: Tính năng, Hiệu suất, Giá và Cách truy cập API
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Grok 4.6 là gì: Tính năng, Hiệu suất, Giá và Cách truy cập API

Grok 4.6 là mô hình ngôn ngữ tiên tiến của xAI, được phát hành ngày 12 tháng 8 năm 2026. Mô hình được xây dựng dựa trên Grok 4.5, tập trung vào tác nhân chạy dài (long-running agents), mã hóa tự động (agentic coding) và các tác vụ tương tác hoặc trực quan. Grok 4.6 có cửa sổ ngữ cảnh 500.000 token, giá 2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra. Trên Artificial Analysis Intelligence Index, mô hình đạt 61 điểm, ngang GPT-5.6 Sol của OpenAI và kém Claude Fable 5 của Anthropic một điểm.

Dùng thử Apidog ngay hôm nay

Điểm quan trọng với nhà phát triển không chỉ là bảng xếp hạng: Grok 4.6 là một lựa chọn đáng thử nếu bạn đang xây dựng workflow tác nhân nhiều bước, cần chi phí đầu ra thấp hoặc muốn đánh giá nhanh một API tương thích OpenAI. Bạn có thể dùng Apidog để thiết kế, kiểm thử và mô phỏng các cuộc gọi API LLM trước khi tích hợp vào ứng dụng.

Tóm tắt

  • Phát hành: 12 tháng 8 năm 2026, bởi xAI.
  • Trọng tâm: tác nhân dài hạn, mã hóa đa bước, tác vụ tương tác và trực quan. xAI cho biết mô hình tự kiểm thử và xác minh công việc thường xuyên hơn trước khi tiếp tục.
  • Thông số: cửa sổ ngữ cảnh 500K token, thời điểm cắt kiến thức ngày 1 tháng 2 năm 2026.
  • Giá: 2 đô la / 1 triệu token đầu vào, 6 đô la / 1 triệu token đầu ra. Biến thể nhanh hơn có giá gấp đôi.
  • Điểm chuẩn: Intelligence Index 61; DeepSWE tăng từ 54 lên 65,9 và APEX-Agents tăng từ 47,1 lên 57,5 so với Grok 4.5.
  • Khả dụng: xAI API, Grok Build, Cursor, OpenRouter, Vercel và Cloudflare.

Grok 4.6 sơ lược

Thông số Grok 4.6
Nhà phát triển xAI
Ngày phát hành 12 tháng 8 năm 2026
Cửa sổ ngữ cảnh 500.000 token
Thời điểm cắt kiến thức 1 tháng 2 năm 2026
Giá đầu vào / đầu ra 2 đô la / 6 đô la mỗi 1 triệu token
Biến thể nhanh Giá gấp đôi
Chỉ số Trí tuệ 61 (GPT-5.6 Sol: 61, Claude Fable 5: 62)
Khả dụng tại xAI API, Cursor, Grok Build, OpenRouter, Vercel, Cloudflare

Có gì thực sự mới so với Grok 4.5?

Theo thông báo Grok 4.6 của xAI, đây không phải là thay đổi kiến trúc được công bố như một cuộc cách mạng. Điểm khác biệt chính nằm ở quá trình đào tạo bổ sung so với Grok 4.5.

Ba thành phần được xAI nêu bật:

  1. Dữ liệu do mô hình tạo ra, được tuyển chọn để tăng cường lý luận và kiến thức kỹ thuật nâng cao.
  2. Bộ dữ liệu kỹ thuật chất lượng cao, tiếp tục hướng đào tạo dựa trên các phiên phát triển thực tế.
  3. Công cụ tối ưu hóa và công thức đào tạo cải tiến, bao gồm các quỹ đạo tinh chỉnh có giám sát cho lý luận và lĩnh vực chuyên biệt.

Về hành vi, điểm đáng kiểm tra nhất là tự xác minh trong các lần chạy tác nhân dài. Thay vì tiếp tục từ giả định chưa được kiểm chứng, Grok 4.6 được mô tả là có xu hướng:

  • Chạy thử nghiệm sau khi viết mã.
  • Đọc lại tệp sau khi chỉnh sửa.
  • Xác minh kết quả của bước trước trước khi chuyển sang bước tiếp theo.

Khi đánh giá mô hình, đừng chỉ hỏi “mã có chạy không?”. Hãy chuẩn bị các task đa bước có kiểm thử, ví dụ:

  • Sửa lỗi trải rộng trên nhiều tệp.
  • Thêm endpoint, test và tài liệu API.
  • Chỉnh sửa giao diện, sau đó xác minh hành vi bằng test hoặc ảnh chụp màn hình.
  • Yêu cầu mô hình gọi công cụ để kiểm tra trạng thái thay vì suy đoán.

Để hiểu thêm dòng dõi đào tạo, hãy xem bài phân tích về ý nghĩa của dữ liệu đào tạo theo phiên Cursor đối với nhà phát triển.

Các điểm chuẩn: đọc đúng những thay đổi đáng kể

Các số liệu do nhà cung cấp công bố luôn cần được kiểm chứng độc lập. Tuy vậy, mức chênh lệch từ Grok 4.5 sang Grok 4.6 đủ lớn để đáng đưa vào kế hoạch đánh giá.

Điểm chuẩn của các mô hình LLM hàng đầu

Ba điểm cần chú ý:

  • Khả năng tác nhân được cải thiện rõ rệt. Mức tăng 10,4 điểm trên APEX-Agents đưa Grok 4.6 đến gần Fable 5 Max, đồng thời nhỉnh hơn GPT-5.6 Sol Max ở chỉ số này.
  • Mã hóa ở cấp độ kho mã là bước tiến lớn nhất. DeepSWE tăng gần 12 điểm, cho thấy mô hình có năng lực cạnh tranh hơn với thay đổi đa tệp. Tuy nhiên, Sol Max vẫn dẫn đầu đáng kể trên benchmark này.
  • Dữ liệu độc lập hỗ trợ xu hướng chung. Artificial Analysis đo chi phí trung bình 0,84 đô la mỗi tác vụ trong các đánh giá tác nhân và ghi nhận Elo 1753 trên GDPval-AA v2 cho công việc tri thức chuyên nghiệp.

Khi chạy benchmark nội bộ, hãy ưu tiên dữ liệu gần với production thay vì chỉ sao chép benchmark công khai:

  1. Chọn 20–50 task đã hoàn thành trong backlog hoặc issue tracker.
  2. Định nghĩa tiêu chí pass/fail rõ ràng: build thành công, test pass, diff hợp lệ, schema đúng.
  3. Chạy cùng prompt, công cụ và giới hạn vòng lặp cho từng model.
  4. Ghi lại tỷ lệ hoàn thành, số lần retry, token đầu ra, latency và số lần cần con người sửa.
  5. Tính chi phí trên task hoàn thành, không chỉ trên một triệu token.

Để có thêm ngữ cảnh về cách đọc các bảng benchmark của xAI, xem phân tích điểm chuẩn Grok 4.5.

Giá cả: yếu tố giá trị ở nhóm mô hình tiên tiến

Grok 4.6 giữ giá của Grok 4.5: 2 đô la cho mỗi triệu token đầu vào và 6 đô la cho mỗi triệu token đầu ra.

Mô hình Giá đầu ra / 1 triệu token
Grok 4.6 6 đô la
Claude Opus 4.8 25 đô la
GPT-5.6 Sol 30 đô la

So với GPT-5.6 Sol, giá token đầu ra thấp hơn khoảng 5 lần. Nhưng token rẻ không đồng nghĩa tác vụ rẻ: nếu mô hình cần nhiều lần sửa, review hoặc retry, chi phí thực tế có thể tăng nhanh.

Vì vậy, hãy theo dõi tối thiểu các chỉ số sau trong môi trường thử nghiệm:

cost_per_successful_task
tokens_per_successful_task
tool_calls_per_successful_task
retry_rate
human_review_time
p95_latency
Enter fullscreen mode Exit fullscreen mode

Biến thể nhanh hơn có giá 4 đô la / 12 đô la mỗi triệu token đầu vào / đầu ra, phù hợp hơn cho trải nghiệm tương tác nhạy cảm với độ trễ. Đến hết ngày 19 tháng 8, người dùng Grok Build và Cursor nhận được 2 lần lượng sử dụng miễn phí để kiểm thử.

Nơi bạn có thể sử dụng Grok 4.6 hôm nay

  • xAI API qua console.x.ai, tương thích OpenAI.
  • Cursor, dưới dạng tùy chọn model trong IDE.
  • Grok Build, không gian làm việc tác nhân của xAI.
  • OpenRouter, Vercel và Cloudflare, dành cho team định tuyến nhiều model qua một gateway.
  • Trên OpenRouter, model được liệt kê là x-ai/grok-4.6.

Nếu bạn đang dùng client tương thích OpenAI, cách bắt đầu là đổi base URL sang https://api.x.ai/v1 và thay tên model trong request. Hướng dẫn API Grok 4.5 vẫn áp dụng về cấu trúc tích hợp; phần cần thay đổi là tên model.

Ví dụ request theo định dạng API tương thích OpenAI:

curl https://api.x.ai/v1/chat/completions \
  -H "Authorization: Bearer $XAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "grok-4.6",
    "messages": [
      {
        "role": "user",
        "content": "Phân tích lỗi trong đoạn mã này và đề xuất bản vá có kiểm thử."
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Không có đợt triển khai tiêu dùng riêng biệt đáng phân tích ở đây. Đây là bản phát hành ưu tiên nhà phát triển; cách đánh giá nhanh nhất là qua API hoặc IDE đã tích hợp sẵn.

Hạn chế và câu hỏi mở

Trước khi đưa Grok 4.6 vào production, cần tính đến các điểm sau:

  • Phần lớn benchmark cụ thể vẫn do nhà cung cấp báo cáo. Artificial Analysis có các điểm độc lập nhìn chung hỗ trợ câu chuyện hiệu năng, nhưng các số liệu DeepSWE, FrontierCode và CursorBench đến từ bảng ra mắt của xAI.
  • Cửa sổ ngữ cảnh nhỏ hơn các đối thủ cùng nhóm. 500K token đủ cho nhiều workload thực tế, nhưng GPT-5.6 Sol có 1,05 triệu token và Claude Fable 5 có 1 triệu token. Đây là khác biệt đáng kể nếu bạn xử lý monorepo hoặc bộ tài liệu cực lớn trong một request.
  • Sol vẫn dẫn đầu ở workload mã hóa khó nhất. Chênh lệch 7 điểm DeepSWE cho thấy GPT-5.6 Sol Max vẫn mạnh hơn cho tự động hóa hoàn toàn trên codebase lớn.
  • Hệ sinh thái xAI còn đang trưởng thành. Batch processing, cấp prompt caching và kiểm soát usage có thể chưa hoàn thiện bằng hệ sinh thái OpenAI hoặc Anthropic. Tính tương thích OpenAI giúp giảm phần lớn chi phí tích hợp, nhưng không giải quyết toàn bộ khác biệt vận hành.

Đây không phải các yếu tố loại trừ. Chúng giúp xác định đúng vị trí của Grok 4.6: một lựa chọn hiệu năng/giá cần được benchmark nghiêm túc, không phải model mặc định chỉ vì danh tiếng.

Ý nghĩa đối với nhà phát triển API

Grok 4.6 tạo ra một đối thủ cạnh tranh về giá rõ ràng ở nhóm model tiên tiến. Với workflow tác nhân thực hiện hàng chục cuộc gọi model cho một task, chênh lệch giá đầu ra có thể tác động trực tiếp đến ngân sách.

Ví dụ, nếu một tác nhân thực hiện 40 cuộc gọi cho mỗi tác vụ, chi phí output token thấp hơn sẽ có ý nghĩa lớn hơn nhiều so với chatbot một lượt. Tuy nhiên, chỉ chuyển model sau khi đo kết quả trên workload thật.

Một quy trình đánh giá thực tế:

  1. Giữ nguyên prompt, tool definition và dữ liệu đầu vào.
  2. Chạy Grok 4.6, GPT-5.6 và Claude trên cùng bộ task.
  3. Lưu toàn bộ request, response, tool call và usage.
  4. Xác nhận output bằng test tự động hoặc schema validation.
  5. So sánh chi phí, latency và tỷ lệ task hoàn thành.

Bạn có thể thiết lập các request cạnh nhau trong Apidog: tạo environment riêng cho xAI, OpenAI và Anthropic; dùng biến cho base URL và API key; sau đó thêm assertion cho schema response, usage token và thời gian phản hồi.

Ví dụ các biến môi trường:

# xAI
BASE_URL=https://api.x.ai/v1
API_KEY={{XAI_API_KEY}}
MODEL=grok-4.6

# OpenAI
BASE_URL=https://api.openai.com/v1
API_KEY={{OPENAI_API_KEY}}
MODEL=gpt-5.6-sol
Enter fullscreen mode Exit fullscreen mode

Với tác vụ gọi hàm, hãy kiểm tra payload công cụ thay vì chỉ đánh giá văn bản đầu ra. Một model có thể viết giải thích tốt nhưng vẫn tạo arguments sai, thiếu trường bắt buộc hoặc gọi sai công cụ.

Checklist tối thiểu cho function calling:

- Tên công cụ có đúng không?
- JSON arguments có parse được không?
- Có thiếu trường required không?
- Kiểu dữ liệu có khớp schema không?
- Tool call có được thực hiện đúng thứ tự không?
- Mô hình có xác minh kết quả tool trước khi tiếp tục không?
Enter fullscreen mode Exit fullscreen mode

Câu hỏi thường gặp

Grok 4.6 là gì trong một câu?

Đây là model tiên tiến của xAI ra mắt vào tháng 8 năm 2026, được tối ưu cho tác nhân chạy dài và mã hóa, có cửa sổ ngữ cảnh 500K token và mức giá đầu ra thấp hơn đáng kể so với một số đối thủ cùng nhóm.

Grok 4.6 có tốt hơn GPT-5.6 không?

Hai model hòa nhau ở mức 61 trên Artificial Analysis Intelligence Index. GPT-5.6 Sol Max dẫn đầu ở DeepSWE, trong khi Grok 4.6 nhỉnh hơn ở APEX-Agents và có giá output token thấp hơn khoảng 5 lần.

Sự khác biệt giữa Grok 4.5 và Grok 4.6 là gì?

API và giá giữ nguyên, nhưng Grok 4.6 cải thiện đáng kể trên DeepSWE (+11,9 điểm) và APEX-Agents (+10,4 điểm), đồng thời được mô tả là có xu hướng tự xác minh tốt hơn trong task dài.

Tôi có thể dùng thử Grok 4.6 miễn phí không?

Grok Build và Cursor có 2 lần lượng sử dụng trong tuần ra mắt. Các phương pháp trong hướng dẫn sử dụng Grok 4.5 miễn phí phần lớn cũng áp dụng cho Grok 4.6.

Top comments (0)