DEV Community

Cover image for Mistral Đã Trở Lại: Le Chonk Đánh Bại GPT-6 Astra và Claude
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Mistral Đã Trở Lại: Le Chonk Đánh Bại GPT-6 Astra và Claude

Mistral đã im ắng ở phân khúc cao cấp một thời gian. Sau khi Mistral Large 3 ra mắt vào tháng 12 năm 2025, cuộc thảo luận về các mô hình tiên tiến có trọng số mở (open-weight frontier) chủ yếu xoay quanh Kimi, DeepSeek, GLM và Qwen. Ngày 6 tháng 10 năm 2026, Mistral phản hồi bằng Mistral Large 4, một mô hình 1 nghìn tỷ tham số mà đội ngũ gọi là “Le Chonk”.

Dùng thử Apidog ngay hôm nay

Con số gây chú ý nhất là điểm chuẩn an ninh mạng: Large 4 đạt 82%, trong khi Claude Opus 5.5 và GPT-6 Astra gần bằng 0. Tuy nhiên, cần đọc đúng ngữ cảnh: các mô hình đóng gần như không có điểm vì từ chối thực hiện nhiệm vụ, không phải vì chúng thất bại khi thực hiện. Bài viết này tập trung vào cách đánh giá Large 4 cho workload thực tế: thông số, chi phí, giới hạn và quy trình kiểm thử API.

Tóm tắt nhanh

  • Mô hình: Mixture-of-experts (MoE) với 1,05 nghìn tỷ tham số tổng, 49 tỷ tham số hoạt động và bộ mã hóa thị giác 1,6 tỷ tham số.
  • Khả năng: Nhận đầu vào văn bản và hình ảnh, hỗ trợ ngữ cảnh 1 triệu token.
  • API: Có bản xem trước công khai với model ID mistral-large-4.
  • Trọng số: Mistral cho biết sẽ phát hành vào cuối tháng 10 năm 2026; giấy phép chưa được công bố.
  • Giá xem trước: $0,68 đầu vào / $2,09 đầu ra cho mỗi triệu token. Giá niêm yết là $1,36 / $4,18.
  • An ninh mạng: Đạt 82% trong bài kiểm tra tái tạo lỗ hổng của AA Cyber Index, nhưng cần tính đến việc các mô hình đóng từ chối nhiệm vụ.
  • Mã hóa: Trong đánh giá do con người thực hiện, Claude Opus 5 đạt 4,22/5 còn Large 4 đạt 3,74/5.

Vì sao có thể nói “Mistral đã trở lại”?

Trong phần lớn năm 2026, các mô hình trọng số mở mạnh nhất chủ yếu đến từ Trung Quốc. Mistral vẫn phát hành Medium 3.5, Devstral 2 và Small 4, nhưng chưa có mô hình nào cạnh tranh trực tiếp với các mô hình frontier đóng.

Large 4 thay đổi vị thế đó. Mistral tuyên bố mô hình này “vượt trội đáng kể so với bất kỳ mô hình mã nguồn mở nào được phát triển ở Mỹ hoặc Châu Âu”. Điểm đáng chú ý với đội ngũ phát triển tại EU là câu chuyện về chủ quyền dữ liệu:

  • Được đào tạo từ đầu trên 3.800 GPU NVIDIA Grace Blackwell.
  • Chạy tại các trung tâm dữ liệu riêng của Mistral ở châu Âu.
  • Hỗ trợ hơn 160 ngôn ngữ, bao gồm tất cả ngôn ngữ chính thức của EU.
  • Ra mắt vài tuần sau vòng Series D trị giá 3 tỷ euro của Mistral.

Mistral Large 4

Large 4 cũng ra mắt ngay sau khi Reflection công bố Beam, khiến cuộc đua mô hình mở giữa Mỹ, Trung Quốc và châu Âu có thêm một đối thủ đáng chú ý.

Điểm chuẩn an ninh mạng: đọc kết quả đúng cách

Chỉ số An ninh mạng của Artificial Analysis có một bài kiểm tra yêu cầu mô hình tái tạo lỗ hổng có thật trong phần mềm mã nguồn mở, sau đó đề xuất bản vá. Theo Mistral, Large 4 đạt 82%, cao nhất trong số các mô hình được so sánh.

Kết quả an ninh mạng của Mistral Large 4

Nhưng Mistral cũng nêu rõ rằng Claude Opus 5.5 và GPT-6 Astra đạt gần bằng 0 vì chúng từ chối thực hiện nhiệm vụ.

Tuyên bố Cách diễn giải chính xác
“Large 4 đánh bại Astra và Opus 5.5 về an ninh mạng” Trong bài kiểm tra này, các mô hình đóng từ chối trả lời; Large 4 trả lời và thường thành công.
“Large 4 là mô hình hack tốt nhất” Chưa được xác nhận. Từ chối là lựa chọn chính sách, không nhất thiết phản ánh giới hạn năng lực.
“Large 4 không an toàn” Cũng chưa được xác nhận. Mistral cho biết tỷ lệ từ chối trung bình của họ với lời nhắc an ninh mạng từ JailbreakBench, StrongREJECT và AgentHarm cao hơn các mô hình mở khác.

Có năng lực thực tế phía sau tiêu đề này:

  • Cybench: giải quyết 93% trong bộ 40 bài tập capture-the-flag.
  • B3 Agent Security Benchmark: chống lại 93,3% cuộc tấn công.

Với đội ngũ bảo mật, ý nghĩa thực tế là bạn có thể dùng một mô hình tự lưu trữ để hỗ trợ tái tạo và vá lỗi CVE trong mã nguồn của mình, đồng thời vẫn kiểm tra hành vi từ chối đối với các yêu cầu nguy hiểm rõ ràng.

Chỉ sử dụng mô hình để kiểm thử, tái tạo lỗ hổng và vá lỗi trên hệ thống bạn sở hữu hoặc được ủy quyền kiểm tra.

Những điểm Large 4 vượt GPT-6 Astra

Ngoài điểm chuẩn an ninh mạng, Mistral báo cáo hai kết quả khác mà cả hai mô hình đều thực hiện nhiệm vụ:

Điểm chuẩn Mistral Large 4 GPT-6 Astra Ghi chú
Dense 200 — nhận diện hình ảnh 42% 41% Chênh lệch 1 điểm, không lớn.
Finance Agent v2 (vals.ai) Dẫn trước Thua sau Mistral chỉ báo cáo thứ hạng.
Harvey Legal Agent Benchmark Mô hình mở tốt nhất Được liệt kê Không có điểm đối đầu trực tiếp.

So với các mô hình mở khác, khoảng cách theo số liệu Mistral rộng hơn:

Điểm chuẩn Mistral Large 4 Đối thủ được so sánh
AutomationBench — 657 quy trình 59,9% Kimi K3, DeepSeek V4 Pro
AA-Briefcase — công việc tri thức 1.393 Elo DeepSeek V4 Pro
DeepSWE v1.1 — mã hóa 61,7% Dẫn đầu nhóm mô hình mở
SWE-Atlas-QnA 59,4% —
Terminal-Bench 4.0 28,3% —

Các số liệu trên đều do Mistral báo cáo trong giai đoạn preview. Chưa có phòng thí nghiệm độc lập chạy lại toàn bộ bài kiểm tra, và Euronews cho biết quá trình reinforcement learning vẫn được hoàn thiện khi ra mắt.

Cách dùng đúng các điểm chuẩn này:

  1. Xem chúng là tín hiệu để chọn mô hình cần thử.
  2. Không xem chúng là lý do duy nhất để chuyển production.
  3. Chạy cùng prompt, dữ liệu và tiêu chí đánh giá của ứng dụng bạn.
  4. So sánh chất lượng, độ trễ, tỷ lệ lỗi và chi phí token.

Large 4 vẫn thua ở đâu?

Mistral cũng công bố một kết quả mà mô hình đóng thắng rõ ràng: đánh giá chất lượng mã do con người thực hiện bởi Surge AI.

Mô hình Điểm mã hóa do con người đánh giá, trên 5
Claude Opus 5 4,22
Mistral Large 4 Preview 3,74
GLM-5.3 3,60
Kimi K3 3,59
GLM-5.2 3,40

Large 4 dẫn trước các mô hình mở Trung Quốc trong bảng này, nhưng vẫn cách Claude Opus 5 gần nửa điểm.

Nếu chất lượng code là tiêu chí số một, hãy kiểm tra các case như:

  • Refactor nhiều file.
  • Sửa lỗi có test thất bại.
  • Sinh migration database.
  • Viết SDK hoặc client API.
  • Tuân thủ JSON Schema và OpenAPI.
  • Xử lý codebase có conventions riêng.

Cũng chưa có so sánh được công bố với Claude Fable 5.1 hoặc GPT-6 Sol. Nếu có ai tuyên bố Large 4 vượt các mô hình đó, hãy yêu cầu điểm chuẩn và điều kiện đánh giá cụ thể.

Thông số kỹ thuật

Thông số Mistral Large 4
Model ID API mistral-large-4 — bí danh mistral-large-4-0
Phiên bản 26.10, preview công khai
Kiến trúc Mixture-of-experts, kết hợp instruction và reasoning
Tham số 1,05 nghìn tỷ tổng, 49 tỷ hoạt động, vision encoder 1,6 tỷ
Context window 1 triệu token
Đầu vào Văn bản, hình ảnh
Reasoning reasoning_effort: "high" hoặc "none"
Công cụ Function calling, structured output, công cụ agent tích hợp
Endpoints /v1/chat/completions, /v1/conversations, /v1/agents, /v1/batch
Trọng số Mở vào cuối tháng 10 năm 2026; giấy phép chưa công bố

Gọi Mistral Large 4 qua API

Bạn có thể bắt đầu với endpoint chat completions quen thuộc.

curl https://api.mistral.ai/v1/chat/completions \
  -H "Authorization: Bearer $MISTRAL_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "mistral-large-4",
    "messages": [
      {
        "role": "system",
        "content": "Bạn là trợ lý kỹ thuật. Trả lời ngắn gọn, có ví dụ có thể chạy được."
      },
      {
        "role": "user",
        "content": "Viết hàm TypeScript kiểm tra một object có khớp JSON Schema đơn giản hay không."
      }
    ],
    "reasoning_effort": "high"
  }'
Enter fullscreen mode Exit fullscreen mode

Khi cần phản hồi nhanh hoặc workload ít phức tạp, thử giảm reasoning:

{
  "model": "mistral-large-4",
  "reasoning_effort": "none",
  "messages": [
    {
      "role": "user",
      "content": "Tóm tắt lỗi HTTP 429 trong 3 gạch đầu dòng."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

Đừng chỉ đánh giá bằng nội dung trả về. Hãy lưu lại các trường sau từ phản hồi:

  • HTTP status.
  • Độ trễ tổng.
  • usage để theo dõi input/output tokens.
  • Tỷ lệ JSON hợp lệ nếu dùng structured output.
  • Tỷ lệ tool call đúng nếu dùng function calling.
  • Kết quả assertion nghiệp vụ của ứng dụng.

Giá: cần lập ngân sách theo giá niêm yết

Trang giá của Mistral đang hiển thị giá preview bằng một nửa giá niêm yết:

Mô hình Đầu vào / 1M token Đầu ra / 1M token Trọng số mở
Mistral Large 4 — giá preview $0,68 $2,09 Có, cuối tháng 10
Mistral Large 4 — giá niêm yết $1,36 $4,18 Có, cuối tháng 10
Claude Opus 5.5 $4,00 $20,00 Không
GPT-6 Astra $10,00 $50,00 Không

Ở giá preview, đầu ra của Large 4 rẻ hơn khoảng 24 lần so với Astra. Với giá niêm yết, đầu ra vẫn rẻ hơn khoảng 12 lần.

Cached input có giá $0,07 cho mỗi triệu token. Điều này đáng chú ý với agent gửi lại system prompt, tài liệu API hoặc định nghĩa công cụ dài trong mỗi lượt gọi.

Ví dụ, nếu agent của bạn luôn gửi lại OpenAPI specification và tool definitions:

  1. Giữ phần nội dung ổn định ở đầu ngữ cảnh.
  2. Tái sử dụng cùng system prompt thay vì tạo biến thể không cần thiết.
  3. Theo dõi tỷ lệ cache hit trong dữ liệu usage.
  4. Tính ngân sách theo giá niêm yết, vì Mistral chưa công bố ngày kết thúc ưu đãi preview.

Bạn có nên thử Large 4?

Hãy thử ngay nếu

  • Bạn chạy workflow agentic hoặc tự động hóa công việc tri thức và muốn giảm chi phí mô hình.
  • Bạn cần đầu ra đa ngôn ngữ cho các ngôn ngữ EU.
  • Bạn có yêu cầu lưu trữ hoặc triển khai suy luận trong EU.
  • Bạn làm bảo mật phòng thủ và cần tái tạo lỗ hổng hợp lệ trong môi trường được ủy quyền.
  • Bạn muốn đánh giá một lựa chọn có thể tự lưu trữ khi trọng số được phát hành.

Hãy chờ nếu

  • Chất lượng mã là tiêu chí quyết định và Claude đang đáp ứng tốt workload hiện tại.
  • Bạn cần số liệu độc lập để bảo vệ quyết định trong review kiến trúc hoặc procurement.
  • Bạn đang dùng Large 3 ở production và không muốn chịu rủi ro từ một bản preview.
  • Bạn cần model ID phiên bản ổn định thay vì alias preview.

Cách kiểm tra Large 4 với API của bạn trong Apidog

Điểm chuẩn chỉ cho biết mô hình làm tốt tác vụ của người khác. Để quyết định có nên chuyển đổi hay không, hãy chạy Large 4 với prompt, schema, API contract và test case của chính bạn.

Apidog giúp bạn thiết lập quy trình so sánh mà không cần viết thêm một client test riêng.

So sánh API trong Apidog

1. Tạo và lưu request

Tạo request:

POST https://api.mistral.ai/v1/chat/completions
Authorization: Bearer {{MISTRAL_API_KEY}}
Content-Type: application/json
Enter fullscreen mode Exit fullscreen mode

Lưu API key dưới dạng environment variable:

MISTRAL_API_KEY=your_api_key
Enter fullscreen mode Exit fullscreen mode

Body ví dụ:

{
  "model": "mistral-large-4",
  "reasoning_effort": "high",
  "messages": [
    {
      "role": "user",
      "content": "Phân tích response API sau và trả về JSON gồm severity, cause, recommendation."
    }
  ]
}
Enter fullscreen mode Exit fullscreen mode

2. Nhân bản request cho từng model

Nhân đôi request và chỉ thay đổi trường model.

{
  "model": "mistral-large-4"
}
Enter fullscreen mode Exit fullscreen mode

So sánh với model hiện tại của bạn:

{
  "model": "your-current-model"
}
Enter fullscreen mode Exit fullscreen mode

Khi gửi hai request, so sánh:

  • Nội dung phản hồi.
  • HTTP status.
  • Độ trễ.
  • Kích thước response.
  • Trường usage.
  • Tỷ lệ tuân thủ format đầu ra.

3. Thêm assertion để biến thử nghiệm thành regression test

Ví dụ assertion cơ bản:

  • Status phải là 200.
  • Nội dung trả về không rỗng.
  • Không có lỗi API trong body.
  • Response khớp JSON Schema khi bạn yêu cầu structured output.

Schema ví dụ cho phản hồi phân loại lỗi:

{
  "type": "object",
  "required": ["severity", "cause", "recommendation"],
  "properties": {
    "severity": {
      "type": "string",
      "enum": ["low", "medium", "high", "critical"]
    },
    "cause": {
      "type": "string"
    },
    "recommendation": {
      "type": "string"
    }
  },
  "additionalProperties": false
}
Enter fullscreen mode Exit fullscreen mode

4. Chạy lại khi model preview thay đổi

Gom request vào test scenario và chạy lại khi:

  • Mistral cập nhật bản preview.
  • Bạn thay đổi prompt hệ thống.
  • Bạn thêm tool definition mới.
  • Bạn thay đổi JSON Schema.
  • Trọng số được phát hành hoặc bạn bắt đầu tự host model.

Quy trình này giúp phát hiện regression trước khi người dùng phát hiện.

Large 4 phù hợp với một số workflow API thực tế:

  • Làm mô hình đánh giá thứ hai trong kiểm thử bảo mật API, chẳng hạn tái tạo lỗi vượt quyền xác thực trên API thử nghiệm do bạn kiểm soát.
  • Chuyển OpenAPI specification được thiết kế trong Apidog thành tool definitions cho agent.
  • Kiểm tra khả năng sinh structured output cho validation, triage hoặc routing.
  • So sánh chi phí và độ trễ của agent workflow có context dài.

Để xem hướng dẫn đầy đủ về xác thực, reasoning, ảnh, function calling và tính chi phí, xem hướng dẫn API Mistral Large 4. Nếu đang dùng Mistral phiên bản cũ hơn, bạn vẫn có thể áp dụng những điều cơ bản về API Mistral AI và hướng dẫn API Mistral Medium 3.5: cùng base URL, cùng cơ chế xác thực, chỉ thay model ID.

Câu hỏi thường gặp

Mistral Large 4 có phải là mã nguồn mở không?

Đây là mô hình có trọng số mở (open-weight). Mistral cho biết trọng số sẽ được phát hành vào cuối tháng 10 năm 2026. Giấy phép chưa được công bố, vì vậy không nên giả định điều khoản giống Apache 2.0 của Large 3.

Large 4 có thực sự đánh bại GPT-6 Astra không?

Theo số liệu Mistral, Large 4 dẫn trước Astra ở Dense 200, 42% so với 41%, và Finance Agent v2. Với bài kiểm tra tái tạo lỗ hổng an ninh mạng, Astra gần bằng 0 vì từ chối nhiệm vụ; đây không phải một so sánh năng lực tương đương.

Large 4 có đánh bại Claude không?

Không phải trong đánh giá mã hóa do con người thực hiện. Claude Opus 5 đạt 4,22 trong khi Large 4 Preview đạt 3,74. Claude Opus 5.5 cũng từ chối nhiệm vụ tái tạo lỗ hổng trong bài kiểm tra an ninh mạng, nên đạt gần bằng 0 ở đó.

“Le Chonk” nghĩa là gì?

Đây là biệt danh không chính thức Mistral dùng cho mô hình, nhằm nói đùa về kích thước của nó. Tên chính thức là Mistral Large 4 hoặc ML4.

Tôi có thể dùng Large 4 miễn phí không?

Gói miễn phí của Mistral bao gồm 10 đô la tín dụng API mỗi tháng và quyền truy cập các mô hình mới nhất trong Le Chat và Vibe. Với giá preview, 10 đô la tương đương khoảng 4,8 triệu token đầu ra trên Large 4.

Kết luận

Mistral Large 4 đưa Mistral trở lại cuộc thảo luận về các mô hình frontier có trọng số mở. Theo số liệu do Mistral công bố, đây là mô hình mở mạnh nhất ngoài Trung Quốc, có chi phí thấp hơn đáng kể so với Astra hoặc Opus 5.5, và sẽ có khả năng tự triển khai khi trọng số được phát hành.

Tuy nhiên, đừng diễn giải điểm 82% an ninh mạng thành “Large 4 vượt Claude và Astra về mọi mặt”: một phần khác biệt đến từ chính sách từ chối của các mô hình đóng. Với mã hóa, kết quả công bố cho thấy Large 4 vẫn thua Claude.

Bước tiếp theo nên là chạy benchmark nội bộ: dùng cùng prompt, cùng schema, cùng API contract và cùng tiêu chí chi phí. Kiểm tra Large 4 trong Apidog khi giá preview còn hiệu lực, nhưng chỉ đưa vào production sau khi bạn có kết quả regression test của riêng mình và thêm các benchmark độc lập sau khi trọng số được phát hành.

Top comments (0)