Trong vài tuần của mùa hè năm 2026, OpenAI và Google đều phát hành các mô hình chuyên biệt về bảo mật mà phần lớn nhà phát triển chưa thể truy cập. GPT-5.6-Cyber của OpenAI ra mắt ngày 10 tháng 8, còn Gemini 3.5 Flash Cyber của Google xuất hiện ngày 21 tháng 7. Cả hai đều có thể tìm lỗ hổng phần mềm, đều yêu cầu phê duyệt để truy cập, và đều không cung cấp khóa API thông thường.
Tuy nhiên, đây không phải hai công cụ cùng loại. Một mô hình nghiêng về nghiên cứu tấn công, mô hình còn lại tập trung vào phòng thủ và vá lỗi. Chúng cũng nằm ở các tầng mô hình cơ sở khác nhau, vì vậy không thể đặt chúng vào một phép so sánh điểm chuẩn trực tiếp.
So sánh trực tiếp
| GPT-5.6-Cyber | Gemini 3.5 Flash Cyber | |
|---|---|---|
| Nhà cung cấp | OpenAI | |
| Ra mắt | 10 tháng 8, 2026 | 21 tháng 7, 2026 |
| Được xây dựng trên | GPT-5.6 Sol (tầng flagship) | Gemini Flash (tầng nhanh, chi phí thấp) |
| Xu hướng | Tấn công: chuỗi khai thác, phát hiện zero-day | Phòng thủ: tìm và khắc phục lỗ hổng |
| Truy cập | Daybreak Red, dành cho đội bảo mật được kiểm duyệt | Thử nghiệm giới hạn cho chính phủ và đối tác đáng tin cậy |
| API công khai | Không | Không |
| Giá công khai | Không | Không |
| Chương trình | OpenAI Daybreak | Google CodeMender |
Tóm lại: GPT-5.6-Cyber là mô hình nghiên cứu tấn công cấp tiên phong, trong khi Gemini 3.5 Flash Cyber là mô hình nhẹ hơn, hướng đến vá lỗi phòng thủ. Khác biệt về định hướng này giải thích phần lớn khác biệt còn lại.
Các tầng mô hình khác nhau
Khác biệt kỹ thuật rõ nhất là mô hình cơ sở.
GPT-5.6-Cyber được xây dựng trên GPT-5.6 Sol, mô hình suy luận mạnh nhất của OpenAI. Nghiên cứu lỗ hổng thực tế đòi hỏi khả năng suy luận liên tục trên các codebase lớn, phức tạp và không quen thuộc. OpenAI đặt mô hình cấp cao nhất của mình bên dưới Cyber để phục vụ loại công việc này.
Ngược lại, Gemini 3.5 Flash Cyber dựa trên tầng Flash nhanh và tiết kiệm chi phí của Google, thay vì tầng flagship Pro. Đây là lựa chọn phù hợp với mục tiêu của CodeMender: quét code ở quy mô lớn, phát hiện lỗi và đề xuất bản vá.
Với quy trình này, tốc độ và hiệu quả chi phí thường quan trọng hơn chiều sâu suy luận tối đa trong một lần chạy. Cũng cần lưu ý rằng mô hình Flash phổ biến đã chuyển sang 3.6, nhưng Cyber vẫn ở 3.5 vì hai dòng có lộ trình phát hành riêng.
Hướng định khác biệt: tấn công so với phòng thủ
Khác biệt quan trọng nhất là mục tiêu tác vụ.
OpenAI huấn luyện GPT-5.6-Cyber để giảm từ chối với các tác vụ lưỡng dụng có rủi ro cao hơn, đồng thời cải thiện khả năng tìm lỗ hổng zero-day và xây dựng chuỗi khai thác, theo thông báo mở rộng Daybreak. Mô hình được phân phối qua Daybreak Red, tầng dành cho:
- Nghiên cứu lỗ hổng được ủy quyền
- Xác thực khai thác
- Kiểm tra bảo mật
Bằng chứng được công bố khi ra mắt tập trung vào năng lực tấn công: hai lỗ hổng V8 liên tiếp trong Chrome, được gán CVE-2026-15903, cùng các phát hiện trên một hệ điều hành di động, một cơ sở dữ liệu và một nhân hệ điều hành.
Google định vị Gemini 3.5 Flash Cyber quanh việc tìm và sửa lỗi. Theo cập nhật mô hình Gemini, mô hình này là một phần của CodeMender: sáng kiến phát hiện lỗ hổng trong mã và đề xuất bản vá.
Nói cách khác:
- GPT-5.6-Cyber: thiên về nghiên cứu tấn công và xác thực khả năng khai thác.
- Gemini 3.5 Flash Cyber: thiên về phát hiện lỗi và hỗ trợ khắc phục.
Điều này không có nghĩa một bên “an toàn” còn bên kia “nguy hiểm”. Mô hình phát hiện lỗ hổng luôn mang tính lưỡng dụng. Đây cũng là lý do cả hai nhà cung cấp đều giới hạn quyền truy cập.
Mức độ minh bạch khác nhau
OpenAI công bố nhiều chỉ số hơn cho GPT-5.6-Cyber, bao gồm:
- Chỉ số tỷ lệ hoàn thành nội bộ: GPT-5.6-Cyber trả lời 95,0% lời nhắc cyber nâng cao, so với 1,5% của Sol cơ sở.
- Các điểm chuẩn được nêu tên, chẳng hạn ExploitGym.
- Một CVE thực tế đã được gán.
- Xếp hạng Khung Sẵn sàng là “Cao”, nhưng chưa tới mức “Nghiêm trọng”.
Để xem chi tiết về nhóm được cấp quyền truy cập, hãy tham khảo Daybreak Blue vs Red.
Google công bố ít chi tiết hơn khi ra mắt. Họ xác nhận mô hình tồn tại, mục tiêu phòng thủ và trạng thái truy cập hạn chế, nhưng không công bố tỷ lệ hoàn thành theo tác vụ hoặc bảng điểm chuẩn so sánh.
Vì vậy, bạn có thể mô tả khác biệt về định hướng, nhưng không thể kết luận mô hình nào “mạnh hơn” trên cùng một biểu đồ:
- Không có benchmark chung được cả hai nhà cung cấp chạy đối đầu.
- Tác vụ đích hầu như không trùng nhau: phát triển khai thác so với tạo bản vá.
- Mức độ công bố số liệu không tương đương.
Điểm chung của chúng
Bỏ qua khác biệt, hai mô hình này cho thấy một số xu hướng chung của công cụ AI security.
- Truy cập bị giới hạn, không phải API mở. Cả hai không hỗ trợ self-service và đều yêu cầu phê duyệt.
- Không có giá công khai. Không có mức giá token công khai vì không có quyền truy cập mở. Các bảng giá không chính thức đang lưu hành không thể được xác minh.
- Cùng một bài toán lưỡng dụng. Mô hình giỏi tìm lỗ hổng có thể giúp đội phòng thủ vá lỗi, nhưng cũng có thể bị dùng để khai thác.
- Câu chuyện phiên bản phức tạp. OpenAI dùng hệ thống Sol/Terra/Luna, trong khi Google giữ Cyber ở 3.5 dù các phiên bản Flash liên quan đã lên 3.6.
Nếu mục tiêu của bạn là tìm API key cho một trong hai mô hình, câu trả lời hiện tại là: không có API tự phục vụ.
Điều quan trọng với bạn: kiểm thử API bạn đang sở hữu
Trừ khi bạn thuộc nhà cung cấp bảo mật được phê duyệt hoặc là đối tác chính phủ, bạn chưa thể đưa GPT-5.6-Cyber hay Gemini 3.5 Flash Cyber vào hệ thống trong quý này.
Việc thực tế hơn là kiểm thử bảo mật cho API của chính bạn. Các lỗ hổng dễ ngăn chặn nhất thường là lỗi biên giới cơ bản: xác thực, phân quyền, cấu hình transport và hợp đồng API.
Với một API client như Apidog, hãy bắt đầu bằng các kiểm tra có tỷ lệ phát hiện lỗi cao và chi phí triển khai thấp.
1. Kiểm thử ranh giới xác thực
Tạo một test matrix cho mỗi endpoint được bảo vệ:
| Trường hợp | Kỳ vọng cần xác nhận |
|---|---|
| Không có token | Bị từ chối với mã trạng thái phù hợp |
| Token hết hạn | Bị từ chối, không trả dữ liệu bảo vệ |
| Token không hợp lệ | Bị từ chối nhất quán |
| Token hợp lệ, thiếu quyền | Bị từ chối theo policy phân quyền |
| Token hợp lệ, đủ quyền | Thành công và chỉ trả dữ liệu được phép |
Ví dụ yêu cầu không có token:
GET /v1/admin/users HTTP/1.1
Host: api.example.com
Ví dụ yêu cầu có token hết hạn:
GET /v1/admin/users HTTP/1.1
Host: api.example.com
Authorization: Bearer <expired-token>
Với từng trường hợp, hãy kiểm tra đồng thời:
- Mã trạng thái HTTP.
- Nội dung response không làm lộ dữ liệu nhạy cảm.
- Thông báo lỗi không tiết lộ chi tiết nội bộ.
- Hành vi nhất quán giữa các endpoint tương đương.
Nguyên tắc đặc quyền tối thiểu cũng áp dụng cho agent và token tự động hóa. Xem thêm: khóa API của tác nhân AI của bạn thực sự có thể làm gì.
2. Kiểm thử bảo mật truyền tải
Nếu API của bạn yêu cầu client certificate hoặc mTLS, hãy kiểm thử cả luồng hợp lệ lẫn luồng bị từ chối:
- Gọi API bằng client certificate hợp lệ.
- Gọi API không có client certificate.
- Gọi API bằng certificate hết hạn hoặc không được tin cậy.
- Xác nhận chỉ client hợp lệ mới đi qua được lớp transport.
Tham khảo hướng dẫn kiểm thử client certificate và mTLS với Apidog.
3. Biến các kiểm tra thành regression test
Đừng chỉ chạy các case này một lần. Hãy lưu chúng trong collection hoặc test suite và chạy lại khi:
- Thay đổi middleware xác thực.
- Thêm endpoint mới.
- Thay đổi scope hoặc role.
- Cập nhật gateway, proxy hoặc cấu hình TLS.
- Phát hành phiên bản API mới.
Đây là công việc có thể bắt đầu ngay, bằng công cụ bạn thực sự truy cập được. Tải xuống Apidog và bắt đầu từ các trường hợp xác thực.
Các câu hỏi thường gặp
GPT-5.6-Cyber hay Gemini 3.5 Flash Cyber tốt hơn?
Chúng được xây dựng cho các nhiệm vụ khác nhau. GPT-5.6-Cyber là mô hình cấp tiên phong, được tinh chỉnh cho nghiên cứu tấn công như phát triển khai thác và phát hiện zero-day. Gemini 3.5 Flash Cyber là mô hình nhẹ hơn, được tinh chỉnh cho vá lỗi phòng thủ. Chưa có benchmark đối đầu do cả hai nhà cung cấp công bố.
Tôi có thể dùng một trong hai qua API không?
Không. GPT-5.6-Cyber yêu cầu phê duyệt qua Daybreak Red. Gemini 3.5 Flash Cyber là chương trình thử nghiệm giới hạn cho chính phủ và đối tác đáng tin cậy. Không có model ID API tự phục vụ cho cả hai.
Tại sao cả hai mô hình đều bị hạn chế?
Vì tính lưỡng dụng. Mô hình giỏi phát hiện lỗ hổng có thể giúp đội phòng thủ vá lỗi, nhưng cũng có thể hỗ trợ việc khai thác. Cả hai nhà cung cấp đang giới hạn quyền truy cập cho các đối tác được kiểm duyệt trong khi theo dõi việc sử dụng thực tế.
Khác biệt giữa các mô hình cơ sở là gì?
GPT-5.6-Cyber dựa trên GPT-5.6 Sol, tầng suy luận flagship của OpenAI. Gemini 3.5 Flash Cyber dựa trên tầng Flash nhanh hơn, chi phí thấp hơn của Google, phù hợp với mục tiêu quét và sửa lỗi ở quy mô lớn.
Tôi nên dùng gì thay thế?
Để bảo mật API của chính bạn, hãy chạy kiểm tra xác thực, transport và hợp đồng API bằng một client như Apidog. Bạn không cần chờ một mô hình bảo mật bị giới hạn quyền truy cập để bắt đầu giảm rủi ro.


Top comments (0)