DEV Community

Cover image for Gemini 3.8 Flash là gì
Sebastian Petrus
Sebastian Petrus

Posted on Originally published at apidog.com

Gemini 3.8 Flash là gì

Gemini 3.8 Flash: Mô hình Flash thông minh hơn cho tác vụ dài hạn

Gemini 3.8 Flash là mô hình cấp Flash mới nhất của Google, phát hành ngày 2 tháng 9 năm 2026 cùng phiên bản bảo mật giới hạn quyền truy cập Gemini 3.8 Flash Cyber. Đây là bản phát hành Flash thứ ba trong sáu tuần, sau Gemini 3.6 Flash và 3.7 Flash. Mức giá giới thiệu giữ nguyên như 3.7 Flash: 0,75 USD cho mỗi triệu token đầu vào và 3,75 USD cho mỗi triệu token đầu ra đến hết ngày 31 tháng 12 năm 2026.

Hãy thử Apidog ngay hôm nay

Gemini 3.8 Flash

Điểm mới quan trọng nhất không phải là giá hay cửa sổ ngữ cảnh, mà là cách mô hình xử lý tác vụ. Google thiết kế Gemini 3.8 Flash để “làm việc chăm chỉ hơn”: thực hiện các bước suy luận nhỏ hơn, tự kiểm tra kết quả và gọi công cụ lặp lại khi cần. Đổi lại, mô hình có thể sử dụng nhiều token hơn cho mỗi tác vụ.

Artificial Analysis đo được lượng token đầu ra cao hơn khoảng 30% so với 3.7 Flash. Vì giá mỗi token không đổi, chi phí theo token tương đương; nhưng nếu bạn lập ngân sách theo tác vụ, chi phí sẽ tăng.

Tổng quan Gemini 3.8 Flash

Thông số Giá trị
ID mô hình API gemini-3.8-flash
Ngày phát hành 2 tháng 9 năm 2026
Nền tảng Dựa trên Gemini 3.7 Flash theo thẻ mô hình DeepMind
Cửa sổ ngữ cảnh 1.048.576 token đầu vào
Đầu ra tối đa 65.536 token
Đầu vào Văn bản, hình ảnh, video, âm thanh, PDF
Đầu ra Chỉ văn bản
Mức độ suy nghĩ low, medium mặc định, high; minimal trả về lỗi
Giá giới thiệu 0,75 USD đầu vào / 3,75 USD đầu ra cho mỗi triệu token
Giá tiêu chuẩn từ 1/1/2027 1,50 USD đầu vào / 7,50 USD đầu ra cho mỗi triệu token
Bộ nhớ đệm ngữ cảnh 0,075 USD cho mỗi triệu token được lưu vào bộ đệm trong thời gian giới thiệu
API hàng loạt Giảm 50%
Giới hạn kiến thức Tháng 3 năm 2026
Khả dụng cho nhà phát triển Gemini API, Google AI Studio, Android Studio, Google Antigravity, Stitch, Gemini Enterprise
Khả dụng cho người dùng Ứng dụng Gemini dành cho người đăng ký AI Pro và Ultra, AI Mode trong Search, Gemini trong Google Sheets
Trạng thái Gemini 3.7 Flash Vẫn được hỗ trợ đầy đủ, chưa có ngày ngừng hỗ trợ

Mức medium là mặc định, không phải high như trên Gemini 3 Pro. Nếu chuyển prompt từ Pro sang Flash mà không chỉ định mức độ suy nghĩ, mô hình có thể suy luận ít hơn.

minimal không tự động ánh xạ sang low mà trả về lỗi xác thực. Ngoài ra, dù giới hạn kiến thức được công bố là tháng 3 năm 2026, thẻ mô hình cảnh báo rằng kiến thức trong một số lĩnh vực có thể chỉ cập nhật đến tháng 1 năm 2025.

Đây là bản tinh chỉnh cho tác vụ dài hạn

Flash là cấp độ “ngựa kéo” của Google, hướng đến phần lớn lưu lượng sản xuất; Pro dành cho các vấn đề khó nhất. Thẻ mô hình DeepMind cho biết Gemini 3.8 Flash dựa trên Gemini 3.7 Flash, vì vậy nên xem đây là một phiên bản kế nhiệm được tinh chỉnh cho:

  • Kỹ thuật phần mềm dài hạn.
  • Tác nhân tự động.
  • Quy trình doanh nghiệp phức tạp.
  • Các tác vụ cần gọi công cụ và tự kiểm tra nhiều vòng.

Nhịp phát hành gần đây:

  • Gemini 3.6 Flash: 21/7/2026, giá 1,50 USD / 7,50 USD.
  • Gemini 3.7 Flash: 13/8/2026, giá giới thiệu 0,75 USD / 3,75 USD.
  • Gemini 3.8 Flash: 2/9/2026, cùng mức giá giới thiệu như 3.7 Flash.

Google gọi đây là bản phát hành Flash thứ ba trong sáu tuần. Artificial Analysis tính cả 3.5 Flash-Lite nên xem đây là mô hình Flash thứ tư trong chưa đầy bốn tháng. Đợt phát hành này không bao gồm Gemini 3.8 Pro, Gemini 4 hay Flash-Lite mới, và Google chưa công bố thời điểm cập nhật Pro.

“Làm việc chăm chỉ hơn” ảnh hưởng đến chi phí thế nào?

Trên tác vụ phức tạp, Gemini 3.8 Flash có thể:

  1. Chia suy luận thành các bước nhỏ hơn.
  2. Tự kiểm tra kết quả trung gian.
  3. Gọi công cụ nhiều lần.
  4. Chạy lâu hơn ở mức nỗ lực cao.

Artificial Analysis ghi nhận các kết quả sau trên bài kiểm tra của họ:

Mức suy nghĩ Chi phí mỗi tác vụ Thời gian mỗi tác vụ
high 0,58 USD 2,5 phút
medium 0,41 USD
low 0,24 USD 0,8 phút

Ở mức high, mô hình tạo trung bình khoảng 48.000 token đầu ra mỗi tác vụ, cao hơn 30% so với 3.7 Flash. Chi phí tương ứng của 3.7 Flash là khoảng 0,40 USD mỗi tác vụ và 2,2 phút.

Tốc độ tổng thể không thay đổi đáng kể. Logan Kilpatrick mô tả 3.8 Flash có tốc độ tương đương 3.7 Flash. Artificial Analysis đo được 302,1 token đầu ra mỗi giây ở mức high, với thời gian đến token đầu tiên là 13,30 giây.

Vì vậy, hãy định tuyến theo tác vụ thay vì đặt một mức suy nghĩ toàn cục:

  • Tác vụ nhạy cảm với độ trễ: low.
  • Tác nhân cần hoàn thành công việc đáng tin cậy: medium.
  • Tác vụ khó, nhiều bước hoặc cần tự kiểm tra: high.

Khi đánh giá chi phí, hãy nhân theo số tác vụ thực tế. Ví dụ, 1.000 tác vụ mỗi ngày ở mỗi mức suy nghĩ sẽ cho ngân sách rất khác nhau dù giá niêm yết trên mỗi token giống nhau.

Điểm chuẩn

Google công bố các số liệu sau trên trang DeepMind Flash:

Điểm chuẩn Gemini 3.8 Flash Gemini 3.7 Flash Claude Opus 5 GPT-5.6 Sol GPT-5.6 Terra Claude Sonnet 5
Vals Finance Agent v2 61,4% 59,0% 58,6% 53,8% 54,4% 53,9%
Harvey Legal Agent Benchmark 10,0% 8,8% 6,7% 2,5% 0,8% 5,0%
HLE-Verified 54,9% 53,6% 54,4% 54,5% 51,1% 31,0%

So với 3.7 Flash, mức tăng lần lượt là 2,4, 1,2 và 1,3 điểm phần trăm. Mức cải thiện không lớn, nhưng Gemini 3.8 Flash có giá thấp hơn nhiều vẫn vượt qua Opus 5 và GPT-5.6 Sol trong hai bảng tài chính và pháp lý.

Claude Fable 5.1, phát hành một ngày trước đó, không xuất hiện trong bảng Google. Bảng so sánh sử dụng Opus 5 và Sonnet 5 của Anthropic làm các phiên bản được công bố gần nhất.

Google cũng đưa ra một số tuyên bố chưa có số liệu dạng văn bản:

  • Trên DeepSWE v1.1, Gemini 3.8 Flash vượt trội hơn hầu hết mô hình lớn hơn với chi phí thấp hơn. Gemini 3.7 Flash đạt 65,3%, nhưng phần trăm của 3.8 Flash chỉ xuất hiện trong bảng hình ảnh của thẻ mô hình.
  • Trong quy trình dài hạn, nặng về tài liệu, đánh giá nội bộ cho thấy mô hình hoàn thành nhiều hơn ba lần số tác vụ so với 3.7 Flash.
  • Khả năng chống tấn công prompt Gray Swan được cải thiện đáng kể.
  • Kết quả SWE-Bench Pro, Terminal-bench và OSWorld chưa được công bố ở dạng văn bản.

Artificial Analysis chấm Gemini 3.8 Flash ở mức high đạt 59 điểm trên Intelligence Index, tăng từ 56 điểm của 3.7 Flash và 52 điểm của 3.6 Flash. Điểm này ngang GPT-5.6 Sol ở mức rất cao và Grok 4.6 ở mức trung bình; cao hơn GPT-5.6 Terra, Claude Fable 5.1 và Muse Spark 1.2, đều đạt 57 điểm.

Trên bài kiểm tra gọi công cụ τ³-Banking, Gemini 3.8 Flash đạt 45%, cao hơn 3.7 Flash 12 điểm phần trăm.

Giá: cùng giá mỗi token, cao hơn mỗi tác vụ

Tất cả giá dưới đây đều tăng gấp đôi từ ngày 1 tháng 1 năm 2027:

Hạng mục Đến 31/12/2026 Từ 1/1/2027
Đầu vào 0,75 USD / 1 triệu token 1,50 USD / 1 triệu token
Đầu ra, bao gồm token suy nghĩ 3,75 USD / 1 triệu token 7,50 USD / 1 triệu token
Đầu vào được lưu vào bộ đệm 0,075 USD / 1 triệu token 0,15 USD / 1 triệu token
Lưu trữ bộ đệm 0,50 USD / 1 triệu token / giờ 1,00 USD / 1 triệu token / giờ
Batch đầu vào / đầu ra 0,375 USD / 1,875 USD 0,75 USD / 3,75 USD

Token suy nghĩ được tính là token đầu ra và được báo cáo riêng trong usageMetadata.thoughtsTokenCount. Vì vậy, một câu trả lời ngắn ở mức high vẫn có thể đắt hơn câu trả lời dài ở mức low.

Google Search grounding có hạn mức riêng:

  • 5.000 yêu cầu miễn phí mỗi tháng, dùng chung cho tất cả mô hình Gemini 3.x.
  • Sau đó: 14 USD cho mỗi 1.000 yêu cầu.

AI Studio và API vẫn có tầng miễn phí giới hạn tốc độ. Google lưu ý dữ liệu ở tầng miễn phí có thể được sử dụng để cải thiện sản phẩm. Hạn mức cụ thể theo mô hình hiển thị trong AI Studio thay vì tài liệu.

Các mốc mở khóa:

  • Tầng 1: liên kết tài khoản thanh toán.
  • Tầng 2: chi tiêu 100 USD và tài khoản hoạt động ba ngày.
  • Tầng 3: chi tiêu 1.000 USD và tài khoản hoạt động 30 ngày.

Các tác vụ có thể chờ đợi nên dùng Batch API để nhận giảm giá 50%.

Cách gọi Gemini 3.8 Flash

Google hiện xem Interactions API là đường dẫn chính cho Gemini 3.x. generateContent được coi là cũ nhưng vẫn được hỗ trợ đầy đủ và chưa có ngày ngừng hoạt động.

Yêu cầu Interactions tối thiểu:

curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
  -H "x-goog-[REDACTED CREDENTIAL] \
  -H 'Content-Type: application/json' \
  -d '{"model":"gemini-3.8-flash","input":"Explain HTTP caching in 3 sentences.","generation_config":{"thinking_level":"medium"}}'
Enter fullscreen mode Exit fullscreen mode

Với hội thoại nhiều lượt, truyền previous_interaction_id để máy chủ giữ trạng thái.

Khi dùng function calling:

  1. Khai báo công cụ bằng JSON Schema.
  2. Nhận bước function_call.
  3. Gửi lại function_result có cả call_idname.
  4. Tiếp tục vòng lặp cho đến khi mô hình hoàn tất.

Trên Gemini 3.8 Flash, call_idname là bắt buộc trong function_result. Trong generateContent cũ, trường tương ứng thường được gọi là id.

Checklist khi chuyển từ Gemini 3.7 Flash

  • Không dùng thinking_level: "minimal" vì sẽ bị từ chối.
  • Thay thinking_budget bằng thinking_level.
  • Không sử dụng candidate_count.
  • Giữ temperature ở mặc định 1.0; Google cảnh báo giảm giá trị này có thể gây lặp hoặc làm giảm hiệu suất.
  • Kiểm tra lại vòng lặp gọi công cụ và giới hạn số lần lặp.
  • Đo thoughtsTokenCount thay vì chỉ kiểm tra độ dài câu trả lời.

Những gì Gemini 3.8 Flash không hỗ trợ

Gemini 3.8 Flash nhận văn bản, hình ảnh, video, âm thanh và PDF, nhưng chỉ tạo đầu ra văn bản.

Không được hỗ trợ:

  • Tạo âm thanh.
  • Live API.
  • Tạo hình ảnh.
  • Phân đoạn hình ảnh trên các mô hình Gemini 3.

Do đó, Gemini 3.8 Flash phù hợp làm lớp suy luận và gọi công cụ, không phải toàn bộ hệ thống thời gian thực. Nếu cần văn bản thông lượng cao, giá thấp và không yêu cầu suy luận nặng, Gemini 3.5 Flash-Lite vẫn có giá 0,30 USD / 2,50 USD cho mỗi triệu token.

Các tính năng còn lại được hỗ trợ gồm:

  • Function calling.
  • Structured output.
  • Context caching.
  • Code execution.
  • Google Search và Maps grounding.
  • Batch API.
  • Computer use ở trạng thái xem trước.

Gemini 3.8 Flash Cyber

Gemini 3.8 Flash Cyber được phát hành cùng ngày nhưng không có đăng ký công khai. Quyền truy cập chỉ dành cho Chương trình Fairwind, hướng đến:

  • Cơ quan chính phủ đáng tin cậy.
  • Đơn vị vận hành hạ tầng quan trọng.
  • Đơn vị bảo trì phần mềm.

Chương trình yêu cầu kiểm tra lý lịch và các biện pháp như MFA chống lừa đảo. Hiện không có API công khai, giá công khai hoặc tùy chọn tự lưu trữ. Mô hình này thay thế phiên bản thử nghiệm giới hạn Gemini 3.5 Flash Cyber.

Theo Google:

  • Tỷ lệ phát hiện lỗ hổng trong thế giới thực vượt 70% trên 20 ngôn ngữ lập trình.
  • Báo cáo của đội bảo mật Chrome cho biết mô hình vá lỗi chính xác hơn 2,6 lần đối với lỗ hổng Chrome so với các mô hình thương mại lớn hơn.

Đây đều là số liệu do Google báo cáo. Phần lớn nhóm phát triển sẽ không có quyền truy cập vào Cyber.

Kiểm tra Gemini 3.8 Flash trong Apidog

Với Gemini 3.8 Flash, câu hỏi quan trọng không chỉ là “request có thành công không?” mà còn là “request đã sử dụng bao nhiêu token?”.

Bạn có thể dùng Apidog để:

  1. Lưu GEMINI_API_KEY trong biến môi trường.
  2. Tạo các endpoint cho Interactions API và generateContent.
  3. Kiểm tra HTTP status 200.
  4. Xác nhận các trường JSON mà ứng dụng thực sự sử dụng.
  5. Đặt giới hạn cho usageMetadata.thoughtsTokenCount.
  6. Chạy cùng một prompt ở mức low, mediumhigh.
  7. So sánh chi phí, thời gian phản hồi và lượng token theo từng tuyến.

Phản hồi streaming được hiển thị dưới dạng SSE. Khi bật includeThoughts: true, điều này hữu ích để gỡ lỗi phần tóm tắt suy nghĩ. Bạn cũng có thể lập lịch chạy kiểm thử hằng ngày và tạo kiểm thử hồi quy token để phát hiện mức sử dụng tăng trước khi hóa đơn tăng.

Tải Apidog để bắt đầu với gói miễn phí.

Câu hỏi thường gặp

Gemini 3.8 Flash là mô hình mới hay bản cập nhật cho 3.7 Flash?

Thẻ mô hình DeepMind cho biết nó dựa trên Gemini 3.7 Flash. Hãy xem đây là phiên bản kế nhiệm được tinh chỉnh: cùng giá, tốc độ và cửa sổ ngữ cảnh, nhưng có nhiều bước suy luận và gọi công cụ hơn trên tác vụ khó. Gemini 3.7 Flash vẫn được hỗ trợ đầy đủ.

Vì sao Gemini 3.8 Flash sử dụng nhiều token hơn 3.7 Flash?

Đây là hành vi được thiết kế có chủ đích. Google cho biết mô hình có thể chạy lâu hơn và sử dụng nhiều token hơn trên tác vụ phức tạp. Artificial Analysis đo được lượng token đầu ra cao hơn 30%. Hãy hạ thinking_level xuống medium hoặc low trên các tuyến không cần suy luận bổ sung.

Cửa sổ ngữ cảnh của Gemini 3.8 Flash là bao nhiêu?

Mô hình hỗ trợ 1.048.576 token đầu vào và 65.536 token đầu ra. Context caching có giá giới thiệu 0,075 USD cho mỗi triệu token được lưu vào bộ đệm đến hết ngày 31 tháng 12 năm 2026.

Có thể dùng Gemini 3.8 Flash trong ứng dụng Gemini miễn phí không?

Thông tin ra mắt chỉ liệt kê ứng dụng Gemini cho người đăng ký Google AI Pro và Ultra. Nhà phát triển vẫn có thể dùng tầng miễn phí giới hạn tốc độ trong AI Studio và API.

Gemini 3.8 Flash so với Claude Fable 5.1 thế nào?

Artificial Analysis chấm lần lượt 59 và 57 điểm. Claude Fable 5.1 có giá 10 USD / 50 USD cho mỗi triệu token, cao hơn khoảng 13 lần so với mức giá giới thiệu của Gemini 3.8 Flash. Tuy nhiên, khoảng cách sẽ thu hẹp khi tính theo số token thực tế trên mỗi tác vụ.

Kết luận

Gemini 3.8 Flash là mô hình Flash hướng đến tác nhân và quy trình dài hạn. Đổi lại mức cải thiện vài điểm trên các điểm chuẩn tác nhân và 12 điểm trên τ³-Banking, mô hình có thể sử dụng thêm khoảng 30% token đầu ra ở mức suy nghĩ cao.

  • Nếu tác nhân gặp khó khăn với Gemini 3.7 Flash, hãy thử Gemini 3.8 Flash ở mức medium hoặc high.
  • Nếu lưu lượng bị giới hạn bởi độ trễ, dùng low hoặc tiếp tục dùng 3.7 Flash.
  • Đo chi phí theo tác vụ, không chỉ theo giá mỗi token.
  • Gắn xác nhận thoughtsTokenCount vào kiểm thử API.
  • Để số liệu thực tế quyết định mức độ suy nghĩ cho từng tuyến.

Tài liệu tham khảo

Top comments (0)