Gemini 3.8 Flash miễn phí: Cách truy cập và sử dụng Gemini API
Gemini 3.8 Flash ra mắt ngày 2 tháng 9 năm 2026 với một cấp miễn phí thực sự. Bạn có thể trò chuyện với mô hình trong Google AI Studio mà không mất phí hoặc gọi mô hình qua Gemini API bằng một khóa API tạo trong khoảng một phút. Google gọi đây là “mô hình Flash thông minh nhất của chúng tôi”; cấp miễn phí sử dụng cùng model ID gemini-3.8-flash như khách hàng trả phí, không phải phiên bản rút gọn.
Có ba điều cần lưu ý:
- Cấp miễn phí bị giới hạn tốc độ.
- Google sử dụng dữ liệu ở cấp miễn phí để cải thiện sản phẩm.
- Ứng dụng Gemini không cung cấp 3.8 Flash cho người dùng miễn phí; bạn cần Google AI Pro hoặc Ultra.
Nếu muốn xem thông số đầy đủ, hãy đọc Gemini 3.8 Flash là gì. Còn nếu muốn chạy yêu cầu đầu tiên ngay bây giờ, hãy làm theo hướng dẫn dưới đây.
Tổng quan về quyền truy cập miễn phí
| Nền tảng | Chi phí | Bao gồm Gemini 3.8 Flash? | Điểm cần lưu ý |
|---|---|---|---|
| Google AI Studio | $0 | Có | Giới hạn tốc độ; dữ liệu được sử dụng để cải thiện sản phẩm |
| Cấp miễn phí Gemini API | $0 | Có | Giới hạn tương tự, hiển thị trên trang giới hạn tốc độ của AI Studio |
| Ứng dụng Gemini, gói miễn phí | $0 | Không | 3.8 Flash yêu cầu Google AI Pro hoặc Ultra |
| Chế độ AI trong Google Search | $0 | Có với người tiêu dùng | Không có API hoặc quyền kiểm soát mức độ tư duy |
| Gemini trong Google Sheets | Phụ thuộc gói | Có với người tiêu dùng | Không có API |
| Google Search grounding | 5.000 yêu cầu/tháng miễn phí | Dùng chung trên Gemini 3.x | Sau đó $14 cho mỗi 1.000 yêu cầu |
| Batch API | Giảm 50% giá trả phí | Có | Không miễn phí; là lựa chọn trả phí rẻ nhất |
| Gemini 3.8 Flash Cyber | Không bán | Không | Chỉ dành cho Chương trình Fairwind, không có API công khai |
Bước 1: Mở AI Studio và chọn gemini-3.8-flash
Truy cập Google AI Studio và đăng nhập bằng tài khoản Google. Bạn không cần tài khoản thanh toán hoặc thẻ tín dụng.
Trong bộ chọn mô hình, chọn gemini-3.8-flash. Đây là model ID ổn định, không có hậu tố preview.
Gemini 3.8 Flash hỗ trợ ba mức độ tư duy:
low-
medium— mặc định high
Mô hình không hỗ trợ mức minimal. Nếu gửi giá trị này qua API, bạn sẽ nhận lỗi xác thực thay vì hệ thống tự động thay thế. Xem hướng dẫn về mức độ tư duy để hiểu tác động của từng mức đến token và thời gian xử lý.
Hai thiết lập quan trọng khi dùng cấp miễn phí:
-
Giữ
temperatureở mức mặc định1.0. Google khuyến nghị mức này cho các mô hình Gemini 3 vì việc giảm nhiệt độ có thể gây vòng lặp hoặc làm giảm chất lượng đầu ra. -
Bắt đầu với
lowkhi thử nghiệm. Gemini 3.8 Flash được thiết kế để dùng nhiều bước suy luận hơn trong các tác vụ phức tạp. Google cho biết mô hình có thể sử dụng nhiều token hơn cho các tác vụ dài và phức tạp. Vì token suy nghĩ cũng tiêu thụ hạn ngạch, mứchighcó thể làm cạn giới hạn miễn phí nhanh hơn Gemini 3.7 Flash.
Bước 2: Lấy khóa API miễn phí
Trong AI Studio, mở trang khóa API và tạo khóa trong một dự án mới hoặc dự án hiện có. Khóa này miễn phí và hoạt động ngay với cấp miễn phí.
Trang giá Gemini API liệt kê đầu vào và đầu ra của Gemini 3.8 Flash là “Miễn phí” ở cấp này, đồng thời hiển thị giá trả phí. Nếu chưa từng tạo khóa, hãy xem hướng dẫn tạo khóa Gemini API.
Lưu khóa dưới dạng biến môi trường thay vì đưa trực tiếp vào mã nguồn hoặc lịch sử shell:
export GEMINI_API_KEY="dán-khóa-của-bạn-vào-đây"
Hãy coi khóa API như một mật khẩu. Cấp miễn phí không liên kết thanh toán nên khóa bị lộ không thể tự tạo hóa đơn, nhưng người khác vẫn có thể sử dụng hết hạn ngạch hằng ngày của bạn.
Bước 3: Thực hiện cuộc gọi miễn phí đầu tiên
Gemini 3.x hiện chủ yếu chạy trên Interactions API. Bạn có thể gửi yêu cầu trực tiếp bằng curl, không cần SDK:
curl -X POST "https://generativelanguage.googleapis.com/v1beta/interactions" \
-H "x-goog-[REDACTED CREDENTIAL] -H 'Content-Type: application/json' \
-d '{"model":"gemini-3.8-flash","input":"Giải thích bộ nhớ đệm HTTP trong 3 câu.","generation_config":{"thinking_level":"low"}}'
Phản hồi là danh sách các bước thực thi, có thể bao gồm suy nghĩ của mô hình và các lần gọi công cụ, kết thúc bằng bước model_output chứa văn bản trả lời.
Nếu ứng dụng hiện tại đang dùng generateContent, mã đó vẫn hoạt động. Google gọi đây là API cũ nhưng vẫn “được hỗ trợ đầy đủ” và chưa công bố ngày ngừng hoạt động. Trên endpoint này, cấu hình mức độ tư duy nằm ở:
generationConfig.thinkingConfig.thinkingLevel
Cả Interactions API, generateContent, ví dụ Python và xử lý đa lượt với previous_interaction_id đều có trong hướng dẫn Gemini 3.8 Flash API.
Nếu nhận lỗi 429, bạn đã chạm giới hạn tốc độ của cấp miễn phí. Hãy đợi hạn ngạch được khôi phục hoặc chuyển sang cấp trả phí.
Cấp miễn phí thực sự tốn gì?
Bạn không phải trả tiền, nhưng có ba giới hạn thực tế.
1. Giới hạn tốc độ
Cấp miễn phí giới hạn:
- Số yêu cầu mỗi phút.
- Số token mỗi phút.
- Số yêu cầu mỗi ngày cho từng mô hình.
Google công bố các con số chính xác trên trang giới hạn tốc độ của AI Studio, thay vì trong tài liệu tĩnh. Các giới hạn có thể thay đổi mà không có changelog, vì vậy hãy kiểm tra trực tiếp trang này thay vì tin vào những con số trên blog. Tài liệu giới hạn tốc độ giải thích cách các cấp hoạt động.
2. Dữ liệu được sử dụng để cải thiện sản phẩm
Google cho biết prompt và output ở cấp miễn phí được sử dụng để cải thiện sản phẩm. Điều này phù hợp với:
- Prompt benchmark.
- Ứng dụng thử nghiệm.
- Dữ liệu không nhạy cảm.
Không nên gửi:
- Hồ sơ khách hàng.
- Mã nguồn chưa phát hành.
- Dữ liệu thuộc NDA.
- Thông tin cá nhân hoặc bí mật kinh doanh.
Cấp trả phí có điều khoản dữ liệu khác. Nếu cần bảo mật, hãy liên kết thanh toán trước khi gửi dữ liệu nhạy cảm.
3. Token suy nghĩ cũng tiêu thụ hạn ngạch
Artificial Analysis đo Gemini 3.8 Flash ở mức high và ghi nhận khoảng 48.000 token đầu ra cho mỗi tác vụ trên chỉ mục của họ — nhiều hơn khoảng 30% so với Gemini 3.7 Flash.
Token suy nghĩ được tính vào cùng giới hạn token mỗi phút với output hiển thị. Vì vậy, mô hình suy luận mạnh hơn cũng có thể tiêu thụ hạn ngạch miễn phí nhanh hơn. Trong giai đoạn thử nghiệm, nên mặc định dùng low hoặc medium.
Ứng dụng Gemini không phải là lộ trình miễn phí
Nhiều kết quả tìm kiếm về “Gemini 3.8 Flash miễn phí” gây nhầm lẫn ở điểm này.
Ở phía người dùng cuối, Gemini 3.8 Flash có trong ứng dụng Gemini dành cho thuê bao Google AI Pro và Ultra. Gói ứng dụng miễn phí không bao gồm mô hình này. Nếu ứng dụng hiển thị một mô hình Flash khi bạn chưa đăng ký, đó không phải Gemini 3.8 Flash.
Hai nền tảng người tiêu dùng có thể cung cấp 3.8 Flash mà không tính thêm phí là:
- Chế độ AI trong Google Search.
- Gemini trong Google Sheets.
Tuy nhiên, các nền tảng này không cho phép bạn kiểm soát mức độ tư duy, số lượng token hoặc API. Với mục đích phát triển, AI Studio và cấp miễn phí Gemini API mới là lựa chọn phù hợp.
Grounding miễn phí: 5.000 yêu cầu Google Search mỗi tháng
Google Search grounding cho phép mô hình lấy thông tin web hiện tại và đưa vào câu trả lời. Tính năng này có 5.000 yêu cầu miễn phí mỗi tháng, dùng chung cho tất cả mô hình Gemini 3.x.
Hạn ngạch là một nhóm dùng chung, không phải 5.000 yêu cầu cho mỗi mô hình. Ví dụ, một yêu cầu grounding với Gemini 3 Pro và một yêu cầu grounding với Gemini 3.8 Flash đều trừ vào cùng hạn ngạch đó.
Sau 5.000 yêu cầu, giá là 14 USD cho mỗi 1.000 yêu cầu. Đây là khoản trợ cấp tốt cho prototype cần dữ liệu mới, nhưng ứng dụng production vẫn cần ngân sách riêng.
Khi hết miễn phí: các lựa chọn trả phí rẻ nhất
Bạn có thể chuyển sang trả phí theo bốn cách sau, từ đơn giản và rẻ nhất.
1. Liên kết tài khoản thanh toán để lên Cấp 1
Liên kết tài khoản thanh toán với dự án trong AI Studio sẽ tự động đưa bạn lên Cấp 1:
- Giới hạn tốc độ cao hơn.
- Giới hạn chi tiêu 250 USD.
- Không yêu cầu phải chi tiền trước.
Cấp 2 mở khóa sau khi chi 100 USD và sử dụng dịch vụ thêm ba ngày, với giới hạn chi tiêu 2.000 USD. Cấp 3 yêu cầu chi 1.000 USD và sử dụng dịch vụ trong 30 ngày.
2. Sử dụng giá giới thiệu
Đến hết ngày 31 tháng 12 năm 2026, Gemini 3.8 Flash có giá:
- 0,75 USD cho mỗi triệu token đầu vào.
- 3,75 USD cho mỗi triệu token đầu ra.
- Token suy nghĩ được tính như token đầu ra.
Từ ngày 1 tháng 1 năm 2027, giá tăng gấp đôi lên 1,50 USD cho đầu vào và 7,50 USD cho đầu ra.
Ví dụ, 1.000 yêu cầu với 2.000 token đầu vào và 500 token đầu ra mỗi yêu cầu có giá khoảng 3,38 USD theo giá giới thiệu. Xem bảng phân tích giá Gemini 3.8 Flash để tính chi phí theo tác vụ.
3. Dùng Batch API cho tác vụ không cần phản hồi ngay
Batch API giảm một nửa giá:
- 0,375 USD cho mỗi triệu token đầu vào.
- 1,875 USD cho mỗi triệu token đầu ra đến hết năm 2026.
Cùng ví dụ 1.000 yêu cầu ở trên, chi phí còn khoảng 1,69 USD. Tài khoản Cấp 1 có thể xếp hàng tối đa 3 triệu token cùng lúc.
Batch API phù hợp với:
- Đánh giá hàng loạt.
- Backfill dữ liệu.
- Tác vụ chạy ban đêm.
- Các quy trình không yêu cầu phản hồi đồng bộ.
Xem hướng dẫn Gemini API Batch Mode để biết cấu trúc request.
4. Caching các tiền tố ổn định
Context caching có giá 0,075 USD cho mỗi triệu token được lưu trong bộ nhớ đệm theo mức giá giới thiệu — chỉ bằng một phần mười giá token đầu vào mới.
Hãy cân nhắc caching nếu bạn thường gửi lại:
- System prompt dài.
- Tài liệu tham chiếu lớn.
- Cùng một ngữ cảnh qua nhiều lượt gọi.
Những gì cấp miễn phí không cung cấp
- Ứng dụng Gemini: Chỉ Google AI Pro và Ultra mới có 3.8 Flash.
- Quyền riêng tư: Dữ liệu ở cấp miễn phí được Google sử dụng để cải thiện sản phẩm và không có tùy chọn tắt.
- Hạn ngạch lớn: Các giới hạn được hiển thị trên trang giới hạn tốc độ và phù hợp hơn với đánh giá hoặc công cụ nhỏ, không phải production.
- Gemini 3.8 Flash Cyber: Phiên bản bảo mật này thuộc Chương trình Fairwind dành cho chính phủ, nhà vận hành cơ sở hạ tầng và nhà bảo trì phần mềm. Không có API công khai, giá bán hoặc tùy chọn tự lưu trữ.
- API trực tiếp, tạo ảnh hoặc tạo âm thanh: Gemini 3.8 Flash nhận đầu vào văn bản, hình ảnh, video, âm thanh và PDF, nhưng chỉ tạo đầu ra văn bản. Mô hình không hỗ trợ tạo ảnh hoặc âm thanh.
- Quyền truy cập không giới hạn: Những website quảng cáo Gemini không giới hạn có thể đang dùng khóa của người khác hoặc cung cấp một mô hình khác. Hướng dẫn truy cập Gemini API miễn phí giải thích cách nhận biết. Chiến lược từng áp dụng cho Gemini 3.6 Flash cũng có thể tham khảo ở đây.
Tận dụng tối đa hạn ngạch với Apidog
Cấp miễn phí hiệu quả nhất khi bạn kiểm soát tốt từng request. Mỗi lần nhập lại prompt thủ công, mỗi lỗi 429 và mỗi lần dùng mức tư duy cao không cần thiết đều làm giảm hạn ngạch không thể hoàn lại.
Apidog giúp chuẩn hóa quy trình:
- Lưu
GEMINI_API_KEYdưới dạng biến môi trường trong một environment của Apidog để khóa không xuất hiện trong request hoặc collection được chia sẻ. - Lưu Interactions API và endpoint
generateContentcũ thành các request có tên, với model, prompt vàthinking_levelđược điền sẵn. - Dùng biến môi trường để chuyển giữa
low,mediumvàhighthay vì chỉnh sửa JSON thủ công. - Thêm assertion cho mã trạng thái để lỗi
429hiển thị là test thất bại thay vì một response trống. - Với endpoint cũ, kiểm tra
usageMetadata.thoughtsTokenCountđể theo dõi số token đã dùng cho suy nghĩ.
Bạn cũng có thể lên lịch một smoke test nhỏ — chẳng hạn một request ở mức low mỗi ngày. Cách này giúp phát hiện thay đổi về hành vi mô hình hoặc giới hạn miễn phí trước khi người dùng nhận ra.
Tải Apidog để bắt đầu và xem cách lên lịch kiểm tra API trong Apidog để cấu hình lịch chạy.
Câu hỏi thường gặp
Gemini 3.8 Flash có miễn phí không?
Có. Bạn có thể dùng mô hình qua Google AI Studio và cấp miễn phí Gemini API. Tuy nhiên, cấp này có giới hạn tốc độ và dữ liệu của bạn được sử dụng để cải thiện sản phẩm Google. Model ID giống cấp trả phí là gemini-3.8-flash.
Tôi có thể dùng Gemini 3.8 Flash trong ứng dụng Gemini miễn phí không?
Không. Ứng dụng Gemini cung cấp 3.8 Flash cho thuê bao Google AI Pro và Ultra. Chế độ AI trong Google Search và Gemini trong Sheets là các nền tảng người tiêu dùng có thể sử dụng mà không cần đăng ký.
Giới hạn tốc độ của cấp miễn phí là gì?
Google hiển thị giới hạn theo từng mô hình trên trang giới hạn tốc độ của AI Studio, thay vì cố định trong nội dung tài liệu. Các giới hạn có thể thay đổi, vì vậy hãy kiểm tra dự án cụ thể của bạn. Khi cần nhiều hơn, liên kết tài khoản thanh toán sẽ đưa dự án lên Cấp 1 mà không yêu cầu chi tiêu.
Cấp miễn phí có bao gồm suy nghĩ không?
Có. Cả ba mức low, medium và high đều hoạt động ở cấp miễn phí; medium là mặc định. Mức minimal trả về lỗi trên Gemini 3.8 Flash. Vì token suy nghĩ được tính vào hạn ngạch, low sẽ giúp kéo dài thời gian sử dụng miễn phí nhất.
Gemini 3.8 Flash Cyber có miễn phí không?
Không. Mô hình này chỉ có trong Chương trình Fairwind và không được cung cấp cho công chúng. Nhà phát triển thông thường có thể dùng Gemini 3.8 Flash để xây dựng và tự thực hiện các kiểm tra bảo mật API.
Bắt đầu miễn phí, sau đó quyết định
Cấp miễn phí là môi trường đánh giá đầy đủ cho Gemini 3.8 Flash, không phải bản dùng thử bị rút gọn. Hãy tạo khóa API, bắt đầu với mức tư duy low, không gửi dữ liệu nhạy cảm và thường xuyên kiểm tra trang giới hạn tốc độ.
Khi lỗi 429 bắt đầu làm gián đoạn công việc, liên kết thanh toán để lên Cấp 1 và chuyển các tác vụ không đồng bộ sang Batch API. Với giá 0,375 USD cho mỗi triệu token đầu vào đến hết tháng 12 năm 2026, tháng trả phí đầu tiên có thể còn rẻ hơn ly cà phê bạn uống trong lúc chờ hạn ngạch miễn phí được đặt lại.

Top comments (0)