DEV Community

Cover image for Gemini 3.5 Flash-Lite là gì
Sebastian Petrus
Sebastian Petrus

Posted on • Originally published at apidog.com

Gemini 3.5 Flash-Lite là gì

Google đã làm mới cấp độ Flash vào ngày 21 tháng 7 năm 2026, và Gemini 3.5 Flash-Lite là phiên bản tiết kiệm chi phí nhất trong đợt phát hành này. Đây là mô hình Gemini rẻ nhất và nhanh nhất hiện có, được thiết kế cho các tác vụ khối lượng lớn, nhạy cảm với độ trễ như phân loại, trích xuất dữ liệu, trả lời tin nhắn ngắn và RAG đơn giản—những trường hợp thông lượng và chi phí quan trọng hơn suy luận sâu.

Dùng thử Apidog ngay hôm nay

Nếu bạn xử lý hàng triệu yêu cầu nhỏ mỗi ngày, Gemini 3.5 Flash-Lite là cấp độ phù hợp để đưa vào luồng xử lý chính. Đợt làm mới này gồm ba mô hình, với cách đặt tên dễ gây nhầm lẫn. Bài viết sẽ làm rõ khác biệt, thông số, chi phí và cách gọi API để tự kiểm tra endpoint.

Gemini 3.5 Flash-Lite là gì?

Gemini 3.5 Flash-Lite là mô hình nhỏ nhất và rẻ nhất trong dòng Gemini của Google. Mô hình được tối ưu cho tốc độ và khối lượng xử lý, không phải các bài toán suy luận phức tạp nhất.

Google ước tính mô hình có thể tạo khoảng 350 token đầu ra mỗi giây, giúp phản hồi gần như tức thì ngay cả khi tải cao. ID mô hình để gọi qua Gemini API là:

gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Gemini 3.5 Flash-Lite

Hãy dùng Flash-Lite cho các tác vụ lặp lại, có cấu trúc và tần suất cao, ví dụ:

  • Gắn nhãn hoặc phân loại ticket hỗ trợ.
  • Trích xuất trường dữ liệu từ email, hóa đơn hoặc biểu mẫu.
  • Tóm tắt hoặc trả lời ngắn từ nội dung đã truy xuất.
  • Xây dựng chatbot cần phản hồi nhanh.
  • Chuẩn hóa dữ liệu văn bản trước khi lưu vào cơ sở dữ liệu.

Các trường hợp sử dụng Gemini 3.5 Flash-Lite

Gemini 3.5 Flash-Lite được phát hành cùng hai mô hình khác:

  • Gemini 3.6 Flash: mô hình Flash chủ lực mới.
  • Gemini 3.5 Flash-Lite: mô hình tối ưu chi phí và thông lượng.
  • Gemini 3.5 Flash Cyber: mô hình bảo mật có kiểm soát.

Bạn có thể xem thông tin gốc trên blog của Googletrang DeepMind Flash. Flash-Lite đứng ở cuối bảng giá và ở đầu bảng tốc độ thô.

Khoan đã, tại sao là 3.5 mà không phải 3.6?

Đây là điểm dễ gây nhầm lẫn nhất.

Mô hình chủ lực mới là Gemini 3.6 Flash, nhưng Flash-Lite và Flash Cyber vẫn dùng nhãn 3.5. Đây không phải lỗi đánh máy: Google phát hành các phiên bản hỗn hợp trong cùng một đợt ra mắt.

Số phiên bản theo dõi dòng mô hình, không theo ngày phát hành. Gemini 3.6 Flash có bước tiến thế hệ lớn hơn nên nhận nhãn 3.6, trong khi Flash-Lite vẫn thuộc nhánh 3.5.

Một điểm khác cần kiểm tra khi tích hợp: Gemini 3.5 Flash-Lite không phải Gemini 3.1 Flash-Lite của thế hệ trước.

Nếu bạn đã dùng 3.1 Flash-Lite, hãy cập nhật rõ ID mô hình trong cấu hình:

- gemini-3.1-flash-lite
+ gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Thông số kỹ thuật và giá cả

Tất cả mức giá dưới đây được tính theo mỗi triệu token qua Gemini API.

Thuộc tính Giá trị
ID mô hình gemini-3.5-flash-lite
Giá đầu vào $0.30 / 1 triệu token
Giá đầu ra $2.50 / 1 triệu token
Tốc độ ~350 token đầu ra/giây
Cấp độ miễn phí Có, qua Google AI Studio, có giới hạn tần suất
Bộ nhớ đệm ngữ cảnh $0.03 / 1 triệu token + $1.00 / 1 triệu token/giờ lưu trữ

Với giá đầu vào $0.30 và đầu ra $2.50 cho mỗi triệu token, Flash-Lite là mức giá công bố rẻ nhất trong dòng Gemini hiện tại.

Để so sánh:

Mô hình Input / 1 triệu token Output / 1 triệu token
Gemini 3.5 Flash-Lite $0.30 $2.50
Gemini 3.6 Flash $1.50 $7.50

Flash-Lite có chi phí đầu vào khoảng một phần năm và chi phí đầu ra bằng một phần ba so với 3.6 Flash. Với hàng triệu lời gọi ngắn, chênh lệch này có tác động trực tiếp đến ngân sách vận hành.

Hãy xác nhận giá hiện tại trong tài liệu giá Gemini API, vì Google cập nhật trực tiếp tại đó.

Khi nào nên dùng bộ nhớ đệm ngữ cảnh?

Dùng context caching khi nhiều yêu cầu chia sẻ cùng dữ liệu đầu vào, chẳng hạn:

  • System prompt cố định.
  • Bộ quy tắc phân loại dài.
  • Tài liệu tham chiếu được dùng lặp lại.
  • Schema JSON yêu cầu mô hình tuân thủ.

Bạn trả phí để lưu token và phí lưu trữ theo giờ, nhưng giảm chi phí cho các token được tái sử dụng trong các lời gọi tiếp theo.

Hiệu suất thực tế

Gemini 3.5 Flash-Lite đạt 54% trên Terminal-Bench 2.1, tăng từ 31% so với phiên bản tiền nhiệm. Đây là bước tiến đáng kể với một mô hình cấp Lite.

Các tác vụ phù hợp nhất gồm:

  1. Phân loại

    Ví dụ: định tuyến ticket đến billing, technical, account, hoặc other.

  2. Trích xuất dữ liệu

    Ví dụ: lấy tên khách hàng, mã đơn hàng, ngày tháng hoặc tổng tiền từ văn bản không có cấu trúc.

  3. Trả lời chat ngắn

    Ví dụ: trả lời FAQ, xác nhận trạng thái hoặc hướng dẫn ngắn.

  4. RAG đơn giản

    Ví dụ: trả lời một câu hỏi dựa trên một hoặc vài đoạn văn đã truy xuất.

Ví dụ prompt phân loại ticket:

Phân loại yêu cầu hỗ trợ dưới đây vào đúng một nhãn:
billing, technical, account, other.

Chỉ trả về JSON theo cấu trúc:
{"category":"<nhãn>","confidence":0-1}

Yêu cầu:
"Thẻ của tôi đã bị tính phí hai lần cho cùng một gói đăng ký."
Enter fullscreen mode Exit fullscreen mode

Mô hình Lite không phải lựa chọn tối ưu cho:

  • Lập trình tác tử phức tạp.
  • Chuỗi gọi công cụ dài, nhiều bước.
  • Lập kế hoạch có phụ thuộc.
  • Suy luận sâu trên cơ sở mã lớn.
  • Tác vụ cần độ tin cậy cao qua nhiều bước.

Trong các trường hợp đó, hãy cân nhắc Gemini 3.6 Flash hoặc một mô hình lớn hơn. Chi phí thấp không còn có ý nghĩa nếu kết quả sai làm tăng chi phí xử lý lại.

Google sử dụng Flash-Lite ở đâu?

Google đang tích hợp Flash-Lite vào Google Tìm kiếm. Điều này cho thấy mô hình được định vị cho lưu lượng truy cập lớn, độ trễ thấp và chi phí mỗi yêu cầu thấp.

Đối với ứng dụng của bạn, đây là tín hiệu thực tế: các đặc tính khiến Flash-Lite phù hợp với lưu lượng tìm kiếm cũng phù hợp với các endpoint sản xuất bận rộn, chẳng hạn hệ thống phân loại, chatbot FAQ hoặc pipeline trích xuất dữ liệu.

Flash-Lite vs Gemini 3.6 Flash: nên chọn mô hình nào?

Quy tắc nhanh:

  • Chọn Flash-Lite khi công việc đơn giản, khối lượng lớn và nhạy cảm với tốc độ.
  • Chọn Gemini 3.6 Flash khi công việc cần suy luận mạnh hơn, lập trình hoặc tác vụ tác tử nhiều bước.
Tiêu chí Gemini 3.5 Flash-Lite Gemini 3.6 Flash
Chi phí Thấp nhất Cao hơn
Tốc độ ~350 token/giây Không phải trọng tâm chính
Phân loại, trích xuất Phù hợp Phù hợp
Chat ngắn, RAG đơn giản Phù hợp Phù hợp
Lập trình phức tạp Hạn chế Phù hợp hơn
Quy trình tác tử nhiều bước Hạn chế Phù hợp hơn
Suy luận sâu Hạn chế Mạnh hơn

Một chiến lược thực tế là định tuyến theo độ khó:

Yêu cầu đơn giản, lặp lại, tần suất cao
  -> Gemini 3.5 Flash-Lite

Yêu cầu cần lập kế hoạch, code hoặc gọi công cụ nhiều bước
  -> Gemini 3.6 Flash
Enter fullscreen mode Exit fullscreen mode

Cách này giữ chi phí thấp cho phần lớn lưu lượng, đồng thời chỉ dùng mô hình mạnh hơn khi thực sự cần thiết.

Xem thêm giá Gemini 3.6 Flash và bài so sánh Gemini 3.5 Flash-Lite vs 3.6 Flash.

Cách truy cập và kiểm tra Gemini 3.5 Flash-Lite

Flash-Lite chạy trên Gemini API. Cách bắt đầu nhanh nhất:

  1. Mở Google AI Studio.
  2. Tạo API key.
  3. Đặt biến môi trường cho API key.
  4. Gọi mô hình gemini-3.5-flash-lite.
  5. Kiểm tra cấu trúc phản hồi trước khi đưa vào production.

Cấp độ miễn phí phù hợp để thử nghiệm nhưng bị giới hạn tần suất. Google có thể sử dụng dữ liệu ở cấp độ miễn phí để cải thiện sản phẩm, vì vậy không nên gửi dữ liệu nhạy cảm qua khóa miễn phí.

Xem tài liệu đầy đủ tại Gemini API docs.

Gọi endpoint bằng cURL

Đầu tiên, lưu API key trong biến môi trường:

export GEMINI_API_KEY="your-api-key"
Enter fullscreen mode Exit fullscreen mode

Sau đó gửi yêu cầu:

curl --request POST \
  --header "Content-Type: application/json" \
  --url "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.5-flash-lite:generateContent?key=${GEMINI_API_KEY}" \
  --data '{
    "contents": [
      {
        "parts": [
          {
            "text": "Phân loại câu này thành positive, neutral hoặc negative. Chỉ trả về nhãn: Tôi hài lòng với tốc độ phản hồi."
          }
        ]
      }
    ]
  }'
Enter fullscreen mode Exit fullscreen mode

Khi kiểm tra phản hồi, hãy xác thực ít nhất:

  • HTTP status là 200.
  • Phản hồi có nội dung cần dùng.
  • Đầu ra tuân thủ schema hoặc định dạng mà ứng dụng yêu cầu.
  • Mô hình trả về đúng nhãn hoặc trường dữ liệu cho các test case mẫu.

Kiểm tra endpoint bằng Apidog

Khi request đã hoạt động, bước tiếp theo là biến nó thành kiểm thử hồi quy. Giá, giới hạn tần suất và cấu trúc phản hồi có thể thay đổi khi Google cập nhật API. Một mô hình Lite nhanh nhưng đôi khi trả lời sai cần có assertion để phát hiện sai lệch sớm.

Với Apidog, bạn có thể:

  1. Tạo request POST tới Gemini endpoint.
  2. Lưu API key dưới dạng biến môi trường thay vì ghi trực tiếp trong request.
  3. Thêm assertion cho mã trạng thái và trường JSON.
  4. Lưu request thành test case hồi quy.
  5. Lên lịch chạy kiểm thử để phát hiện lỗi trước người dùng.

Ví dụ assertion nên có:

Status code = 200
Response body có trường candidates
Response body có nội dung text
Nhãn trả về thuộc tập giá trị hợp lệ
Enter fullscreen mode Exit fullscreen mode

Apidog không chạy mô hình và không thay thế Gemini API. Đây là ứng dụng khách để gọi, xác thực và giám sát endpoint gemini-3.5-flash-lite cùng phần còn lại của API stack.

Câu hỏi thường gặp

Gemini 3.5 Flash-Lite có giống Gemini 3.6 Flash không?

Không. Đây là hai mô hình khác nhau trong cùng đợt làm mới ngày 21 tháng 7 năm 2026. Flash-Lite là cấp độ rẻ nhất và nhanh nhất cho tác vụ đơn giản, khối lượng lớn. Gemini 3.6 Flash là mô hình chủ lực có khả năng suy luận và lập trình mạnh hơn.

Tại sao Flash-Lite là 3.5 thay vì 3.6?

Google dùng phiên bản hỗn hợp: mô hình Flash chủ lực được nâng lên 3.6, trong khi Flash-Lite và Flash Cyber vẫn giữ nhãn 3.5. Số phiên bản theo dõi dòng mô hình, không theo ngày ra mắt.

Đây có phải Gemini 3.1 Flash-Lite cũ không?

Không. Gemini 3.5 Flash-Lite là mô hình mới hơn. Gemini 3.1 Flash-Lite là thế hệ trước. Hãy kiểm tra ID mô hình:

gemini-3.5-flash-lite
Enter fullscreen mode Exit fullscreen mode

Gemini 3.5 Flash-Lite có miễn phí không?

Có cấp độ miễn phí qua Google AI Studio, với giới hạn tần suất. Cấp độ này phù hợp để thử nghiệm và sử dụng nhẹ. Với khối lượng production, hãy dùng API key trả phí và tránh gửi dữ liệu nhạy cảm qua cấp độ miễn phí.

Flash-Lite phù hợp nhất với việc gì?

Flash-Lite phù hợp cho phân loại, trích xuất, trả lời tin nhắn ngắn và RAG đơn giản ở quy mô lớn. Đây không phải lựa chọn tối ưu cho lập trình tác tử khó hoặc suy luận dài nhiều bước—những tác vụ mà Gemini 3.6 Flash phù hợp hơn.

Top comments (0)