Gemini · Chi phí AI · Chủ quyền dữ liệu

Gemini 3.6 Flash: token rẻ hơn 17%, nhưng vùng xử lý ML vẫn chỉ có endpoint global — doanh nghiệp Việt đọc thế nào?

Cập nhật lần cuối: 22/07/2026

Render trừu tượng mạch số phát sáng đỏ và trắng, minh hoạ lớp tính toán của mô hình ngôn ngữ

Ảnh: Pachon in Motion / Pexels

Ngày 21/07/2026, Google công bố Gemini 3.6 Flash cùng 3.5 Flash-Lite và 3.5 Flash Cyber. Điểm bán hàng chính không phải "thông minh hơn" mà là hiệu quả token: cùng một việc, model dùng ít token đầu ra hơn và giá mỗi token đầu ra cũng rẻ hơn. Bài này đối chiếu ba nguồn kiểm chứng được — công bố của Google, bảng giá Gemini API, và số đo độc lập của Artificial Analysis — rồi chỉ ra một đánh đổi ít ai nhắc: trang model chính thức của 3.6 Flash chưa liệt kê vùng xử lý ML nào ngoài endpoint global. Mọi số liệu tra cứu ngày 22/07/2026.

Tóm tắt nhanh

  • Rẻ hơn ở đầu ra. Giá output của 3.6 Flash là $7,50/1 triệu token, giảm từ $9,00 của 3.5 Flash (−16,7%). Giá input giữ nguyên $1,50.
  • Dùng ít token hơn. Google nói 3.6 Flash tiêu thụ ít hơn 17% token đầu ra so với 3.5 Flash trên Artificial Analysis Index. Số đo độc lập của Artificial Analysis cho ra −16,0% (23.307 so với 27.733 token/tác vụ) — khớp với công bố.
  • Nhanh hơn nhiều, thông minh gần như bằng. Artificial Analysis đo tốc độ đầu ra 279,96 token/giây so với 169,67 của 3.5 Flash (nhanh hơn ~1,65 lần), trong khi Intelligence Index gần như đi ngang: 50,07 so với 50,20.
  • Đánh đổi thật: trang model chính thức của 3.6 Flash (cập nhật 21/07/2026) khai báo Model availability chỉ có globalkhông có mục ML processing; trong khi 3.5 Flash liệt kê ML processing tại asia-southeast1 (Singapore), asia-northeast1, asia-south1, us, eu, europe-west2.
  • Hệ quả cho doanh nghiệp Việt: nếu hồ sơ tuân thủ của bạn yêu cầu biết dữ liệu được xử lý ở vùng nào, 3.6 Flash chưa đáp ứng — Google ghi rõ endpoint global không bảo đảm cách ly theo vùng.

Số liệu chính (có nguồn)

  • Gemini 3.6 Flash phát hành 21/07/2026, launch stage GA, model ID gemini-3.6-flashtrang model Google Cloud.
  • Giá standard paid tier: $1,50 input / $7,50 output mỗi 1M token; batch $0,75 / $3,75; context caching hạng standard $0,15bảng giá Gemini Developer API.
  • Gemini 3.5 Flash để so: $1,50 input / $9,00 output; Gemini 3.5 Flash-Lite (cùng ngày 21/07): $0,30 / $2,50cùng bảng giá.
  • Artificial Analysis đo độc lập: Intelligence Index 50,07 (3.6 Flash) so với 50,20 (3.5 Flash); tốc độ đầu ra 279,96 so với 169,67 token/giây; cửa sổ ngữ cảnh cả hai đều 1 triệu token.
  • Chi phí chạy trọn bộ Artificial Analysis Intelligence Index: $726,70 cho 3.6 Flash so với $1.040,88 cho 3.5 Flash — thấp hơn 30,2% (tổng 5 hạng mục token do Artificial Analysis công bố).

Gemini 3.6 Flash mới ở chỗ nào?

Điểm mới cốt lõi của Gemini 3.6 Flash là làm xong cùng một việc bằng ít token đầu ra hơn — Google công bố mức giảm 17% so với 3.5 Flash trên Artificial Analysis Index, và tới 65% ở một số phép đo như DeepSWE của Datacurve. Google mô tả model này hướng vào điều phối nhiều bước, tái cấu trúc mã toàn stack và suy luận tổng quát; model cũng "ít hành động thừa" hơn — giải quyết các tác vụ chẩn đoán chỉ-đọc mà không tự ý sửa file.

Về thông số cứng, 3.6 Flash giữ nguyên khung của dòng Flash: cửa sổ ngữ cảnh 1.048.576 token, tối đa 65.536 token đầu ra, nhận text/ảnh/audio/video và chỉ xuất text. Có vài thay đổi có thể làm vỡ code cũ mà đội kỹ thuật cần biết trước: các tham số temperature, top-K, top-P tuỳ chỉnh sẽ bị bỏ qua, còn frequency penaltypresence penalty tuỳ chỉnh sẽ báo lỗi. Nếu bạn chưa nắm khái niệm token, đọc trước bài Token AI là gì?.

Cùng ngày, Google phát hành Gemini 3.5 Flash-Lite (bản rẻ và nhanh nhất dòng 3.5) và Gemini 3.5 Flash Cyber — model chuyên bảo mật; theo Google, model này sắp được mở, và khi mở thì chỉ dành riêng cho chính phủ và đối tác tin cậy qua CodeMender theo một chương trình thí điểm truy cập giới hạn (tính đến 22/07/2026 chưa mở). Google cũng cho biết 3.5 Pro đang thử nghiệm với đối tác, và họ đã bắt đầu đợt tiền huấn luyện cho Gemini 4.

Giá rẻ hơn ở đâu — và rẻ bao nhiêu?

Toàn bộ phần giảm giá nằm ở đầu ra: $7,50 thay vì $9,00 mỗi 1 triệu token (−16,7%), trong khi giá input giữ nguyên $1,50. Với các workload agent — vốn sinh rất nhiều token suy luận và gọi công cụ — đây là phần chi phí lớn nhất, nên mức giảm này cộng dồn nhanh. Bảng dưới lấy trực tiếp từ bảng giá Gemini Developer API, hạng Paid Tier, tra cứu ngày 22/07/2026.

Bảng 1 — Giá Gemini Developer API, USD / 1 triệu token (nguồn: ai.google.dev/gemini-api/docs/pricing, tra cứu 22/07/2026)
ModelInput (standard)Output (standard)Input (batch)Output (batch)Context caching (standard)
Gemini 3.6 Flash$1,50$7,50$0,75$3,75$0,15
Gemini 3.5 Flash$1,50$9,00$0,75$4,50$0,15
Gemini 3.5 Flash-Lite$0,30$2,50$0,15$1,25$0,03

Đọc bảng cho đúng: hai mức giảm cộng hưởng với nhau. Giá mỗi token đầu ra giảm 16,7%, và số token đầu ra cần dùng cũng giảm ~16–17%. Nhân hai lại, chi phí cho cùng một tác vụ giảm mạnh hơn nhiều so với con số đọc trên bảng giá — đúng như phần đo độc lập ở mục sau. Ngoài ra, 3.6 Flash còn có hạng Priority đắt hơn ($2,70 input / $13,50 output) dành cho workload cần độ ưu tiên cao.

Với doanh nghiệp đang cân nhắc giữa gọi API và tự chạy mô hình tại chỗ, bài Chi phí thật chạy LLM on-premise cho khung so sánh đầy đủ hơn — vì bảng giá API chỉ là một vế của bài toán.

Tờ giấy in nhiều loại biểu đồ cùng kính lúp và bút chì trên bàn gỗ, nhìn từ trên xuống
Con số nhà cung cấp công bố và con số bên thứ ba đo được không phải lúc nào cũng kể cùng một câu chuyện — nên soi cả hai. Ảnh: RDNE Stock project / Pexels

Google công bố gì, bên thứ ba đo được gì?

Google công bố 3.6 Flash thắng 3.5 Flash ở cả bốn phép đo họ dẫn ra, còn Artificial Analysis đo độc lập lại cho thấy trí tuệ tổng thể gần như đi ngang (50,07 so với 50,20) — nghĩa là bước tiến thật của bản này nằm ở tốc độ và hiệu quả chứ không phải ở khả năng suy luận thô. Hai bảng dưới đặt cạnh nhau để bạn tự đối chiếu.

Bảng 2 — Benchmark do Google công bố: 3.6 Flash so với 3.5 Flash (nguồn: blog.google, 21/07/2026)
Phép đoGemini 3.6 FlashGemini 3.5 FlashÝ nghĩa
DeepSWE (Datacurve)49%37%Sửa lỗi phần mềm thực tế
MLE Bench63,9%49,7%Nghiên cứu học máy
OSWorld-Verified83,0%78,4%Điều khiển máy tính (computer use)
GDPval-AA v214211349Công việc tri thức
Bảng 3 — Số đo độc lập của Artificial Analysis (nguồn: artificialanalysis.ai, tra cứu 22/07/2026)
Chỉ sốGemini 3.6 FlashGemini 3.5 FlashChênh lệch
Intelligence Index50,0750,20−0,13 điểm
Tốc độ đầu ra (token/giây)279,96169,67+65,0%
Token đầu ra cho một tác vụ Index23.30727.733−16,0%
Chi phí chạy trọn bộ Index (USD)726,701.040,88−30,2%
AA-Briefcase Elo (mid)961,36865,64+95,72
Omniscience Index23,5322,68+0,85
Cửa sổ ngữ cảnh1.000.0001.000.000bằng nhau

Ghi chú cách tính: "token đầu ra cho một tác vụ Index" là tổng hai thành phần answer + reasoning do Artificial Analysis công bố (3.6 Flash: 10.543,6 + 12.762,9; 3.5 Flash: 9.819,4 + 17.913,9). "Chi phí chạy trọn bộ Index" là tổng năm hạng mục answer / reasoning / cache write / cache read / non-cache input cũng do Artificial Analysis công bố. Đây là phép cộng trực tiếp từ dữ liệu công bố, không phải ước lượng. Về ô "cửa sổ ngữ cảnh": bảng này ghi 1.000.000 vì đó là giá trị Artificial Analysis công bố (contextWindowTokens), còn thân bài ghi 1.048.576 theo trang model chính thức của Google — cùng một hạn mức, chỉ khác cách làm tròn của mỗi nguồn.

Chi tiết đáng chú ý nhất nằm ở cột token đầu ra: 3.6 Flash thực ra tốn nhiều token trả lời hơn (10.544 so với 9.819), nhưng cắt gần 29% token suy luận (12.763 so với 17.914). Nói cách khác, model không nói ngắn lại — nó nghĩ gọn lại. Với các quy trình agent chạy hàng nghìn lượt mỗi ngày, đó mới là chỗ tiền thoát ra.

Đánh đổi ít ai nhắc: vùng xử lý ML

Tính đến 22/07/2026, trang model chính thức của Gemini 3.6 Flash khai báo Model availability chỉ có globalkhông liệt kê mục ML processing nào — trong khi trang của 3.5 Flash liệt kê rõ ML processing tại sáu vùng, gồm asia-southeast1 (Singapore) là vùng gần Việt Nam nhất. Đây không phải tiểu tiết: tài liệu Google Cloud nêu rõ endpoint global định tuyến và xử lý dữ liệu ở bất kỳ đâu trên toàn cầu, và không cung cấp bảo đảm cách ly theo vùng hay cư trú dữ liệu.

Bảng 4 — Vùng khả dụng & vùng xử lý ML theo trang model chính thức (nguồn: cloud.google.com, tra cứu 22/07/2026)
ModelNgày phát hànhModel availabilityML processing (vùng xử lý)
Gemini 3.6 Flash21/07/2026globalKhông liệt kê vùng nào
Gemini 3.5 Flash19/05/2026global, us, eu, europe-west2, asia-northeast1, asia-south1, asia-southeast1us, eu, europe-west2, asia-northeast1, asia-south1, asia-southeast1
Gemini 3.5 Flash-Lite21/07/2026global, us, euus, eu

Cách đọc bảng: "Model availability" là nơi bạn gọi được API; "ML processing" là nơi phép tính thực sự chạy — hai thứ khác nhau, và chỉ cái thứ hai mới trả lời được câu hỏi tuân thủ "dữ liệu của tôi được xử lý ở đâu". Tài liệu Google cũng phân biệt rõ: dữ liệu lưu trữ (at rest) thì ở nguyên vùng bạn chọn bất kể gọi endpoint nào, còn vị trí xử lý (in-use) do lựa chọn endpoint quyết định.

Cần nói cho công bằng: đây là trạng thái của một model vừa GA được một ngày, và danh sách vùng có thể được cập nhật về sau. Nhưng ở thời điểm bạn ra quyết định hôm nay, hồ sơ tuân thủ phải viết theo cái tài liệu đang khai báo, không phải theo cái sẽ có. Chủ đề này chúng tôi đã bàn ở góc chính sách trong bài Microsoft đưa xử lý Copilot về trong biên giới 15 nước"Năm chủ quyền AI".

Cận cảnh bó dây mạng màu xanh dương cắm vào switch trong trung tâm dữ liệu, đèn cổng sáng xanh lá
Endpoint bạn gọi quyết định phép tính chạy ở đâu — endpoint global không ràng buộc theo vùng địa lý nào. Ảnh: Brett Sayles / Pexels

Doanh nghiệp Việt nên làm gì với thông tin này?

Câu trả lời ngắn: tách workload theo mức nhạy cảm của dữ liệu, chứ đừng đổi toàn bộ hệ thống sang model mới chỉ vì rẻ hơn 17%. Khung quyết định chúng tôi khuyến nghị:

  • Dữ liệu không nhạy cảm, khối lượng lớn → chuyển sang 3.6 Flash sớm. Tóm tắt tài liệu công khai, phân loại ticket, sinh mô tả sản phẩm, trợ lý nội dung marketing. Đây là chỗ mức giảm ~30% chi phí mỗi tác vụ thấy được ngay trên hoá đơn.
  • Dữ liệu có yêu cầu tuân thủ về nơi xử lý → giữ nguyên 3.5 Flash ở endpoint vùng. Chừng nào 3.6 Flash chưa khai báo ML processing ở vùng cụ thể, việc chuyển sang nó là bước lùi về hồ sơ tuân thủ, dù rẻ hơn.
  • Kiểm tra tham số trước khi đổi model. Nếu code hiện tại đặt frequency_penalty hoặc presence_penalty, gọi 3.6 Flash sẽ báo lỗi; nếu đặt temperature/top-K/top-P, giá trị bị bỏ qua âm thầm — dạng lỗi khó phát hiện vì hệ thống vẫn chạy nhưng hành vi model đã khác.
  • Đo bằng workload của chính bạn, không tin bảng benchmark. Intelligence Index gần như đi ngang giữa hai bản; phần thắng nằm ở tốc độ và số token. Chạy thử 100–200 tác vụ thật, đếm token và bấm giờ — con số của bạn mới là con số quyết định.
  • Dữ liệu tối mật → cân nhắc mô hình tự chủ. Với hồ sơ nhân sự, hợp đồng, dữ liệu khách hàng, lựa chọn an toàn nhất vẫn là chạy mô hình mã nguồn mở tại chỗ — xem LLM chủ quyền trên máy chủ nội bộ.

Gemini 3.6 Flash làm cùng một việc bằng ít token hơn và rẻ hơn khoảng 30% mỗi tác vụ, nhưng cho tới khi Google công bố vùng xử lý ML cụ thể, nó chỉ nên chạy các workload mà bạn chấp nhận được việc không biết dữ liệu được xử lý ở quốc gia nào.

Câu hỏi thường gặp

Gemini 3.6 Flash rẻ hơn 3.5 Flash bao nhiêu?

Giá mỗi 1 triệu token đầu ra giảm từ $9,00 xuống $7,50 (−16,7%), giá đầu vào giữ nguyên $1,50. Nhưng chi phí thực tế giảm nhiều hơn vì model còn dùng ít token hơn: Artificial Analysis đo chi phí chạy trọn bộ Intelligence Index là $726,70 cho 3.6 Flash so với $1.040,88 cho 3.5 Flash, tức thấp hơn 30,2%.

Gemini 3.6 Flash có thông minh hơn 3.5 Flash không?

Tuỳ phép đo. Google công bố 3.6 Flash thắng ở DeepSWE (49% so với 37%), MLE Bench (63,9% so với 49,7%), OSWorld-Verified (83,0% so với 78,4%) và GDPval-AA v2 (1421 so với 1349). Nhưng Artificial Analysis đo Intelligence Index tổng hợp gần như đi ngang: 50,07 so với 50,20. Bước tiến rõ nhất là tốc độ (279,96 so với 169,67 token/giây) và hiệu quả token.

Dữ liệu gửi lên Gemini 3.6 Flash được xử lý ở đâu?

Tính đến 22/07/2026, trang model chính thức khai báo Model availability chỉ có globalkhông liệt kê vùng ML processing nào. Tài liệu Google Cloud nêu rõ endpoint global định tuyến và xử lý dữ liệu ở bất kỳ đâu trên toàn cầu, không bảo đảm cách ly theo vùng. Nếu cần biết vùng xử lý, Gemini 3.5 Flash hiện có ML processing tại asia-southeast1 (Singapore) và năm vùng khác.

Đổi từ 3.5 Flash sang 3.6 Flash có phải sửa code không?

Có thể. Google liệt kê các thay đổi có thể làm vỡ code: giá trị tuỳ chỉnh của temperature, top-K, top-P sẽ bị bỏ qua; giá trị tuỳ chỉnh của frequency penaltypresence penalty sẽ báo lỗi; và request có lượt cuối mang vai trò model cũng bị từ chối. Nên rà soát cấu hình gọi API trước khi đổi model ID.

Gemini 3.5 Flash-Lite khác gì và dùng khi nào?

3.5 Flash-Lite phát hành cùng ngày 21/07/2026, giá $0,30 input / $2,50 output mỗi 1M token — rẻ hơn 3.6 Flash khoảng 5 lần và 3 lần tương ứng. Artificial Analysis đo tốc độ đầu ra 388,77 token/giây (tra cứu 22/07/2026); bài công bố của Google dẫn lại số đo của Artificial Analysis tại thời điểm ra mắt là 350 token/giây. Model hướng vào tác vụ khối lượng lớn, độ trễ thấp như tìm kiếm agent và xử lý tài liệu. Đổi lại, Artificial Analysis đo Intelligence Index chỉ 36,48 so với 50,07 của 3.6 Flash — hợp việc đơn giản lặp lại, không hợp suy luận nhiều bước.

Chọn model AI theo hồ sơ dữ liệu, không theo bảng giá

Namtech giúp doanh nghiệp phân loại workload theo mức nhạy cảm, đo chi phí token trên tác vụ thật, và thiết kế kiến trúc AI giữ dữ liệu nhạy cảm trong tầm kiểm soát của tổ chức.

Đặt lịch tư vấn miễn phí

Lưu ý: Bài viết tổng hợp từ nguồn công khai tại 22/07/2026. Giá API, danh sách vùng khả dụng và điểm benchmark là ảnh chụp tại thời điểm tra cứu và sẽ thay đổi — đặc biệt với model vừa phát hành. Các mức chênh lệch phần trăm là phép tính trực tiếp từ số liệu công bố, đã ghi rõ cách tính trong bài. Thông tin tham khảo, không phải tư vấn kỹ thuật, đầu tư hay pháp lý.

Bắt đầu

Bắt đầu với một buổi khảo sát miễn phí

Để xác định gói phù hợp và phạm vi chi tiết, Namtech đề xuất một buổi khảo sát ngắn không tính phí.

Chúng tôi phản hồi trong vòng 1 ngày làm việc. Không spam, không chia sẻ thông tin của bạn.