Mô hình mở

Mô hình AI mở dùng thương mại được: bản đồ Mỹ – Trung Quốc – Châu Âu, benchmark và thế mạnh từng model (09/2026)

Cập nhật lần cuối: 30/09/2026

Bản đồ thế giới — minh hoạ các mô hình AI mở đến từ Mỹ, Trung Quốc và Châu Âu

Năm 2026, doanh nghiệp muốn chạy AI ngay trong văn phòng — dữ liệu không rời tổ chức — có nhiều lựa chọn hơn bao giờ hết: hàng chục mô hình AI mở (open-weight) từ Mỹ, Trung Quốc và Châu Âu có thể tải về, tự chạy và dùng cho mục đích thương mại. Nhưng "mở" không có nghĩa là "muốn làm gì cũng được": mỗi họ mô hình đi kèm một giấy phép khác nhau, và khoảng cách với GPT, Claude, Gemini cũng khác nhau rất nhiều giữa các model. Bài này lập bản đồ các mô hình mở mới nhất theo xuất xứ, ghi rõ giấy phép và điều kiện thương mại, kiến trúc, thế mạnh, điểm benchmark độc lập so với mô hình thương mại, rồi gợi ý chọn model theo nhu cầu và theo RAM của Mac Studio / Mac mini. Mọi phiên bản, giấy phép và con số đều dẫn nguồn sơ cấp, tra cứu ngày 30/09/2026.

Tóm tắt nhanh

  • Trung Quốc dẫn về sức mạnh: trên Artificial Analysis Intelligence Index, 3 mô hình mở cao nhất là MiMo-V2.6-Pro (46), GLM-5.3 (45), Kimi K3 (44) — đều của Trung Quốc; Claude Opus 5.5 đạt 58, GPT-5.6 Sol 47, Gemini 3.8 Flash 41.
  • Mỹ dẫn về model nhỏ, giấy phép sạch: Gemma 4 (Google), Muse Glimmer 30B (Meta), Granite 4.2 (IBM) và gpt-oss (OpenAI) đều Apache 2.0; Phi-4-reasoning-vision (Microsoft) là MIT. Llama 4 dùng giấy phép riêng có điều kiện.
  • Châu Âu = Mistral: Mistral Small 4, Large 3, Ministral 3, Devstral Small 2 là Apache 2.0; Mistral Medium 3.5 và Devstral 2 dùng Modified MIT, không được dùng nếu công ty có doanh thu trên 20 triệu USD/tháng.
  • Tiếng Việt: trên SEA-HELM, Qwen 3.5 397B (78,15) và Gemma 4 31B (77,09) sát Claude Opus 4.8 (78,70) và GPT 6 Astra (77,86).
  • Chạy trên Mac: Mac mini 32GB đủ cho nhóm ~27–31 tỷ tham số (Qwen3.8-27B, Gemma 4 31B); Mac Studio 128–256GB mở ra nhóm 120–300 tỷ tham số (ước lượng).
Số liệu chính (có nguồn)

Mô hình AI mở "dùng thương mại được" nghĩa là gì?

Mô hình AI mở (open-weight) là mô hình mà nhà phát triển công bố trọng số để ai cũng tải về và tự chạy trên máy của mình; "dùng thương mại được" nghĩa là giấy phép đi kèm cho phép đưa mô hình vào sản phẩm, dịch vụ hoặc quy trình kinh doanh. Hai điều này tách biệt: trọng số có thể tải tự do nhưng giấy phép vẫn cấm hoặc giới hạn thương mại. Vì vậy, câu hỏi đầu tiên khi chọn model cho doanh nghiệp không phải "model nào mạnh nhất" mà là "giấy phép của model này cho mình làm gì".

Trong các mô hình Namtech rà soát cho bài này, giấy phép rơi vào ba nhóm. Nhóm 1 — giấy phép dễ dãi (Apache 2.0, MIT, và OpenMDW của NVIDIA): dùng thương mại không có ngưỡng doanh thu hay người dùng, chỉ phải giữ thông báo bản quyền khi phân phối lại. Ví dụ, Google viết trong bài ra mắt Gemma 4 rằng mô hình được phát hành theo giấy phép Apache 2.0 cho phép thương mại. Nhóm 2 — giấy phép riêng có điều kiện: cho phép thương mại nhưng kèm ngưỡng người dùng, ngưỡng doanh thu hoặc nghĩa vụ ghi nhãn — Llama 4, Kimi K3, Qwen3.8-Max, GLM-5.3, MiniMax M3, Mistral Medium 3.5. Nhóm 3 — cấm thương mại: ví dụ giấy phép của MiniMax-M2.7 ghi rõ mọi hình thức dùng thương mại đều bị cấm nếu không có văn bản cho phép riêng của MiniMax. Nhóm 3 bị loại khỏi bài.

Một lưu ý về cách gọi: nhiều bài viết gọi chung các mô hình này là "mã nguồn mở". Cách gọi chính xác hơn là "mô hình mở" hoặc "open-weight", vì phần được mở chủ yếu là trọng số, còn dữ liệu huấn luyện và mã huấn luyện thường không công bố. Namtech đã phân tích chi tiết bài toán giấy phép theo góc nhìn triển khai trong bài chọn mô hình mã nguồn mở cho AI nội bộ; bài này tập trung vào bản đồ các model mới nhất tính tới cuối tháng 9/2026.

Bảng 1 — Bản đồ mô hình mở dùng thương mại được theo xuất xứ (phiên bản mới nhất đã verify ngày 30/09/2026; giấy phép đọc từ file LICENSE/model card gốc)
Xuất xứ · HãngMô hình (phát hành)Giấy phépKiến trúcThế mạnh chính
Mỹ · OpenAIgpt-oss-120b / 20b (05/08/2025)Apache 2.0 + chính sách sử dụng gpt-ossMoE 117B (5,1B hoạt động) / 21B (3,6B); ngữ cảnh 131KSuy luận có chỉnh mức, gọi công cụ; bản 20b chạy trong 16GB
Mỹ · GoogleGemma 4 E2B/E4B/26B A4B/31B (02/04/2026), 12B (03/06/2026)Apache 2.031B dense; 26B MoE (3,8B hoạt động); ngữ cảnh tới 256KĐa ngôn ngữ (hơn 140 ngôn ngữ), đa phương thức, gọi hàm; tiếng Việt tốt trên SEA-HELM
Mỹ · MetaMuse Glimmer 30B (08/2026)Apache 2.0 (+ chính sách sử dụng)Dense ~29,6B, nhận ảnh; ngữ cảnh 131K+Agent chạy trên máy cá nhân, gọi công cụ
Mỹ · MetaLlama 4 Scout / Maverick (05/04/2025)Llama 4 Community License (có điều kiện)MoE 109B / 400B, 17B hoạt độngĐa phương thức, ngữ cảnh rất dài (Scout 10M)
Mỹ · MicrosoftPhi-4-reasoning-vision-15B (04/03/2026)MITDense 15B; ngữ cảnh 16KSuy luận toán, khoa học trên ảnh; tác vụ điều khiển máy tính
Mỹ · IBMGranite 4.2 3B/8B/30B (25/08/2026)Apache 2.0Dense 30B; ngữ cảnh 128K (mở rộng 512K)Suy luận bật/tắt, gọi công cụ, định hướng doanh nghiệp
Trung Quốc · AlibabaQwen3.8-27B (08/2026)Apache 2.0Dense 27B, nhận ảnh; ngữ cảnh 262K (mở rộng 1M)Lập trình agent, dùng máy tính; mạnh nhất nhóm vừa một máy nhỏ
Trung Quốc · AlibabaQwen3.8-2.4T-A95B (08/2026)Qwen3.8-Max License (ngưỡng 50 triệu USD/12 tháng cho MaaS)MoE 2,4T (95B hoạt động)Model mở lớn nhất của Qwen
Trung Quốc · DeepSeekDeepSeek-V4.1-Flash (10/09/2026)MITMoE 552B, đa phương thức; ngữ cảnh 1MAgent lập trình, terminal; ngang mô hình thương mại trên benchmark hãng công bố
Trung Quốc · Z.aiGLM-5.3 (trọng số 27/08/2026) · GLM-5.3-Flash (08/2026)GLM-5.3 License (chỉ gác ở doanh thu 10 tỷ USD) · Flash: MITMoE ~753B · Flash 320B (18B hoạt động)Lập trình, agent; Flash là bản đa phương thức gọn hơn
Trung Quốc · MoonshotKimi K3 (trọng số 27/07/2026)Kimi K3 License (ngưỡng 20 triệu USD/12 tháng cho MaaS)MoE 2,8T (104B hoạt động); ngữ cảnh 1MSuy luận, duyệt web, dùng máy tính
Trung Quốc · XiaomiMiMo-V2.6-Pro-RL (09/2026)MIT (ghi trên model card)MoE 1,02T (42B hoạt động); ngữ cảnh 1MĐiểm cao nhất nhóm mở trên Artificial Analysis
Trung Quốc · MiniMaxMiniMax M3 (06/2026)MiniMax Community License (ghi nhãn, ngưỡng 20 triệu USD/năm)MoE ~428B (~23B hoạt động); ngữ cảnh 1MDuyệt web, agent
Châu Âu · Mistral (Pháp)Mistral Small 4 (16/03/2026)Apache 2.0MoE 119B (6,5B hoạt động); ngữ cảnh 256KGộp chat, suy luận, lập trình, đa phương thức; có tiếng Việt trong danh sách ngôn ngữ
Châu Âu · MistralMistral Large 3, Ministral 3 (02/12/2025); Devstral Small 2 (09/12/2025)Apache 2.0Large 3: MoE 675B (41B hoạt động); Ministral 3B/8B/14B; Devstral 24BLarge: đa phương thức; Ministral: máy nhỏ; Devstral: agent lập trình
Châu Âu · MistralMistral Medium 3.5 (22/05/2026)Modified MIT (không dùng nếu doanh thu > 20 triệu USD/tháng)Dense 128B; ngữ cảnh 256KLập trình agent (77,6% SWE-Bench Verified, hãng công bố)
Châu Âu · EUEuroLLM-22B-Instruct-2512 (12/2025)Apache 2.0Dense ~22,6B; ngữ cảnh 32KNgôn ngữ châu Âu, dịch thuật (không có tiếng Việt)

Ngày phát hành lấy theo blog chính hãng hoặc model card; với Kimi K3 và GLM-5.3 là ngày commit trọng số đầu tiên trên Hugging Face. Kiến trúc "MoE" (mixture-of-experts) nghĩa là mỗi token chỉ kích hoạt một phần tham số; "dense" là kích hoạt toàn bộ.

Nhóm Mỹ: model nhỏ, giấy phép sạch

Điểm chung của nhóm Mỹ năm 2026 là giấy phép sạch và kích thước vừa phải: hầu hết là Apache 2.0 hoặc MIT, và phần lớn đủ nhỏ để chạy trên một máy trạm hay Mac. Đổi lại, trên các bảng xếp hạng độc lập, mô hình mở tốt nhất của Mỹ đứng sau nhóm đầu Trung Quốc khá xa. Một chi tiết đáng chú ý: ngoài gpt-oss và Llama 4, các model card của Gemma 4, Muse Glimmer, Phi và Granite chỉ so với mô hình mở khác, không so trực tiếp với GPT, Claude hay Gemini.

OpenAI gpt-oss-120b và gpt-oss-20b

gpt-oss vẫn là mô hình mở dạng chat mới nhất của OpenAI tính tới ngày tra cứu. Theo bài báo gpt-oss trên arXiv, hai mô hình được phát hành theo giấy phép Apache 2.0 kèm chính sách sử dụng gpt-oss; model card ghi ngày 05/08/2025. Cả hai là MoE: bản 120b có 117 tỷ tham số với 5,1 tỷ tham số hoạt động, bản 20b có 21 tỷ với 3,6 tỷ hoạt động. Trang Hugging Face của gpt-oss-120b ghi bản 120b vừa một GPU 80GB và bản 20b chạy trong 16GB bộ nhớ, cùng khả năng chỉnh mức suy luận, gọi hàm, duyệt web và chạy mã Python.

Về so sánh với mô hình thương mại, OpenAI tự công bố gpt-oss-120b vượt o3-mini và tiệm cận o4-mini trên các benchmark chuẩn — đây là các model thương mại thế hệ 2025. Trên thang độc lập, Artificial Analysis chấm gpt-oss-120b (high) 12 điểm, còn trên Arena, gpt-oss-120b đứng hạng 208 với 1.352 điểm. Thế mạnh thật của gpt-oss hiện nay là nhẹ và nhanh: bản 20b chạy được trên Mac mini 16GB, phù hợp tác vụ phân loại, trích xuất, trợ lý nội bộ đơn giản.

Google Gemma 4

Gemma 4 là họ mô hình mở mạnh nhất của Google, phát hành theo giấy phép Apache 2.0. Bài ra mắt đề ngày 02/04/2026 giới thiệu các bản E2B, E4B, 26B MoE và 31B dense; bản 12B ra sau, ngày 03/06/2026. Theo model card Gemma 4, bản 26B A4B có tổng 25,2 tỷ tham số nhưng chỉ 3,8 tỷ hoạt động, ngữ cảnh 256K, hỗ trợ hơn 140 ngôn ngữ, có chế độ suy nghĩ và gọi hàm gốc. Model card công bố bản 31B đạt 84,3% GPQA Diamond và 80,0% LiveCodeBench v6 — nhưng chỉ so với Gemma 3.

Google cho biết tại thời điểm ra mắt, bản 31B đứng hạng 3 trong các mô hình mở trên bảng Arena. Tra ngày 25/09/2026, Gemma 4 31B có 1.453 điểm trên Arena, hạng 73 toàn bảng; Artificial Analysis chấm 19 điểm. Điểm nổi bật nhất của Gemma 4 với doanh nghiệp Việt là tiếng Việt: trên SEA-HELM, Gemma 4 31B đạt 77,09 — chỉ kém Claude Opus 4.8 khoảng 1,6 điểm, dù nhỏ hơn rất nhiều. Đây là lý do Gemma 4 thường là ứng viên đầu tiên Namtech đem thử cho trợ lý nội bộ tiếng Việt trên máy vừa.

Meta: Muse Glimmer 30B và Llama 4

Meta có hai hướng rất khác nhau. Mới nhất là Muse Glimmer 30B, do Meta Superintelligence Lab phát hành tháng 8/2026 theo Apache 2.0 — không có ngưỡng người dùng, không bắt ghi "Built with Llama". Model card Muse Glimmer ghi mô hình dành cho cả mục đích thương mại và nghiên cứu, dense khoảng 29,6 tỷ tham số kèm bộ mã hoá ảnh, tối ưu cho tác vụ agent tự động trên phần cứng người dùng, và bản nén 4-bit chạy được trong khoảng 24GB hoặc 32GB. Model card chỉ so với Gemma 4 và Qwen; Artificial Analysis chấm Muse Glimmer (high) 17 điểm, SEA-HELM tiếng Việt 73,52.

Llama 4 (Scout và Maverick, ngày 05/04/2025) là MoE 17 tỷ tham số hoạt động, tổng 109 tỷ và 400 tỷ. Meta tự công bố trong bài giới thiệu Llama 4 rằng Maverick vượt GPT-4o và Gemini 2.0 Flash trên nhiều benchmark phổ biến — so với mô hình thương mại đời 2024–2025. Giấy phép là điểm cần đọc kỹ: Llama 4 Community License yêu cầu công ty có hơn 700 triệu người dùng hoạt động/tháng tại ngày phát hành phải xin giấy phép riêng, bắt buộc hiển thị "Built with Llama" và đặt "Llama" ở đầu tên mô hình phái sinh; còn chính sách sử dụng không cấp quyền với các mô hình đa phương thức Llama 4 cho cá nhân cư trú hoặc công ty có trụ sở chính tại EU (người dùng cuối của sản phẩm không bị áp). Với doanh nghiệp Việt Nam, ngưỡng 700 triệu gần như không chạm tới, nhưng nghĩa vụ ghi nhãn vẫn áp dụng.

Microsoft Phi và IBM Granite

Mô hình Phi mới nhất có nhân ngôn ngữ là Phi-4-reasoning-vision-15B, phát hành 04/03/2026 theo giấy phép MIT. Model card ghi 15 tỷ tham số, ngữ cảnh 16.384 token, nhắm tới suy luận toán và khoa học trên dữ liệu hình ảnh và tác vụ điều khiển máy tính; model card chỉ so với mô hình mở. Ngữ cảnh 16K khá ngắn cho bài toán hỏi–đáp tài liệu dài, nên Phi hợp hơn với tác vụ chuyên biệt như đọc biểu đồ, sơ đồ.

IBM Granite 4.2 (3B, 8B, 30B) ra ngày 25/08/2026. Blog của IBM trên Hugging Face xác nhận toàn bộ Granite 4.2 phát hành theo Apache 2.0; model card bản 30B mô tả kiến trúc dense có suy luận, ngữ cảnh 128K mở rộng tới 512K, gọi công cụ có suy luận. IBM không so với model nào khác trong model card; Artificial Analysis chấm Granite 4.2 30B 15 điểm. Granite hợp với doanh nghiệp cần một nhà cung cấp "truyền thống", giấy phép rõ ràng, hơn là cần điểm số cao nhất.

Hình minh hoạ trừu tượng mạng neural — đại diện cho các mô hình ngôn ngữ lớn
Mô hình mở khác nhau chủ yếu ở kiến trúc (dense hay MoE), số tham số hoạt động và giấy phép — ba yếu tố quyết định chạy được trên máy nào và dùng thương mại ra sao. Ảnh: Google DeepMind / Pexels

Nhóm Trung Quốc: dẫn đầu về sức mạnh mô hình mở

Nhóm Trung Quốc đang nắm các vị trí đầu bảng mô hình mở. Artificial Analysis viết trên trang xếp hạng mô hình mở rằng MiMo-V2.6-Pro và GLM-5.3 (max) là hai mô hình mở thông minh nhất, tiếp theo là Kimi K3 (max) và GLM-5.3-Flash. Đặc điểm chung: phần lớn là MoE cỡ hàng trăm tỷ đến hàng nghìn tỷ tham số, ngữ cảnh 1 triệu token, và model card so thẳng với Claude, GPT. Điểm cần lưu ý: không model card hay giấy phép nào trong nhóm này nhắc tới tiếng Việt; bằng chứng tiếng Việt chỉ đến từ bảng độc lập SEA-HELM.

Qwen (Alibaba): Qwen3.8

Qwen3.8-27B là mô hình dense 27 tỷ tham số, nhận ảnh, ngữ cảnh 262.144 token (mở rộng tới 1 triệu), giấy phép Apache 2.0 không kèm điều kiện. Theo model card Qwen3.8-27B, Qwen tự công bố 61,7 điểm SWE-bench Pro so với 53,4 của Claude Opus 4.6 Max, và 84,3 điểm OSWorld-Verified so với 72,7; nhưng ở GPQA Diamond (89,2 so với 91,3) và Terminal Bench 2.1 (73,0 so với 78,2) thì vẫn kém. Artificial Analysis chấm Qwen3.8 27B (xhigh) 34 điểm — cao nhất trong các model mở cỡ này mà Namtech tra được, gần gấp đôi Gemma 4 31B.

Hai bản lớn hơn có giấy phép khác hẳn. Qwen3.8-2.4T-A95B (2,4 nghìn tỷ tham số, 95 tỷ hoạt động) dùng Qwen3.8-Max License: doanh nghiệp làm dịch vụ mô hình (MaaS) hoặc trợ lý công việc AI có doanh thu hợp nhất trên 50 triệu USD trong 12 tháng liên tiếp phải xin giấy phép riêng. Qwen3.8-Flash-Next còn chặt hơn: Qwen Community License 1.0 bắt mọi doanh nghiệp làm MaaS hoặc trợ lý công việc AI phải xin giấy phép riêng trước khi dùng thương mại — không có sàn doanh thu. Nói cách khác, cùng họ Qwen nhưng bản 27B dùng tự do, còn Flash-Next thì không, nếu mô hình kinh doanh của bạn là bán dịch vụ AI.

Với tiếng Việt, thế hệ trước Qwen3.5 vẫn đáng chú ý: model card Qwen3.5-397B-A17B ghi mở rộng hỗ trợ lên 201 ngôn ngữ và phương ngữ, và trên SEA-HELM tiếng Việt bản 397B đạt 78,15 — cao nhất nhóm mô hình mở trên bảng. Qwen3.6-35B-A3B (35 tỷ tổng, 3 tỷ hoạt động, Apache 2.0) và Qwen 3.6 27B (76,12 trên SEA-HELM) là lựa chọn gọn cho máy vừa.

DeepSeek V4.1-Flash và V4-Pro

DeepSeek phát hành toàn bộ trọng số theo giấy phép MIT. Bản mới nhất là DeepSeek-V4.1-Flash: nhật ký cập nhật của DeepSeek ghi ngày 10/09/2026 chính thức phát hành model này, và cho biết thế hệ V4 Flash trước đó đã ngừng trên API (trọng số mở vẫn còn). Theo model card V4.1-Flash, đây là MoE đa phương thức với 552 tỷ tham số lõi, ngữ cảnh tới 1 triệu token. Bảng so sánh của hãng ở mức suy luận tối đa cho thấy V4.1-Flash đạt 90,6 trên Terminal-Bench 2.1, nhỉnh hơn Opus 5.0 (89,1) và GPT-5.6 Sol (88,8); nhưng ở GPQA Diamond thì 90,9 so với 93,4 và 94,1. Artificial Analysis chấm V4.1 Flash 39 điểm; trên Arena, bản này đứng hạng 29.

Bản lớn DeepSeek-V4-Pro (1,6 nghìn tỷ tham số, 49 tỷ hoạt động) có bản chính thức 0813 thay bản preview. Với doanh nghiệp tự chạy, bản đáng chú ý hơn là DeepSeek-V4-Flash đời đầu: 284 tỷ tham số, 13 tỷ hoạt động, MIT — theo model card V4-Flash. Cỡ này là một trong số ít model mở "gần frontier" nằm vừa một Mac Studio 256GB theo ước lượng dung lượng ở phần dưới.

GLM (Z.ai): GLM-5.3 và GLM-5.3-Flash

Model card GLM-5.3 ghi rõ GLM-5.3 dùng cùng mô hình nền với GLM-5.2 — toàn bộ cải thiện đến từ hậu huấn luyện; trọng số lên Hugging Face ngày 27/08/2026. Artificial Analysis chấm GLM-5.3 (max) 45 điểm, hạng 2 nhóm mở. Trong bảng của hãng, GLM-5.3 đạt 66,9 trên DeepSWE v1.1, cao hơn Opus 4.8 (58,0) nhưng thấp hơn Fable 5 (69,7) và GPT-5.6 Sol (72,7). Giấy phép "GLM-5.3 License" nghe có vẻ gắt nhưng thực tế rất rộng: điều khoản chỉ bắt doanh nghiệp làm MaaS có doanh thu trên 10 tỷ USD/12 tháng qua đánh giá an ninh của Z.ai.

Bản gọn GLM-5.3-Flash dùng MIT, tổng 320 tỷ tham số và chỉ 18 tỷ hoạt động, là mô hình đa phương thức gốc đầu tiên trong dòng GLM-5 theo model card GLM-5.3-Flash; Artificial Analysis chấm 42 điểm, hạng 4 nhóm mở. GLM-5.2 đời trước cũng là MIT; trên SEA-HELM tiếng Việt, GLM 5.2 đạt 76,93. Namtech đã có bài riêng về GLM-5.2 khi mô hình này ra mắt.

Kimi K3 (Moonshot AI)

Kimi K3 là mô hình mở có số tham số lớn nhất trong bài: theo model card Kimi K3, MoE tổng 2,8 nghìn tỷ tham số, 104 tỷ hoạt động, ngữ cảnh 1.048.576 token, nhận cả văn bản và ảnh. Moonshot tự công bố K3 đạt 93,5 GPQA Diamond, so với 92,6 của Fable 5, 94,1 của GPT-5.6 Sol và 91,0 của Claude Opus 4.8. Trên thang độc lập, Artificial Analysis chấm Kimi K3 (max) 44 điểm, và trên Arena K3 đứng hạng 16 — cao nhất trong các model có trọng số mở mà Namtech tìm thấy trên bảng ngày 25/09/2026.

Giấy phép Kimi K3 License cho phép thương mại nhưng có ngưỡng: doanh nghiệp vận hành dịch vụ mô hình (MaaS) với doanh thu trên 20 triệu USD/12 tháng phải ký thoả thuận riêng với Moonshot. Giấy phép cũng miễn các yêu cầu này cho dùng nội bộ — đúng kịch bản AI nội bộ của doanh nghiệp. Thực tế, với 2,8 nghìn tỷ tham số, K3 vượt xa dung lượng một hay vài Mac; Namtech đã phân tích chi tiết trong bài về Kimi K3.

MiniMax M3, Xiaomi MiMo và các model khác

MiniMax M3 (khoảng 428 tỷ tham số, 23 tỷ hoạt động, ngữ cảnh 1M) cho phép thương mại có điều kiện: MiniMax Community License bắt hiển thị "Built with MiniMax M3", phải xin văn bản cho phép nếu sản phẩm có doanh thu trên 20 triệu USD/năm (dưới mức đó chỉ cần gửi thông báo một lần), kèm danh mục cấm dùng. Artificial Analysis chấm M3 29 điểm. Đừng nhầm với MiniMax-M2.7 — bản cũ hơn nhưng cấm thương mại.

Xiaomi MiMo-V2.6-Pro hiện đứng đầu nhóm mở trên Artificial Analysis với 46 điểm. Model card MiMo-V2.6-Pro-RL mô tả MoE 1,02 nghìn tỷ tham số, 42 tỷ hoạt động, ngữ cảnh 1M, nhận văn bản, ảnh, âm thanh và video; giấy phép ghi MIT trong siêu dữ liệu model card. Lưu ý: tại thời điểm tra, repo không có file LICENSE riêng — doanh nghiệp nên lưu bản chụp model card làm căn cứ. Các model Trung Quốc khác như Tencent Hy4-preview (Apache 2.0) hay Meituan LongCat-2.0 (MIT) cũng có trọng số mở, nhưng chưa có điểm độc lập đủ để so sánh trong bài.

Nhóm Châu Âu: Mistral gần như là đại diện duy nhất

Ở Châu Âu, mô hình mở dùng thương mại được và đủ sức cạnh tranh hiện gần như chỉ có Mistral AI (Pháp); các dự án khác chủ yếu phục vụ ngôn ngữ châu Âu hoặc nghiên cứu. Điều quan trọng nhất với Mistral là phân biệt hai nhóm giấy phép: Apache 2.0 (dùng tự do) và Modified MIT (bị chặn nếu công ty có doanh thu lớn).

Mistral Apache 2.0: Small 4, Large 3, Ministral 3, Devstral Small 2

Mistral Small 4 ra ngày 16/03/2026; thông báo của Mistral ghi mô hình được phát hành theo Apache 2.0. Model card mô tả MoE 128 chuyên gia (4 hoạt động), 119 tỷ tham số với 6,5 tỷ hoạt động mỗi token, ngữ cảnh 256K, nhận văn bản và ảnh; một model gộp cả chế độ chat, suy luận (trước là Magistral) và lập trình (Devstral). Tiếng Việt có trong danh sách ngôn ngữ của model card. Artificial Analysis chấm Small 4 (Reasoning) 11 điểm. Namtech có bài riêng về Mistral Small 4.

Mistral Large 3 và Ministral 3 ra cùng ngày 02/12/2025. Bài giới thiệu Mistral 3 ghi Large 3 là MoE thưa 41 tỷ tham số hoạt động, tổng 675 tỷ, và toàn bộ các model đều Apache 2.0; Ministral 3 có các cỡ 3B, 8B, 14B cho máy nhỏ. Devstral Small 2 (24B, 09/12/2025) là model lập trình agent; model card ghi đủ nhẹ để chạy trên một Mac 32GB. Theo bảng của chính model card Devstral Small 2, model đạt 68,0% SWE-bench Verified, so với 77,2% của Claude Sonnet 4.5 và 76,2% của Gemini 3 Pro (số của đối thủ lấy từ công bố công khai) — kém khoảng 8–9 điểm nhưng chạy được tại chỗ.

Mistral Modified MIT: Medium 3.5 và Devstral 2

Mistral Medium 3.5 (22/05/2026) là mô hình dense 128 tỷ tham số, ngữ cảnh 256K. Mistral công bố Medium 3.5 đạt 77,6% SWE-Bench Verified, xếp trên Devstral 2 và Qwen3.5 397B A17B. Trên SEA-HELM tiếng Việt, Medium 3.5 đạt 68,82 — thấp hơn đáng kể nhóm Qwen, Gemma, GLM. Artificial Analysis chấm 14 điểm; Arena xếp hạng 113.

Điểm mấu chốt là giấy phép. File LICENSE của Medium 3.5 là Modified MIT, trong đó ghi bạn không được thực thi quyền nào theo giấy phép nếu doanh thu hợp nhất toàn cầu hằng tháng của công ty (hoặc của công ty bạn làm thuê) vượt 20 triệu USD trong tháng trước đó. Devstral 2 (123B) dùng cùng điều khoản. Với đa số SME Việt Nam, ngưỡng này không chạm tới; nhưng tập đoàn lớn hoặc công ty con của tập đoàn đa quốc gia phải kiểm tra doanh thu hợp nhất trước khi dùng.

Các mô hình châu Âu khác

EuroLLM-22B-Instruct-2512 — dự án do EU tài trợ — dùng Apache 2.0, dense khoảng 22,6 tỷ tham số, ngữ cảnh 32K, tập trung vào ngôn ngữ châu Âu và dịch thuật; danh sách ngôn ngữ trong model card không có tiếng Việt. Apertus 1.5 của Thuỵ Sĩ (không thuộc EU) có mặt trên SEA-HELM tiếng Việt với 64,66 điểm cho bản 70B, nhưng Namtech chưa đọc được trực tiếp file giấy phép của bản này nên không đưa vào danh sách khuyến nghị. Một số model khác như ALIA (Tây Ban Nha) hay Velvet (Ý) có ghi chú hạn chế về mục đích sử dụng trong model card, còn Aleph Alpha dùng giấy phép chỉ cho nghiên cứu phi thương mại — nên Namtech không đưa vào danh sách khuyến nghị.

Benchmark: mô hình mở so với GPT, Claude, Gemini ra sao?

Trả lời ngắn: mô hình mở tốt nhất đã ngang hoặc vượt một số mô hình thương mại đang bán, nhưng vẫn cách mô hình thương mại đứng đầu một khoảng rõ rệt. Để so công bằng, Namtech ưu tiên ba bảng độc lập: Artificial Analysis Intelligence Index v4.3.2 (gộp 10 bài đánh giá, chấm trong điều kiện đồng nhất), bảng xếp hạng Arena (người dùng bỏ phiếu chọn câu trả lời tốt hơn — đo mức ưa thích, không đo đúng sai), và SEA-HELM cho tiếng Việt.

Bảng 2 — Điểm độc lập: mô hình mở so với mô hình thương mại (Artificial Analysis: điểm trên trang từng mô hình, tra 30/09/2026; Arena: bảng text ngày 25/09/2026; "—" = không tìm thấy trên bảng)
Mô hìnhLoạiArtificial Analysis IndexArena (điểm · hạng)
Claude Opus 5.5 (Anthropic)Thương mại581.509 · hạng 1
GPT-5.6 Sol (OpenAI)Thương mại471.483 · hạng 19
Gemini 3.8 Flash (Google)Thương mại411.492 · hạng 10 (sơ bộ)
MiMo-V2.6-Pro (Xiaomi)Mở · MIT461.480 · hạng 23
GLM-5.3 (Z.ai)Mở · GLM-5.3 License451.480 · hạng 24
Kimi K3 (Moonshot)Mở · Kimi K3 License441.488 · hạng 16
DeepSeek V4.1 FlashMở · MIT391.477 · hạng 29
Qwen3.8 27B (Alibaba)Mở · Apache 2.0341.438 · hạng 95
Gemma 4 31B (Google)Mở · Apache 2.0191.453 · hạng 73
Muse Glimmer (Meta)Mở · Apache 2.0171.424
Granite 4.2 30B (IBM)Mở · Apache 2.015—
Mistral Medium 3.5Mở · Modified MIT141.426 · hạng 113
gpt-oss-120b (OpenAI)Mở · Apache 2.0121.352 · hạng 208
Mistral Small 4Mở · Apache 2.011—

Điểm Artificial Analysis lấy theo cấu hình mạnh nhất hiển thị trên trang từng mô hình (ví dụ "max", "high", "Reasoning"); các trang có thể không cập nhật cùng lúc. Nhãn giấy phép trong bảng là của Namtech theo file LICENSE gốc, không theo nhãn của Arena.

Bảng 2 cho thấy ba điều. Thứ nhất, khoảng cách ở đỉnh vẫn còn: Claude Opus 5.5 hơn mô hình mở tốt nhất 12 điểm trên Artificial Analysis. Thứ hai, ở tầng giữa đã chồng lấn: MiMo-V2.6-Pro, GLM-5.3, Kimi K3 cao hơn Gemini 3.8 Flash, và MiMo chỉ kém GPT-5.6 Sol một điểm. Thứ ba, có một "vực" giữa model mạnh và model chạy được trên máy nhỏ: các model dưới 35 tỷ tham số chỉ đạt 17–34 điểm, và riêng Qwen3.8-27B tách hẳn khỏi phần còn lại của nhóm này.

Bảng 3 — Số hãng tự công bố khi so với mô hình thương mại (trích từ model card/blog chính hãng; điều kiện đo do hãng chọn, KHÔNG phải số độc lập)
Mô hình mởBenchmarkĐiểm model mởĐiểm model thương mại (theo cùng bảng)
DeepSeek-V4.1-FlashTerminal-Bench 2.190,6Opus-5.0: 89,1 · GPT-5.6 Sol: 88,8
DeepSeek-V4.1-FlashGPQA Diamond90,9Opus-5.0: 93,4 · GPT-5.6 Sol: 94,1
Kimi K3GPQA Diamond93,5Fable 5: 92,6 · GPT-5.6 Sol: 94,1 · Opus 4.8: 91,0
GLM-5.3DeepSWE v1.166,9Opus 4.8: 58,0 · Fable 5: 69,7 · GPT-5.6 Sol: 72,7
Qwen3.8-27BSWE-bench Pro61,7Opus 4.6 Max: 53,4
Qwen3.8-27BTerminal Bench 2.173,0Opus 4.6 Max: 78,2
Devstral Small 2 (24B)SWE-bench Verified68,0%Claude Sonnet 4.5: 77,2% · Gemini 3 Pro: 76,2%
gpt-oss-120bTổng hợp benchmark chuẩnOpenAI: vượt o3-mini, tiệm cận o4-mini
Llama 4 MaverickNhiều benchmark phổ biếnMeta: vượt GPT-4o và Gemini 2.0 Flash

Số tự công bố hữu ích để biết model mạnh ở mảng nào, nhưng nên đọc kèm ba lưu ý. Mỗi hãng tự chọn benchmark, mức suy luận và bộ khung chạy (harness) có lợi cho mình; nhiều bảng so với model thương mại đời trước (Opus 4.6, GPT-4o) thay vì đời mới nhất; và cùng một model, điểm có thể khác giữa các bảng — ví dụ DeepSeek ghi NL2Repo khác nhau giữa model card và nhật ký cập nhật. Vì vậy Namtech dùng Bảng 2 để xếp hạng và Bảng 3 chỉ để hiểu thế mạnh từng model, rồi luôn đo lại trên dữ liệu thật của khách trước khi chốt.

Mô hình mở nào giỏi tiếng Việt?

Theo bảng tiếng Việt của SEA-HELM — bảng đánh giá độc lập của AI Singapore, cập nhật 18/09/2026 — một số mô hình mở đã sát mô hình thương mại tốt nhất ở tiếng Việt. Đây là điểm khác biệt lớn so với bảng tổng hợp tiếng Anh: khoảng cách ở tiếng Việt hẹp hơn nhiều, và model nhỏ như Gemma 4 31B đứng rất gần các model thương mại.

Bảng 4 — Điểm tiếng Việt trên SEA-HELM (cập nhật 18/09/2026; bảng "detailed/VI", bật hiển thị cả mô hình đóng; khoảng tin cậy 95% khoảng ±1,5 điểm)
Mô hìnhLoạiĐiểm tiếng Việt
Claude Opus 4.8Thương mại78,70
Gemini 3.1 Pro PreviewThương mại78,66
Qwen 3.5 397B MoEMở · Apache 2.078,15
GPT 6 AstraThương mại77,86
Gemma 4 31BMở · Apache 2.077,09
GLM 5.2 754B MoE (FP8)Mở · MIT76,93
Qwen 3.6 27BMở · Apache 2.076,12
Muse Glimmer 30BMở · Apache 2.073,52
DeepSeek V4 Pro 1600B MoEMở · MIT73,40
Mistral Medium 3.5 128BMở · Modified MIT68,82
Apertus 1.5 70BMở64,66

Với khoảng tin cậy khoảng ±1,5 điểm, bốn mô hình đầu bảng — Opus 4.8, Gemini 3.1 Pro Preview, Qwen 3.5 397B và GPT 6 Astra — gần như ngang nhau về tiếng Việt. Gemma 4 31B và Qwen 3.6 27B, hai model đủ nhỏ để chạy trên Mac mini hoặc Mac Studio cấu hình thấp, chỉ kém nhóm đầu khoảng 1,5–2,6 điểm. Ngược lại, Mistral Medium 3.5 và Apertus kém rõ rệt, nên không phải lựa chọn ưu tiên cho ứng dụng tiếng Việt. Lưu ý: SEA-HELM chưa có điểm cho một số model mới như Qwen3.8, Kimi K3 hay DeepSeek V4.1-Flash, nên với các model này vẫn phải tự đo.

Hình minh hoạ trừu tượng cấu trúc mạng neural nhiều lớp
Model nhỏ như Gemma 4 31B hay Qwen 3.6 27B đã sát mô hình thương mại hàng đầu ở tiếng Việt trên SEA-HELM — đủ tốt cho trợ lý nội bộ chạy tại chỗ. Ảnh: Google DeepMind / Pexels

Chọn mô hình mở theo RAM Mac Studio và Mac mini

Trên Mac, yếu tố quyết định chạy được model nào là dung lượng bộ nhớ hợp nhất, vì toàn bộ trọng số — kể cả phần chuyên gia không hoạt động của MoE — phải nằm trong RAM. Bảng dưới dùng cùng công thức ước lượng với bài chi phí thật chạy LLM on-premise và các trang sản phẩm của Namtech: bộ nhớ dùng được ≈ 75% RAM, mô hình 4-bit ≈ 0,5 byte/tham số, chừa 20% cho ngữ cảnh. Đây là trần dung lượng lý thuyết, không phải số đo tốc độ.

Bảng 5 — Chọn model theo RAM (cỡ tối đa: ước lượng của Namtech; ứng viên: model có tổng tham số nằm dưới trần, theo model card)
Máy · RAMCỡ model tối đa (4-bit, ước lượng)Ứng viên dùng thương mại được
Mac mini M6 16GB~19 tỷ tham sốGemma 4 12B, Phi-4-reasoning-vision-15B, Ministral 3 14B; gpt-oss-20b (OpenAI ghi chạy trong 16GB, sát trần)
Mac mini 24GB~28 tỷGemma 4 26B A4B, Qwen3.8-27B, Qwen 3.6 27B, Devstral Small 2 24B
Mac mini 32GB~38 tỷGemma 4 31B, Muse Glimmer 30B, Granite 4.2 30B, Qwen3.6-35B-A3B
Mac mini M5 Pro 48–64GB / Mac Studio M5 Max 48–64GB~57–76 tỷNhóm trên với ngữ cảnh dài hơn, chạy song song 2 model (ví dụ một model chat + một model lập trình)
Mac Studio M5 Ultra 96GB~115 tỷNhóm 30B với nhiều người dùng; gpt-oss-120b (117B) và Mistral Small 4 (119B) sát trần — cần thử thực tế
Mac Studio M5 Max 128GB~153 tỷgpt-oss-120b, Mistral Small 4, Mistral Medium 3.5 128B
Mac Studio M5 Ultra 256GB~307 tỷDeepSeek-V4-Flash 284B; GLM-5.3-Flash (320B) vượt trần một chút
Cụm 2–4 Mac Studio 256GB~614 – 1.228 tỷDeepSeek-V4.1-Flash 552B, GLM-5.2/5.3 (~753B), MiniMax M3 (~428B)

Ước lượng, không phải benchmark: RAM × 0,75 × 0,8 ÷ 0,5 byte/tham số. Model MoE như Gemma 4 26B A4B hay Qwen3.6-35B-A3B chiếm RAM theo tổng tham số nhưng chạy nhanh theo tham số hoạt động. Kimi K3 (2,8T), Qwen3.8-2.4T và DeepSeek-V4-Pro (1,6T) vượt khả năng của các cấu hình trên.

Nhìn Bảng 5, "điểm ngọt" cho đa số doanh nghiệp là nhóm 24–32GB: Qwen3.8-27B (điểm độc lập cao nhất nhóm nhỏ) và Gemma 4 31B (tiếng Việt tốt nhất nhóm nhỏ) đều Apache 2.0 và vừa một Mac mini. Mac Studio 96–128GB đáng đầu tư khi cần phục vụ nhiều người cùng lúc, chạy nhiều model song song, hoặc dùng model cỡ 120 tỷ. Nhóm model "gần frontier" từ vài trăm tỷ tham số trở lên cần Mac Studio 256GB hoặc ghép cụm — chi tiết ở bài ghép cụm Mac Studio chạy AI.

Chọn mô hình theo nhu cầu

Không có model tốt nhất cho mọi việc; cách chọn thực tế là xác định nhu cầu chính, lọc theo giấy phép, rồi chọn model nhỏ nhất đủ dùng và đo trên dữ liệu thật. Dựa trên các nguồn ở trên, Namtech gợi ý điểm xuất phát như sau.

Trợ lý nội bộ và hỏi–đáp tài liệu tiếng Việt: bắt đầu với Gemma 4 31B hoặc Qwen 3.6 27B — cả hai Apache 2.0, trên 76 điểm SEA-HELM tiếng Việt, vừa Mac mini 32GB. Nếu có Mac Studio lớn, Qwen 3.5 397B cho điểm tiếng Việt cao nhất nhóm mở. Lập trình và agent: Qwen3.8-27B cho máy nhỏ (61,7 SWE-bench Pro theo hãng công bố); Devstral Small 2 nếu muốn model chuyên code của châu Âu; DeepSeek-V4.1-Flash hoặc GLM-5.3 nếu có cụm máy và cần sức mạnh gần mô hình thương mại. Đọc ảnh, biểu đồ, giao diện: Gemma 4, Muse Glimmer, Mistral Small 4 đều nhận ảnh; Phi-4-reasoning-vision chuyên suy luận trên hình. Ngữ cảnh rất dài: DeepSeek, GLM, Kimi, MiMo đều công bố 1 triệu token, Qwen3.8-27B mở rộng tới 1 triệu — nhưng ngữ cảnh dài tốn rất nhiều RAM cho bộ đệm, cần tính vào cấu hình máy.

Ưu tiên giấy phép sạch nhất: nếu bộ phận pháp chế muốn tránh mọi điều khoản riêng, hãy giới hạn danh sách vào Apache 2.0 và MIT: Gemma 4, Muse Glimmer, Granite 4.2, gpt-oss, Phi, Qwen3.8-27B, Qwen3.5/3.6, DeepSeek, GLM-5.2, GLM-5.3-Flash, Mistral Small 4, Large 3, Ministral 3, Devstral Small 2. Danh sách này đã đủ phủ gần như mọi nhu cầu nội bộ ở quy mô máy Mac. Trước khi nạp bất kỳ model nào, cũng nên kiểm tra nguồn gốc repo tải về — xem thêm bài về xuất xứ mô hình mở.

Lưu ý pháp lý khi dùng giấy phép mô hình mở

Phần này tóm tắt điều khoản đọc từ file giấy phép gốc để doanh nghiệp biết cần hỏi gì — không phải tư vấn pháp lý; hợp đồng và mô hình kinh doanh cụ thể nên được luật sư xem xét. Có năm loại điều khoản hay gặp. Ngưỡng người dùng: Llama 4 (700 triệu người dùng hoạt động/tháng, tính tại ngày phát hành). Ngưỡng doanh thu: Mistral Medium 3.5 và Devstral 2 (20 triệu USD/tháng, áp cho mọi mục đích), Kimi K3 (20 triệu USD/12 tháng, chỉ khi làm MaaS), Qwen3.8-Max (50 triệu USD/12 tháng, MaaS hoặc trợ lý công việc AI), GLM-5.3 (10 tỷ USD, chỉ yêu cầu đánh giá an ninh), MiniMax M3 (20 triệu USD/năm). Không có sàn: Qwen3.8-Flash-Next bắt mọi doanh nghiệp làm MaaS hoặc trợ lý công việc AI xin giấy phép riêng.

Nghĩa vụ ghi nhãn: "Built with Llama" và tiền tố "Llama" cho mô hình phái sinh; "Built with MiniMax M3"; Qwen3.8-Max và Kimi yêu cầu hiển thị tên model khi sản phẩm vượt 100 triệu người dùng hoạt động/tháng hoặc 20 triệu USD doanh thu/tháng. Giới hạn theo vùng và mục đích: chính sách sử dụng của Llama 4 không cấp quyền với model đa phương thức cho công ty có trụ sở chính tại EU; MiniMax M3 có danh mục cấm dùng, trong đó có mục đích quân sự; gpt-oss và Muse Glimmer đi kèm chính sách sử dụng riêng dù giấy phép là Apache 2.0.

Với kịch bản AI nội bộ — doanh nghiệp tự chạy model phục vụ nhân viên của mình, không bán dịch vụ AI cho bên ngoài — phần lớn các ngưỡng MaaS không áp dụng, và Kimi K3 License còn ghi rõ miễn yêu cầu cho dùng nội bộ. Rủi ro lớn nhất trong thực tế là chọn nhầm phiên bản: cùng một họ nhưng khác giấy phép (Qwen3.8-27B và Qwen3.8-Flash-Next; MiniMax M3 và M2.7; Mistral Small 4 và Medium 3.5). Hãy đọc file LICENSE của chính repo gốc bạn tải, lưu bản sao kèm ngày tải, và ghi lại trong hồ sơ triển khai.

Namtech triển khai mô hình mở trên Mac như thế nào?

Namtech triển khai AI nội bộ theo nguyên tắc đo trước, chốt sau: chọn 2–3 model ứng viên có giấy phép phù hợp, chạy thử trên tài liệu và câu hỏi thật của khách, đo chất lượng tiếng Việt, tốc độ và mức RAM, rồi mới chốt model và cấu hình máy. Mô hình chạy 100% trên máy đặt tại văn phòng khách hoặc tại Namtech, dữ liệu không gửi ra dịch vụ AI bên ngoài.

Doanh nghiệp có hai cách bắt đầu. Mua máy: xem cấu hình và giá Mac Studio và Mac mini. Hoặc thuê máy nếu chưa muốn đầu tư: dịch vụ thuê Mac Studio và Mac mini chạy AI của Namtech có kỳ hạn 12 tháng, máy đặt tại Namtech, doanh nghiệp truy cập mô hình qua API hoặc VPN và Namtech lo quản trị. Cách này phù hợp để thử một model như Qwen3.8-27B hay Gemma 4 31B trên dữ liệu thật trước khi quyết định mua.

Tính tới 30/09/2026, mô hình AI mở dùng thương mại được đã đủ mạnh cho phần lớn nhu cầu nội bộ: Trung Quốc dẫn về sức mạnh, Mỹ dẫn về model nhỏ giấy phép sạch, Châu Âu có Mistral — và với tiếng Việt, Gemma 4 31B hay Qwen 3.6 27B chạy trên một Mac mini đã sát GPT, Claude, Gemini, miễn là chọn đúng giấy phép và đo trên dữ liệu thật.

Câu hỏi thường gặp

Mô hình AI mở (open-weight) có phải là mã nguồn mở không?

Không hẳn. Open-weight nghĩa là trọng số mô hình được công bố để tải về và tự chạy. Có dùng thương mại được hay không phụ thuộc vào giấy phép đi kèm: Apache 2.0 và MIT gần như không ràng buộc, còn các giấy phép riêng như Llama 4 Community License, Kimi K3 License, Qwen3.8-Max License hay Modified MIT của Mistral có điều kiện về ngưỡng người dùng, doanh thu hoặc ghi nhãn. Có bản còn cấm thương mại, ví dụ MiniMax-M2.7.

Mô hình mở mạnh nhất hiện nay là gì và kém GPT, Claude, Gemini bao xa?

Theo Artificial Analysis Intelligence Index (tra ngày 30/09/2026), nhóm mô hình mở dẫn đầu là MiMo-V2.6-Pro (46 điểm), GLM-5.3 (45) và Kimi K3 (44), đều đến từ Trung Quốc. Cùng bảng đó, Claude Opus 5.5 đạt 58, GPT-5.6 Sol 47 và Gemini 3.8 Flash 41. Nghĩa là mô hình mở tốt nhất đã ngang hoặc vượt một số mô hình thương mại, nhưng vẫn cách mô hình thương mại đứng đầu khoảng 12 điểm.

Mô hình mở nào tốt cho tiếng Việt?

Trên bảng tiếng Việt của SEA-HELM (cập nhật 18/09/2026), Qwen 3.5 397B đạt 78,15 và Gemma 4 31B đạt 77,09, sát Claude Opus 4.8 (78,70), Gemini 3.1 Pro Preview (78,66) và GPT 6 Astra (77,86). Qwen 3.6 27B đạt 76,12. Với máy nhỏ, Gemma 4 31B và Qwen 3.6 27B là hai ứng viên đáng thử đầu tiên; vẫn nên kiểm tra trên tài liệu thật của doanh nghiệp.

Doanh nghiệp Việt Nam dùng Llama 4 thương mại có bị vướng không?

Với đa số doanh nghiệp thì không vướng ngưỡng 700 triệu người dùng/tháng của Llama 4 Community License. Nhưng giấy phép yêu cầu hiển thị "Built with Llama", đặt chữ "Llama" ở đầu tên mô hình phái sinh và tuân thủ chính sách sử dụng chấp nhận được. Chính sách này cũng không cấp quyền với các mô hình đa phương thức Llama 4 cho công ty có trụ sở chính tại EU. Nếu muốn tránh các điều kiện này, có thể chọn mô hình Apache 2.0 như Gemma 4 hoặc Muse Glimmer.

Mac Studio hoặc Mac mini chạy được mô hình mở cỡ nào?

Theo ước lượng Namtech dùng cho tư vấn (bộ nhớ dùng được khoảng 75% RAM, mô hình 4-bit khoảng 0,5 byte/tham số, chừa 20% cho ngữ cảnh): Mac mini 32GB chạy được mô hình tới khoảng 38 tỷ tham số như Qwen3.8-27B hay Gemma 4 31B; Mac Studio 128GB tới khoảng 153 tỷ như gpt-oss-120b hay Mistral Small 4; Mac Studio 256GB tới khoảng 307 tỷ như DeepSeek-V4-Flash. Đây là trần dung lượng, không phải số đo tốc độ.

Không muốn mua máy thì có cách nào chạy mô hình mở nội bộ không?

Có. Namtech có dịch vụ thuê Mac Studio và Mac mini kỳ hạn 12 tháng: máy đặt tại Namtech, doanh nghiệp truy cập mô hình qua API hoặc VPN, Namtech quản trị máy. Xem cấu hình và giá tại trang thuê Mac Studio của Namtech.

Chọn đúng mô hình mở cho doanh nghiệp của bạn

Namtech giúp lọc model theo giấy phép, đo tiếng Việt và tốc độ trên tài liệu thật, rồi triển khai chạy tại chỗ trên Mac Studio hoặc Mac mini — mua hoặc thuê theo kỳ 12 tháng.

Đặt lịch tư vấn miễn phí

Lưu ý: Bài viết tổng hợp từ nguồn công khai tra cứu ngày 30/09/2026. Số benchmark trong Bảng 3 là số do từng hãng tự công bố trong điều kiện của hãng; Bảng 2 và Bảng 4 là bảng độc lập tại ngày tra cứu và thay đổi thường xuyên. Cỡ model theo RAM là ước lượng dung lượng, không phải số đo tốc độ. Phần giấy phép chỉ tóm tắt điều khoản để tham khảo, không phải tư vấn pháp lý.

Nguồn tham khảo
Bắt đầu

Bắt đầu với một buổi khảo sát miễn phí

Để xác định gói phù hợp và phạm vi chi tiết, Namtech đề xuất một buổi khảo sát ngắn không tính phí.

Chúng tôi phản hồi trong vòng 1 ngày làm việc. Không spam, không chia sẻ thông tin của bạn.