"Tự chạy AI on-premise để dữ liệu không rời tổ chức" là hướng đi ngày càng được doanh nghiệp Việt cân nhắc. Nhưng trước khi mua phần cứng, câu hỏi đầu tiên phải là: tốn bao nhiêu? Bài này bóc tách ba khoản chi phí thật của việc tự vận hành một mô hình ngôn ngữ lớn (LLM): VRAM (mô hình cần bao nhiêu bộ nhớ GPU), tiền điện (GPU chạy 24/7 tốn bao nhiêu theo giá điện chính thức tại Việt Nam), và phần cứng (GPU hay máy Apple Silicon như Mac Studio) — rồi so sánh với chi phí gọi cloud API cùng một mô hình. Mọi con số đều dẫn nguồn công khai, tra cứu ngày 18/07/2026; phần Mac Studio / Mac mini cập nhật ngày 24/09/2026.
Tóm tắt nhanh
- VRAM cần bao nhiêu: ước tính nhanh bằng số tham số × số byte/tham số. Mô hình 70–73 tỷ tham số cần ~36 GB VRAM ở lượng tử hoá INT4, ~145 GB ở FP16 (chưa tính overhead).
- Tiền điện GPU: tính theo giá bán lẻ điện bình quân VN 2.204,0655 đ/kWh (chưa VAT, từ 10/5/2025 — Bộ Công Thương). Một GPU H100 (TDP 700W) chạy 24/7 tốn ~504 kWh ≈ 1,11 triệu đ/tháng tiền điện — chỉ riêng GPU.
- Phần cứng là khoản lớn nhất — vốn mua máy thường vượt xa tiền điện; đây là biến quyết định điểm hoà vốn. Giá GPU trung tâm dữ liệu biến động theo thị trường; còn Mac Studio có giá công khai: từ 79.800.000₫ (gói AI Box, 36GB) đến 182.400.000₫ (gói AI Enterprise, 96GB), đã gồm VAT.
- Điện của Mac Studio: theo Apple, mức tiêu thụ tối đa đo được khoảng 200W (M5 Max) đến 385W (M5 Ultra) cho cả máy — tức ~0,32–0,61 triệu đ/tháng nếu chạy liên tục ở mức tối đa.
- So với cloud API: cùng mô hình Qwen2.5-72B, giá cloud tham chiếu ~$0,475 vào / $0,495 ra mỗi 1 triệu token (Artificial Analysis). Ở khối lượng thấp–vừa, thuê API vẫn rẻ hơn tự chạy vì không tốn vốn phần cứng.
- Khi nào tự chạy đáng: khối lượng dùng cao & liên tục, hoặc khi bắt buộc giữ dữ liệu tại chỗ (tuân thủ, chủ quyền dữ liệu) — chứ không phải mặc định "tự chạy luôn rẻ hơn".
Số liệu chính (có nguồn)
- Giá bán lẻ điện bình quân VN: 2.204,0655 đ/kWh (chưa VAT), áp dụng từ 10/5/2025 — Bộ Công Thương / EVN.
- TDP GPU (chính hãng NVIDIA): RTX 4090 = 450W; A100 = 300W (PCIe)/400W (SXM); H100 = tối đa 700W (SXM).
- Số tham số (HuggingFace, model card): Qwen2.5-7B = 7,61 tỷ; Qwen2.5-32B = 32,5 tỷ; Llama 3.3 70B = 70,6 tỷ; Qwen2.5-72B = 72,7 tỷ.
- Giá cloud API cùng mô hình (Qwen2.5-72B, trung vị nhà cung cấp — Artificial Analysis): $0,475 đầu vào / $0,495 đầu ra mỗi 1 triệu token.
- Tỷ giá tham chiếu để quy đổi: ~26.440 đ/USD (Vietcombank bán ra, 17/07/2026).
- Công suất Mac Studio (Apple): tối đa đo được ~200W (M5 Max 18 CPU/32 GPU) và ~385W (M5 Ultra 36 CPU/80 GPU); định mức nguồn liên tục tối đa 480W. Mac mini: định mức nguồn liên tục tối đa 155W.
- Giá máy 3 gói AI nội bộ Namtech (giá bán Namtech 24/09/2026, đã gồm VAT): AI Box 79.800.000₫ · AI Pro 111.150.000₫ · AI Enterprise 182.400.000₫.
Mô hình cần bao nhiêu VRAM?
Một mô hình cần bộ nhớ GPU (VRAM) tối thiểu bằng số tham số nhân với số byte lưu mỗi tham số. Ở độ chính xác FP16/BF16, mỗi tham số chiếm 2 byte; lượng tử hoá xuống INT8 còn 1 byte, INT4 còn 0,5 byte. Vì vậy một mô hình 72,7 tỷ tham số (Qwen2.5-72B, theo model card HuggingFace) cần ~145 GB VRAM ở FP16, nhưng chỉ ~36 GB ở INT4 — đủ vừa một GPU 80 GB. Đây là lý do lượng tử hoá (quantization) gần như bắt buộc khi tự host.
Lưu ý quan trọng: con số trong bảng dưới là trọng số thô (weights only). Khi chạy thực tế, phải cộng thêm khoảng 20–30% cho KV-cache, activations và overhead của runtime — nên hãy xem đây là sàn tối thiểu, không phải mức cấu hình khuyến nghị. (GB ở đây tính theo tỷ byte để dễ đối chiếu dung lượng GPU.)
| Mô hình mở | Số tham số | VRAM FP16 (2 byte) | VRAM INT4 (0,5 byte) | GPU gợi ý (INT4, đã tính overhead) | Mac Studio tương ứng (ước lượng) |
|---|---|---|---|---|---|
| Qwen2.5-7B | 7,61 tỷ | ~15,2 GB | ~3,8 GB | 1× RTX 4090 (24 GB) — dư sức | AI Box (36GB) — dư sức |
| Qwen2.5-32B | 32,5 tỷ | ~65 GB | ~16,3 GB | 1× RTX 4090 (24 GB) vừa đủ | AI Box (36GB) |
| Llama 3.3 70B | 70,6 tỷ | ~141 GB | ~35,3 GB | 1× A100/H100 80 GB, hoặc 2× RTX 4090 | AI Pro (64GB) |
| Qwen2.5-72B | 72,7 tỷ | ~145 GB | ~36,4 GB | 1× A100/H100 80 GB, hoặc 2× RTX 4090 | AI Pro (64GB) |
Bài học rút ra: chọn cỡ mô hình trước, GPU theo sau. Một mô hình 7–32 tỷ tham số lượng tử hoá có thể chạy trên một card tiêu dùng 24 GB; nhưng nhóm 70 tỷ trở lên đã cần GPU trung tâm dữ liệu 80 GB hoặc ghép nhiều card — bước nhảy chi phí rất lớn.
Máy Apple Silicon giải bài toán này theo cách khác: bộ nhớ hợp nhất — CPU và GPU dùng chung một khối RAM. macOS mặc định cho GPU dùng khoảng 75% bộ nhớ đó, nên theo ước lượng của Namtech, một Mac Studio 64GB dành được ~48 GB cho mô hình — đủ nạp nhóm 70–72 tỷ tham số ở INT4 trong một máy, không phải ghép card. Đây là ước lượng từ dung lượng bộ nhớ, không phải số đo tốc độ.
Tiền điện: GPU chạy 24/7 tốn bao nhiêu?
Tiền điện một GPU chạy liên tục cả tháng tính bằng công thức TDP (kW) × 720 giờ × giá điện. Với giá bán lẻ điện bình quân tại Việt Nam là 2.204,0655 đ/kWh (chưa gồm VAT, áp dụng từ 10/5/2025 theo Bộ Công Thương), một GPU H100 công suất 700W chạy 24/7 tiêu thụ ~504 kWh và tốn khoảng 1,11 triệu đồng/tháng — và đó mới chỉ là điện của riêng GPU.
Chúng tôi dùng giá bình quân làm mốc minh bạch, dễ kiểm chứng. Trên thực tế, hoá đơn của doanh nghiệp còn phụ thuộc cấp điện áp và khung giờ (thấp/bình thường/cao điểm) theo biểu giá tại Quyết định 1279/QĐ-BCT, cộng VAT, và — quan trọng — điện tổng của cả máy chủ (CPU, RAM, quạt) và làm mát phòng máy thường gấp 1,5–2 lần điện GPU thuần. Nói cách khác, hãy nhân đôi các con số dưới đây để ước lượng hoá đơn thực tế.
| GPU | VRAM | TDP (công suất) | Điện/tháng (24/7) | Tiền điện/tháng* |
|---|---|---|---|---|
| NVIDIA RTX 4090 | 24 GB | 450W | 324 kWh | ~714.000 đ |
| NVIDIA A100 (PCIe) | 40/80 GB | 300W | 216 kWh | ~476.000 đ |
| NVIDIA A100 (SXM) | 80 GB | 400W | 288 kWh | ~635.000 đ |
| NVIDIA H100 (SXM) | 80 GB | 700W | 504 kWh | ~1.111.000 đ |
*Tiền điện của riêng GPU, theo giá điện bình quân chưa VAT. Hoá đơn thực tế cao hơn do có CPU/RAM/làm mát (thường ×1,5–2), VAT, và biểu giá theo cấp điện áp/khung giờ.
Mac Studio và Mac mini tốn bao nhiêu điện?
Cùng công thức, nhưng với máy Apple ta dùng số Apple công bố cho cả máy (CPU, GPU, bộ nhớ, SSD) chứ không chỉ riêng phần GPU như Bảng 2. Theo Apple, mức tiêu thụ tối đa đo được của Mac Studio khoảng 200W với M5 Max và 385W với M5 Ultra; định mức nguồn liên tục tối đa của Mac Studio là 480W và của Mac mini là 155W (trang thông số Apple).
| Máy | Công suất dùng để tính | Điện/tháng (24/7) | Tiền điện/tháng* |
|---|---|---|---|
| Mac mini (M6 / M5 Pro) | 155W — định mức nguồn tối đa | 111,6 kWh | ~246.000 đ |
| Mac Studio M5 Max (gói AI Box, AI Pro) | ~200W — tối đa Apple đo được | 144 kWh | ~317.000 đ |
| Mac Studio M5 Ultra (gói AI Enterprise) | ~385W — tối đa Apple đo được (bản 36 CPU/80 GPU) | 277,2 kWh | ~611.000 đ |
*Tính cho cả máy ở mức tối đa, giá điện bình quân chưa VAT — máy không phải lúc nào cũng chạy hết công suất, nên đây là mức trần. Apple đo mức 385W trên bản M5 Ultra 36 CPU/80 GPU; gói AI Enterprise dùng bản 30 CPU/64 GPU nên chúng tôi lấy 385W làm trần. Hoá đơn thực tế vẫn phụ thuộc VAT và biểu giá theo cấp điện áp/khung giờ.
So sánh cho công bằng: Bảng 2 là điện của riêng GPU, còn Bảng 2b là cả máy. Dù vậy, Mac Studio M5 Max ở mức tối đa (~200W cho cả máy) vẫn thấp hơn điện của riêng bất kỳ GPU nào trong Bảng 2; bản M5 Ultra (~385W) ngang tầm riêng một GPU A100. Và vì là máy để bàn (nhiệt độ hoạt động 10–35°C theo Apple) nên không bắt buộc phòng máy riêng như rack GPU.
Điểm bất ngờ với nhiều người: tiền điện GPU thường KHÔNG phải khoản lớn nhất. Một GPU trung tâm dữ liệu tốn 0,5–1,1 triệu đồng điện/tháng — đáng kể, nhưng nhỏ so với vốn mua chính chiếc GPU đó. Đó là lý do bài toán TCO không thể bỏ qua phần cứng.
Ba thành phần của TCO on-premise
Tổng chi phí sở hữu (TCO) khi tự chạy LLM gồm ba khoản, và khoản lớn nhất là vốn đầu tư phần cứng — thường vượt xa tiền điện và vận hành cộng lại. Bảng dưới xếp ba khoản theo mức độ và tính biến động, để doanh nghiệp biết đâu là biến cần chốt trước khi quyết.
| Thành phần | Gồm những gì | Mức độ & biến động |
|---|---|---|
| 1. Vốn phần cứng (CAPEX) | GPU, máy chủ, mạng, lưu trữ; khấu hao theo vòng đời | Lớn nhất — quyết định điểm hoà vốn. GPU trung tâm dữ liệu biến động mạnh theo thị trường, phải lấy báo giá thực tế; Mac Studio có giá công khai (xem Bảng 5). |
| 2. Tiền điện (OPEX) | Điện GPU + điện phần còn lại của máy + làm mát | Trung bình. Riêng GPU ~0,5–1,1 triệu đ/tháng/GPU; nhân ~1,5–2 cho tổng hệ thống. Mac Studio: ~0,32–0,61 triệu đ/tháng cho cả máy ở mức tối đa (Bảng 2b). |
| 3. Vận hành (OPEX) | Nhân sự MLOps, cập nhật mô hình, giám sát, bảo trì, dự phòng | Ổn định nhưng dễ bị bỏ quên; với tổ chức nhỏ có thể là khoản "đắt" nhất vì thiếu người. |
Tự chạy so với thuê cloud API
Ở khối lượng dùng thấp đến vừa, thuê cloud API cùng một mô hình thường rẻ hơn tự chạy, vì bạn không phải bỏ vốn phần cứng. Lấy chính Qwen2.5-72B làm ví dụ: giá cloud tham chiếu (trung vị các nhà cung cấp, theo Artificial Analysis) là $0,475 cho 1 triệu token đầu vào và $0,495 cho 1 triệu token đầu ra. Quy đổi theo tỷ giá ~26.440 đ/USD (Vietcombank, 17/07/2026), ta có:
| Khối lượng/tháng | Chi phí cloud API | Điện tự chạy (GPU 80 GB, chưa gồm CAPEX) |
|---|---|---|
| 50M token vào + 50M ra | $48,5 ≈ 1,28 triệu đ | ~0,64–1,11 triệu đ (A100/H100) + vốn GPU |
| 200M token vào + 100M ra | $144,5 ≈ 3,82 triệu đ | ~0,64–1,11 triệu đ (A100/H100) + vốn GPU |
Đọc bảng cho đúng: tiền điện tự chạy gần như cố định theo giờ vận hành, còn chi phí cloud tăng theo lượng token. Vì thế cloud rẻ hơn khi dùng ít; đến một ngưỡng khối lượng đủ cao và liên tục, phần điện + khấu hao phần cứng của tự chạy mới rẻ hơn tính trên mỗi token. Nhưng con số quyết định là vốn phần cứng. Giá GPU trung tâm dữ liệu biến động mạnh nên bài này không gán giá; doanh nghiệp phải lấy báo giá thực tế rồi chia khấu hao.
Với Mac Studio thì có giá công khai để làm phép chia. Máy gói AI Pro (64GB, đủ nạp Qwen2.5-72B ở INT4 theo ước lượng ở Bảng 1) giá 111.150.000₫ đã gồm VAT. Nếu giả định khấu hao 36 tháng, mỗi tháng ~3,09 triệu đ, cộng điện tối đa ~0,32 triệu đ (Bảng 2b) — ngang chi phí API ở mức 200M token vào + 100M ra (3,82 triệu đ). Đây chỉ là phép chia minh hoạ: bài chưa kiểm chứng một máy có xử lý kịp khối lượng đó hay không, vì tốc độ phụ thuộc mô hình, độ dài prompt và số người dùng đồng thời — cần đo trên tải thật trước khi kết luận.
Góc nhìn cho doanh nghiệp Việt
Với đa số doanh nghiệp Việt, lựa chọn hợp lý không phải "tất cả tự chạy" hay "tất cả cloud", mà là phân loại theo dữ liệu và khối lượng. Với phần tự chạy, Namtech triển khai trên Apple Silicon (Mac Studio), nối tiếp lộ trình tự xây AI nội bộ và chủ quyền dữ liệu AI. Lý do: bộ nhớ hợp nhất lớn trong một máy, giá công khai, điện thấp và đặt được ngay tại văn phòng.
Chọn cấu hình theo nhu cầu
| Gói | Máy | Giá phần cứng | Bộ nhớ cho mô hình* | Cỡ mô hình tối đa (4-bit)* | Điện tối đa | Phù hợp |
|---|---|---|---|---|---|---|
| AI Box | Mac Studio M5 Max 18CPU 32GPU 36GB 512GB | 79.800.000₫ | ~27 GB | ~43 tỷ tham số | ~200W | Nhóm nhỏ, một phòng ban |
| AI Pro | Mac Studio M5 Max 18CPU 40GPU 64GB 512GB | 111.150.000₫ | ~48 GB | ~76 tỷ tham số | ~200W | Nhiều phòng ban, RAG nâng cao |
| AI Enterprise | Mac Studio M5 Ultra 30CPU 64GPU 96GB 1TB | 182.400.000₫ | ~72 GB | ~115 tỷ tham số | ≤ ~385W | Toàn doanh nghiệp, mô hình lớn, RAG + tích hợp ERP |
| AI Cluster | Nhiều máy Mac Studio ghép với nhau | Báo giá riêng | Theo số máy | Theo số máy | Theo số máy | Quy mô vượt quá một máy |
*Ước lượng của Namtech để tư vấn chọn máy, không phải số đo benchmark: bộ nhớ dùng được ≈ RAM × 0,75 (phần macOS mặc định cho GPU dùng); mô hình lượng tử 4-bit ≈ 0,5 byte/tham số, chừa 20% cho ngữ cảnh. Giá chỉ gồm phần cứng; phần mềm và triển khai báo riêng. Công suất: mức tối đa Apple đo được (xem Bảng 2b).
Phần mềm chạy mô hình là các công cụ phổ biến trên Mac: MLX, Ollama hoặc LM Studio; mô hình mở như Qwen, SEA-LION, Gemma — chọn cỡ theo Bảng 1 rồi đối chiếu cột "Cỡ mô hình tối đa" ở trên. Xem chi tiết từng máy tại trang Mac Studio, hoặc so sánh ba cấu hình cạnh nhau.
Nếu chỉ cần thử nghiệm hoặc dùng cá nhân, Mac mini rẻ hơn: bản M6 32GB giá 41.040.000₫ (ước lượng mô hình tới ~38 tỷ tham số) và bản M5 Pro 64GB giá 86.070.000₫ (~76 tỷ). Đổi lại, băng thông bộ nhớ thấp hơn (170 GB/s và 307 GB/s, so với 460–614 GB/s của M5 Max theo Apple) — mà băng thông là yếu tố chính quyết định tốc độ sinh chữ — nên sẽ chậm hơn Mac Studio cùng dung lượng. Đặt các máy cạnh nhau tại trang so sánh Mac.
Khi nào vẫn nên dùng GPU?
Mac Studio không thắng mọi bài toán. GPU NVIDIA vẫn là lựa chọn đúng khi:
- Nhiều người dùng đồng thời hoặc xử lý hàng loạt: GPU trung tâm dữ liệu cùng phần mềm phục vụ chuyên dụng (như vLLM) gom nhiều yêu cầu chạy cùng lúc hiệu quả hơn một máy để bàn.
- Prompt rất dài, RAG trên kho tài liệu lớn: bước đọc prompt phụ thuộc sức tính toán thô, nơi GPU mạnh hơn; lợi thế của Mac nằm ở dung lượng bộ nhớ lớn trong một máy, không phải tốc độ xử lý prompt dài.
- Huấn luyện / fine-tune mô hình, hoặc phần mềm chỉ chạy trên CUDA của NVIDIA.
- Đã có sẵn phòng máy, rack và đội vận hành GPU — khi đó chi phí biên để thêm GPU thấp hơn.
Nguyên tắc chọn không đổi, dù là GPU hay Mac:
- Bắt đầu bằng một máy, chọn theo cỡ mô hình: nhu cầu 7–32 tỷ tham số lượng tử hoá → AI Box; nhóm 70–72 tỷ → AI Pro; mô hình lớn hơn hoặc cả doanh nghiệp → AI Enterprise, rồi AI Cluster khi vượt quá một máy.
- Dữ liệu nhạy cảm → tự chạy; tác vụ thường → cân nhắc API: nếu bài toán bắt buộc giữ dữ liệu tại chỗ (tuân thủ Luật Bảo vệ dữ liệu cá nhân 91/2025/QH15, hợp đồng khách hàng), tự chạy là điều kiện — chi phí là cái giá của chủ quyền, không phải để tiết kiệm.
- Tính TCO bằng số thật của bạn: lấy khối lượng token thực tế + giá phần cứng thực tế + hoá đơn điện thực tế, rồi mới so cloud vs tự chạy. Đừng quyết dựa trên cảm tính "on-premise chắc rẻ hơn".
Tự chạy LLM on-premise không mặc định rẻ hơn cloud — nó rẻ hơn khi khối lượng dùng đủ lớn và liên tục, và luôn đáng khi dữ liệu buộc phải ở lại trong tổ chức.
Câu hỏi thường gặp
Làm sao ước tính nhanh VRAM một mô hình cần?
Lấy số tham số × số byte mỗi tham số: FP16 = 2 byte, INT8 = 1 byte, INT4 = 0,5 byte. Ví dụ mô hình 72,7 tỷ tham số cần ~145 GB ở FP16 và ~36 GB ở INT4 (trọng số thô). Khi chạy thực tế cộng thêm 20–30% cho KV-cache và activations.
Tiền điện chạy một GPU 24/7 ở Việt Nam là bao nhiêu?
Tính bằng TDP(kW) × 720 giờ × giá điện. Với giá bình quân 2.204,0655 đ/kWh (chưa VAT, từ 10/5/2025 theo Bộ Công Thương): RTX 4090 (450W) ~714.000 đ/tháng; A100 SXM (400W) ~635.000 đ; H100 SXM (700W) ~1,11 triệu đ — đây là điện của riêng GPU, hoá đơn thực tế cao hơn do làm mát, VAT và biểu giá theo cấp điện áp/khung giờ.
Mac Studio chạy 24/7 tốn bao nhiêu tiền điện?
Theo Apple, Mac Studio tiêu thụ tối đa khoảng 200W (M5 Max) đến 385W (M5 Ultra) cho cả máy. Với giá bình quân 2.204,0655 đ/kWh (chưa VAT), chạy liên tục ở mức tối đa tốn khoảng 317.000 đ/tháng (M5 Max, gói AI Box và AI Pro) đến 611.000 đ/tháng (M5 Ultra, gói AI Enterprise). Đây là mức trần; hoá đơn thực tế còn phụ thuộc VAT và biểu giá theo khung giờ.
Tự chạy on-premise có rẻ hơn thuê cloud API không?
Không mặc định. Ở khối lượng thấp–vừa, cloud API thường rẻ hơn vì không cần bỏ vốn phần cứng. Tự chạy rẻ hơn tính trên mỗi token chỉ khi khối lượng dùng cao và liên tục đủ để khấu hao GPU. Ngoài ra, tự chạy còn có giá trị không quy ra tiền: giữ dữ liệu tại chỗ.
Khoản chi phí lớn nhất khi tự chạy LLM là gì?
Thường là vốn đầu tư phần cứng — vượt xa tiền điện và vận hành. Giá GPU trung tâm dữ liệu biến động mạnh nên cần báo giá thực tế; Mac Studio có giá công khai: 79.800.000₫ (gói AI Box) đến 182.400.000₫ (gói AI Enterprise), đã gồm VAT. Chia khấu hao theo vòng đời để tính TCO chính xác.
Doanh nghiệp nhỏ nên bắt đầu thế nào?
Bắt đầu với một máy gói AI Box (Mac Studio M5 Max 36GB, 79.800.000₫ đã gồm VAT), chạy mô hình mở 7–32 tỷ tham số lượng tử hoá như Qwen, SEA-LION hay Gemma qua MLX, Ollama hoặc LM Studio (ước lượng tối đa ~43 tỷ tham số ở 4-bit). Dùng nó cho các tác vụ nội bộ, đo khối lượng token thực tế, rồi mới quyết nâng lên AI Pro, AI Enterprise hay chuyển một phần sang cloud dựa trên số liệu thật.
Khi nào nên chọn GPU thay vì Mac Studio?
Khi có nhiều người dùng đồng thời hoặc xử lý hàng loạt, khi prompt rất dài trên kho tài liệu lớn (bước đọc prompt cần sức tính toán thô, nơi GPU mạnh hơn), khi cần huấn luyện hay fine-tune, phần mềm chỉ chạy CUDA, hoặc khi đã có sẵn phòng máy và đội vận hành GPU. Mac Studio mạnh ở bộ nhớ lớn trong một máy, giá công khai và điện thấp.
Tính TCO AI on-premise cho đúng bài toán của bạn
Namtech giúp doanh nghiệp chọn cỡ mô hình, chọn gói Mac Studio (AI Box, AI Pro, AI Enterprise hoặc AI Cluster) và ước tính TCO thực tế (bộ nhớ, điện, phần cứng, vận hành) — cùng phương án lai giữa on-premise và cloud để tối ưu chi phí lẫn chủ quyền dữ liệu.
Đặt lịch tư vấn miễn phíLưu ý: Bài viết tổng hợp từ nguồn công khai tại 18/07/2026; phần Mac Studio / Mac mini cập nhật 24/09/2026. Số VRAM là ước tính theo công thức tham số × byte (trọng số thô, chưa gồm overhead 20–30%); cỡ mô hình chạy được trên Mac là ước lượng theo dung lượng bộ nhớ, không phải benchmark; tiền điện là kết quả tính toán từ công suất chính hãng (NVIDIA, Apple) và giá điện bình quân chính thức, chưa gồm VAT; giá máy Mac là giá bán Namtech đã gồm VAT tại 24/09/2026 và thay đổi theo giá niêm yết của Apple; giá cloud API và tỷ giá có thể thay đổi. Thông tin tham khảo, không phải tư vấn kỹ thuật, đầu tư hay pháp lý.
- Bộ Công Thương — Điều chỉnh giá bán lẻ điện bình quân từ 10/5/2025 (2.204,0655 đ/kWh, QĐ 1279/QĐ-BCT)
- NVIDIA — GeForce RTX 4090 (Total Graphics Power 450W)
- NVIDIA — A100 Tensor Core GPU (Max TDP 300W PCIe / 400W SXM)
- NVIDIA — H100 Tensor Core GPU (Max TDP up to 700W SXM)
- Apple — Mac Studio power consumption and thermal output (M5 Max tối đa ~200W, M5 Ultra tối đa ~385W)
- Apple VN — Thông số Mac Studio (định mức nguồn liên tục tối đa 480W, băng thông bộ nhớ)
- Apple VN — Thông số Mac mini (định mức nguồn liên tục tối đa 155W)
- Apple VN — Giá niêm yết Mac Studio (cơ sở tính giá bán Namtech)
- HuggingFace — Qwen2.5-72B-Instruct (72,7 tỷ tham số)
- HuggingFace — Qwen2.5-32B-Instruct (32,5 tỷ tham số)
- HuggingFace — Qwen2.5-7B-Instruct (7,61 tỷ tham số)
- HuggingFace — Llama-3.3-70B-Instruct (70,6 tỷ tham số)
- Artificial Analysis — Qwen2.5-72B pricing ($0,475 vào / $0,495 ra mỗi 1M token)
- VTC News — Tỷ giá USD/VND 17/7/2026 (Vietcombank bán ra ~26.440 đ)