Chi phí thuê GPU Server: tính theo giờ, tháng và tải
Chi phí thuê GPU Server cần gắn với công việc phải hoàn thành và thời gian sử dụng. Một GPU có phí thấp mỗi giờ có thể mất lâu hơn cho cùng job, trong khi thuê theo tháng có thể tốn nhiều nếu card phần lớn nhàn rỗi.

Chi phí thuê GPU Server cần gắn với công việc phải hoàn thành và thời gian sử dụng. Một GPU có phí thấp mỗi giờ có thể mất lâu hơn cho cùng job, trong khi thuê theo tháng có thể tốn nhiều nếu card phần lớn nhàn rỗi.
Bài này trình bày phương pháp tính ngân sách; mọi con số minh họa là giả định. Giá, cấu hình và chính sách cấp phát cần xác nhận ở bảng giá GPU Server.
Những thành phần trong báo giá
| Khoản | Câu hỏi cần làm rõ |
|---|---|
| GPU | Model, số card, VRAM, riêng hay chia sẻ |
| Host | CPU/RAM và giới hạn tài nguyên |
| Storage | Dung lượng checkpoint/dataset, phí giữ dữ liệu |
| Network | Upload/download và băng thông cam kết |
| Thời gian | Đơn vị tính tiền, thời gian tối thiểu và idle |
| Vận hành | Cài môi trường, quản trị và xử lý lỗi |
| Phục hồi | Backup, lưu checkpoint và máy dự phòng |
Tổng VRAM không đủ mô tả quyền sử dụng compute. Hai gói cùng model card có thể khác CPU, công suất giới hạn, topology và storage. Yêu cầu bảng cấu hình cùng phạm vi dịch vụ để so sánh.
Thuê theo giờ: tính cả chuẩn bị
Ngân sách = đơn giá × tổng thời gian tính phí + storage + network + các dịch vụ bổ sung. Tổng thời gian có thể gồm tải model, cài dependency, warm-up, chạy job và chờ giữ máy. Hỏi khi dừng VM thì khoản nào dừng tính, khoản nào tiếp tục.
Ví dụ giả định 25.000 đồng/giờ và 120 giờ tính phí cho compute tương đương 3 triệu đồng, chưa tính storage/network. Nếu job chỉ chạy 100 giờ nhưng chuẩn bị và chờ thêm 20 giờ, không nên lấy 100 giờ làm ngân sách.
Thuê theo tháng: đo tỷ lệ sử dụng
Với giá giả định 10 triệu đồng/tháng, 400 giờ công việc hữu ích cho chi phí bình quân 25.000 đồng/giờ hữu ích. Nếu chỉ có 100 giờ hữu ích, giá bình quân là 100.000 đồng. Đây là cách phân bổ chi phí, không phải đơn giá của gói dịch vụ.
Tỷ lệ sử dụng cao không chỉ là GPU utilization cao. Job phải đúng, ổn định và có output sử dụng được. Các lần chạy lỗi, thử tham số và thời gian không phục vụ khách vẫn cần đưa vào tổng chi phí.
So sánh trên một đơn vị kết quả
| Workload | Đơn vị nên đo |
|---|---|
| Inference | Request/token được chấp nhận trong giới hạn latency |
| Fine-tuning | Một run hoàn tất với cấu hình và chất lượng mục tiêu |
| Tạo ảnh | Ảnh đạt yêu cầu với cùng pipeline/độ phân giải |
| Batch processing | Khối lượng dữ liệu hoàn thành trước deadline |
Không so token/s tổng của một hệ batch lớn với latency một request của hệ khác. Cần cùng model, precision, input/output và tiêu chí chất lượng. Đọc so sánh RTX 4090/5090 để chuẩn bị phép thử.
Giảm chi phí bằng quy trình
- Chuẩn bị artifact và môi trường tái tạo để giảm thời gian dựng máy.
- Giữ checkpoint đúng kỳ để tránh chạy lại toàn bộ job.
- Lập lịch batch, hạn chế idle nhưng giữ khả năng phục vụ đỉnh tải.
- Đo storage/network trước khi tải dataset lớn.
- Chọn precision hoặc model nhỏ hơn chỉ khi chất lượng vẫn đạt.
Khi nào chọn từng hình thức?
Theo thời gian phù hợp tác vụ có giới hạn và có thể kết thúc tài nguyên sau chạy. Theo tháng phù hợp nhu cầu đều hoặc cần tài nguyên sẵn sàng, nhưng phải tính mức dùng thực tế. Điều kiện cung cấp khác nhau giữa nhà cung cấp; không mặc định mọi card đều có cả hai hình thức.
- Ước tính lịch sử dụng và tải cao điểm.
- Benchmark workload đại diện.
- Lấy báo giá compute cùng storage/mạng.
- Tính kịch bản dùng thấp, cơ sở và cao.
- Chốt quyền sử dụng GPU và chính sách lưu dữ liệu.
Gửi workload tới dịch vụ GPU Server, kèm model, context hoặc batch, thời gian thuê và dung lượng dữ liệu. Đây là cơ sở báo giá thực tế hơn chỉ yêu cầu một tên card.
Giá theo giờ thấp hơn có chắc tiết kiệm không?
Không. Phải nhân với thời gian hoàn thành, tính thời gian chuẩn bị và các khoản lưu trữ/mạng.
Có nên tắt máy khi không dùng?
Cân nhắc chính sách tính phí, thời gian khởi động lại, availability và việc giữ dữ liệu. Xác nhận gói hỗ trợ cách vận hành này.
Cần GPU cho workload này?
NOC aigpu.vn hỗ trợ chọn GPU, VRAM và cấu hình phù hợp. PoC trong 24 giờ.
Bài viết liên quan
GPU / AIGPU Server là gì? Cách chọn GPU cho mô hình ngôn ngữ lớn
Hướng dẫn chọn GPU Server theo workload: bộ nhớ, độ trễ, tải đồng thời và khả năng vận hành ứng dụng AI.
GPU / AIRTX 4090 vs RTX 5090 cho AI: VRAM và cách kiểm thử
So sánh 24 GB GDDR6X và 32 GB GDDR7; chọn GPU theo model, tải đồng thời và kết quả kiểm thử ứng dụng.
GPU / AINVIDIA H200 SXM: thông số, phiên bản và mô hình AI
Đội phục vụ mô hình lớn thường hết bộ nhớ trước khi dùng hết tính toán. H200 tăng dư địa chứa trọng số và cache, nên cần đánh giá theo số phiên đồng thời và độ dài tài liệu mà khách gửi vào.