GPU / AI

Cần bao nhiêu VRAM để chạy Llama 3.1 70B?

Tính riêng trọng số, KV cache và overhead; ví dụ context 8K, 32K và 128K với cache FP16.

aigpu.vnCập nhật 5 Tháng 10, 2026
Ảnh minh họa: Cần bao nhiêu VRAM để chạy Llama 3.1 70B?

VRAM để chạy Llama 3.1 70B gồm trọng số, KV cache và bộ nhớ phục vụ tính toán. Dung lượng file model chỉ là điểm bắt đầu: context dài và nhiều request đang xử lý có thể khiến hệ thống hết VRAM dù model nạp thành công.

Ước tính riêng phần trọng số

Precision lý tưởngPhép tính với 70 tỷ tham sốDung lượng thập phân
FP16/BF1670 tỷ × 2 byte140 GB
8-bit70 tỷ × 1 byte70 GB
4-bit70 tỷ × 0,5 byte35 GB

Bảng là phép tính lý tưởng, không phải dung lượng checkpoint hay VRAM đo được. Metadata lượng tử hóa, tensor giữ precision cao hơn và framework làm kết quả khác đi. GB thập phân cũng khác GiB; cần dùng cùng đơn vị khi so với GPU.

Tính KV cache đúng với grouped-query attention

Đối với cache đầy đủ của kiến trúc attention thông thường có GQA, bộ nhớ cache gần đúng theo byte = 2 × số layer × số KV head × head dimension × tổng token đang lưu × byte mỗi phần tử. Dùng số KV head thay vì toàn bộ hidden size. Tổng token gồm prompt và token đã sinh của các sequence đang hoạt động.

Cấu hình Llama 3.1 70B dùng 80 layer, 8 KV head và head dimension 128. Với cache FP16, mỗi token cần khoảng 327.680 byte, tức 320 KiB, trước overhead và thay đổi do engine.

Token cache của một sequenceKV cache FP16 xấp xỉ
8.1922,5 GiB
32.76810 GiB
131.07240 GiB

Ví dụ bốn sequence cùng giữ 8.192 token cần khoảng 10 GiB KV cache. Đây là phép tính từ cấu hình, không phải benchmark. Prefix sharing, cách cấp phát block, tensor parallel và precision cache có thể làm mức dùng thực tế khác đi.

Vì sao một RTX 5090 không đủ chứa toàn bộ 70B 4-bit phổ biến?

Một GPU 32 GB nhỏ hơn ngay phần trọng số 4-bit lý tưởng 35 GB của 70 tỷ tham số, chưa tính cache. Vì vậy không nên mặc định một RTX 5090 có thể giữ toàn bộ 70B 4-bit trong VRAM. Offload sang RAM hoặc phương pháp nén khác có thể cho phép chạy, nhưng đặc tính hiệu năng và chất lượng cần đánh giá riêng.

Nhiều GPU không tự động tạo một vùng nhớ chung

Hai card 24 GB chỉ hữu ích cho model lớn nếu engine hỗ trợ chia model và từng card còn đủ headroom cho phân vùng của nó. Phải kiểm tra topology PCIe, khả năng truyền giữa GPU, phương pháp parallel và phiên bản phần mềm. Tổng VRAM bằng phép cộng không bảo đảm workload chạy được hay đạt độ trễ mong muốn.

Quy trình chọn cấu hình

  1. Chốt checkpoint, định dạng lượng tử hóa và engine.
  2. Đặt giới hạn prompt, output và concurrency cho tải production.
  3. Ước tính trọng số, KV cache và dành bộ nhớ cho runtime.
  4. Nạp model, thử prompt ngắn/dài và tải đồng thời đại diện.
  5. Đo VRAM đỉnh, OOM, thời gian token đầu và tốc độ sinh.
  6. Điều chỉnh context/concurrency hoặc số GPU rồi thử lại.

Với một GPU 80 GB, phần trọng số 8-bit lý tưởng có thể vừa nhưng không đồng nghĩa còn đủ cache cho context dài hay nhiều request. Với FP16 trên nhiều GPU, cần tính memory theo từng card và overhead thực tế, không chỉ tổng 140 GB.

Xem GPU Server là gì và dịch vụ thuê GPU. Khi gửi yêu cầu cấu hình, cung cấp model, precision, context và số request đồng thời để có phương án kiểm thử phù hợp.

Cache FP8 có luôn giảm một nửa tổng VRAM không?

Không. Nó tác động chủ yếu đến phần KV cache; trọng số và các vùng nhớ khác vẫn cần tính riêng, đồng thời engine phải hỗ trợ cấu hình này.

Model nạp được có nghĩa phục vụ production được không?

Chưa. Cần thử context dài và concurrency mục tiêu, đo OOM cùng độ trễ trước khi nghiệm thu.

Cần GPU cho workload này?

NOC aigpu.vn hỗ trợ chọn GPU, VRAM và cấu hình phù hợp. PoC trong 24 giờ.

Bài viết liên quan

Xem tất cả bài viết
GọiFBZaloSalesZaloOA