Bỏ qua điều hướng
CÔNG TY CỔ PHẦN GIẢI PHÁP CÔNG NGHỆ HQG
Trung tâm AI · Công cụ

So sánh mô hình AI mở

Đặt tối đa 4 mô hình cạnh nhau để chọn bằng tiêu chí dùng được: giấy phép có cho thương mại không, ngữ cảnh bao nhiêu, cần bao nhiêu VRAM và phần cứng tối thiểu là gì. Không có điểm benchmark ở đây — chất lượng phải tự thử trên câu hỏi thật của công ty bạn.

Đang so sánh 3/4:Qwen3 8BGemma 3 27B ITLlama 3.3 70B Instruct

Bấm để thêm vào bảng so sánh.

Bảng đối chiếu 3 mô hình AI mở: tham số, ngữ cảnh, giấy phép, tiếng Việt, VRAM ước tính và phần cứng tối thiểu
Tiêu chíQwen3 8B

Alibaba Qwen

Gemma 3 27B IT

Google

Llama 3.3 70B Instruct

Meta

Tham số8,2B27,4B70,6B
Ngữ cảnh gốc40.960 token131.072 token131.072 token
Giấy phép thương mạiDùng thương mại đượcApache 2.0Thương mại có điều kiệnGemma Terms of UseCho phép thương mại nhưng phải tuân thủ chính sách sử dụng bị cấm của Google.Thương mại có điều kiệnLlama 3.3 Community LicenseGiới hạn 700 triệu người dùng hoạt động tháng và yêu cầu ghi nguồn.
Tiếng Việttốtchưa rõHãng không công bố — phải tự thử trên câu hỏi thật của công ty.chưa rõHãng không công bố — phải tự thử trên câu hỏi thật của công ty.
VRAM · Suy luận 4-bit7,8 GB1 × L4 24GB22,9 GB1 × L40S 48GB47,9 GB1 × A100 80GB PCIe
VRAM · Suy luận 8-bit11,9 GB1 × L4 24GB36,5 GB1 × L40S 48GB82,9 GB1 × H100 NVL 94GB PCIe
VRAM · Suy luận BF1620,9 GB1 × L4 24GB66,6 GB1 × A100 80GB PCIe160,5 GB2 × H100 NVL 94GB PCIe
VRAM · Fine-tune QLoRA9 GB1 × L40S 48GB24,1 GB1 × L40S 48GB57,6 GB1 × A100 80GB PCIe
Phần cứng tối thiểu (suy luận 4-bit)1 × L4 24GB (24 GB)Xem thiết bị 1 × L40S 48GB (48 GB)Xem thiết bị 1 × A100 80GB PCIe (80 GB)Xem thiết bị
Phần cứng để fine-tune QLoRA1 × L40S 48GB (48 GB)1 × L40S 48GB (48 GB)1 × A100 80GB PCIe (80 GB)
Gợi ý ứng dụng
  • Chatbot tiếng Việt
  • Agent gọi công cụ
  • Chế độ suy nghĩ/không suy nghĩ
  • Hỏi đáp ảnh + văn bản
  • Tóm tắt
  • Chatbot
  • Trợ lý doanh nghiệp
  • RAG tài liệu nội bộ
  • Soạn thảo văn bản
Ghi chúHãng công bố hỗ trợ 119 ngôn ngữ, có tiếng Việt. Ngữ cảnh gốc ~32K, mở rộng bằng YaRN.Phần lớn lớp dùng sliding window 1.024 token nên KV cache thực tế nhỏ hơn nhiều so với công thức chuẩn (công thức cho cận trên).—
Trang chính chủ · công cụBản gốc Tính cấu hình riêngBản gốc Tính cấu hình riêngBản gốc Tính cấu hình riêng

Đang hiện bộ mô hình gợi ý. Chọn mô hình ở trên để đổi bảng — liên kết trên thanh địa chỉ sẽ mang theo lựa chọn của bạn (dạng ?m=slug1,slug2).

Các cột VRAM được tính thế nào?

Suy luận 4-bit
Suy luận, trọng số 4-bit (GPTQ/AWQ/GGUF/NF4), 1 người dùng, ngữ cảnh theo mặc định của mô hình (tối đa 8.192 token).
Suy luận 8-bit
Suy luận, trọng số 8-bit (FP8 hoặc INT8 cùng 1 byte/tham số), 1 người dùng, ngữ cảnh như trên.
Suy luận BF16
Suy luận ở độ chính xác gốc khi hãng phát hành, 1 người dùng, ngữ cảnh như trên.
Fine-tune QLoRA
QLoRA: trọng số gốc 4-bit + adapter, batch 1, độ dài chuỗi 2.048 token. Adapter giả định ~1% tham số (rank 64 trên mọi lớp tuyến tính).

Công thức đầy đủ và chỗ để thay số của bạn (số người dùng đồng thời, ngữ cảnh dài hơn, batch lớn hơn) nằm ở công cụ tính cấu hình.

Đọc bảng này cho đúng

“Tiếng Việt: chưa rõ” không có nghĩa là kém. Đó là trường hợp hãng không công bố danh sách ngôn ngữ. Cách duy nhất để biết là tự thử trên câu hỏi thật của bạn.

Giấy phép thay đổi theo từng phiên bản. Luôn mở trang chính chủ ở cột cuối và đọc bản gốc trước khi dùng thương mại.

VRAM là ước lượng theo công thức, không phải đo thực tế. Phần mềm phục vụ mô hình, cách lượng tử hoá và độ dài câu hỏi thật đều làm con số đổi.

Không có cột “mô hình nào giỏi hơn”. Mọi bảng xếp hạng chất lượng đều phụ thuộc bộ câu hỏi dùng để chấm; HQG không đăng điểm benchmark của bên khác như số liệu của mình.

Thông tin tham khảo, kiểm tra giấy phép trước khi dùng thương mại. Số tham số và kiến trúc lấy từ trang chính chủ; mức VRAM là ước tính theo công thức, không phải đo thực tế. Dữ liệu mô hình đối chiếu với trang chính chủ tại thời điểm 2026-09.