Bỏ qua điều hướng
CÔNG TY CỔ PHẦN GIẢI PHÁP CÔNG NGHỆ HQG
AI & GPU

Từ 72 GPU xuống 4 GPU: thu nhỏ cấu hình đẳng cấp thế giới về đúng ngân sách Việt Nam

Bốn bậc hạ tầng AI với tiền điện mỗi năm lần lượt là 68 triệu, 463 triệu, 1,85 tỷ và 3,28 tỷ đồng. Bài viết đưa cấu hình tham chiếu cho từng bậc, danh sách chính xác những thứ cắt được khi đi xuống, những thứ tuyệt đối không cắt, và các dấu hiệu cho biết bạn đã sẵn sàng lên bậc tiếp theo.

N
Nguyễn Phúc Thịnh
Giám đốc Công nghệ
10/10/202614 phút đọc

Bốn bậc, và tiền điện của từng bậc

Mọi cuộc nói chuyện về hạ tầng AI trở nên dễ hơn khi có một cái thang với các bậc rõ ràng và giá vận hành của từng bậc. Tôi dùng bốn bậc. Bậc một là một máy chủ 2U với bốn GPU dạng PCIe. Bậc hai là một nút tám GPU dạng HGX trong khung 8U hoặc 10U. Bậc ba là từ bốn nút tám GPU trở lên nối với nhau bằng mạng tốc độ cao. Bậc bốn là tủ rack hoàn chỉnh kiểu GB300 NVL72 với 72 GPU trong một miền NVLink.

Tiền điện của từng bậc tính theo biểu giá bán lẻ điện cho kinh doanh áp dụng từ 10 tháng 5 năm 2025, cấp từ 22 kV trở lên, giờ bình thường 2.887 đồng mỗi kWh chưa thuế, và tính cả hệ số PUE của phòng máy. Bậc một khoảng 68 triệu đồng mỗi năm. Bậc hai khoảng 463 triệu đồng. Bậc ba khoảng 1,85 tỷ đồng. Bậc bốn khoảng 3,28 tỷ đồng. Đây là riêng tiền điện, chưa tính khấu hao phần cứng, chưa tính nhân sự, chưa tính giấy phép phần mềm.

Nhìn vào cái thang đó, câu hỏi đúng không còn là tôi mua được bậc nào mà là bậc nào tạo ra giá trị tương xứng với chi phí vận hành của nó. Và câu hỏi tiếp theo, quan trọng hơn: khi đi từ bậc bốn xuống bậc một, tôi cắt những gì mà không làm hỏng khả năng giải quyết bài toán của mình. Phần còn lại của bài trả lời đúng hai câu hỏi đó.

  • Bậc một: một máy chủ 2U với bốn GPU dạng PCIe.
  • Bậc hai: một nút tám GPU dạng HGX trong khung 8U hoặc 10U.
  • Bậc ba: từ bốn nút tám GPU trở lên nối bằng mạng tốc độ cao.
  • Bậc bốn: tủ rack kiểu GB300 NVL72, 72 GPU trong một miền NVLink.
  • Tiền điện mỗi năm: khoảng 68 triệu, 463 triệu, 1,85 tỷ và 3,28 tỷ đồng.
  • Các con số trên chưa gồm khấu hao phần cứng, nhân sự và giấy phép phần mềm.

Bậc bốn: cấu hình đẳng cấp thế giới và tất cả những gì nó đòi hỏi

Để biết cắt gì, trước hết phải biết đủ bộ gồm những gì. Một tủ GB300 NVL72 theo tài liệu Lenovo gồm 18 khay tính toán 1U và 9 khay switch NVLink trong tủ MGX 48U, với 72 GPU và 36 CPU Grace trong một miền NVLink. Mỗi GPU có 288 GB HBM3e, băng thông 7,7 TB/s, công suất 1.100W, và kết nối NVLink 1,8 TB/s theo kiểu full mesh. Mỗi khay có 960 GB bộ nhớ LPDDR5X và tối đa tám ổ E1.S.

Phần hạ tầng đi kèm là nơi chi phí thật nằm. Công suất tủ 135 kW thiết kế, đỉnh tới 155 kW. Nguồn qua sáu hoặc tám khay 33 kW, phân phối bằng busbar một chiều 50V chịu 1.400A. Làm mát chất lỏng tới chip với khoảng 90 phần trăm nhiệt đi theo nước, lưu lượng 59 đến 177 lít mỗi phút tuỳ nhiệt độ nước cấp, và CDU từ 250 kW trong tủ tới 1,8 MW cuối dãy theo danh mục Supermicro. Mạng gồm bốn cổng OSFP 800 Gb/s mỗi khay cho tầng ra ngoài, cộng tầng quản trị riêng với BlueField-3 và switch quản trị.

Cộng lại, bạn cần: hợp đồng điện công suất lớn, máy biến áp và máy phát tương ứng, UPS cỡ trên 150 kVA cho một tủ, sàn chịu tải tập trung, hệ thống nước làm mát với CDU và quy trình bảo dưỡng chất tải lạnh, hệ cáp quang 800G, và một đội vận hành biết làm việc với cả nước và cả mạng tốc độ cao. Không có hạng mục nào trong danh sách này là tuỳ chọn. Đó là lý do bậc bốn không phải một quyết định mua sắm mà là một dự án hạ tầng.

  • 18 khay tính toán 1U, 9 khay switch NVLink, tủ MGX 48U, 72 GPU và 36 CPU Grace.
  • Mỗi GPU: 288 GB HBM3e, 7,7 TB/s, 1.100W, NVLink 1,8 TB/s full mesh.
  • Mỗi khay: 960 GB LPDDR5X, tối đa 8 ổ E1.S.
  • Công suất tủ 135 kW thiết kế, 155 kW đỉnh; nguồn qua khay 33 kW; busbar 50V DC 1.400A.
  • Làm mát chất lỏng, khoảng 90 phần trăm nhiệt theo nước, 59–177 LPM tuỳ nhiệt độ nước cấp.
  • Mạng 4 cổng OSFP 800 Gb/s mỗi khay, cộng tầng quản trị riêng.
  • Hạ tầng bắt buộc: điện công suất lớn, UPS trên 150 kVA, sàn chịu tải, hệ nước, cáp quang 800G, đội vận hành chuyên môn.

Bậc ba: bốn nút tám GPU nối bằng mạng

Bậc ba giữ lại khả năng huấn luyện phân tán nhưng bỏ miền NVLink 72 GPU. Cấu hình tham chiếu gồm bốn nút tám GPU dạng HGX B300, chẳng hạn HPE Compute XD690 hoặc Dell PowerEdge XE9780, nối với nhau qua một cặp switch 800G hoặc 400G để có dự phòng. Mỗi nút có NVLink nội bộ nối tám GPU của nó; giữa các nút là mạng gói. Tổng 32 GPU.

Điện: lấy mức 14,3 kW liên tục mà HPE công bố cho một nút, bốn nút là khoảng 57,2 kW. Ở 80 phần trăm tải trung bình, đó là 400.858 kWh mỗi năm, tức khoảng 1,157 tỷ đồng tiền điện phần máy, và khoảng 1,85 tỷ đồng khi tính PUE 1,6. Bốn nút 10U chiếm 40U, tức vừa một tủ 42U về chiều cao nhưng hoàn toàn không vừa về điện: 57 kW trong một tủ là mức mà phòng máy doanh nghiệp Việt Nam không đỡ được. Thực tế bạn sẽ phải chia bốn nút ra ba hoặc bốn tủ, mỗi tủ một nút, và đó là một chi tiết quy hoạch sàn cần tính từ đầu.

Những gì mất khi xuống từ bậc bốn: băng thông giữa các GPU khác nút giảm từ 1,8 TB/s xuống 800 Gb/s, tức khoảng mười tám lần. Hệ quả kỹ thuật: tensor parallel chỉ nên nằm trong một nút, còn giữa các nút dùng pipeline parallel hoặc data parallel. Với mô hình vừa trong tám GPU, sự mất mát này gần như không ảnh hưởng. Với mô hình phải cắt ngang qua nhiều nút, thời gian huấn luyện tăng đáng kể, và đó chính là ranh giới quyết định bạn có cần bậc bốn hay không.

  • Bốn nút 8 GPU HGX B300 nối qua cặp switch 800G hoặc 400G có dự phòng, tổng 32 GPU.
  • Điện: khoảng 57,2 kW cho bốn nút; 400.858 kWh/năm ở 80 phần trăm tải.
  • Tiền điện khoảng 1,157 tỷ đồng/năm phần máy, khoảng 1,85 tỷ đồng ở PUE 1,6.
  • Bốn nút 10U vừa một tủ về chiều cao nhưng không vừa về điện — phải chia ra nhiều tủ.
  • Băng thông giữa GPU khác nút giảm từ 1,8 TB/s xuống 800 Gb/s, khoảng 18 lần.
  • Tensor parallel chỉ nên trong một nút; giữa các nút dùng pipeline hoặc data parallel.
  • Nếu mô hình vừa trong tám GPU, mất mát này gần như không ảnh hưởng.

Bậc hai: một nút tám GPU

Đây là bậc mà tôi khuyên phần lớn doanh nghiệp Việt Nam có nhu cầu AI thật sự nên nhắm tới, và cũng là bậc có tỷ lệ triển khai thành công cao nhất trong các dự án chúng tôi làm. Cấu hình tham chiếu: một nút tám GPU HGX B300 làm mát bằng khí, dạng 8U của Lenovo SR680a V4 hoặc Supermicro, hoặc dạng 10U của HPE XD690 và Dell XE9780. Mạng 100GbE hoặc 200GbE ra ngoài, lưu trữ cục bộ bằng các khay NVMe của chính máy, cộng một hệ NAS hoặc SAN hiệu năng vừa làm tầng dữ liệu.

Điện khoảng 14,3 kW liên tục theo con số HPE công bố, tức khoảng 463 triệu đồng tiền điện mỗi năm ở PUE 1,6. Mức 14 kW cho một thiết bị là cao so với hiện trạng nhưng nằm trong tầm cải tạo: cần một tủ riêng với đường điện riêng, ngăn cách luồng nóng lạnh, và điều hoà đủ công suất. Không cần vòng nước, không cần busbar một chiều, không cần tủ ORV3.

Những gì cắt được so với bậc ba: toàn bộ lớp mạng 800G và cặp switch tốc độ cao, vì chỉ có một nút nên không có lưu lượng giữa các nút. Đây là khoản cắt lớn nhất và ít đau nhất trong toàn bộ bài toán thu nhỏ. Tám GPU trong một nút vẫn nối nhau bằng NVLink ở băng thông đầy đủ, nên mọi kỹ thuật song song hoá trong một nút vẫn chạy nguyên vẹn. Với một mô hình 288 GB nhân tám là khoảng 2,3 TB bộ nhớ GPU trong một miền NVLink, bạn nạp được gần như mọi mô hình mã nguồn mở hiện có ở định dạng đã lượng tử hoá.

  • Cấu hình tham chiếu: một nút 8 GPU HGX B300 làm mát khí, 8U hoặc 10U.
  • Mạng 100GbE hoặc 200GbE; lưu trữ khay NVMe trong máy cộng NAS hoặc SAN hiệu năng vừa.
  • Điện khoảng 14,3 kW liên tục, khoảng 463 triệu đồng tiền điện mỗi năm ở PUE 1,6.
  • Cần tủ riêng, đường điện riêng, ngăn luồng nóng lạnh; không cần nước, busbar DC hay tủ ORV3.
  • Cắt được toàn bộ lớp mạng 800G và cặp switch tốc độ cao.
  • Tám GPU vẫn nối NVLink đầy đủ trong nút, nên song song hoá trong nút chạy nguyên vẹn.
  • Khoảng 2,3 TB bộ nhớ GPU trong một miền — nạp được gần như mọi mô hình mã nguồn mở đã lượng tử hoá.

Bậc một: một máy chủ 2U bốn GPU PCIe

Bậc một là nơi phần lớn doanh nghiệp nên bắt đầu, và nhiều đơn vị nên dừng lại. Cấu hình tham chiếu: một máy chủ 2U hai socket với bốn GPU dạng PCIe, bộ nhớ lấp đủ kênh, hai ổ NVMe cho hệ điều hành và bốn ổ NVMe cho dữ liệu nóng, mạng 25GbE kép. Điện khoảng 2,4 kW; ở 70 phần trăm tải trung bình là 14.717 kWh mỗi năm, tức khoảng 42,5 triệu đồng tiền điện phần máy và khoảng 68 triệu đồng khi tính PUE 1,6.

Khác biệt kiến trúc quan trọng nhất so với bậc hai: GPU dạng PCIe không nối nhau bằng NVLink ở băng thông cao như bo HGX. Chúng nói chuyện qua PCIe và qua CPU. Hệ quả: bạn không huấn luyện được mô hình phải cắt ngang nhiều GPU một cách hiệu quả, nhưng bạn chạy được bốn khối lượng công việc độc lập trên bốn GPU, hoặc chạy suy luận cho một mô hình vừa trong một GPU và nhân bốn bản để tăng thông lượng.

Đó chính là hình dạng của hầu hết nhu cầu AI doanh nghiệp thật: một trợ lý nội bộ trả lời câu hỏi về tài liệu công ty, một mô hình nhận dạng ký tự để số hoá hồ sơ, một mô hình phân loại văn bản cho bộ phận chăm sóc khách hàng, một mô hình thị giác kiểm tra chất lượng trên dây chuyền. Bốn bài toán, bốn GPU, không cần GPU nào nói chuyện với GPU nào. Nếu danh sách nhu cầu của bạn trông như vậy thì bậc một là cấu hình đúng, và bất kỳ bậc cao hơn đều là tiền tiêu không có đích.

  • Cấu hình tham chiếu: máy 2U hai socket, 4 GPU PCIe, RAM lấp đủ kênh, 2 ổ NVMe hệ thống và 4 ổ dữ liệu, mạng 25GbE kép.
  • Điện khoảng 2,4 kW; 14.717 kWh/năm ở 70 phần trăm tải.
  • Tiền điện khoảng 42,5 triệu đồng/năm phần máy, khoảng 68 triệu đồng ở PUE 1,6.
  • GPU PCIe không nối NVLink băng thông cao như bo HGX — giao tiếp qua PCIe và CPU.
  • Phù hợp: bốn khối lượng công việc độc lập, hoặc nhân bản suy luận để tăng thông lượng.
  • Không phù hợp: huấn luyện mô hình phải cắt ngang nhiều GPU.
Công cụ liên quan
Dùng công cụ tư vấn GPU AI
Xem ngay

Danh sách cắt được, theo thứ tự nên cắt

Khi ngân sách buộc phải cắt, hãy cắt theo đúng thứ tự sau, từ ít đau nhất tới nhiều đau nhất. Thứ nhất, cắt miền NVLink liên tủ: chín khay switch NVLink cùng toàn bộ hạ tầng busbar đi kèm. Chỉ cần thứ này khi mô hình không vừa trong tám GPU. Thứ hai, cắt mạng 800G xuống 200G hoặc 100G: chỉ cần 800G khi huấn luyện phân tán qua nhiều nút. Thứ ba, cắt lưu trữ cục bộ mật độ cao, từ hàng trăm khay E1.S xuống vài khay NVMe trong máy cộng một hệ lưu trữ ngoài.

Thứ tư, cắt làm mát chất lỏng và chuyển sang khí. Bằng chứng rằng việc này khả thi: HPE và Dell đều bán bản tám GPU B300 làm mát bằng khí ở mức 14 đến 16 kW. Thứ năm, hạ công suất thiết kế của CPU: Intel Xeon 6+ có chế độ 330W thay cho 450W với mức giảm xung toàn nhân khoảng 14 phần trăm, AMD EPYC 9006 cho điều chỉnh trong khoảng 400W đến 600W. Thứ sáu, giảm số GPU mỗi nút từ tám xuống bốn và chuyển từ bo HGX sang GPU dạng PCIe.

Có hai thứ tôi khuyên không cắt trong mọi trường hợp. Thứ nhất là dung lượng bộ nhớ GPU: nó quyết định bạn nạp được mô hình nào và phục vụ được bao nhiêu phiên đồng thời, và không thể bù bằng phần mềm. Khi phải chọn giữa bốn GPU dung lượng lớn và tám GPU dung lượng nhỏ cùng ngân sách, trong phần lớn bài toán phục vụ mô hình ngôn ngữ, bốn GPU dung lượng lớn là lựa chọn ít hối tiếc hơn. Thứ hai là lưu trữ nhanh cho dữ liệu nóng: một GPU chờ dữ liệu là một GPU đang đốt tiền mà không sinh ra kết quả, và đây là lỗi thiết kế phổ biến nhất chúng tôi gặp ở các cụm GPU tự lắp.

  • Cắt thứ nhất: miền NVLink liên tủ và hạ tầng busbar — chỉ cần khi mô hình không vừa trong 8 GPU.
  • Cắt thứ hai: mạng 800G xuống 200G hoặc 100G — chỉ cần 800G khi huấn luyện đa nút.
  • Cắt thứ ba: lưu trữ cục bộ mật độ cao, chuyển sang vài khay NVMe cộng lưu trữ ngoài.
  • Cắt thứ tư: làm mát chất lỏng sang khí — HPE và Dell đều có bản 8 GPU B300 làm mát khí.
  • Cắt thứ năm: hạ công suất CPU — Xeon 6+ chế độ 330W, EPYC 9006 điều chỉnh 400–600W.
  • Cắt thứ sáu: giảm từ 8 GPU HGX xuống 4 GPU PCIe.
  • Không cắt: dung lượng bộ nhớ GPU.
  • Không cắt: lưu trữ nhanh cho dữ liệu nóng — GPU chờ dữ liệu là GPU đốt tiền không sinh kết quả.

Dấu hiệu bạn đã sẵn sàng lên bậc tiếp theo

Từ bậc một lên bậc hai: khi tỷ lệ tận dụng GPU trung bình trong ba tháng vượt 70 phần trăm đo bằng DCGM hoặc công cụ tương đương, khi số yêu cầu bị từ chối vì hết bộ nhớ GPU vượt vài phần trăm tổng yêu cầu, hoặc khi mô hình bạn cần dùng không vừa trong một GPU. Ba dấu hiệu này đo được, và nếu không có dấu hiệu nào thì đừng nâng cấp bất kể người bán nói gì.

Từ bậc hai lên bậc ba: khi bạn thực sự huấn luyện, không phải chỉ fine-tune LoRA, và một chu kỳ huấn luyện trên một nút mất quá lâu để đội có thể chạy đủ số thí nghiệm mỗi quý. Hoặc khi bạn cần dự phòng: một nút duy nhất nghĩa là khi nó bảo trì thì dịch vụ dừng, và nếu AI đã thành hạ tầng thiết yếu có cam kết nội bộ thì hai nút là yêu cầu tối thiểu, không phải điều xa xỉ.

Từ bậc ba lên bậc bốn: khi mô hình bạn làm việc với không vừa trong tám GPU dù đã lượng tử hoá, và việc chia nó qua mạng gói làm thời gian mỗi bước huấn luyện tăng tới mức không chấp nhận được. Đây là một điều kiện kỹ thuật rất cụ thể, và nếu bạn không đo được nó thì bạn chưa cần bậc bốn. Và một dấu hiệu ngược mà tôi muốn nhấn mạnh: nếu tỷ lệ tận dụng dưới 50 phần trăm ở bất kỳ bậc nào, việc cần làm là tối ưu phần mềm và lịch trình, không phải mua phần cứng. Chuyển từ thư viện suy luận thông thường sang vLLM hoặc TensorRT-LLM có thể tăng thông lượng nhiều lần trên chính phần cứng đang có, với chi phí bằng vài tuần công của một kỹ sư.

  • Bậc một lên bậc hai: tận dụng GPU trung bình ba tháng vượt 70 phần trăm.
  • Bậc một lên bậc hai: yêu cầu bị từ chối vì hết bộ nhớ GPU vượt vài phần trăm tổng yêu cầu.
  • Bậc một lên bậc hai: mô hình cần dùng không vừa trong một GPU.
  • Bậc hai lên bậc ba: thực sự huấn luyện và một chu kỳ trên một nút quá lâu cho nhịp thí nghiệm.
  • Bậc hai lên bậc ba: cần dự phòng vì AI đã thành hạ tầng thiết yếu có cam kết nội bộ.
  • Bậc ba lên bậc bốn: mô hình không vừa trong tám GPU dù đã lượng tử hoá, và chia qua mạng làm chậm không chấp nhận được.
  • Dấu hiệu ngược: tận dụng dưới 50 phần trăm thì tối ưu phần mềm trước, chưa mua phần cứng.

Kết luận thẳng thắn

Cái thang bốn bậc với tiền điện 68 triệu, 463 triệu, 1,85 tỷ và 3,28 tỷ đồng mỗi năm là công cụ ra quyết định hữu dụng nhất mà tôi có khi tư vấn. Nó biến câu hỏi mơ hồ về cấu hình thành câu hỏi rõ ràng về giá trị: bài toán của tôi có tạo ra giá trị vượt mức chi phí vận hành của bậc này hay không. Nếu không trả lời được, bạn đang ở bậc quá cao.

Lỗi phổ biến nhất là nhảy bậc. Doanh nghiệp đọc tin về cấu hình đẳng cấp thế giới, mua một hệ tám GPU hoặc hơn ngay từ đầu, rồi để nó chạy ở mức tận dụng dưới hai mươi phần trăm trong hơn một năm vì chưa có bài toán đủ chín và chưa có đội vận hành đủ kinh nghiệm. Thiệt hại không chỉ là tiền mà còn là niềm tin nội bộ với dự án AI, vốn khó phục hồi hơn tiền.

Lộ trình tôi khuyên gần như luôn giống nhau: bắt đầu ở bậc một với một máy bốn GPU, chạy sáu tháng, đo ba con số gồm tỷ lệ tận dụng GPU, đỉnh bộ nhớ GPU sử dụng và số yêu cầu bị từ chối. Ba con số đó quyết định bậc tiếp theo chính xác hơn mọi bảng so sánh. Và trong lúc chưa chắc, thuê máy chủ GPU theo tháng để chạy thử nghiệm thay vì mua: khoản thuê vài tháng rẻ hơn rất nhiều so với một quyết định mua sai. HQG cho thuê máy chủ GPU theo tháng, khảo sát điện và làm mát tại chỗ, và thiết kế lộ trình nâng cấp theo từng bậc tại TP.HCM, Đà Nẵng và Hà Nội. Hotline 1900 636 106.

Nguồn đã tra

Thông số cấu hình bậc bốn và bậc hai lấy từ tài liệu kỹ thuật của hãng. Các con số về tiền điện là phép tính số học từ công suất công bố, biểu giá điện hiện hành và hệ số PUE giả định đã nêu rõ trong bài; hãy thay bằng công suất đo thực tế và biểu giá áp dụng cho hợp đồng điện của bạn.

  • Lenovo Press — GB300 NVL72, thông số tủ, khay, điện và nước: https://lenovopress.lenovo.com/lp2357-lenovo-nvidia-gb300-nvl72-rack-scale-ai
  • Supermicro SRS-GB300-NVL72 — khay nguồn và lựa chọn CDU: https://www.supermicro.com/en/products/system/gpu/48u/srs-gb300-nvl72
  • HPE Compute XD690 — công suất 14,3 kW liên tục và 16,4 kW đỉnh: https://buy.hpe.com/us/en/compute/rack-servers/proliant-compute-xd600-servers/hpe-compute-xd690/p/1014909740
  • Dell PowerEdge XE9780 — bản 10U làm mát khí tám GPU: https://www.dell.com/en-us/shop/ipovw/poweredge-xe9780
  • Lenovo Press — ThinkSystem SR680a V4, bản 8U làm mát khí: https://lenovopress.lenovo.com/lp2264-thinksystem-sr680a-v4-server
  • Biểu giá bán lẻ điện theo Quyết định 1279/QĐ-BCT: https://thuvienphapluat.vn/phap-luat-doanh-nghiep/bai-viet/gia-dien-kinh-doanh-2026-cap-nhat-moi-nhat-20133.html
Dùng công cụ tư vấn GPU AI

Nhập mô hình và số người dùng để nhận cấu hình GPU phù hợp.

Dùng ngay
#hạ tầng AI#cấu hình tham chiếu#TCO#GPU#phòng máy#ngân sách
N
Nguyễn Phúc Thịnh
Giám đốc Công nghệ

Định hướng kiến trúc kỹ thuật và bộ tiêu chuẩn triển khai hạ tầng của HQG, với nhiều năm dẫn dắt các dự án trung tâm dữ liệu quy mô lớn.

Chia sẻ