Bỏ qua điều hướng
CÔNG TY CỔ PHẦN GIẢI PHÁP CÔNG NGHỆ HQG
Trung tâm AI · Công cụ

Lập kế hoạch huấn luyện mô hình AI

Trước khi mua GPU hay gọi nhà thầu, hãy biết: dữ liệu của bạn là bao nhiêu token, một lần huấn luyện mất mấy giờ, cần bao nhiêu ổ cho checkpoint, tốn bao nhiêu điện và dự án chạy mấy tuần. Mọi con số đi kèm phép tính để kỹ sư của bạn kiểm lại.

Fine-tune theo giọng công ty

Dạy mô hình trả lời đúng văn phong, thuật ngữ và quy tắc của công ty — từ tập hội thoại mẫu đã được người thật duyệt.

Cách làm: QLoRA hoặc LoRA trên vài nghìn đến vài chục nghìn mẫu hội thoại. Giữ nguyên trọng số gốc, chỉ học lớp adapter.

Fine-tune dạy CÁCH NÓI, không dạy được KIẾN THỨC cập nhật. Thông tin hay thay đổi (giá, tồn kho, chính sách) phải lấy qua RAG, không nhồi vào trọng số.

RAG trên tài liệu riêng

Trợ lý trả lời theo tài liệu nội bộ và trích dẫn được đoạn gốc. Không huấn luyện mô hình sinh, chỉ xây kho vector từ tài liệu.

Cách làm: Chạy mô hình nhúng (embedding) xuôi một lượt qua toàn bộ tài liệu, lưu vector vào kho; mô hình sinh dùng bản có sẵn.

Đây là lựa chọn nên thử TRƯỚC khi fine-tune: rẻ hơn, sửa dữ liệu là đổi được câu trả lời ngay, và luôn có trích dẫn để người dùng kiểm.

Huấn luyện tiếp trên miền dữ liệu riêng

Mô hình chưa quen ngôn ngữ, thuật ngữ của ngành (hồ sơ kỹ thuật, văn bản chuyên ngành) — học tiếp trên kho văn bản thô của công ty.

Cách làm: Continued pre-training: thường 1 epoch trên kho văn bản lớn, LoRA cho nhẹ hoặc toàn phần khi có nhiều GPU.

Tốn nhất trong ba hướng và dễ làm mô hình quên năng lực cũ (catastrophic forgetting). Chỉ làm khi đã thử RAG và LoRA mà vẫn chưa đạt.

Thông số kế hoạch
Mục tiêu

8,2B tham số · giấy phép Apache 2.0

Độ chính xác dùng để tính: INT4 (4-bit).

Quy đổi ra 3 triệu token theo công thức hiện ở bảng bên.

Giả định nâng cao (sửa được)

Kết quả ước lượng

VRAM cần
23,9 GB
Vừa 1 × 48 GB
1 epoch
~6 phút
MFU giả định 40%
Cả lần chạy
~17 phút
3 epoch
Số lần thử nên tính
12 lần
Chạy được 143,2 lần/tuần
Ổ cho checkpoint
3,5 GB
1,1 GB/bản
Điện cho cả quá trình
2 kWh
≈ 7.931 ₫ tiền điện

Cần cân nhắc trước khi chạy

  • Fine-tune dạy cách nói và cách định dạng, không dạy được kiến thức hay thay đổi. Trước khi huấn luyện, hãy thử RAG — rẻ hơn và sửa được ngay.

Phần cứng đủ cho 23,9 GB VRAM

  • 1 × L40S 48GB48 GB · dư 50%

    Một card là đủ — đơn giản nhất để triển khai.

  • 1 × RTX 6000 Ada 48GB48 GB · dư 50%

    Một card là đủ — đơn giản nhất để triển khai.

  • 1 × A100 80GB PCIe80 GB · dư 70%

    Một card là đủ — đơn giản nhất để triển khai.

Lịch trình 16 tuần

Tính từ lượng dữ liệu, số người làm dữ liệu và số giờ máy khả dụng mỗi tuần. Sửa ba thông số đó là lịch đổi theo.

  1. Tuần 1

    Chốt mục tiêu và bộ câu hỏi kiểm tra

    • Viết ra 1 câu mô tả việc mô hình phải làm được, kèm tiêu chí đạt/không đạt.
    • Lập bộ 50–200 câu hỏi thật kèm đáp án mong muốn do người trong công ty duyệt (bộ đánh giá).
    • Đo thử mô hình gốc chưa huấn luyện trên bộ này để có mốc so sánh.

    Kết quả phải có: Bộ đánh giá đã chốt + điểm của mô hình gốc

  2. Tuần 2–11

    Thu thập và làm sạch dữ liệu

    • Xuất hội thoại/biểu mẫu, bỏ trùng, chuẩn hoá về mẫu JSONL theo chat template của mô hình.
    • Ẩn danh thông tin cá nhân trước khi đưa vào tập huấn luyện.
    • Tách train/validation theo thời gian hoặc theo nguồn, không trộn ngẫu nhiên nếu dữ liệu lặp nội dung.
    • Năng suất giả định: 500 mẫu/người/tuần × 1 người.

    Kết quả phải có: Tập dữ liệu đã làm sạch + ảnh chụp tình trạng dữ liệu

  3. Tuần 12

    Chạy thử nhỏ để bắt lỗi quy trình

    • Huấn luyện trên 1–2% dữ liệu để bắt lỗi định dạng, lỗi hết VRAM, lỗi nạp dữ liệu.
    • Kiểm tra lưu và nạp lại checkpoint thành công trước khi chạy thật.

    Kết quả phải có: Một lần chạy hoàn tất không lỗi + log

  4. Tuần 13

    Huấn luyện và dò tham số (12 lần thử)

    • Mỗi lần chạy ~17 phút trên 1 × NVIDIA L40S 48GB.
    • Mỗi lần chỉ đổi một nhóm tham số (learning rate, rank, số epoch) và ghi lại kết quả.
    • Dừng sớm khi điểm validation xấu đi — không chạy hết epoch cho vui.

    Kết quả phải có: Bảng so sánh các lần chạy + bản tốt nhất

  5. Tuần 14

    Đánh giá và soát an toàn

    • Chấm trên bộ đánh giá đã chốt từ tuần 1; so với mô hình gốc.
    • Người thật đọc mù 50 câu trả lời của bản mới và bản gốc để chọn.
    • Thử các câu hỏi hiểm: dữ liệu nhạy cảm, câu ngoài phạm vi, prompt injection.

    Kết quả phải có: Báo cáo đánh giá + quyết định có đưa vào dùng

  6. Tuần 15–16

    Chạy thử trong một nhóm nhỏ

    • Mở cho một phòng ban dùng thật, có nút báo lỗi câu trả lời.
    • Theo dõi độ trễ, tỷ lệ phải chuyển cho người thật, các câu trả lời bị báo sai.
    • Gom câu trả lời sai thành dữ liệu cho vòng sau.

    Kết quả phải có: Bản chạy thử + danh sách lỗi để làm vòng tiếp theo

Vì sao ra những con số trên

Mỗi dòng là phép tính đã thay số thật — bạn hoặc kỹ sư của bạn tính lại bằng máy tính tay được.

Công thức và kết quả từng phần của kế hoạch
Token dữ liệu5.000 mẫu × 600 token/mẫu = 3 triệu token3 triệu token
Tổng token xử lý3 triệu token × 3 epoch9 triệu token
Thời gian 1 epoch4 × 8,19 tỷ tham số × 3 triệu token ÷ (733 TFLOPS × 1 GPU × MFU 0,4)~6 phút
Thời gian cả lần chạy~6 phút × 3 epoch~17 phút
Giờ máy mỗi tuần8 giờ/ngày × 5 ngày/tuần40 giờ/tuần
Dung lượng 1 checkpoint0,082 tỷ tham số được học × 14 byte/tham số1,1 GB
Ổ cần cho checkpoint1,1 GB × 3 bản giữ lại3,5 GB
Điện năng 1 lần chạy455 W × 0,3 giờ × PUE 1,6 ÷ 1.0000,2 kWh
Công suất cả máy350 W/GPU × 1 GPU × 1,3 (CPU, RAM, quạt, tổn hao nguồn)455 W
Số lần thử chạy được trong 1 tuần40 giờ/tuần ÷ 0,3 giờ/lần143,2 lần/tuần
Số lần thử nên tínhKhuyến nghị của HQG: lấy số lần chạy được trong 2 tuần (143,2 × 2), tối thiểu 3 lần (1 chạy thử + 2 lần dò tham số), tối đa 12 lần12 lần
Số tuần cho phần máy chạy0,3 giờ/lần × 12 lần ÷ 40 giờ/tuần (làm tròn lên)1 tuần

Giả định đã dùng — đọc trước khi đưa cho lãnh đạo

  • Tất cả con số trên là ƯỚC LƯỢNG từ công thức số học hiển thị ngay bên cạnh, không phải kết quả đo trên máy thật. Thời gian thực tế phụ thuộc framework, tốc độ nạp dữ liệu, mạng giữa các GPU và thời gian dừng để đánh giá.
  • FLOPs/GPU lấy theo bảng thông số GPU của HQG (733 TFLOPS cho NVIDIA L40S 48GB). MFU 40% là GIẢ ĐỊNH — hãy đo MFU thật của bạn rồi nhập lại.
  • Quy đổi ký tự → token (3 ký tự/token) là GIẢ ĐỊNH cho tiếng Việt có dấu. Cách đo đúng: nạp tokenizer của chính mô hình bạn dùng và đếm trên dữ liệu thật của bạn.
  • Giá điện 3.250 đ/kWh và PUE 1,6 là số tham chiếu trong cấu hình site, không phải hoá đơn của bạn.
  • Lịch trình theo tuần dựa trên năng suất làm dữ liệu giả định và 40 giờ máy/tuần; sửa hai thông số này là lịch đổi theo.

Cách đo số token thật và chuẩn bị dữ liệu: xem Chuẩn bị dữ liệu huấn luyện và hướng dẫn fine-tune LoRA/QLoRA.

Công cụ tính như thế nào?

Thời gian huấn luyện ước lượng theo bậc độ lớn: k × số tham số × số token ÷ (FLOPs mỗi GPU × số GPU × MFU), với k = 6 cho huấn luyện đầy đủ, 4 cho LoRA/QLoRA và 2 khi chỉ chạy xuôi để nhúng tài liệu. MFU (mức khai thác thực của GPU) là giả định bạn sửa được, mặc định 40%.

VRAM dùng chung công thức với công cụ tính cấu hình: trọng số, KV cache, activations, gradient và trạng thái optimizer, cộng phần dự phòng.

Điện năng = công suất (W) × giờ × PUE ÷ 1.000. Công suất lấy TDP của GPU × số card × 1,3 cho CPU, RAM, quạt và tổn hao nguồn. Giá điện và PUE là số tham chiếu trong cấu hình web, không phải hoá đơn của bạn.

Lịch trình theo tuần tính từ lượng dữ liệu, số người làm dữ liệu và số giờ máy khả dụng mỗi tuần — ba thông số bạn tự nhập.

Những gì công cụ này KHÔNG làm

Không hứa chất lượng mô hình. Không có con số nào ở đây nói bản fine-tune của bạn sẽ trả lời tốt hơn bao nhiêu phần trăm. Điều đó chỉ đo được bằng bộ câu hỏi thật do người trong công ty duyệt.

Không phải báo giá. Trang này không tính tiền thiết bị. Tiền điện là ước lượng theo giá tham chiếu.

Không thay đo thực tế. Thời gian thật phụ thuộc framework, tốc độ nạp dữ liệu, mạng giữa các GPU. Hãy chạy thử trên 1–2% dữ liệu rồi nhân lên — con số đó đáng tin hơn mọi công thức.

Bước tiếp theo: chuẩn bị dữ liệu và so sánh mô hình trước khi chốt phần cứng.