AI & LLM nội bộ (Private AI)
Xây dựng cụm GPU nội bộ chạy mô hình mã nguồn mở (Llama, Qwen, Gemma) kèm RAG trên kho tài liệu doanh nghiệp, giao diện chat nội bộ có phân quyền và ghi log đầy đủ. Dữ liệu không rời khỏi hệ thống.
- Ngân sách từ
- 850.000.000 ₫
- Thời gian triển khai
- 6 tuần
Vấn đề đang gặp và cách HQG xử lý
Phần lớn doanh nghiệp tìm tới giải pháp này sau khi đã gặp đúng tình huống bên trái.
Doanh nghiệp muốn dùng AI nhưng không thể gửi hợp đồng, hồ sơ khách hàng hay dữ liệu tài chính lên dịch vụ công cộng. Chi phí API cũng tăng không kiểm soát khi số người dùng tăng.
Xây dựng cụm GPU nội bộ chạy mô hình mã nguồn mở (Llama, Qwen, Gemma) kèm RAG trên kho tài liệu doanh nghiệp, giao diện chat nội bộ có phân quyền và ghi log đầy đủ. Dữ liệu không rời khỏi hệ thống.
Kết quả đo được sau triển khai
Các con số dưới đây lấy từ dự án thực tế của HQG, đo trước và sau khi đưa hệ thống vào vận hành ổn định.
- -72%
- Chi phí/1M token so với API
- -65%
- Thời gian tra cứu tài liệu
- 0%
- Dữ liệu rời khỏi doanh nghiệp
Kiến trúc giải pháp
Luồng đi từ người dùng xuống các lớp hạ tầng. Mọi lớp đều được đưa vào hệ giám sát tập trung của HQG (đường nét đứt bên phải).
Thành phần hệ thống
| Lớp | Thành phần | Vai trò trong hệ thống |
|---|---|---|
| 1 | Server 4–8x GPULớp tính toán | Nơi mô hình thực sự chạy. Mỗi node mang 4–8 GPU với tổng VRAM 192–640GB, đủ phục vụ mô hình 70B lượng tử FP8 cho khoảng 100 phiên đồng thời. |
| 2 | InfiniBand/25GbELớp kết nối | Nối các node huấn luyện với băng thông thấp độ trễ. InfiniBand dùng khi huấn luyện đa node; 25GbE là mức đủ nếu chỉ chạy suy luận. |
| 3 | vLLM + Open WebUILớp phục vụ mô hình | vLLM quản lý bộ nhớ KV cache và gộp yêu cầu theo lô liên tục; Open WebUI là giao diện chat nội bộ có lịch sử hội thoại và phân quyền theo phòng ban. |
| 4 | Qdrant / pgvectorLớp dữ liệu | Cơ sở dữ liệu vector lưu embedding của tài liệu nội bộ, phục vụ tìm kiếm ngữ nghĩa trong pipeline RAG trước khi đưa ngữ cảnh vào mô hình. |
| 5 | Keycloak SSOLớp định danh | Đăng nhập một lần bằng tài khoản công ty, gắn mỗi câu hỏi với một người dùng cụ thể trong log — điều kiện bắt buộc khi kiểm toán truy vết dữ liệu nhạy cảm. |
Ngân sách từ 850.000.000 ₫, triển khai trong 6 tuần
Ngân sách là mức khởi điểm cho quy mô nhỏ nhất, đã gồm thiết bị và công triển khai, chưa gồm VAT 8%. Lộ trình bên dưới áp dụng cho quy mô tiêu chuẩn.
- 1Tuần 1
Workshop use case
Làm việc với các phòng ban để chọn 2–3 tình huống sử dụng đo được, ước lượng số người dùng đồng thời và kích thước kho tài liệu cần đưa vào RAG.
- 2Tuần 2
Thiết kế & đặt hàng
Chốt cấu hình GPU, tính tải điện và làm mát cho tủ rack, đặt hàng thiết bị và chuẩn bị mặt bằng phòng máy.
- 3Tuần 3–4
Lắp đặt & dựng nền tảng
Lắp rack, đi dây, cài driver GPU, dựng cụm vLLM và cơ sở dữ liệu vector, tích hợp đăng nhập một lần.
- 4Tuần 5
Nạp dữ liệu & tinh chỉnh RAG
Đưa kho tài liệu vào pipeline, tinh chỉnh cách cắt đoạn và xếp hạng kết quả, kiểm tra chất lượng trả lời với người dùng thật.
- 5Tuần 6
Benchmark & bàn giao
Đo tốc độ sinh token, độ trễ token đầu tiên và mức sử dụng GPU; bàn giao tài liệu vận hành và đào tạo hai buổi cho đội kỹ thuật.
Đã triển khai thực tế
Trợ lý AI nội bộ trả lời hợp đồng & quy trình, tiết kiệm ~4.100 giờ/năm
Xem thêm dự án của HQGGiải pháp liên quan
Nhận thiết kế và dự toán cho ai & llm nội bộ (private ai)
Kỹ sư giải pháp sẽ khảo sát hiện trạng và gửi lại hai đến ba phương án kèm bảng so sánh chi phí 5 năm trong vòng 5 ngày làm việc.
Yêu cầu thiết kế & dự toán
Điền thông tin bên dưới, kỹ sư giải pháp phụ trách AI & LLM nội bộ (Private AI) sẽ phản hồi trong 2 giờ làm việc.