Bỏ qua điều hướng
CÔNG TY CỔ PHẦN GIẢI PHÁP CÔNG NGHỆ HQG
Ngành áp dụng: Đa ngành

AI & LLM nội bộ (Private AI)

Xây dựng cụm GPU nội bộ chạy mô hình mã nguồn mở (Llama, Qwen, Gemma) kèm RAG trên kho tài liệu doanh nghiệp, giao diện chat nội bộ có phân quyền và ghi log đầy đủ. Dữ liệu không rời khỏi hệ thống.

Ngân sách từ
850.000.000 ₫
Thời gian triển khai
6 tuần
Bối cảnh

Vấn đề đang gặp và cách HQG xử lý

Phần lớn doanh nghiệp tìm tới giải pháp này sau khi đã gặp đúng tình huống bên trái.

Vấn đề

Doanh nghiệp muốn dùng AI nhưng không thể gửi hợp đồng, hồ sơ khách hàng hay dữ liệu tài chính lên dịch vụ công cộng. Chi phí API cũng tăng không kiểm soát khi số người dùng tăng.

Cách HQG giải quyết

Xây dựng cụm GPU nội bộ chạy mô hình mã nguồn mở (Llama, Qwen, Gemma) kèm RAG trên kho tài liệu doanh nghiệp, giao diện chat nội bộ có phân quyền và ghi log đầy đủ. Dữ liệu không rời khỏi hệ thống.

Kết quả

Kết quả đo được sau triển khai

Các con số dưới đây lấy từ dự án thực tế của HQG, đo trước và sau khi đưa hệ thống vào vận hành ổn định.

-72%
Chi phí/1M token so với API
-65%
Thời gian tra cứu tài liệu
0%
Dữ liệu rời khỏi doanh nghiệp
Kiến trúc

Kiến trúc giải pháp

Luồng đi từ người dùng xuống các lớp hạ tầng. Mọi lớp đều được đưa vào hệ giám sát tập trung của HQG (đường nét đứt bên phải).

Người dùng & thiết bị đầu cuốiGiám sát& sao lưuZabbix · Grafana · VeeamLớp tính toánServer 4–8x GPULớp kết nốiInfiniBand/25GbELớp phục vụ mô hìnhvLLM + Open WebUILớp dữ liệuQdrant / pgvectorLớp định danhKeycloak SSO12345

Thành phần hệ thống

Bảng thành phần hệ thống của giải pháp AI & LLM nội bộ (Private AI)
LớpThành phầnVai trò trong hệ thống
1Server 4–8x GPULớp tính toánNơi mô hình thực sự chạy. Mỗi node mang 4–8 GPU với tổng VRAM 192–640GB, đủ phục vụ mô hình 70B lượng tử FP8 cho khoảng 100 phiên đồng thời.
2InfiniBand/25GbELớp kết nốiNối các node huấn luyện với băng thông thấp độ trễ. InfiniBand dùng khi huấn luyện đa node; 25GbE là mức đủ nếu chỉ chạy suy luận.
3vLLM + Open WebUILớp phục vụ mô hìnhvLLM quản lý bộ nhớ KV cache và gộp yêu cầu theo lô liên tục; Open WebUI là giao diện chat nội bộ có lịch sử hội thoại và phân quyền theo phòng ban.
4Qdrant / pgvectorLớp dữ liệuCơ sở dữ liệu vector lưu embedding của tài liệu nội bộ, phục vụ tìm kiếm ngữ nghĩa trong pipeline RAG trước khi đưa ngữ cảnh vào mô hình.
5Keycloak SSOLớp định danhĐăng nhập một lần bằng tài khoản công ty, gắn mỗi câu hỏi với một người dùng cụ thể trong log — điều kiện bắt buộc khi kiểm toán truy vết dữ liệu nhạy cảm.
Đầu tư & tiến độ

Ngân sách từ 850.000.000 ₫, triển khai trong 6 tuần

Ngân sách là mức khởi điểm cho quy mô nhỏ nhất, đã gồm thiết bị và công triển khai, chưa gồm VAT 8%. Lộ trình bên dưới áp dụng cho quy mô tiêu chuẩn.

  1. 1Tuần 1

    Workshop use case

    Làm việc với các phòng ban để chọn 2–3 tình huống sử dụng đo được, ước lượng số người dùng đồng thời và kích thước kho tài liệu cần đưa vào RAG.

  2. 2Tuần 2

    Thiết kế & đặt hàng

    Chốt cấu hình GPU, tính tải điện và làm mát cho tủ rack, đặt hàng thiết bị và chuẩn bị mặt bằng phòng máy.

  3. 3Tuần 3–4

    Lắp đặt & dựng nền tảng

    Lắp rack, đi dây, cài driver GPU, dựng cụm vLLM và cơ sở dữ liệu vector, tích hợp đăng nhập một lần.

  4. 4Tuần 5

    Nạp dữ liệu & tinh chỉnh RAG

    Đưa kho tài liệu vào pipeline, tinh chỉnh cách cắt đoạn và xếp hạng kết quả, kiểm tra chất lượng trả lời với người dùng thật.

  5. 5Tuần 6

    Benchmark & bàn giao

    Đo tốc độ sinh token, độ trễ token đầu tiên và mức sử dụng GPU; bàn giao tài liệu vận hành và đào tạo hai buổi cho đội kỹ thuật.

Dự án tiêu biểu

Đã triển khai thực tế

Khách hàng
Tập đoàn bất động sản (TP.HCM)
Quy mô
1.200 nhân sự, 380.000 tài liệu
Kết quả

Trợ lý AI nội bộ trả lời hợp đồng & quy trình, tiết kiệm ~4.100 giờ/năm

Xem thêm dự án của HQG
Có thể bạn cần

Giải pháp liên quan

Ảo hoá & Hyper-Converged

Từ 620.000.000 ₫ · 4 tuần triển khai

Xem chi tiết

Backup & Disaster Recovery

Từ 380.000.000 ₫ · 3 tuần triển khai

Xem chi tiết

An ninh mạng & Zero Trust

Từ 450.000.000 ₫ · 5 tuần triển khai

Xem chi tiết
Bắt đầu

Nhận thiết kế và dự toán cho ai & llm nội bộ (private ai)

Kỹ sư giải pháp sẽ khảo sát hiện trạng và gửi lại hai đến ba phương án kèm bảng so sánh chi phí 5 năm trong vòng 5 ngày làm việc.

Yêu cầu thiết kế & dự toán

Điền thông tin bên dưới, kỹ sư giải pháp phụ trách AI & LLM nội bộ (Private AI) sẽ phản hồi trong 2 giờ làm việc.

Thông tin của bạn chỉ dùng để tư vấn dự án, không chia sẻ cho bên thứ ba.