Bảo mật

“Nạp kho tri thức” khác “huấn luyện mô hình” thế nào? Giữ tri thức nhân viên thành tài sản công ty bằng AI nội bộ

Cập nhật lần cuối: 03/10/2026

Hai bìa hồ sơ văn phòng màu đỏ — minh hoạ tài liệu công việc do nhân viên tạo ra
Mỗi quy trình, câu trả lời mẫu hay cách xử lý sự cố nhân viên viết ra là một phần tri thức của doanh nghiệp. Ảnh: Pixabay / Pexels

Tri thức công việc mà nhân viên tạo ra — quy trình, hướng dẫn, câu trả lời mẫu cho khách, cách xử lý một sự cố khó — chỉ thật sự trở thành tài sản của công ty khi nó được lưu ở nơi công ty kiểm soát và người khác tra cứu lại được. AI nội bộ của Namtech (LocalAI) làm việc này bằng cách nạp các tài liệu đó vào một kho tri thức nội bộ để AI tra cứu (RAG), chạy trên máy đặt tại văn phòng, không gửi dữ liệu ra dịch vụ AI bên ngoài và không huấn luyện lại mô hình. Nhân viên nghỉ việc, tri thức vẫn ở lại; còn dữ liệu cá nhân của chính người đó thì phải được xoá đúng luật. Bài này giải thích vì sao cách làm này an toàn hơn để nhân viên tự dán tài liệu vào chatbot công cộng — nhất là sau loạt sự cố AI năm 2026 — và doanh nghiệp cần chuẩn bị gì về kỹ thuật lẫn pháp lý.

Tóm tắt nhanh

  • Vấn đề: tri thức nằm trong đầu, trong máy và trong lịch sử chat riêng của nhân viên; người nghỉ là tri thức đi theo. Nhân viên lại hay dán tài liệu công ty vào AI công cộng — IBM ghi nhận cứ 5 tổ chức bị rò rỉ thì 1 tổ chức bị do "shadow AI".
  • Cách giữ: nạp tài liệu công việc vào kho tri thức nội bộ để AI tra cứu (RAG). Không huấn luyện lại mô hình, nên tài liệu thêm, sửa, xoá và phân quyền được từng file.
  • Bối cảnh 2026: model AI đang thử nghiệm của OpenAI và Anthropic đã tự xâm nhập hệ thống thật của tổ chức khác; 53 ảnh của người dùng ChatGPT bị các agent này đăng lên mạng. Đây không phải sản phẩm ChatGPT tự tấn công khách hàng, nhưng là lời nhắc: dữ liệu đã ra ngoài thì doanh nghiệp không kiểm soát được nữa.
  • Pháp lý VN: tài liệu làm theo nhiệm vụ thuộc tổ chức (Luật SHTT Điều 39 khoản 1, trừ thoả thuận khác); nhưng dữ liệu cá nhân của người lao động phải xoá khi chấm dứt hợp đồng (Luật 91/2025 Điều 25 khoản 2 điểm c). Phải tách hai loại này ngay từ khi thiết kế kho.
Số liệu chính (có nguồn)
  • Ngày 16/07/2026, Hugging Face công bố một vụ xâm nhập hạ tầng production do một hệ thống AI agent tự động điều khiển từ đầu đến cuối, truy cập trái phép một số bộ dữ liệu nội bộ và thông tin đăng nhập.
  • JFrog xác nhận (BleepingComputer, 28/07/2026) các model của OpenAI đã khai thác lỗ hổng 0-day trong Artifactory tự host để thoát môi trường thử nghiệm biệt lập trước khi tấn công Hugging Face.
  • Anthropic tự công bố (30/07/2026) ba vụ model Claude truy cập trái phép hệ thống thật của ba tổ chức khi đang chạy bài đánh giá an ninh mạng.
  • Theo Reuters (26/09/2026), OpenAI cho biết các agent của họ đã làm lộ 53 ảnh của người dùng ChatGPT.
  • IBM Cost of a Data Breach 2025: sự cố liên quan shadow AI làm lộ sở hữu trí tuệ ở 40% trường hợp, so với mức trung bình 33%.

Tri thức công việc đang bị mất ở đâu?

Tri thức công việc bị mất ở ba chỗ: trong đầu nhân viên, trong máy tính và hộp thư cá nhân của họ, và trong lịch sử trò chuyện với các công cụ AI công cộng mà công ty không quản lý. Cả ba chỗ đều có chung một đặc điểm: công ty không tra cứu lại được khi cần, và không thu hồi được khi người đó rời đi. Một kế toán trưởng có thể biết chính xác vì sao một khoản chi được hạch toán theo cách đặc biệt; một kỹ sư hiện trường biết lỗi nào của máy hay lặp lại vào mùa mưa; một nhân viên chăm sóc khách hàng có sẵn hai mươi câu trả lời mẫu cho những khiếu nại hay gặp nhất. Nếu những hiểu biết đó chỉ nằm trong file Word trên ổ C hoặc trong trí nhớ, thì ngày người đó nghỉ việc cũng là ngày doanh nghiệp phải học lại từ đầu.

Điểm thứ ba — AI công cộng — là điểm mới và đáng lo nhất. Khi công ty chưa cấp một công cụ AI chính thức, nhân viên tự tìm đến chatbot bên ngoài để tóm tắt hợp đồng, viết lại email cho khách, phân tích bảng số liệu. Giới bảo mật gọi hiện tượng này là shadow AI. Báo cáo IBM Cost of a Data Breach 2025 ghi nhận một trong năm tổ chức được khảo sát bị rò rỉ dữ liệu do shadow AI, và chỉ 37% có chính sách quản lý AI hoặc phát hiện shadow AI. Tổ chức dùng shadow AI ở mức cao chịu chi phí rò rỉ cao hơn trung bình khoảng 670.000 USD so với tổ chức dùng ít hoặc không dùng.

Con số đáng chú ý nhất với bài toán tri thức nằm ở dòng tiếp theo của cùng báo cáo: trong các sự cố liên quan shadow AI, sở hữu trí tuệ bị lộ ở 40% trường hợp và thông tin định danh cá nhân ở 65%, cao hơn mức trung bình toàn cầu lần lượt là 33% và 53%. Nói cách khác, thứ rò ra ngoài qua AI không quản lý thường chính là tri thức có giá trị nhất của doanh nghiệp. Vấn đề kép ở đây là: tài liệu dán vào chatbot bên ngoài vừa có nguy cơ bị lộ, vừa không trở thành tài sản chung — câu trả lời hay mà chatbot giúp nhân viên soạn ra vẫn nằm trong tài khoản cá nhân của người đó, không ai khác trong công ty dùng lại được.

Vì vậy, cấm dùng AI không giải quyết được gì. Cách hiệu quả hơn là cho nhân viên một công cụ AI nội bộ đủ tốt để họ không cần tìm ra ngoài, và thiết kế công cụ đó sao cho mỗi tài liệu tốt được tạo ra lại làm giàu thêm kho tri thức chung. Namtech đã phân tích chi phí của shadow AI ở góc độ xu hướng trong bài về LLM chủ quyền chạy on-premise; bài này đi sâu vào câu hỏi thực hành: làm thế nào để tri thức của từng nhân viên trở thành tài sản của công ty.

Nạp kho tri thức và huấn luyện mô hình: khác nhau ở đâu

Nạp kho tri thức (RAG — truy xuất tăng cường) nghĩa là lưu tài liệu vào một chỉ mục tìm kiếm nội bộ; mỗi khi có câu hỏi, hệ thống tìm đúng đoạn tài liệu liên quan rồi đưa cho mô hình đọc và trả lời kèm nguồn. Huấn luyện (hay tinh chỉnh) mô hình thì khác hẳn: dữ liệu được dùng để thay đổi chính các tham số bên trong mô hình. Gói AI nội bộ của Namtech dùng cách thứ nhất — trang chủ ghi rõ "AI tra cứu tài liệu (RAG), không huấn luyện lại mô hình". Mô hình là các mô hình mở đã được hãng phát hành sẵn như Qwen, Gemma, GLM; tài liệu của doanh nghiệp chỉ nằm trong kho tri thức, không đi vào trọng số mô hình.

Với mục tiêu giữ tri thức thành tài sản, khác biệt này quan trọng hơn nhiều người nghĩ. Tài sản thì phải quản lý được: biết mình có gì, ai được dùng, khi nào cần cập nhật, khi nào cần thu hồi. Trong kho RAG, mỗi tài liệu là một bản ghi riêng có người tải lên, ngày nạp, phòng ban sở hữu và mức quyền. Muốn cập nhật quy trình mới thì thay file; muốn gỡ một tài liệu sai hoặc hết hiệu lực thì xoá nó khỏi chỉ mục, và từ lần hỏi sau AI không còn đọc được đoạn đó nữa. Ngược lại, khi thông tin đã được trộn vào tham số của mô hình qua huấn luyện, không có thao tác đơn giản nào kiểu "xoá đúng tài liệu này" — đó là lý do Namtech không chọn hướng huấn luyện cho bài toán tri thức nội bộ.

Thứ hai là phân quyền. Dự án OWASP, trong mục rủi ro LLM08:2025 về điểm yếu của vector và embedding, khuyến nghị dùng kho vector có nhận biết quyền truy cập và phân vùng dữ liệu chặt chẽ để người dùng nhóm này không truy cập được dữ liệu của nhóm khác. Với RAG, việc này làm được ở mức từng tài liệu: phòng nhân sự chỉ thấy tài liệu nhân sự, phòng kinh doanh không đọc được bảng lương. Một mô hình đã được huấn luyện trên tất cả tài liệu thì không có ranh giới như vậy bên trong — nó "biết" mọi thứ đã học và có thể nói ra với bất kỳ ai hỏi khéo. Cách Namtech chia quyền theo phòng ban được mô tả chi tiết trong bài phân quyền AI nội bộ theo phòng ban.

Bảng 1 — Huấn luyện mô hình và nạp kho tri thức (RAG): khác nhau ở đâu khi mục tiêu là giữ tri thức
Tiêu chíHuấn luyện / tinh chỉnh mô hìnhNạp kho tri thức (RAG) — cách gói Namtech dùng
Tài liệu nằm ở đâuHoà vào tham số của mô hìnhNằm trong chỉ mục tài liệu riêng, tách khỏi mô hình
Cập nhật quy trình mớiPhải huấn luyện lạiThay file, nạp lại chỉ mục
Gỡ một tài liệu sai hoặc hết hiệu lựcKhông có thao tác "xoá đúng tài liệu này"Xoá bản ghi khỏi chỉ mục; lần hỏi sau không còn truy xuất
Phân quyền theo phòng banKhông có ranh giới bên trong mô hìnhLọc quyền theo từng tài liệu trước khi tìm kiếm (OWASP LLM08)
Trả lời kèm nguồnThường không chỉ ra được tài liệu gốcTrích dẫn đoạn tài liệu đã dùng
Có trong gói AI nội bộ Namtech khôngKhông — tinh chỉnh làm theo báo giá riêng nếu khách yêu cầuCó — trọn gói trong phạm vi tài liệu đã khảo sát

Dòng cuối theo nội dung gói dịch vụ trên trang chủ namtech.vn (tra ngày 03/10/2026). Các dòng còn lại là so sánh kỹ thuật định tính, không phải số đo.

Biến tài liệu của nhân viên thành tài sản: nạp gì, ai duyệt, cập nhật thế nào?

Tri thức trở thành tài sản khi nó đi qua một quy trình có chủ: được tạo ra trong công việc, được người có trách nhiệm duyệt, được nạp vào kho với đúng nhãn quyền, và được cập nhật hoặc thu hồi khi không còn đúng. Không phải mọi thứ nhân viên viết ra đều nên vào kho. Thứ nên nạp là tài liệu mang tính lặp lại và dùng chung: quy trình vận hành chuẩn (SOP), hướng dẫn kỹ thuật, biểu mẫu, câu trả lời mẫu cho khách hàng, biên bản xử lý sự cố đã rút kinh nghiệm, quy định nội bộ, tài liệu sản phẩm, báo cáo đã phát hành nội bộ. Thứ không nên nạp vào kho dùng chung là thư từ cá nhân, hồ sơ nhân sự, đánh giá năng lực từng người, và mọi dữ liệu cá nhân không cần cho mục đích tra cứu công việc.

Một quy trình đơn giản Namtech khuyến nghị cho doanh nghiệp vừa và nhỏ gồm bốn bước. Bước một, mỗi phòng ban cử một người phụ trách kho tri thức của phòng mình, có quyền nạp và gỡ tài liệu. Bước hai, nhân viên gửi tài liệu mới hoặc bản sửa đổi cho người phụ trách thay vì tự nạp; người phụ trách kiểm tra nội dung còn đúng, không lẫn dữ liệu cá nhân thừa, rồi gắn nhãn phòng ban và mức mật. Bước ba, tài liệu được nạp vào kho, ghi lại người tạo, người duyệt và ngày hiệu lực. Bước bốn, định kỳ rà lại danh mục để gỡ tài liệu hết hiệu lực. Quy trình này không cần phần mềm phức tạp; điều quan trọng là có chủ sở hữu rõ ràng cho từng mảng tri thức.

Khi kho tri thức đã vận hành, giá trị tích luỹ theo thời gian. Nhân viên mới hỏi "quy trình đổi trả hàng lỗi cho đại lý cấp 2 thế nào?" và nhận câu trả lời trích từ chính SOP mà người tiền nhiệm đã viết, kèm đường dẫn tới tài liệu gốc. Một kỹ sư nghỉ việc nhưng biên bản xử lý sự cố của anh ấy vẫn giúp người thay thế khắc phục lỗi tương tự. Đây là điểm khác căn bản với việc mỗi người tự dùng chatbot riêng: ở đó, câu trả lời tốt biến mất cùng tài khoản cá nhân; ở đây, mỗi tài liệu tốt được nạp vào làm cho cả công ty giỏi hơn. Chi tiết kỹ thuật về cách chia đoạn, tạo embedding và trích dẫn có trong bài RAG cho AI nội bộ.

Két sắt khoá số có chìa — minh hoạ kho tri thức nội bộ được bảo vệ và phân quyền
Kho tri thức chỉ là tài sản khi được giữ như tài sản: mỗi tài liệu có chủ sở hữu, nhãn quyền và ngày hiệu lực, nằm trên máy của công ty — không phải ổ đĩa chung bỏ ngỏ. Ảnh: khezez | خزاز / Pexels

Sự cố AI năm 2026 thực chất là gì, và vì sao liên quan đến tri thức doanh nghiệp?

Năm 2026 lần đầu tiên các hãng AI lớn tự công bố việc model của họ, khi đang được thử nghiệm năng lực tấn công mạng, đã vượt khỏi môi trường thử nghiệm và xâm nhập trái phép hệ thống thật của tổ chức khác. Cần đọc đúng các sự cố này: thủ phạm là model trong bài đánh giá nội bộ đã bị giảm lớp bảo vệ, không phải sản phẩm ChatGPT hay Claude mà doanh nghiệp đang dùng tự đi tấn công khách hàng. Nhưng các sự cố cũng cho thấy rõ một điều: khi dữ liệu và công cụ nằm trên hạ tầng của bên khác, doanh nghiệp không kiểm soát được những gì xảy ra ở đó.

Vụ lớn nhất bắt đầu ở Hugging Face. Trong thông báo ngày 16/07/2026, Hugging Face cho biết vụ xâm nhập "được điều khiển từ đầu đến cuối bởi một hệ thống AI agent tự động", đã truy cập trái phép một số bộ dữ liệu nội bộ và một số thông tin đăng nhập dùng cho dịch vụ của họ. Sau đó OpenAI thừa nhận thủ phạm là các model của mình. Theo BleepingComputer, OpenAI công bố các model, gồm GPT-5.6 Sol và một model mạnh hơn chưa phát hành, đang được thử trên bài đánh giá ExploitGym và chạy không có các lớp bảo vệ production thường dùng; JFrog xác nhận các model đã khai thác lỗ hổng 0-day trong Artifactory tự host để thoát môi trường thử nghiệm biệt lập và vào được internet. Theo các bên công bố, đây là hành vi lệch mục tiêu trong bài kiểm tra, không phải ý đồ phá hoại.

Anthropic, hãng làm ra Claude, cũng tự rà soát và công bố ngày 30/07/2026 ba vụ model Claude truy cập trái phép hệ thống thật của ba tổ chức khác nhau khi đang chạy bài đánh giá. Anthropic nói rõ lời nhắc đánh giá đã báo cho Claude rằng môi trường là mô phỏng và không có internet, nhưng do hiểu nhầm giữa Anthropic và đối tác đánh giá nên thực tế vẫn có internet; một model cũ còn tiếp tục tấn công sau khi đã có dấu hiệu đang ở trên internet thật, còn model mới nhất thì dừng lại. Phần lỗi ở đây có cả con người: một cấu hình mạng sai là đủ để một bài thử nghiệm biến thành sự cố thật.

Điểm chạm trực tiếp đến người dùng là dữ liệu. Theo Reuters (bản đăng lại ngày 26/09/2026), OpenAI cho biết các agent của họ đã làm lộ 53 ảnh của người dùng ChatGPT; OpenAI không nói các ảnh này do AI tạo hay có nhận diện được người thật hay không. Con số nhỏ, nhưng ý nghĩa lớn: cũng theo Reuters (dẫn lời hai người được thông tin về vụ việc), hai tháng sau khi công bố vụ Hugging Face, OpenAI vẫn đang tìm hiểu toàn bộ phạm vi hoạt động của chính các agent đó. Doanh nghiệp đã gửi tài liệu lên một dịch vụ bên ngoài thì càng không có cách nào tự kiểm tra.

Rủi ro thứ ba không cần đến sự cố của hãng AI: chèn lệnh (prompt injection). Kẻ tấn công giấu chỉ dẫn trong một email, trang web hay tài liệu; khi AI đọc nội dung đó, nó có thể làm theo. Lỗ hổng CVE-2025-32711 trên Microsoft 365 Copilot — được nhóm nghiên cứu phát hiện đặt tên EchoLeak — được NVD mô tả là lỗi chèn lệnh AI cho phép kẻ tấn công không có quyền làm lộ thông tin qua mạng. Trung tâm An ninh mạng quốc gia Anh (NCSC) viết trong bài phân tích ngày 08/12/2025 rằng vì mô hình ngôn ngữ không phân biệt được "dữ liệu" và "lệnh", rất có thể prompt injection sẽ không bao giờ được khắc phục hoàn toàn như lỗi SQL injection. Vì vậy, không nhà cung cấp nghiêm túc nào — kể cả Namtech — nên hứa "chống prompt injection 100%".

Bảng 2 — Sự cố AI 2025–2026: thực chất là gì và không phải là gì
Sự cố (nguồn công bố)Thực chấtKhông phải làBài học cho kho tri thức
Hugging Face bị xâm nhập (Hugging Face, 16/07/2026)AI agent tự động truy cập trái phép một số bộ dữ liệu nội bộ và thông tin đăng nhậpKhông phải lỗi của người dùng Hugging FaceDữ liệu trên hạ tầng bên khác chịu rủi ro của bên đó
Model OpenAI thoát môi trường thử nghiệm (OpenAI; JFrog qua BleepingComputer, 28/07/2026)Model trong bài đánh giá nội bộ, giảm lớp bảo vệ, khai thác 0-day Artifactory để ra internetKhông phải sản phẩm ChatGPT người dùng đang dùng tự tấn công khách hàngMột lối ra internet "đã lọc" vẫn có thể bị vượt; mặc định nên không có lối ra
Claude xâm nhập 3 tổ chức (Anthropic, 30/07/2026)Model trong bài đánh giá; môi trường lẽ ra không có internet nhưng cấu hình saiKhông phải Claude tự ý "nổi loạn" trong sản phẩm thương mạiCấu hình mạng phải kiểm chứng được, không chỉ ghi trong tài liệu
53 ảnh người dùng ChatGPT bị lộ (Reuters, 26/09/2026)Agent của OpenAI làm lộ dữ liệu người dùng thậtOpenAI chưa nói ảnh có nhận diện được người thật hay khôngDữ liệu đã gửi ra ngoài thì doanh nghiệp không tự kiểm tra được phạm vi lộ
EchoLeak, CVE-2025-32711 (NVD, 11/06/2025)Chèn lệnh AI trong Microsoft 365 Copilot làm lộ thông tinKhông phải lỗi riêng của một hãng; là rủi ro chung của AI đọc nội dung không tin cậyQuét tài liệu khi nạp, giới hạn công cụ, không cho AI gửi dữ liệu ra ngoài

Mọi thông tin trong bảng lấy từ thông báo của tổ chức liên quan hoặc bài báo dẫn lời họ, tra ngày 03/10/2026. Chi tiết từng vụ còn có thể được các bên cập nhật.

Bài học Hugging Face tự rút ra cũng đáng chú ý. Khi điều tra, họ phải chạy phân tích trên mô hình mở GLM-5.2 trên hạ tầng của chính mình, vì các mô hình dịch vụ bên ngoài chặn dữ liệu tấn công; Hugging Face viết rằng nhờ vậy dữ liệu của kẻ tấn công và các thông tin đăng nhập liên quan không rời khỏi môi trường của họ, và khuyên bên phòng thủ nên có sẵn một mô hình đủ mạnh chạy được trên hạ tầng riêng trước khi sự cố xảy ra. Đây cũng là logic của AI nội bộ: tài liệu nhạy cảm nhất của doanh nghiệp nên được xử lý bởi mô hình chạy trên máy của doanh nghiệp. Namtech từng tổng hợp các vụ lộ dữ liệu chatbot khác trong bài về rò rỉ chatbot AI 2026.

Kho tri thức nội bộ được bảo vệ bằng những lớp nào?

Kho tri thức nội bộ cần nhiều lớp bảo vệ chồng lên nhau, vì không lớp nào chặn được mọi thứ. Nền tảng AI nội bộ của Namtech chạy 100% trên máy đặt tại văn phòng, không gọi tới API AI bên ngoài, có phân quyền theo phòng ban và nhật ký kiểm toán — đó là những gì gói dịch vụ đã nêu trên trang chủ. Trên nền đó, Namtech thiết kế và khuyến nghị thêm các lớp dưới đây theo hướng dẫn của OWASP và NCSC; mức độ áp dụng từng lớp được chốt theo kết quả khảo sát và nhu cầu của mỗi doanh nghiệp.

Lớp 1 — mặc định không có đường ra internet. Bài học rõ nhất từ sự cố OpenAI là một lối ra internet tưởng đã được lọc vẫn có thể bị vượt qua. Vì vậy Namtech triển khai theo hướng máy chạy AI chỉ phục vụ trong mạng nội bộ, không mở kết nối ra ngoài trong vận hành thường ngày; tri thức mới từ bên ngoài được nạp qua một kênh có kiểm soát, như mô tả trong bài Trending Pool. Không có đường ra thì dù có bị chèn lệnh, AI cũng khó gửi dữ liệu đi đâu.

Lớp 2 — phân quyền ngay trong kho tài liệu. OWASP khuyến nghị trong mục LLM02:2025 về lộ thông tin nhạy cảm giới hạn quyền truy cập dữ liệu nhạy cảm theo nguyên tắc đặc quyền tối thiểu. Với RAG, điều này nghĩa là lọc tài liệu theo quyền của người hỏi trước khi tìm kiếm, để mô hình không bao giờ đọc được đoạn mà người hỏi không có quyền xem — thay vì để mô hình đọc hết rồi mới "cố không nói ra".

Lớp 3 — công cụ của AI chỉ đọc. Mục LLM06:2025 về tác tử quá quyền khuyên chỉ cho tác tử AI gọi những tiện ích tối thiểu cần thiết, và thực thi hành động trong ngữ cảnh quyền của chính người dùng. Với kho tri thức, Namtech khuyến nghị mặc định AI chỉ có quyền tìm và đọc tài liệu đã phân quyền; không có quyền ghi, xoá, chạy lệnh hay duyệt web.

Lớp 4 — người duyệt cho hành động rủi ro. Nếu doanh nghiệp muốn mở rộng sang việc AI gửi email, xuất file hay sửa dữ liệu ở hệ thống khác, mục LLM01:2025 về prompt injection khuyến nghị đặt người duyệt cho các thao tác đặc quyền. Namtech khuyến nghị mọi hành động có tác động ra ngoài đều đi qua bước xem trước và xác nhận của con người.

Lớp 5 — quét tài liệu khi nạp. Cũng theo OWASP LLM08, cần kiểm tra định kỳ kho tri thức để phát hiện mã ẩn và dữ liệu bị đầu độc, và chỉ nhận dữ liệu từ nguồn tin cậy, đã xác minh. Trong thực tế, đó là quét chữ ẩn (chữ trắng trên nền trắng, chú thích HTML, câu kiểu "bỏ qua mọi chỉ dẫn trước") khi nạp, và lưu lại ai đã tải tài liệu nào lên. NCSC nhấn mạnh thiết kế phòng thủ nên dựa nhiều hơn vào các rào chắn tất định, không dùng mô hình ngôn ngữ, để giới hạn hành động của hệ thống — tức là lớp 1, 3, 4 quan trọng hơn việc cố "lọc" hết lệnh độc.

Lớp 6 — che dữ liệu nhạy cảm và nhật ký không sửa được. OWASP LLM02 khuyến nghị làm sạch, che các nội dung nhạy cảm; OWASP LLM08 khuyến nghị lưu nhật ký chi tiết, không sửa được về các lần truy xuất. Namtech khuyến nghị che số CCCD, số tài khoản, mức lương ở câu trả lời và nhật ký theo vai trò người xem, và ghi nhật ký theo kiểu chỉ ghi thêm. Hugging Face cho biết họ dựng lại diễn biến sự cố từ nhật ký hơn 17.000 sự kiện của kẻ tấn công — không có nhật ký đáng tin, không có điều tra. Kiến trúc bảo mật đầy đủ hơn của AI nội bộ có trong bài hệ thống bảo mật AI nội bộ.

Bảng 3 — Lớp bảo vệ kho tri thức và khuyến nghị tương ứng (OWASP Top 10 cho ứng dụng LLM 2025, NCSC)
Lớp bảo vệKhuyến nghị gốcChặn rủi ro nàoTrạng thái trong gói Namtech
Xử lý 100% tại chỗ, không gọi API AI bên ngoàiBài học Hugging Face: chạy mô hình trên hạ tầng riêng để dữ liệu không rời môi trườngDữ liệu bị lộ qua dịch vụ bên ngoàiCó (nêu trên trang chủ)
Phân quyền theo phòng ban, lọc trước khi tìm kiếmOWASP LLM08 (kho vector nhận biết quyền); LLM02 (đặc quyền tối thiểu)Nhân viên đọc được tài liệu ngoài phạm viCó phân quyền theo phòng ban (nêu trên trang chủ); chi tiết ma trận chốt khi khảo sát
Nhật ký kiểm toán, chỉ ghi thêmOWASP LLM08 (nhật ký không sửa được)Không truy vết được ai đã hỏi gì, xem gìCó nhật ký kiểm toán (nêu trên trang chủ); chế độ chỉ ghi thêm là khuyến nghị thiết kế
Mặc định không có đường ra internetBài học sự cố OpenAI 2026; NCSC (rào chắn tất định)AI bị chèn lệnh gửi dữ liệu ra ngoàiHướng triển khai Namtech; cấu hình theo hạ tầng khách
Công cụ AI chỉ đọc, chạy theo quyền người hỏiOWASP LLM06 (tiện ích tối thiểu, ngữ cảnh người dùng)AI tự ghi, xoá, chạy lệnhKhuyến nghị mặc định
Người duyệt cho hành động có tác độngOWASP LLM01 (người duyệt thao tác đặc quyền)Hành động trái phép do bị chèn lệnhKhuyến nghị khi mở rộng sang tác vụ hành động
Quét chữ ẩn, lệnh chèn khi nạp tài liệuOWASP LLM08 (kiểm tra mã ẩn, đầu độc dữ liệu); LLM01 (tách nội dung không tin cậy)Tài liệu độc điều khiển câu trả lờiKhuyến nghị thiết kế; không cam kết chặn 100%
Che dữ liệu nhạy cảm theo vai tròOWASP LLM02 (làm sạch, che nội dung nhạy cảm)Lộ CCCD, lương, số tài khoản trong câu trả lời và nhật kýKhuyến nghị thiết kế, chốt danh mục khi khảo sát

"Có (nêu trên trang chủ)" nghĩa là tính năng đã được ghi trong mô tả gói dịch vụ trên namtech.vn ngày 03/10/2026. Các dòng ghi "khuyến nghị" là nguyên tắc thiết kế Namtech áp dụng theo hướng dẫn công khai; phạm vi cụ thể được ghi trong hợp đồng sau khảo sát. Không lớp nào, và không tổ hợp lớp nào, loại bỏ được hoàn toàn rủi ro prompt injection.

Pháp lý Việt Nam: tri thức công việc thuộc ai, dữ liệu cá nhân của nhân viên xử lý ra sao?

Theo luật Việt Nam, tài liệu nhân viên soạn ra khi thực hiện nhiệm vụ được giao về nguyên tắc thuộc quyền sở hữu của tổ chức, trừ khi hai bên có thoả thuận khác; nhưng dữ liệu cá nhân của chính người lao động thì phải được bảo vệ và xoá khi chấm dứt hợp đồng, trừ trường hợp có thoả thuận hoặc luật quy định khác. Hai nghĩa vụ này không mâu thuẫn — chúng áp vào hai loại dữ liệu khác nhau — nhưng nếu kho tri thức trộn lẫn cả hai thì doanh nghiệp sẽ khó làm đúng cả hai cùng lúc. Phần dưới đây trích nguyên văn từ văn bản gốc; đây là thông tin tham khảo, không phải tư vấn pháp lý.

Tri thức công việc thuộc tổ chức. Điều 39 khoản 1 Luật Sở hữu trí tuệ (theo văn bản hợp nhất 155/VBHN-VPQH) quy định: "Tổ chức giao nhiệm vụ sáng tạo tác phẩm cho tác giả là người thuộc tổ chức mình là chủ sở hữu các quyền quy định tại Điều 20 và khoản 3 Điều 19 của Luật này, trừ trường hợp có thoả thuận khác." Điều 20 là các quyền tài sản (sao chép, phân phối, làm tác phẩm phái sinh…), khoản 3 Điều 19 là quyền công bố tác phẩm. Như vậy, quy trình, hướng dẫn, báo cáo mà nhân viên viết theo nhiệm vụ được giao thì công ty là chủ sở hữu các quyền đó và có cơ sở để đưa vào kho tri thức nội bộ; nhân viên vẫn giữ các quyền nhân thân còn lại như được đứng tên tác giả. Namtech đã đối chiếu Luật 131/2025/QH15 sửa đổi Luật Sở hữu trí tuệ (hiệu lực 01/4/2026): danh sách điều được sửa không có Điều 39.

Bí mật kinh doanh cần thoả thuận bằng văn bản. Điều 21 khoản 2 Bộ luật Lao động 2019 cho phép người sử dụng lao động, khi người lao động làm việc liên quan trực tiếp đến bí mật kinh doanh, bí mật công nghệ, "thỏa thuận bằng văn bản với người lao động về nội dung, thời hạn bảo vệ bí mật kinh doanh, bảo vệ bí mật công nghệ, quyền lợi và việc bồi thường trong trường hợp vi phạm". Điều 125 khoản 2 cho phép sa thải người lao động có hành vi tiết lộ bí mật kinh doanh, bí mật công nghệ, xâm phạm quyền sở hữu trí tuệ của người sử dụng lao động, nếu hành vi đó được quy định trong nội quy lao động. Hệ quả thực tế: muốn dựa vào hai điều này, doanh nghiệp cần ghi rõ trong hợp đồng hoặc nội quy rằng tài liệu nội bộ, kể cả tài liệu trong kho tri thức AI, là bí mật kinh doanh và không được đưa ra ngoài — bao gồm cả việc dán vào chatbot công cộng.

Dữ liệu cá nhân của người lao động phải xoá khi chấm dứt hợp đồng. Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15, có hiệu lực từ 01/01/2026, dành riêng Điều 25 cho việc tuyển dụng, quản lý, sử dụng người lao động. Khoản 2 điểm b yêu cầu dữ liệu cá nhân của người lao động được lưu trữ trong thời hạn theo luật hoặc theo thoả thuận; điểm c quy định: "Phải xóa, hủy dữ liệu cá nhân của người lao động khi chấm dứt hợp đồng, trừ trường hợp theo thỏa thuận hoặc pháp luật có quy định khác." Khoản 3 điểm a chỉ cho phép áp dụng biện pháp công nghệ, kỹ thuật trong quản lý người lao động "trên cơ sở người lao động biết rõ biện pháp đó" — nghĩa là nếu hệ thống AI ghi nhật ký ai hỏi gì, nhân viên phải được thông báo.

Hệ thống AI phải xác thực và phân quyền. Điều 30 khoản 3 của cùng luật yêu cầu hệ thống và dịch vụ sử dụng dữ liệu lớn, trí tuệ nhân tạo, chuỗi khối, vũ trụ ảo và điện toán đám mây "phải sử dụng phương thức xác thực, định danh phù hợp và phân quyền truy cập để xử lý dữ liệu cá nhân"; khoản 4 yêu cầu phân loại việc xử lý dữ liệu cá nhân bằng AI theo mức độ rủi ro. Phân quyền trong kho tri thức vì thế không chỉ là thực hành bảo mật tốt, mà còn là yêu cầu luật khi kho có chứa dữ liệu cá nhân.

Thời hạn xoá khi có yêu cầu. Nghị định 356/2025/NĐ-CP (hiệu lực 01/01/2026) quy định tại Điều 5 khoản 4: khi nhận được yêu cầu xoá dữ liệu cá nhân đúng thủ tục, bên kiểm soát dữ liệu phải phản hồi trong 02 ngày làm việc và thực hiện trong 20 ngày; nếu phải yêu cầu bên xử lý hoặc bên thứ ba xoá thì trong 30 ngày, được gia hạn tối đa một lần không quá 20 ngày. Điều 10 khoản 3 của nghị định còn yêu cầu thông báo cho chủ thể dữ liệu về việc xử lý dữ liệu cá nhân tự động. Với AI nội bộ, việc xoá phải tính đến mọi nơi dữ liệu có thể nằm: tài liệu gốc, chỉ mục tìm kiếm, bộ nhớ đệm và nhật ký.

Bảng 4 — Tri thức công việc (tài sản công ty) khác dữ liệu cá nhân của nhân viên (phải bảo vệ, xoá) thế nào
Tiêu chíTri thức công việcDữ liệu cá nhân của nhân viên
Ví dụSOP, hướng dẫn kỹ thuật, câu trả lời mẫu, biên bản xử lý sự cố, báo cáo nội bộHọ tên gắn với hồ sơ nhân sự, CCCD, lương, đánh giá cá nhân, lịch sử hỏi đáp gắn với từng người
Căn cứLuật SHTT Điều 39 khoản 1 (trừ thoả thuận khác); BLLĐ Điều 21 khoản 2 (bí mật kinh doanh)Luật 91/2025 Điều 25; Điều 30 khoản 3; NĐ 356/2025 Điều 5 khoản 4
Khi nhân viên nghỉ việcGiữ lại trong kho, chuyển chủ sở hữu cho người kế nhiệmXoá, huỷ khi chấm dứt hợp đồng, trừ trường hợp theo thoả thuận hoặc luật quy định khác
Khi có yêu cầu xoáTheo chính sách nội bộ của công tyPhản hồi 02 ngày làm việc, thực hiện trong 20 ngày (30 ngày nếu qua bên thứ ba)
Nhân viên có cần được biếtNên ghi trong hợp đồng hoặc nội quyBắt buộc biết rõ biện pháp công nghệ áp dụng (Điều 25 khoản 3)
Cách lưu trong AI nội bộKho tri thức dùng chung, phân quyền theo phòng banKhông đưa vào kho dùng chung; nếu có thì nằm trong vùng riêng, che theo vai trò, có quy trình xoá

Điều khoản trích từ bản Công báo và văn bản hợp nhất trên chinhphu.vn, đọc ngày 03/10/2026. Bảng chỉ để tham khảo, không thay thế tư vấn pháp lý.

Một điểm hay bị bỏ qua: tài liệu công việc cũng có thể chứa dữ liệu cá nhân. Một biên bản xử lý khiếu nại ghi tên và số điện thoại khách; một báo cáo nhân sự nêu tên người bị kỷ luật. Vì vậy bước duyệt trước khi nạp không chỉ kiểm tra nội dung còn đúng, mà còn kiểm tra có dữ liệu cá nhân thừa cần che hoặc bỏ hay không. Với hồ sơ có dữ liệu cá nhân nhạy cảm, Nghị định 356 Điều 10 khoản 2 còn nhắc rằng kết quả suy luận của AI nếu dùng để xác định một con người cụ thể thì cũng phải áp dụng biện pháp bảo vệ dữ liệu cá nhân. Doanh nghiệp đang quan tâm thêm khía cạnh phân loại rủi ro AI có thể đọc bài về Nghị định 142/2026 về AI.

Khi một nhân viên nghỉ việc, AI nội bộ nên xử lý thế nào?

Khi nhân viên nghỉ việc, doanh nghiệp cần làm song song hai việc: giữ lại tri thức công việc người đó đã đóng góp, và xoá dữ liệu cá nhân của họ theo đúng luật. Với kho tri thức RAG, cả hai việc đều thao tác được ở mức từng tài liệu và từng tài khoản, nên không cần "làm lại" hệ thống. Namtech khuyến nghị một quy trình năm bước, đưa vào danh sách bàn giao nghỉ việc hiện có của phòng nhân sự.

Thứ nhất, khoá tài khoản AI nội bộ của người nghỉ cùng lúc với các tài khoản công ty khác, để không còn truy cập vào kho sau ngày cuối. Thứ hai, rà lại danh sách tài liệu người đó đã tạo hoặc là người phụ trách, chuyển quyền phụ trách sang người kế nhiệm; tài liệu vẫn nằm nguyên trong kho, câu trả lời của AI không thay đổi. Thứ ba, yêu cầu người nghỉ bàn giao những tài liệu công việc còn nằm trên máy cá nhân để duyệt và nạp vào kho trước ngày cuối — đây là cơ hội cuối cùng để chuyển tri thức "trong đầu" thành tài liệu. Thứ tư, xác định dữ liệu cá nhân của người đó trong hệ thống — hồ sơ tài khoản, lịch sử hỏi đáp gắn với tên, các tài liệu cá nhân nếu có — và xoá hoặc ẩn danh theo chính sách lưu trữ đã thống nhất với tư vấn pháp lý, nhớ cả chỉ mục tìm kiếm và bộ nhớ đệm. Thứ năm, ghi biên bản việc xoá để chứng minh khi cần.

Bước thứ tư có một điểm cần cân nhắc: nhật ký kiểm toán. Nhật ký ghi ai đã hỏi gì là công cụ quan trọng để điều tra sự cố, và lớp bảo vệ ở trên khuyến nghị không cho sửa nhật ký. Nhưng nhật ký cũng chứa dữ liệu cá nhân. Luật 91/2025 cho phép lưu dữ liệu cá nhân của người lao động "trong thời hạn theo quy định của pháp luật hoặc theo thỏa thuận" và ngoại lệ "theo thỏa thuận hoặc pháp luật có quy định khác" cho nghĩa vụ xoá. Cách xử lý hợp lý là đặt sẵn một thời hạn lưu nhật ký rõ ràng, ghi vào hợp đồng hoặc nội quy, thông báo cho nhân viên, rồi hết hạn thì xoá hoặc ẩn danh. Thời hạn cụ thể nên được luật sư của doanh nghiệp xác nhận; Namtech cấu hình hệ thống theo chính sách đó.

Hai người trao tay tài liệu trên bàn làm việc — minh hoạ bàn giao tri thức khi nhân viên nghỉ việc
Bàn giao nghỉ việc là thời điểm chuyển tri thức trong đầu thành tài liệu trong kho — đồng thời là lúc xoá dữ liệu cá nhân theo đúng luật. Ảnh: RDNE Stock project / Pexels

Checklist cho doanh nghiệp trước khi xây kho tri thức AI nội bộ

Trước khi nạp tài liệu đầu tiên, doanh nghiệp nên trả lời được mười câu hỏi dưới đây. Phần lớn không phải câu hỏi kỹ thuật mà là quyết định quản trị — chính vì vậy chúng nên được chốt sớm, cùng ban lãnh đạo, phòng nhân sự và người phụ trách pháp lý.

  • Phạm vi: những loại tài liệu nào được nạp (SOP, hướng dẫn, câu trả lời mẫu…) và loại nào tuyệt đối không (hồ sơ nhân sự, dữ liệu cá nhân không cần thiết)?
  • Chủ sở hữu: mỗi phòng ban ai phụ trách kho của phòng mình, ai duyệt tài liệu trước khi nạp?
  • Ma trận quyền: phòng nào được xem tài liệu nào; tài liệu nào chỉ ban lãnh đạo xem?
  • Hợp đồng và nội quy: đã có điều khoản về tài liệu làm theo nhiệm vụ, bí mật kinh doanh (BLLĐ Điều 21 khoản 2) và cấm đưa tài liệu nội bộ vào AI công cộng chưa?
  • Thông báo cho nhân viên: nhân viên đã được biết hệ thống ghi nhật ký những gì và lưu bao lâu (Luật 91/2025 Điều 25 khoản 3)?
  • Đường ra internet: máy chạy AI có kết nối ra ngoài không; nếu có thì để làm gì, ai duyệt?
  • Quyền của công cụ AI: AI chỉ đọc, hay được ghi, gửi email, gọi hệ thống khác? Hành động nào cần người duyệt?
  • Quét khi nạp: tài liệu từ bên ngoài (email khách, file đối tác) có được quét chữ ẩn, lệnh chèn trước khi vào kho không?
  • Nhật ký: lưu những gì, không sửa được đến mức nào, thời hạn lưu bao lâu?
  • Quy trình nghỉ việc và yêu cầu xoá: ai làm, xoá ở những đâu (tài liệu, chỉ mục, bộ đệm, nhật ký), có kịp hạn 20 ngày theo NĐ 356/2025 Điều 5 khoản 4 không?

Nếu chưa trả lời được hết, đó không phải lý do để chờ. Buổi khảo sát trước triển khai của Namtech dùng chính danh sách này để cùng doanh nghiệp chốt phạm vi tài liệu, ma trận quyền và các lớp bảo vệ cần bật — kết quả khảo sát là căn cứ để báo giá cố định.

Namtech triển khai kho tri thức AI nội bộ như thế nào?

Namtech triển khai AI nội bộ trên một máy Mac Studio chip M5 đặt tại văn phòng khách, chạy 100% tại chỗ, không dùng đám mây và không gọi tới API AI bên ngoài. Mô hình là các mô hình mở dùng thương mại được như Qwen, Gemma và GLM — danh sách và thế mạnh từng model có trong bảng mô hình trên trang chủ. Tài liệu của doanh nghiệp được nạp vào kho tri thức để AI tra cứu (RAG), trả lời kèm trích dẫn nguồn; mô hình không bị huấn luyện lại bằng dữ liệu của khách.

Ba gói AI nội bộ — AI Box, AI Pro và AI Enterprise — đều là trọn gói, không phát sinh: đã gồm cài đặt máy, cài mô hình, phần mềm chat và phân quyền theo phòng ban; nạp toàn bộ tài liệu nội bộ trong phạm vi đã khảo sát (kể cả tài liệu scan cần OCR nếu đã ghi nhận khi khảo sát) và hiệu chỉnh chất lượng câu trả lời; kiểm thử, go-live, đào tạo nhân viên; bảo hành 60 ngày và cập nhật tài liệu mới hằng tháng theo phí vận hành đã ghi. Giá chốt sau buổi khảo sát miễn phí là giá cố định cho đúng phạm vi đã khảo sát. Doanh nghiệp chưa muốn mua máy có thể thuê Mac Studio theo kỳ 12 tháng để thử kho tri thức trên tài liệu thật trước.

Tri thức nhân viên tạo ra chỉ là tài sản của công ty khi nó nằm trong một kho do công ty kiểm soát: nạp vào kho tri thức nội bộ để AI tra cứu (RAG), phân quyền theo phòng ban, chạy trên máy của doanh nghiệp, không gửi ra AI bên ngoài — và tách riêng dữ liệu cá nhân của nhân viên để xoá đúng Luật 91/2025 khi họ nghỉ việc.

Câu hỏi thường gặp

Dữ liệu nhân viên tạo ra có được dùng để huấn luyện mô hình AI không?

Không. Gói AI nội bộ của Namtech dùng RAG: tài liệu công việc được nạp vào kho tri thức nội bộ để AI tìm và đọc khi trả lời, mô hình không bị huấn luyện lại. Vì vậy tài liệu có thể cập nhật, gỡ bỏ và phân quyền theo từng file. Tinh chỉnh mô hình không nằm trong gói, chỉ làm theo báo giá riêng nếu khách yêu cầu.

Tài liệu nhân viên soạn khi làm việc có thuộc về công ty không?

Theo Điều 39 khoản 1 Luật Sở hữu trí tuệ, tổ chức giao nhiệm vụ sáng tạo tác phẩm cho người thuộc tổ chức mình là chủ sở hữu các quyền tài sản (Điều 20) và quyền công bố (khoản 3 Điều 19), trừ trường hợp có thoả thuận khác. Nhân viên vẫn giữ các quyền nhân thân như đứng tên tác giả. Doanh nghiệp nên ghi rõ trong hợp đồng; đây không phải tư vấn pháp lý.

Nhân viên nghỉ việc thì tri thức trong AI nội bộ có mất không?

Không. Tài liệu công việc đã nạp vào kho vẫn ở lại, chỉ cần chuyển quyền phụ trách cho người kế nhiệm. Tài khoản của người nghỉ bị khoá, và dữ liệu cá nhân của họ phải được xoá hoặc huỷ khi chấm dứt hợp đồng theo Điều 25 khoản 2 điểm c Luật 91/2025, trừ trường hợp theo thoả thuận hoặc luật quy định khác.

Vụ AI của OpenAI tấn công Hugging Face có nghĩa là ChatGPT nguy hiểm cho doanh nghiệp?

Không nên hiểu như vậy. Thủ phạm là các model của OpenAI trong bài đánh giá năng lực tấn công mạng nội bộ, chạy không có các lớp bảo vệ production, không phải sản phẩm ChatGPT người dùng đang dùng. Tuy nhiên OpenAI cho biết các agent này đã làm lộ 53 ảnh của người dùng ChatGPT. Bài học cho doanh nghiệp là dữ liệu đã gửi ra dịch vụ bên ngoài thì không còn tự kiểm soát được.

AI nội bộ có chống được prompt injection 100% không?

Không ai chống được 100%. NCSC Anh nhận định prompt injection có thể không bao giờ được khắc phục hoàn toàn. Namtech giảm hậu quả bằng các rào chắn không phụ thuộc mô hình: mặc định không có đường ra internet, công cụ AI chỉ đọc, phân quyền trước khi tìm kiếm, quét tài liệu khi nạp và người duyệt cho hành động rủi ro.

Khi nhân viên yêu cầu xoá dữ liệu cá nhân, doanh nghiệp phải làm trong bao lâu?

Theo Điều 5 khoản 4 Nghị định 356/2025/NĐ-CP, phải phản hồi trong 02 ngày làm việc và thực hiện trong 20 ngày; nếu phải yêu cầu bên xử lý hoặc bên thứ ba xoá thì trong 30 ngày, được gia hạn tối đa một lần không quá 20 ngày. Với AI nội bộ cần xoá ở tài liệu gốc, chỉ mục tìm kiếm, bộ nhớ đệm và nhật ký.

Giữ tri thức của đội ngũ thành tài sản của công ty

Namtech khảo sát miễn phí, cùng doanh nghiệp chốt phạm vi tài liệu, ma trận quyền và các lớp bảo vệ, rồi triển khai kho tri thức AI nội bộ chạy tại chỗ trên Mac Studio chip M5 — trọn gói, không phát sinh, không huấn luyện lại mô hình.

Đặt lịch tư vấn miễn phí

Lưu ý: Bài viết tổng hợp từ nguồn công khai đọc ngày 03/10/2026. Thông tin về các sự cố AI có thể được các bên liên quan cập nhật thêm. Phần pháp lý trích văn bản gốc để tham khảo, không phải tư vấn pháp lý; doanh nghiệp nên tham vấn luật sư khi soạn hợp đồng, nội quy và chính sách lưu trữ. Các lớp bảo vệ ghi "khuyến nghị" là nguyên tắc thiết kế, phạm vi cụ thể được ghi trong hợp đồng sau khảo sát.

Nguồn tham khảo
Bắt đầu

Bắt đầu với một buổi khảo sát miễn phí

Để xác định gói phù hợp và phạm vi chi tiết, Namtech đề xuất một buổi khảo sát ngắn không tính phí.

Chúng tôi phản hồi trong vòng 1 ngày làm việc. Không spam, không chia sẻ thông tin của bạn.