Trước khi một AI nội bộ có thể trả lời chính xác về doanh nghiệp của bạn, nó phải "đọc" được tài liệu thật của bạn — và chất lượng câu trả lời không bao giờ vượt quá chất lượng kho tài liệu bạn đưa vào. Bài này là checklist phía khách hàng: kho tài liệu đang nằm ở đâu, bản scan và ảnh xử lý ra sao, tài liệu hết hiệu lực bỏ đi thế nào, dữ liệu cá nhân (PII) che ở đâu, và vì sao phải gắn nhãn phòng ban ngay từ khâu chuẩn bị để hệ thống lọc quyền được ở tầng truy hồi. Đọc xong, bạn sẽ tự trả lời được một câu: kho tài liệu của tôi đã đủ điều kiện để đưa vào AI chưa?
Tóm tắt nhanh
- Nguyên tắc số 1: AI nội bộ chỉ tốt bằng dữ liệu đầu vào — "rác vào thì rác ra". Khâu chuẩn bị tài liệu quyết định phần lớn chất lượng, không phải chọn mô hình nào.
- 5 bước chuẩn bị: (1) kiểm kê tài liệu nằm ở đâu → (2) làm sạch (scan/ảnh, bản trùng, tài liệu hết hiệu lực) → (3) phân loại theo mức nhạy cảm → (4) che dữ liệu cá nhân → (5) gắn nhãn phòng ban.
- Bản scan/ảnh phải OCR trước khi nạp — ảnh không có lớp chữ thì AI "nhìn" nhưng không "đọc" được. Đây là bước tiền xử lý mà chính tài liệu kiến trúc RAG của Microsoft cũng nhấn mạnh.
- Che PII là nghĩa vụ pháp lý, không phải tùy chọn: Luật Bảo vệ dữ liệu cá nhân (Luật số 91/2025/QH15) đã có hiệu lực từ 01/01/2026.
- Gắn nhãn phòng ban sớm để về sau lọc quyền ngay ở tầng RAG — mỗi phòng chỉ truy hồi đúng phần của mình, không rò rỉ chéo.
- PII gồm những gì: theo OWASP, dữ liệu nhạy cảm với ứng dụng LLM gồm "thông tin định danh cá nhân (PII), chi tiết tài chính, hồ sơ y tế, dữ liệu kinh doanh mật, thông tin đăng nhập và tài liệu pháp lý".
- Làm sạch là bước bắt buộc: tài liệu kiến trúc RAG của Microsoft ghi rõ nội dung "cần tiền xử lý để dọn nhiễu, trích xuất media, chuyển âm thanh thành văn bản… định dạng lại nội dung, hoặc đánh dấu phần cần bỏ qua".
- Nhãn nhạy cảm để làm gì: nhãn nhạy cảm của Microsoft Purview "cho phép bạn phân loại và bảo vệ dữ liệu của tổ chức".
- Mốc pháp lý: Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 — tình trạng "Còn hiệu lực", ngày có hiệu lực 01/01/2026 (cơ sở dữ liệu văn bản Bộ Công an).
Vì sao khâu chuẩn bị tài liệu quyết định chất lượng AI nội bộ
Vì AI nội bộ trả lời dựa trên chính tài liệu bạn đưa vào — nếu tài liệu lộn xộn, trùng lặp hoặc đã hết hiệu lực, câu trả lời cũng sẽ sai theo. Một trợ lý AI cho doanh nghiệp thường hoạt động theo cơ chế truy hồi tăng cường (RAG): khi bạn hỏi, hệ thống đi tìm những đoạn tài liệu liên quan nhất rồi mới soạn câu trả lời dựa trên chúng. Nghĩa là mô hình không "biết" gì về công ty bạn cả — nó chỉ giỏi đọc và tổng hợp những gì được đưa cho. Đưa vào một hợp đồng đã bị thay thế, AI sẽ tự tin trích dẫn điều khoản cũ.
Đây là lý do khâu tốn công nhất của một dự án AI nội bộ thường không nằm ở việc chọn mô hình hay mua GPU, mà ở việc chuẩn bị dữ liệu đầu vào. Tài liệu doanh nghiệp Việt điển hình nằm rải rác: một phần trong email, một phần trên ổ chia sẻ, vài thư mục trên Google Drive hay SharePoint, hợp đồng scan thành ảnh PDF, và không ít bản giấy trong tủ hồ sơ. Trước khi nghĩ đến chuyện "AI trả lời ra sao", câu hỏi thực tế hơn là: những tài liệu đó đã sẵn sàng để một cỗ máy đọc chưa?
Chuẩn bị tài liệu cho AI đi qua năm bước, đi từ "gom về một chỗ" đến "gắn quyền cho từng phần". Sơ đồ dưới đây tóm tắt cả năm bước — phần còn lại của bài sẽ đi sâu từng bước.
Bước 1 — Kiểm kê: kho tài liệu của bạn đang nằm ở đâu?
Bước đầu tiên không phải là chuyển tài liệu đi đâu cả, mà là liệt kê hết những nơi tài liệu đang nằm. Bạn không thể làm sạch hay gắn quyền cho thứ mình còn chưa biết là mình có. Trên thực tế, phần lớn "khoảng mù" của một dự án AI nội bộ đến từ những kho ít ai nhớ tới: hộp thư của một trưởng phòng đã nghỉ, một ổ NAS cũ, hay thư mục "Tài liệu chung" mà mỗi người hiểu một kiểu.
Hãy lập một bảng kiểm kê đơn giản: mỗi dòng là một nguồn tài liệu, kèm định dạng, chủ sở hữu, và mức độ quan trọng. Bảng này chính là bản đồ để các bước sau bám vào. Nó cũng giúp bạn quyết định sớm: nguồn nào đưa vào AI ngay, nguồn nào để sau, nguồn nào dứt khoát không đưa.
| Nơi lưu trữ | Định dạng thường gặp | Rủi ro nếu bỏ sót hoặc đưa vào thô |
|---|---|---|
| Email & tệp đính kèm | .eml, PDF, Word, Excel | Chứa nhiều PII và bản nháp lẫn bản chính — dễ đưa nhầm thông tin cá nhân, dữ liệu cũ |
| Google Drive / SharePoint / OneDrive | Tài liệu đám mây, Google Docs | Nhiều bản trùng và bản "Copy of…"; quyền chia sẻ lộn xộn sẵn từ trước |
| Ổ chia sẻ nội bộ / NAS | Đủ loại tệp, cây thư mục sâu | Tài liệu tồn đọng nhiều năm, lẫn cả bản hết hiệu lực; hiếm khi có nhãn |
| Hợp đồng & hồ sơ scan | PDF ảnh, ảnh chụp điện thoại | Không có lớp chữ (text) — AI không đọc được nếu chưa OCR |
| Hệ thống nghiệp vụ (ERP/CRM/HRM) | Bản ghi có cấu trúc, báo cáo xuất ra | Đầy dữ liệu cá nhân của khách và nhân sự; cần trích lọc, không bê nguyên |
| Bản giấy trong tủ hồ sơ | Giấy | Chưa số hóa — phải scan + OCR mới đưa vào được |
Một mẹo thực dụng: đánh dấu ngay ở bước này những nguồn chắc chắn không đưa vào AI — ví dụ hộp thư cá nhân, tài liệu nhân sự nhạy cảm, hay dữ liệu khách hàng thuộc diện bảo mật hợp đồng. Loại chúng ra từ đầu rẻ hơn nhiều so với việc gỡ chúng ra sau khi đã trót nạp vào chỉ mục.
Bước 2 — Làm sạch: bản scan/ảnh, bản trùng và tài liệu hết hiệu lực
Làm sạch nghĩa là biến kho tài liệu "người đọc được" thành kho "máy đọc được", đồng thời loại bỏ những bản gây nhiễu. Đây là bước tốn công nhưng đáng giá nhất, vì nó xử lý trực tiếp ba nguồn sai phổ biến nhất của AI nội bộ: tài liệu máy không đọc được, tài liệu trùng, và tài liệu đã lỗi thời.
Về mặt kỹ thuật, đây chính là khâu "chuẩn bị dữ liệu" mà tài liệu kiến trúc RAG của Microsoft mô tả: nội dung "cần tiền xử lý để dọn nhiễu, trích xuất media, chuyển âm thanh thành văn bản, trích khung hình từ video, định dạng lại nội dung, hoặc đánh dấu những phần cần bỏ qua". Ba việc cụ thể phía khách nên làm:
- OCR cho bản scan và ảnh: một hợp đồng scan thành PDF ảnh trông thì giống tài liệu, nhưng với máy nó chỉ là bức ảnh — không có chữ để tìm. Phải chạy nhận dạng ký tự (OCR) để tạo lớp chữ, rồi mới nạp. Đây là lý do một kho đầy PDF scan thường "câm" trước AI dù nhìn bằng mắt vẫn đọc tốt.
- Gỡ bản trùng và bản nháp: "Copy of hợp đồng (2) final FINAL" là cảnh quen thuộc. Trùng lặp khiến AI truy hồi ra nhiều mảnh na ná nhau và khó biết bản nào là bản đúng. Giữ một bản chuẩn cho mỗi tài liệu.
- Loại tài liệu hết hiệu lực: quy trình đã thay, bảng giá năm ngoái, chính sách đã bị văn bản mới thay thế — nếu còn trong kho, AI sẽ trích dẫn chúng như thể vẫn đúng. Hãy đánh dấu ngày hiệu lực và loại/đóng băng bản cũ.
Một câu hỏi hay gặp: "cứ đưa hết vào rồi bảo AI tự lọc có được không?". Không nên. AI không có cách nào biết bản nào đã hết hiệu lực nếu bạn không nói cho nó, và mỗi tài liệu rác đưa vào đều làm loãng kết quả truy hồi. Làm sạch ở đầu vào luôn rẻ và chính xác hơn sửa ở đầu ra.
Bước 3 — Phân loại và gắn nhãn theo mức nhạy cảm
Phân loại là gắn cho mỗi tài liệu một mức nhạy cảm để về sau hệ thống biết đối xử với nó khác nhau. Không phải tài liệu nào cũng ngang nhau: một bản tin nội bộ khác hẳn một hồ sơ lương hay một hợp đồng có điều khoản bảo mật. Nếu không phân loại, bạn buộc phải chọn một trong hai thái cực tệ — hoặc mở hết cho AI đọc (rủi ro rò rỉ), hoặc khóa hết (AI thành vô dụng).
Cách làm chuẩn trong doanh nghiệp là dùng nhãn nhạy cảm (sensitivity label). Nền tảng như Microsoft Purview mô tả đúng vai trò của nhãn này: chúng "cho phép bạn phân loại và bảo vệ dữ liệu của tổ chức, đồng thời không cản trở năng suất và khả năng cộng tác của người dùng". Bạn không cần bắt đầu phức tạp — bốn mức dưới đây đủ dùng cho hầu hết doanh nghiệp vừa và nhỏ.
| Mức nhãn | Ví dụ tài liệu | Cách xử lý khi đưa vào AI nội bộ |
|---|---|---|
| Công khai | Brochure, bài blog, thông cáo | Đưa vào tự do; có thể dùng cho trợ lý mọi phòng |
| Nội bộ | Quy trình, sổ tay, biểu mẫu chung | Đưa vào cho người trong tổ chức; không phát ra ngoài |
| Hạn chế | Hợp đồng, báo cáo tài chính, giá vốn | Chỉ nhóm/phòng liên quan truy hồi được (lọc quyền ở tầng RAG) |
| Mật | Hồ sơ lương, dữ liệu PII, tài liệu ban giám đốc | Cân nhắc không đưa vào, hoặc che PII và giới hạn rất chặt |
Điểm mấu chốt: nhãn nên được gắn ngay ở bước chuẩn bị, bởi chính người hiểu tài liệu — không để dồn sang lúc kỹ thuật nạp dữ liệu. Người nạp dữ liệu không biết bảng lương tháng 3 có được xem là "Mật" hay không; chủ sở hữu tài liệu thì biết. Gắn nhãn đúng ở đây là nền để bước cuối — lọc quyền — chạy được.
Bước 4 — Che dữ liệu cá nhân (PII)
PII là mọi thông tin có thể nhận ra một con người cụ thể, và che nó trước khi nạp vào AI vừa là yêu cầu kỹ thuật vừa là nghĩa vụ pháp lý. Danh mục rủi ro cho ứng dụng LLM của OWASP xếp "Rò rỉ thông tin nhạy cảm" thành một hạng mục riêng, và liệt kê rõ dữ liệu nhạy cảm gồm "thông tin định danh cá nhân (PII), chi tiết tài chính, hồ sơ y tế, dữ liệu kinh doanh mật, thông tin đăng nhập và tài liệu pháp lý". Cùng tài liệu đó, OWASP khuyến nghị ứng dụng phải "thực hiện làm sạch dữ liệu đầy đủ" để dữ liệu người dùng không lọt vào nơi không nên.
Về pháp lý, đây không còn là chuyện tùy tâm. Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 đã ở tình trạng "Còn hiệu lực" với ngày có hiệu lực 01/01/2026 — nghĩa là việc xử lý dữ liệu cá nhân của khách hàng và nhân viên khi đưa vào một hệ thống AI đều nằm trong phạm vi điều chỉnh của luật. Trước khi nạp, hãy rà và che các trường như: căn cước/CCCD, số điện thoại, email cá nhân, số tài khoản, thông tin sức khỏe, và lương của từng cá nhân.
Che PII không có nghĩa là bỏ luôn tài liệu. Với nhiều hồ sơ, bạn vẫn giữ được phần nghiệp vụ hữu ích sau khi thay các trường cá nhân bằng ký hiệu ẩn danh — ví dụ giữ cấu trúc hợp đồng nhưng thay tên và số định danh bằng "[KHÁCH HÀNG]". Nguyên tắc là giữ giá trị nghiệp vụ, bỏ danh tính cá nhân ở những chỗ AI không cần biết.
Ba việc nên chuẩn hóa trước khi bàn giao cho khâu nạp dữ liệu:
- Lập danh mục trường PII cần che (CCCD, SĐT, email, số tài khoản, dữ liệu sức khỏe, lương) và thống nhất cách ẩn danh.
- Quyết định "che" hay "loại" cho từng loại hồ sơ: hồ sơ mà giá trị nằm ở cấu trúc thì che; hồ sơ mà giá trị chính là dữ liệu cá nhân thì loại khỏi phạm vi AI.
- Ghi lại quyết định (ai duyệt, che trường nào) để chứng minh tuân thủ khi cần rà soát.
Bước 5 — Gắn nhãn phòng ban để lọc quyền ở tầng RAG
Gắn nhãn phòng ban ngay từ khâu chuẩn bị chính là thứ cho phép AI về sau chỉ trả lời mỗi phòng bằng đúng tài liệu họ được xem. Bốn bước trên làm cho tài liệu "sạch và được phân loại"; bước này quyết định "ai được đọc gì". Và điểm quan trọng phía khách cần hiểu: quyền không tự có — nó dựa vào nhãn mà bạn gắn cho tài liệu ở bước chuẩn bị.
Cơ chế chốt chặn nằm ở tầng truy hồi (RAG): mỗi đoạn tài liệu được gắn metadata phòng ban và mức nhạy cảm; khi một người đặt câu hỏi, hệ thống chỉ tìm trong những đoạn mà nhóm của họ được phép. Nhờ vậy AI không bao giờ "nhìn thấy" tài liệu ngoài phạm vi, nên không thể vô tình tiết lộ. Chúng tôi đã mô tả kỹ cơ chế này trong bài Sơ đồ phòng ban & phân quyền AI nội bộ; cách dựng tầng truy hồi có ở bài RAG cho tài liệu nội bộ, và các lớp phòng thủ tổng thể ở bài Hệ thống bảo mật AI nội bộ.
Vì cơ chế lọc quyền dựa trên nhãn phòng ban, một tài liệu bị gắn sai nhãn — hoặc không có nhãn — sẽ hoặc lọt ra ngoài phạm vi, hoặc biến mất khỏi phòng đáng ra được xem. Đó là lý do bước gắn nhãn thuộc về phía khách hàng (người hiểu tài liệu), còn phần thực thi lọc thuộc về hệ thống. Hai phần khớp nhau thì phân quyền mới chặt.
Kho tài liệu của bạn đã đủ điều kiện chưa?
Một kho tài liệu "đủ điều kiện" là kho đã đi qua đủ năm bước: gom về, làm sạch, phân loại, che PII và gắn nhãn phòng ban. Bảng dưới là checklist nhanh để bạn tự chấm — nếu còn nhiều ô chưa đạt, đó chính là phần việc của một buổi khảo sát trước khi triển khai.
| Hạng mục | Đạt khi… |
|---|---|
| Kiểm kê nguồn | Đã liệt kê mọi nơi tài liệu nằm và đánh dấu nguồn không đưa vào |
| Bản scan/ảnh | Đã OCR để có lớp chữ máy đọc được |
| Bản trùng & nháp | Mỗi tài liệu chỉ còn một bản chuẩn |
| Tài liệu hết hiệu lực | Đã đánh dấu ngày hiệu lực và loại/đóng băng bản cũ |
| Phân loại nhạy cảm | Mỗi tài liệu có một nhãn: Công khai / Nội bộ / Hạn chế / Mật |
| Che PII | Đã rà và che dữ liệu cá nhân theo danh mục thống nhất |
| Nhãn phòng ban | Mỗi tài liệu gắn phòng ban để lọc quyền ở tầng RAG |
Chuẩn bị tài liệu không phải việc làm một lần rồi thôi: mỗi khi có quy trình mới, hợp đồng mới hay chính sách thay đổi, tài liệu mới cũng cần đi qua đúng năm bước này trước khi vào kho. Một quy ước gắn nhãn tốt ở đầu sẽ giúp việc bổ sung về sau nhẹ nhàng hơn nhiều.
Góc nhìn Namtech
Với các dự án AI nội bộ Namtech triển khai (chạy 100% tại chỗ trên Apple Silicon, mô hình mã nguồn mở, dữ liệu không rời tổ chức), bước chuẩn bị tài liệu luôn là phần đầu tiên của buổi khảo sát — trước cả khi bàn về mô hình hay phần cứng. Chúng tôi cùng khách rà kho tài liệu theo đúng năm bước ở trên: kiểm kê nguồn, làm sạch bản scan và bản hết hiệu lực, thống nhất mức nhạy cảm, che PII, và quy ước nhãn phòng ban để lọc quyền ở tầng RAG. Bạn không cần làm sạch xong hết mới bắt đầu — nhưng cần biết mình đang đứng ở đâu trên checklist. Đó là điều một buổi khảo sát ngắn sẽ trả lời.
Chuẩn bị tài liệu là bước quyết định chất lượng AI nội bộ: kho tài liệu đã làm sạch, phân loại, che PII và gắn nhãn phòng ban thì AI mới trả lời đúng và không rò rỉ chéo — chọn mô hình nào chỉ là chuyện đến sau.
Câu hỏi thường gặp
Tôi có cần số hóa và làm sạch hết tài liệu trước khi bắt đầu không?
Không. Bạn nên bắt đầu bằng một phạm vi rõ ràng (ví dụ tài liệu của một phòng) đã đi qua năm bước, rồi mở rộng dần. Điều quan trọng là biết mình đang ở đâu trên checklist, chứ không phải làm sạch toàn bộ kho trước khi chạy.
Bản scan PDF có đưa thẳng vào AI được không?
Thường là không hiệu quả. PDF scan là ảnh, không có lớp chữ nên máy không "đọc" được để tìm kiếm. Phải chạy OCR để tạo lớp chữ trước khi nạp — đây là một phần của bước làm sạch.
Che PII có làm tài liệu mất giá trị với AI không?
Không, nếu che đúng chỗ. Với phần lớn hồ sơ, giá trị nghiệp vụ nằm ở cấu trúc và nội dung, không ở danh tính cá nhân. Bạn giữ phần nghiệp vụ và thay các trường cá nhân bằng ký hiệu ẩn danh; những hồ sơ mà giá trị chính là dữ liệu cá nhân thì nên loại khỏi phạm vi AI.
Vì sao phải gắn nhãn phòng ban ngay ở khâu chuẩn bị?
Vì cơ chế lọc quyền ở tầng RAG dựa trên nhãn đó: mỗi phòng chỉ truy hồi được tài liệu gắn đúng phòng mình. Nhãn phải do người hiểu tài liệu gắn ở khâu chuẩn bị; nếu để trống hoặc gắn sai, quyền sẽ hoặc rò rỉ ra ngoài phạm vi, hoặc chặn nhầm người đáng được xem.
Chưa chắc kho tài liệu của mình đã sẵn sàng?
Namtech rà kho tài liệu của bạn theo checklist năm bước và đề xuất phạm vi đưa vào AI nội bộ trước — dữ liệu chạy tại chỗ, không rời tổ chức.
Đặt buổi khảo sát miễn phíLưu ý: Bài viết mang tính hướng dẫn quy trình chuẩn bị dữ liệu, cập nhật 07/08/2026; hãy điều chỉnh mức nhãn và danh mục PII theo cơ cấu và nghĩa vụ tuân thủ thực tế của tổ chức bạn.
- Microsoft Learn — Develop a RAG Solution: Preparation Phase (tiền xử lý, làm sạch nội dung; tra 12/08/2026)
- Microsoft Learn — Learn about sensitivity labels (phân loại & bảo vệ dữ liệu tổ chức; tra 12/08/2026)
- OWASP — LLM02:2025 Sensitive Information Disclosure (PII, dữ liệu nhạy cảm, làm sạch dữ liệu; tra 12/08/2026)
- Luật Bảo vệ dữ liệu cá nhân số 91/2025/QH15 — cơ sở dữ liệu văn bản Bộ Công an: "Còn hiệu lực", ngày có hiệu lực 01/01/2026 (tra 12/08/2026)