Khử Nhận Dạng Dữ Liệu Huấn Luyện AI: Cách Dạy Mô Hình GenAI & Machine Learning Không Vi Phạm Luật PDPD

Hướng dẫn kỹ thuật và pháp lý khử nhận dạng tập dữ liệu huấn luyện (Training Data) cho Generative AI, LLM và mô hình Machine Learning. Bảo vệ PII, ngăn chặn rò rỉ dữ liệu qua Prompt Extraction và tuân thủ Luật 91/2025/QH15.

Để huấn luyện một mô hình AI hay tinh chỉnh (fine-tune) một mô hình ngôn ngữ lớn (LLM), các kỹ sư dữ liệu cần đưa vào hàng triệu dòng dữ liệu hội thoại, lịch sử giao dịch và hành vi của người dùng. Nếu dữ liệu đầu vào chứa số Căn cước công dân, họ tên, địa chỉ hoặc thông tin y tế chưa được làm sạch, mô hình có thể vô tình tái hiện lại những thông tin riêng tư này trong câu trả lời cho người khác. Doanh nghiệp cần tiến hành Đánh giá An toàn Dữ liệu AI & Sinh trắc học để xây dựng pipeline khử nhận dạng chuẩn mực trước khi đưa dữ liệu vào các mô hình học máy.

1. Cạm bẫy pháp lý khi sử dụng dữ liệu cá nhân để huấn luyện mô hình AI#

Khi doanh nghiệp nạp dữ liệu khách hàng vào các mô hình AI, pháp luật xác định đây là một chuỗi hành vi xử lý dữ liệu phức tạp (thu thập, phân tích, trích xuất, tổng hợp và lưu trữ trong trọng số mô hình). Dưới góc độ Luật 91/2025/QH15, có 3 rủi ro pháp lý chết người mà các kỹ sư AI thường bỏ qua:

a) Vi phạm nguyên tắc 'Giới hạn mục đích' (Purpose Limitation)#

Khi người dùng cung cấp thông tin (họ tên, số điện thoại, lịch sử mua sắm, nội dung trao đổi khiếu nại), sự đồng ý (Consent) ban đầu thường chỉ phục vụ mục đích 'Cung cấp sản phẩm và dịch vụ'. Việc tự ý mang tập dữ liệu này đi huấn luyện mô hình AI nội bộ hoặc cung cấp cho bên thứ ba mà không có sự đồng ý riêng biệt là hành vi xử lý dữ liệu trái mục đích, vi phạm nguyên tắc giới hạn mục đích của Luật Bảo vệ dữ liệu cá nhân.

b) Rủi ro 'Học vẹt' và trích xuất dữ liệu nhạy cảm (Model Memorization & Data Extraction Attack)#

Các mô hình Deep Learning có xu hướng ghi nhớ chính xác (Memorize) các chuỗi ký tự độc nhất xuất hiện trong tập huấn luyện. Kẻ tấn công có thể sử dụng các kỹ thuật Prompt Injection hoặc Adversarial Prompting để ép Chatbot AI tiết lộ thông tin bí mật như số thẻ tín dụng, mật khẩu, CCCD hoặc lịch sử bệnh án của khách hàng khác từng xuất hiện trong tập dữ liệu training.

c) Nghĩa vụ lập Hồ sơ Đánh giá tác động (DPIA) đối với hệ thống AI theo Luật 91/2025/QH15#

Theo Điều 21 Luật 91/2025/QH15 và Điều 19 Nghị định 356/2025/NĐ-CP, việc lập Hồ sơ Đánh giá tác động xử lý dữ liệu cá nhân (DPIA) theo Mẫu số 10 là nghĩa vụ chung của bên kiểm soát, bên kiểm soát và xử lý đối với mọi hoạt động xử lý - bao gồm hệ thống AI xử lý dữ liệu sinh trắc học (nhận diện khuôn mặt, giọng nói) hoặc dữ liệu nhạy cảm - không phân biệt quy mô và KHÔNG có cơ chế 'tiền kiểm'/xét duyệt trước. Doanh nghiệp tự lập, lưu giữ hồ sơ và nộp về cơ quan chuyên trách trong 60 ngày kể từ ngày đầu tiên xử lý dữ liệu; cơ quan chuyên trách sẽ thông báo kết quả trong 15 ngày.

2. Bản chất của Khử nhận dạng dữ liệu huấn luyện AI#

Căn cứ khoản 11 Điều 2 Luật 91/2025/QH15, khử nhận dạng là quá trình làm thay đổi hoặc xóa bỏ thông tin để tạo ra dữ liệu mới không thể xác định danh tính một con người cụ thể. Khi dữ liệu huấn luyện AI đã được khử nhận dạng hoàn toàn (Anonymized Data), nó sẽ thoát khỏi phạm vi điều chỉnh của Luật Bảo vệ dữ liệu cá nhân.

Điều này mang lại lợi ích kép: Doanh nghiệp thoải mái tận dụng kho dữ liệu khổng lồ để nâng cao độ chính xác của AI mà không cần xin lại Consent của từng cá nhân, đồng thời loại trừ 100% nguy cơ mô hình AI làm lộ thông tin nhạy cảm của khách hàng ra môi trường công cộng.

3. Quy trình 4 bước khử nhận dạng tập dữ liệu (Training Data Pipeline)#

Để xây dựng một pipeline chuẩn hóa dữ liệu AI sẵn sàng cho môi trường Production, đội ngũ Data Engineering cần triển khai 4 bước kỹ thuật sau:

Bước 1: Nhận diện thực thể có tên (Named Entity Recognition - NER) & Tách lọc PII#

Sử dụng các mô hình NLP chuyên dụng tiếng Việt (như PhoBERT, XLM-RoBERTa fine-tuned) kết hợp với các biểu thức chính quy (Regex) để tự động quét toàn bộ văn bản và gán nhãn các thực thể PII (Personally Identifiable Information): Tên người ([PERSON]), Số điện thoại ([PHONE]), Số CCCD ([ID_NUM]), Địa chỉ ([ADDRESS]), Email ([EMAIL]), Số tài khoản ngân hàng ([BANK_ACC]).

Bước 2: Áp dụng kỹ thuật Xáo trộn & Thay thế đại diện (Pseudonymization & Obfuscation)#

Thay vì chỉ đơn thuần xóa bỏ thông tin (làm mất cấu trúc ngữ pháp tự nhiên của câu văn), kỹ sư dữ liệu nên thay thế PII bằng các nhãn thực thể giả lập có cùng phân phối thống kê. Ví dụ: 'Khách hàng Nguyễn Văn A, số điện thoại 0903123456 ở Quận 1' được chuyển thành: 'Khách hàng [PERSON_1], số điện thoại [PHONE_1] ở [DISTRICT_1]'. Điều này giúp mô hình AI vẫn học được ngữ cảnh và ý định câu hỏi mà không học danh tính thực.

Bước 3: Ứng dụng Tính riêng tư vi phân (Differential Privacy in Model Training)#

Khi huấn luyện các mô hình Machine Learning phân loại hoặc hồi quy, áp dụng thuật toán DP-SGD (Differentially Private Stochastic Gradient Descent) bằng cách thêm nhiễu Gauss (Gaussian Noise) vào các gradient trong quá trình cập nhật trọng số, đảm bảo rằng sự hiện diện hay vắng mặt của một bản ghi cá nhân bất kỳ không làm thay đổi đáng kể đầu ra của mô hình.

Bước 4: Sử dụng Dữ liệu tổng hợp (Synthetic Data Generation)#

Đối với các bài toán cần dữ liệu bảng (Tabular Data) như chấm điểm tín dụng hay dự báo churn khách hàng, sử dụng các mô hình tạo sinh như CTGAN (Conditional Tabular GAN) hoặc TVAE để sinh ra tập dữ liệu nhân tạo phản ánh 100% mối tương quan toán học của dữ liệu thật mà không chứa bất kỳ người thật nào.

4. Checklist đánh giá an toàn dữ liệu AI dành cho CTO & Lead AI#

1. Đã kiểm kê nguồn gốc và tính hợp pháp của toàn bộ dữ liệu đầu vào (Data Lineage & Training Consent)?
2. Pipeline lọc PII có tỷ lệ nhận diện chính xác (Recall/Precision) đạt trên 99% đối với dữ liệu tiếng Việt không?
3. Các API gọi đến các nền tảng LLM quốc tế (OpenAI, Claude, Gemini) có được cấu hình Zero Data Retention (ZDR) không?
4. Đã ban hành Quy chế sử dụng AI có trách nhiệm (Responsible AI Policy) trong nội bộ doanh nghiệp chưa?
5. Đã lập hồ sơ Đánh giá tác động (DPIA) theo Mẫu số 10 và nộp về cơ quan chuyên trách trong 60 ngày kể từ ngày đầu tiên xử lý dữ liệu cho hệ thống AI chưa?

5. Giải pháp tư vấn và thẩm định an toàn dữ liệu AI từ LexData#

LexData cung cấp các khóa Đào tạo Chuyên gia DPO & Năng lực Quản trị Dữ liệu AI chuyên sâu dành riêng cho đội ngũ kỹ sư Machine Learning, Product Manager và Pháp chế nội bộ.

Bộ hồ sơ Đánh giá tác động DPIA & Chuyển dữ liệu Xuyên biên giới nộp Cục A05 (Bộ Công an) đúng quy chuẩn, giúp doanh nghiệp yên tâm tăng tốc đổi mới sáng tạo.

Câu hỏi thường gặp (FAQ)#

Q1: Gửi dữ liệu khách hàng qua API của OpenAI ChatGPT để tóm tắt văn bản có vi phạm Luật PDPD không?
A1: Có, nếu dữ liệu đó chứa thông tin cá nhân chưa khử nhận dạng. Vì máy chủ OpenAI đặt tại nước ngoài, đây bị coi là hành vi Chuyển dữ liệu cá nhân ra nước ngoài: doanh nghiệp phải lập hồ sơ đánh giá tác động chuyển dữ liệu theo Mẫu số 09 và nộp trong 60 ngày kể từ ngày đầu tiên chuyển dữ liệu (Điều 20 Luật 91/2025/QH15).

Q2: Dữ liệu do AI sinh ra (Synthetic Data) có cần xin phép chủ thể dữ liệu gốc không?
A2: Không. Synthetic Data là dữ liệu nhân tạo, không liên kết trực tiếp với bất kỳ con người cụ thể nào nên không thuộc phạm vi điều chỉnh của Luật PDPD.

Lời kết#

Khử nhận dạng dữ liệu huấn luyện AI không chỉ là yêu cầu pháp lý bắt buộc theo Luật Bảo vệ dữ liệu cá nhân 91/2025/QH15 mà còn là thước đo năng lực công nghệ và đạo đức dữ liệu của doanh nghiệp hiện đại. Đầu tư bài bản vào quy trình làm sạch và ẩn danh hóa dữ liệu ngay từ hôm nay chính là tấm khiên vững chắc nhất bảo vệ giá trị doanh nghiệp trong kỷ nguyên AI.

Bắt đầu

Sẵn sàng để doanh nghiệp của bạn tuân thủ?

Đặt lịch tư vấn 30 phút miễn phí. Chúng tôi sẽ phác thảo các điểm rủi ro ưu tiên và bước đi phù hợp với quy mô của bạn — không ràng buộc.

  • Phản hồi trong vòng 1 ngày làm việc
  • Bảo mật thông tin trao đổi
LIÊN HỆ

Gửi yêu cầu tư vấn

Chia sẻ nhu cầu của bạn, đội ngũ LexData sẽ phản hồi trong thời gian sớm nhất.

0/1.000

Thông tin bạn cung cấp chỉ được xử lý nhằm tiếp nhận và phản hồi yêu cầu này, theo Chính sách bảo vệ dữ liệu cá nhân của LexData.