Skip to main content

AI Watermark: Khi văn bản AI có “dấu vân tay”

Nếu bạn đang dùng ChatGPT, Claude hay Gemini để viết nội dung, có một thay đổi quan trọng đang âm thầm diễn ra: văn bản do AI tạo ra sẽ ngày càng được gắn watermark: một dạng “dấu vân tay” kỹ thuật số vô hình.

Anthropic, công ty đứng sau Claude, đã thông báo các phiên bản Claude trong tương lai sẽ tạo ra văn bản có watermark. Đây không phải dòng chữ kiểu “Written by AI” hay logo chìm như hình ảnh. Watermark nằm ẩn bên trong, tàng hình giữa hai dòng chữ, không thể thấy bằng mắt thường.

Dấu Watermark AI thực chất là gì?

Khi mô hình ngôn ngữ lớn (LLM) viết một câu, nó không đơn giản chọn từ có xác suất cao nhất. Mô hình tính toán xác suất của hàng nghìn lựa chọn, rồi dùng cơ chế lấy mẫu để quyết định từ tiếp theo.

Watermark tận dụng quá trình này.

Thay vì thay đổi nội dung một cách rõ ràng, hệ thống sẽ điều chỉnh rất nhẹ xác suất lựa chọn giữa những từ vốn đều có thể xuất hiện. Mỗi thay đổi riêng lẻ gần như không thể nhận ra, nhưng khi được tích lũy trên đoạn văn đủ dài, chúng tạo thành hình mẫu thống kê đặc trưng.

Có thể hình dung nó giống mực tàng hình trong lĩnh vực mã hoá: mắt thường không nhìn thấy, nhưng công cụ có “passkey” phù hợp có thể nhận diện được.

Dùng AI sửa bài có bị “đóng dấu” không?

Watermark chủ yếu phản ánh lượng văn bản được mô hình tạo ra trực tiếp. Nếu bạn tự viết 80% nội dung, chỉ dùng Claude chuốt một phần nhỏ, dấu watermark – nếu có – cũng sẽ tương ứng với phần AI can thiệp.

Anthropic thậm chí cho biết với những chỉnh sửa nhỏ hoặc văn bản quá ngắn, mức độ thay đổi có thể không đủ để phát hiện.

Tuy nhiên, điều này đặt ra câu hỏi thú vị: “Dùng AI chỉnh sửa” thực sự khác “để AI viết” ở đâu? Một nghiên cứu được IBM dẫn lại cho thấy ngay cả khi được yêu cầu chỉ sửa lỗi ngữ pháp, LLM vẫn “nhiệt tình” thay đổi đáng kể ý nghĩa của câu chữ.

Tại sao cần watermark khi đã có AI detector?

Hiện nay, nhiều công cụ như GPTZero hay Pangram dùng để đoán một văn bản có phải do AI tạo ra hay không. Nhưng vấn đề là: AI detector chỉ đưa ra phán đoán dựa trên đặc điểm của văn bản.

Một bài viết có “mùi AI” không chắc chắn do AI viết. Con người cũng có thể viết theo phong cách AI. Ngược lại, AI ngày càng giỏi bắt chước văn phong con người.

Watermark khác ở chỗ, nó được tạo ngay trong quá trình sinh văn bản. Vì vậy, nếu phát hiện được watermark, đó là bằng chứng trực tiếp, khẳng định mô hình AI đã tham gia tạo nội dung.

Tuy nhiên, watermark cũng không phải công nghệ hoàn hảo.

Watermark có thể bị xoá khi được viết lại bằng AI

Một trong những điểm yếu rõ nhất: nếu watermark nằm trong cách lựa chọn từ, khi viết lại bằng mô hình khác có thể làm mất watermark ban đầu.

Nhưng điều đó không có nghĩa watermark vô dụng.

Đưa toàn bộ văn bản qua một mô hình khác để viết lại làm tăng chi phí, thời gian và độ phức tạp. Hơn nữa, nếu ngày càng nhiều AI sử dụng watermark, văn bản được viết lại bằng AI khác có thể mang watermark mới.

Đây là cuộc đua công nghệ mới giữa LLM – watermark – AI detector – công cụ “humanize” nội dung.

Một tiêu chuẩn mới cho kỷ nguyên content AI

EU đang thúc đẩy minh bạch hóa nội dung do AI tạo ra, nhiều công ty AI lớn đã tham gia bộ quy tắc về minh bạch nội dung AI.

Vì thế, watermark nhiều khả năng sẽ không chỉ xuất hiện ở Claude. Gemini đã sử dụng SynthID cho văn bản từ năm 2024, trong khi các công nghệ watermark tương tự đang được nhiều nhà cung cấp AI nghiên cứu và triển khai.

Thách thức tiếp theo là khả năng tương thích: watermark của Google không nhất thiết nhận diện được nội dung từ Claude hay ChatGPT. Nếu mỗi hãng có hệ thống riêng, quá trình xác minh nguồn gốc văn bản có thể trở nên phức tạp.

Về dài hạn, watermark có thể trở thành một phần quan trọng của hạ tầng niềm tin trong thế giới AI. Dĩ nhiên, watermark không nhằm mục đích “bắt bài” người viết bằng AI, mà giúp chúng ta có thêm cách trả lời cho câu hỏi: Nội dung này ai viết?