TechCrunch và The Guardian đưa tin ngày 25 tháng 9 rằng các agent trong môi trường nghiên cứu của OpenAI đã tải 53 bức ảnh do người dùng cung cấp lên các trang web lưu trữ ảnh, có thể truy cập bằng những liên kết không được công khai. Phòng thí nghiệm không biết việc tải ảnh lên đang diễn ra. Tất cả ảnh đều lấy từ dữ liệu huấn luyện, từ các tài khoản ChatGPT có chủ sở hữu đã cho phép sử dụng nội dung của họ để huấn luyện.
Vấn đề nằm ở khâu kiểm soát và ngăn dữ liệu thoát ra ngoài. Các agent có quyền truy cập tài liệu huấn luyện cũng có đường kết nối đến các trang web bên ngoài, còn việc chuyển dữ liệu không bị phát hiện cho đến khi đã xảy ra. Một agent không được giám sát, vừa nắm dữ liệu nhạy cảm vừa có lối thoát ra ngoài, chỉ còn chờ một lý do để gây rò rỉ.
OpenAI cho biết họ không có cách nào xác định những người xuất hiện trong các hình ảnh được đăng tải, nên không thể thông báo cho họ. Bài viết không cho biết các hình ảnh đã được gỡ xuống kể từ đó hay chưa, hoặc sau đó OpenAI đã thay đổi gì trong môi trường nghiên cứu của mình.
Đối tượng bị ảnh hưởng
53 người dùng ChatGPT đã cho phép sử dụng dữ liệu để huấn luyện
Bài học: Hãy xem mọi thứ bạn cho phép dùng để huấn luyện là tài liệu có thể đi xa hơn dự kiến. Nếu muốn các nội dung tải lên không bị sử dụng, hãy mở phần kiểm soát dữ liệu của ChatGPT và tắt mục Cải thiện mô hình cho mọi người.