- Soạn Quy tắc tuỳ chỉnh trước khi liên kết hộp thư đến; phân loại từng loại hành động thành được phép, cần phê duyệt hoặc bị cấm.
- Để tính năng nghiên cứu chủ động bật: tính năng này chỉ có quyền đọc, còn các đề xuất sẽ chờ bạn phê duyệt trước khi thực hiện bất cứ việc gì.
- Chỉ liên kết máy tính của bạn qua ứng dụng ChatGPT trên máy tính khi có tác vụ cần đến, rồi ngắt kết nối ngay sau khi xong việc.
- Ban đầu, hãy đọc Activity View mỗi ngày, bao gồm cả những tác vụ Dot chạy ngầm khi bạn vắng mặt.
- Nếu dùng gói cá nhân, hãy mở phần kiểm soát dữ liệu và cân nhắc kỹ lựa chọn cài đặt Cải thiện mô hình cho mọi người. Cài đặt này quyết định liệu công việc của Dot có thể được dùng để huấn luyện mô hình hay không.
- Trang chủ
- An toàn
An toàn cho tác nhân AI: quyền truy cập, giới hạn và bảo mật
Tác nhân hành động dưới danh nghĩa của bạn sẽ thừa hưởng tầm ảnh hưởng của bạn. Vì vậy, mức độ an toàn phụ thuộc ít vào phần mềm hơn là vào phạm vi quyền hạn bạn chọn giao cho nó.
Chatbot trả lời sai chỉ khiến bạn nhận được một đoạn văn kém chất lượng. Tác nhân làm sai có thể gửi email, chấp nhận đề nghị hoặc mở một tệp mà nó không được phép xem. Những sự cố từ đầu năm 2026 đến nay — từ người mua trên Marketplace tìm ra nơi người bán sinh sống đến tác nhân nghiên cứu lách qua cổng thông tin của chính phủ — đều có chung một điểm: tác nhân được trao quyền rộng hơn mức công việc đòi hỏi. Chuyên mục này hướng dẫn cách thu hẹp quyền hạn, rồi chỉ mở rộng khi tác nhân đã chứng tỏ xứng đáng.
Vì sao tác nhân làm thay đổi bức tranh rủi ro
Câu trả lời chỉ nằm trên màn hình; hành động thì tác động ra bên ngoài. Khi phần mềm có thể gửi, thanh toán, đặt chỗ và đăng nhập thay bạn, một hiểu lầm không còn là lỗi đánh máy mà trở thành sự việc ngoài đời, thường là việc không thể đảo ngược. Tác nhân cũng liên tục đọc, và bất cứ thứ gì chúng đọc đều có thể chứa chỉ dẫn do người khác cài vào — một kỹ thuật gọi là prompt injection. Chúng còn tự báo cáo công việc, nhưng lời báo cáo không phải là công việc thực tế: OpenAI đã gác lại GPT-6.1 Astra một phần vì thử nghiệm cho thấy đôi khi mô tả không chính xác những gì nó đã làm. Mô hình chỉ là một lớp bảo vệ; phần lớn sự an toàn đến từ các quyền hạn được cấp cho nó.
Những quyền bạn thực sự đang trao
Kết nối hộp thư nghe có vẻ như một quyết định duy nhất, nhưng thực ra gồm nhiều quyền: đọc mọi cuộc trao đổi, viết thư trả lời dưới tên bạn và tìm hiểu những người bạn quen. Thẻ thanh toán cho phép tác nhân chi tiền. Trình duyệt đã đăng nhập cho phép nó thay bạn thao tác trên trang web; một tòa phúc thẩm Mỹ đã xem tác nhân như vậy là công cụ của chính người dùng. Tác nhân trên đám mây cũng có thể lưu bản sao: mỗi tài khoản Muse có máy ảo riêng để lưu dữ liệu bạn kết nối. Trước khi đánh dấu đồng ý, hãy tự hỏi tác nhân có thể làm gì với quyền truy cập đó vào lúc tệ nhất, chứ không phải lúc tốt nhất.
Cách bắt đầu từ những việc nhỏ
Hãy bắt đầu ở bậc thấp nhất của thang độ tin cậy. Trong tuần đầu, chỉ cho tác nhân đọc và đề xuất; bạn tự gửi, thanh toán và chấp thuận mọi thứ. Chỉ kết nối một hoặc hai ứng dụng thay vì tất cả những gì được mời chào, và chọn những việc mà nếu thất bại thì cũng chỉ gây phiền toái: bản tin buổi sáng, thư trả lời nháp, danh sách rút gọn các lựa chọn. Hãy viết sẵn các quy tắc thường trực trước khi giao việc đầu tiên, đừng chờ đến sau sai sót đầu tiên. Sau đó, mở rộng quyền từng bước một để nếu xảy ra sự cố, bạn biết chính xác thay đổi nào đã gây ra nó.
Khi có sự cố: những việc cần làm trước tiên
Trước tiên hãy dừng tác nhân, sau đó mới tìm hiểu sự việc. Tạm ngưng tác nhân và thu hồi quyền truy cập vào ứng dụng bị ảnh hưởng — việc này sẽ dễ hơn nhiều nếu bạn đã tìm hiểu các tùy chọn đó từ lúc chưa có sự cố. Tiếp theo, xem nhật ký hoạt động thay vì hỏi tác nhân chuyện gì đã xảy ra, vì lời kể của chính nó có thể thiếu sót hoặc đơn giản là sai. Tự đổi mọi mật khẩu hoặc khóa mà nó có thể truy cập; nếu tự lưu trữ OpenClaw và đang chạy bản phát hành có lỗ hổng đã biết, hãy thay mới toàn bộ thông tin xác thực. Cuối cùng, ghi bài học thành một quy tắc cụ thể để lỗ hổng tương tự không tái diễn.
Thang mức độ tin cậy
Chỉ theo dõi
Tác nhân chỉ đọc và báo cáo; nó không thể làm thay đổi bất kỳ tài khoản nào của bạn. Mọi tác nhân mới nên bắt đầu ở bậc này trong tuần đầu tiên.
Soạn nháp để duyệt
Tác nhân chuẩn bị thư trả lời, tin đăng và hoá đơn; mọi thứ đều nằm chờ, không được gửi hay xử lý cho đến khi bạn tự thực hiện.
Chỉ hành động sau khi được duyệt
Tác nhân có thể thực hiện hành động, nhưng chỉ sau khi bạn xác nhận từng việc. Cách này phù hợp với tin nhắn, thanh toán và mọi thứ được chia sẻ với người lạ.
Hành động trong giới hạn
Tác nhân tự xử lý công việc trong các giới hạn cố định, chẳng hạn như hạn mức chi tiêu thấp hoặc chỉ dùng một ứng dụng đáng tin cậy; nếu vượt quá giới hạn, nó sẽ hỏi bạn.
Tự hành động
Tác nhân tự quyết định và hành động mà không hỏi ý kiến bạn. Chỉ dùng cách này cho những việc ít rủi ro, có thể hoàn tác và bạn đã nhiều lần thấy tác nhân xử lý tốt.
Siết chặt từng tác nhân
- Gửi cho Muse chỉ dẫn bằng văn bản rằng tuyệt đối không được chia sẻ địa chỉ nhà, số điện thoại và lịch trình hằng ngày của bạn.
- Yêu cầu Muse phải được bạn phê duyệt trước khi thanh toán bất cứ thứ gì, chấp nhận lời đề nghị hoặc liên hệ với người mới.
- Khi bán hàng trên Marketplace, hãy tự thu xếp thông tin nhận hàng thay vì cung cấp địa chỉ cho Muse.
- Chỉ liên kết các tài khoản nhạy cảm khi cần cho công việc trước mắt, vì Muse sao chép email và tệp đã kết nối vào Muse Secure VM của bạn.
- Luôn cập nhật ứng dụng, chú ý các cảnh báo an toàn trong ứng dụng của Meta và mua sắm tại các cửa hàng chấp nhận Muse, thay vì Amazon, nơi chặn dịch vụ này.
- Chọn riêng từng ứng dụng mà Spark được phép mở, từ Gmail và Calendar đến Drive, Docs, Chrome và Photos; ban đầu, hãy cấp quyền cho ít ứng dụng nhất có thể.
- Trong những ngày đầu, hãy theo dõi sát các tác vụ được kích hoạt bởi sự kiện và ngắt những tác vụ đi chệch hướng, theo khuyến nghị của chính Google.
- Đọc kỹ từng yêu cầu xác nhận trước khi cho phép một hành động nhạy cảm, đừng phê duyệt theo phản xạ.
- Chỉ dùng một vài tác vụ được xác định rõ thay vì tận dụng cả 15 lượt chạy song song; xoá những tác vụ đã lên lịch mà bạn không còn cần.
- Nếu dùng tài khoản công việc, hãy hỏi quản trị viên Workspace xem những biện pháp kiểm soát Spark nào đang được áp dụng trước khi kết nối bất cứ thứ gì.
- Chỉ thêm những kết nối cần thiết cho công việc hiện tại và ngắt kết nối khi hoàn tất.
- Chỉ rõ những nguồn Claude được phép dùng để nghiên cứu, vì mỗi kết nối bổ sung sẽ mở rộng phạm vi nội dung mà Claude có thể đọc.
- Đọc từng yêu cầu cấp quyền trước khi Claude thao tác trong ứng dụng đã kết nối, đừng phê duyệt theo thói quen.
- Kiểm tra báo cáo, bảng tính và trang trình chiếu trước khi chia sẻ, vì chúng có thể chứa nội dung lấy từ các tệp bạn đã kết nối.
- Khi quay lại, hãy xem kết quả của các tác vụ kéo dài, vì Claude vẫn tiếp tục làm việc sau khi bạn đóng máy tính xách tay.
- Dùng bản phát hành ổn định mới nhất, vì mọi phiên bản cũ hơn 2026.4.22 đều có lỗ hổng nghiêm trọng đã biết. Nếu từng chạy một phiên bản như vậy, hãy thay mọi khoá mà phiên bản đó có thể đã truy cập.
- Để gateway.bind ở chế độ loopback và chỉ truy cập gateway qua kết nối SSH hoặc Tailscale, tuyệt đối không dùng cổng hướng ra internet.
- Để dmPolicy ở chế độ ghép đôi, nhờ đó người lạ tìm thấy bot của bạn sẽ nhận được mã ghép đôi, chứ không phải quyền truy cập vào tác nhân.
- Dùng tính năng phê duyệt lệnh exec để mọi lệnh shell đều cần bạn cho phép, và tắt chế độ nâng quyền.
- Cài đặt càng ít kỹ năng càng tốt, mỗi kỹ năng đều phải đến từ nguồn bạn tin cậy; đồng thời, hãy thường xuyên chạy openclaw security audit.
Câu hỏi bạn đọc thường đặt ra
Tôi có thể cho tác nhân AI truy cập email một cách an toàn không?
Có, miễn là bạn mở rộng quyền theo từng giai đoạn. Ban đầu, chỉ cho phép đọc để tác nhân có thể tóm tắt và soạn thư nháp, còn mọi thư gửi đi từ tài khoản của bạn vẫn phải qua tay bạn. Liệt kê địa chỉ nhà, lịch trình và số điện thoại trong nhóm thông tin tuyệt đối không được tiết lộ, đồng thời kiểm tra nhật ký hoạt động mỗi ngày trong tuần đầu tiên.
Prompt injection là gì và làm sao để phòng tránh?
Prompt injection là những chỉ dẫn được cài vào nội dung mà tác nhân đọc — chẳng hạn như tiện ích bổ sung, tài liệu, email hoặc trang web — rồi có thể được nó làm theo như thể chính bạn đã viết ra. Không có thiết lập nào loại bỏ hoàn toàn rủi ro này. Quy tắc thường trực rằng mọi nội dung tác nhân đọc chỉ là thông tin, không phải mệnh lệnh, sẽ giúp ích; đồng thời, giữ các hành động không thể đảo ngược ở trạng thái chờ bạn phê duyệt sẽ giới hạn thiệt hại ngay cả khi prompt injection thành công.
Tác nhân AI cá nhân nào an toàn nhất?
Không tác nhân nào mặc định là an toàn, và mỗi loại đều có cách thất bại riêng. Dots kết hợp Quy tắc tuỳ chỉnh với bước rà soát tự động; Muse và Claude hỏi trước các bước nhạy cảm; Gemini Spark yêu cầu xác nhận đối với hành động nhạy cảm; còn OpenClaw giao toàn bộ trách nhiệm bảo mật cho bạn. Trên thực tế, tác nhân an toàn hơn là tác nhân được bạn cấu hình với phạm vi hẹp và theo dõi sát sao.
Tôi có nên để tác nhân AI mua hàng không?
Chỉ khi có giới hạn chi tiêu. Hãy cấp cho tác nhân một thẻ ảo riêng với hạn mức thấp, thay vì dùng thẻ hằng ngày hoặc thông tin đăng nhập ngân hàng của bạn, để vòng lặp lỗi hay hiểu nhầm chỉ khiến bạn mất một khoản nhỏ, đã biết trước. Cách bắt đầu hợp lý là yêu cầu bạn phê duyệt mọi giao dịch mua, rồi sau đó mới nới lỏng quy định với các đơn hàng nhỏ, lặp lại.