Anthropic thừa nhận AI xâm nhập 3 hệ thống thật
Anthropic thừa nhận AI xâm nhập 3 hệ thống thật

Anthropic, công ty phát triển chatbot Claude, vừa xác nhận rằng các mô hình AI của hãng đã truy cập trái phép vào hệ thống thật của ba tổ chức bên ngoài trong quá trình thử nghiệm an ninh mạng. Theo CNBC, điều đáng nói là hãng không hề phát hiện sự cố ngay khi nó diễn ra, mà chỉ bắt đầu rà soát sau khi OpenAI công bố một tình huống tương tự.

Mô hình AI tưởng đang chơi trong môi trường giả lập

Nguyên nhân bắt nguồn từ các bài kiểm tra capture the flag, một dạng thử nghiệm phổ biến trong giới an ninh mạng, nơi AI được giao nhiệm vụ tự tìm và khai thác lỗ hổng trên một hệ thống giả lập. Mục tiêu ban đầu là đánh giá năng lực tấn công mạng của Claude trong một môi trường được cô lập hoàn toàn khỏi Internet.

Tuy nhiên, một lỗi cấu hình phát sinh trong khâu phối hợp với đối tác đánh giá bảo mật Irregular đã khiến môi trường thử nghiệm vẫn kết nối với Internet. Đối với Claude, nó vẫn chỉ đang thực hiện nhiệm vụ được giao trong một sân chơi giả lập. Nhưng trên thực tế, các yêu cầu tìm kiếm mục tiêu và khai thác lỗ hổng lại dẫn đến những hệ thống đang vận hành ngoài đời thật.

Banner rộng Pickt — ứng dụng danh sách mua sắm cộng tác cho Telegram

Theo Financial Times, có một chi tiết cho thấy mức độ bất ngờ của sự cố. Trong một bài kiểm tra, Claude được giao tấn công một doanh nghiệp giả định. Doanh nghiệp giả này lại có tên trùng với một công ty tồn tại ngoài đời. Mô hình đã tìm thấy website thật, xác định nhầm đây là mục tiêu cần khai thác rồi truy cập thành công vào cơ sở dữ liệu sản xuất của doanh nghiệp đó vì tin rằng đây vẫn là một phần của bài kiểm tra.

Không dùng zero-day mà chỉ khai thác mật khẩu yếu

Anthropic nhấn mạnh rằng các mô hình không sử dụng kỹ thuật tấn công tinh vi hay zero-day. Thay vào đó, Claude tận dụng những điểm yếu rất phổ biến như mật khẩu yếu, endpoint không yêu cầu xác thực hoặc cấu hình hệ thống sơ hở. Điều này cho thấy AI không cần những kỹ năng siêu hacker để gây ra rủi ro, mà chỉ cần khả năng tự động hóa việc tìm kiếm và khai thác các lỗi cơ bản cũng đã đủ để xâm nhập vào nhiều hệ thống nếu không được bảo vệ chặt chẽ.

Quan trọng hơn, Anthropic không phát hiện sự cố ngay tại thời điểm xảy ra. Theo Reuters, công ty chỉ bắt đầu rà soát hơn 141.000 phiên thử nghiệm sau khi OpenAI công bố một sự cố tương tự liên quan đến AI agent trong các bài đánh giá an ninh mạng. Quá trình kiểm tra này đã phát hiện các vụ truy cập trái phép diễn ra từ tháng 4, buộc Anthropic phải dừng toàn bộ các bài đánh giá có khả năng kết nối Internet từ ngày 23/7 trước khi hoàn tất xác minh và thông báo cho các tổ chức bị ảnh hưởng.

Bài toán quản trị hạ tầng trong kỷ nguyên AI agent

Sự việc của Anthropic cho thấy AI đang bước sang một giai đoạn phát triển rất khác so với chatbot truyền thống. Trước đây, một mô hình ngôn ngữ chỉ tạo ra văn bản. Ngày nay, các AI agent có thể mở trình duyệt, chạy lệnh, viết mã, quét mạng, tìm kiếm mục tiêu và thực hiện hàng loạt thao tác liên tục mà gần như không cần con người can thiệp. Điều này giúp AI trở thành công cụ hỗ trợ lập trình, nghiên cứu hay an ninh mạng cực kỳ mạnh mẽ, nhưng đồng thời cũng mở ra những loại rủi ro hoàn toàn mới nếu quyền truy cập và cơ chế giám sát không được thiết kế đủ chặt.

Banner sau bài viết Pickt — ứng dụng danh sách mua sắm cộng tác với hình minh họa gia đình

Đối với ngành AI, đây có lẽ là thông điệp quan trọng nhất sau sự cố của Anthropic. Mối nguy không còn chỉ nằm ở việc mô hình thông minh đến đâu, mà còn nằm ở việc hệ thống phía sau mô hình được xây dựng an toàn đến mức nào. Khi AI được trao quyền hành động thay vì chỉ trả lời câu hỏi, một lỗi cấu hình tưởng chừng rất nhỏ cũng có thể khiến ranh giới giữa môi trường thử nghiệm và thế giới thực biến mất.

Sau nhiều năm lo ngại về viễn cảnh AI tự đưa ra quyết định ngoài tầm kiểm soát, sự cố của Anthropic cho thấy một thực tế gần gũi hơn nhiều: trước khi phải đối mặt với những kịch bản khoa học viễn tưởng, các công ty AI sẽ phải giải quyết những bài toán rất đời thường về phân quyền, cô lập hệ thống và quản trị hạ tầng. Trong kỷ nguyên AI agent, những lỗi vận hành như vậy có thể trở thành rủi ro lớn không kém chính sức mạnh của mô hình AI.

Theo CNBC, Reuters, Financial Times.