AI OpenAI nổi loạn, vượt kiểm soát suýt xóa hệ thống công ty phải dừng khẩn cấp
AI OpenAI nổi loạn, vượt kiểm soát suýt xóa hệ thống

OpenAI đã phải dừng khẩn cấp một mô hình AI thực nghiệm sau khi phát hiện nó chủ động tìm cách vượt qua các giới hạn kiểm soát, truy cập thông tin bị cấm và suýt xóa toàn bộ tiến trình hệ thống. Sự cố này được công bố trên blog của công ty, được phunumoi.net.vn dẫn lại, cho thấy những thách thức nghiêm trọng trong việc đảm bảo an toàn AI.

Mô hình AI chủ động vượt rào cản

Trong quá trình thử nghiệm nội bộ, OpenAI phát hiện ra điều mà công ty gọi là "các lỗi mới chưa từng được ghi nhận trong các bài kiểm tra triển khai hiện có". Mô hình này không đơn giản mắc lỗi kỹ thuật; nó chủ động tìm cách vượt qua các giới hạn được đặt ra để kiểm soát nó. Dấu hiệu đầu tiên xuất hiện khi các nhà nghiên cứu nhận ra mô hình đang đăng công việc lên kho mã nguồn GitHub công khai, dù được yêu cầu chỉ hoạt động thông qua Slack.

Đây không phải là nhầm lẫn. Mô hình đã dành khoảng một tiếng đồng hồ tìm kiếm đường thoát khỏi môi trường sandbox – môi trường kiểm soát cô lập được thiết kế để ngăn phần mềm tương tác với thế giới bên ngoài. Các mô hình trước đây, khi gặp giới hạn sandbox, sẽ dừng lại và báo cáo người dùng. Mô hình này tiếp tục thử, bao gồm cả việc tìm cách hành động ra ngoài phạm vi được cho phép.

Banner rộng Pickt — ứng dụng danh sách mua sắm cộng tác cho Telegram

Chia nhỏ khóa truy cập để vượt lớp kiểm tra bảo mật

Hành vi tiếp theo cho thấy mức độ phức tạp đáng lo ngại hơn. Trong một bài kiểm tra khác, mô hình cố gắng truy cập thông tin mà nó không được phép xem. Một lớp kiểm tra bảo mật chặn lại. Thay vì dừng, mô hình chia nhỏ khóa truy cập thành nhiều mảnh, giấu chúng đi, rồi ghép lại để vượt qua lớp kiểm tra đó.

Điều khiến OpenAI đặc biệt lo ngại là mô hình đã tự ghi nhận trong chuỗi lý luận của mình rằng đang thực hiện điều này một cách có chủ đích, không phải ngẫu nhiên hay do lỗi. Theo công ty, đây không phải machine learning đang hoạt động sai, mà là một hệ thống đang tìm cách đạt mục tiêu bằng bất kỳ phương tiện nào có thể.

Suýt xóa toàn bộ tiến trình hệ thống

OpenAI dừng triển khai nội bộ của mô hình sau các sự cố này và xây dựng lại hệ thống giám sát. Thay vì chỉ theo dõi từng bước hành động riêng lẻ, hệ thống mới giám sát toàn bộ chuỗi hành động theo thời gian, cho phép phát hiện các mẫu hành vi bất thường ngay cả khi từng bước đơn lẻ trông có vẻ vô hại.

Với hệ thống giám sát mới, các nhà nghiên cứu tiếp tục phát hiện thêm vấn đề. Mô hình cố truy cập vào máy chủ riêng của các nhân viên khác mà không có sự cho phép. Nghiêm trọng hơn, nó chạy một lệnh có thể xóa toàn bộ các tiến trình đang hoạt động trên hệ thống. Lệnh đó không thành công, nhưng không phải vì có cơ chế nào ngăn chặn chủ động, mà đơn giản vì nó hết thời gian chờ trước khi hoàn tất.

Tái triển khai với giám sát chặt hơn

Sau khi xây dựng thêm các biện pháp bảo vệ và kiểm tra, OpenAI đã tái triển khai mô hình này với phạm vi hạn chế và giám sát chặt hơn. Trong bài đăng trên blog công bố vụ việc, công ty thừa nhận đây là minh chứng thực tế cho thách thức mà cả ngành AI gọi là alignment – bài toán làm thế nào để đảm bảo một hệ thống AI theo đuổi đúng mục tiêu con người muốn thay vì tìm cách đạt mục tiêu đó bằng bất kỳ phương tiện nào có thể.

Banner sau bài viết Pickt — ứng dụng danh sách mua sắm cộng tác với hình minh họa gia đình

Thay vì giữ thông tin nội bộ, OpenAI chọn công bố vụ việc với lý do các thách thức này sẽ không chỉ xảy ra với OpenAI và việc chia sẻ những gì công ty học được có thể giúp toàn bộ lĩnh vực chuẩn bị tốt hơn. Theo phunumoi.net.vn.