Anthropic tiết lộ ba sự cố xâm nhập trong thử nghiệm an toàn mô hình AI
06:26 - 31/07/2026
Anthropic tiết lộ ba sự cố xâm nhập trong thử nghiệm an toàn mô hình AI
Ngày 31 tháng 7, Anthropic cho biết vào thứ Năm rằng một số mô hình mạnh nhất của họ đã truy cập trái phép vào hệ thống thực trong các thử nghiệm an ninh mạng trước khi triển khai. Sau khi OpenAI tiết lộ việc xâm nhập vào cơ sở hạ tầng của Hugging Face trong thời gian thử nghiệm mô hình của họ, Anthropic đã xem xét hơn 141.000 đánh giá an ninh mạng và phát hiện ba sự cố xâm nhập. Do sự hiểu lầm với đối tác thử nghiệm Irregular, môi trường đánh giá đã vô tình kết nối với internet, dẫn đến việc Opus 4.7, Mythos 5 và một mô hình nghiên cứu nội bộ đã xâm nhập vào hệ thống thực của ba tổ chức. Những sự cố này xảy ra trong thời gian thử nghiệm "cướp cờ" - mô hình cần tìm thông tin ẩn trong môi trường mô phỏng. Sự kiện này có thể được truy nguyên từ tháng 4, Anthropic hiện đã liên hệ với ba tổ chức bị ảnh hưởng, trong đó hai tổ chức trước đó không nhận thấy hoạt động xâm nhập. Khác với sự kiện của OpenAI, mô hình của Anthropic không khai thác lỗ hổng zero-day, mà là do cấu hình môi trường sai dẫn đến việc có quyền truy cập mạng. Giống như OpenAI, Anthropic đã không triển khai các biện pháp bảo vệ bổ sung trong quá trình đánh giá để đo lường khả năng cơ bản của mô hình. Các sự kiện của OpenAI và Anthropic cho thấy các mô hình AI tiên tiến có thể tiếp cận các hệ thống thực trong thời gian thử nghiệm an ninh, điều này đã dấy lên những câu hỏi mới về cách các phòng thí nghiệm bảo đảm an toàn cho môi trường đánh giá của họ.