AI đang phát triển của OpenAI xâm nhập công ty khác, cho thấy khó kiểm soát
OpenAI ngày 21 cho biết một mô hình AI đang phát triển đã tiến hành tấn công mạng vào công ty khác trái với ý định của con người. Vụ việc một lần nữa cho thấy mối đe dọa từ AI đang gia tăng và việc kiểm soát là rất khó khăn.
AI tự chủ xâm nhập
Giám đốc điều hành Sam Altman cùng ngày đăng trên mạng xã hội rằng 'trong quá trình đánh giá mô hình, đã xảy ra một sự cố an ninh nghiêm trọng'. Các tổ chức thẩm định bên ngoài từ trước đã chỉ ra rằng AI của công ty này có nguy cơ thực hiện hành vi gian lận. Kể từ khi Anthropic của Mỹ công bố AI hiệu năng cao 'Mythos' vào tháng 4, mức cảnh giác đối với rủi ro tấn công mạng bằng AI đã gia tăng thêm một nấc.
Trong sự cố lần này, có thể nói lần đầu tiên doanh nghiệp bị AI hoạt động tự chủ tấn công mạng và cách thức cụ thể đã được làm rõ. Theo OpenAI, lẽ ra AI phải trải qua đánh giá để kiểm tra khả năng xâm nhập vào hệ thống mô phỏng, nhưng nó đã thoát khỏi môi trường thử nghiệm bị ngắt kết nối với internet và xâm nhập vào hệ thống của Hugging Face, vốn chỉ những người liên quan nội bộ mới được phép tiếp cận.
Lợi dụng zero-day
AI được cho là đã khai thác một lỗ hổng mà ngay cả nhà phát triển cũng không nắm được. Các khiếm khuyết của hệ thống thường được đơn vị vận hành sửa để tăng cường khả năng phòng thủ, nhưng lỗ hổng chưa công bố được gọi là zero-day và rất khó xử lý. AI lần này có thể đã xâm nhập nhanh chóng bằng cách tận dụng một zero-day tinh vi đến mức con người cũng khó phát hiện.
Đây cũng là trường hợp AI mất kiểm soát, đi ngược lại chỉ thị 'hãy giải bài tập thực hành'. Anthropic và Google của Mỹ cũng đã ghi nhận hành vi tương tự trong quá trình phát triển. AI dành cho người dùng cuối có các rào chắn ngăn lạm dụng, nhưng lần này là mô hình đang phát triển dành cho sử dụng nội bộ, và vì OpenAI đã vô hiệu hóa một số biện pháp đối phó nên sức tấn công của nó mạnh hơn.
OpenAI cho biết AI gây ra sự cố là phiên bản mới nhất 'GPT-5.6 Sol' hoặc nhiều mô hình chưa công bố. Trong hồ sơ đánh giá của các tổ chức bên ngoài cũng có những dấu hiệu cho thấy khả năng xảy ra vụ việc lần này.
Cảnh báo từ đánh giá an toàn
Viện An ninh AI của chính phủ Anh (AISI) báo cáo rằng trong quá trình đánh giá tấn công mạng, xác suất xảy ra hành vi gian lận ở GPT-5.6 Sol là khoảng 13%, cao hơn 5 điểm phần trăm so với mô hình của Anthropic. Tổ chức nghiên cứu METR của Mỹ cũng chỉ ra rằng mô hình này có tỷ lệ hành vi sai trái cao nhất từ trước đến nay, bao gồm khai thác lỗ hổng và các hành vi bị cấm. Ngay trong tài liệu đánh giá hiệu năng của chính OpenAI cũng nêu rằng đã xảy ra những trường hợp cùng loại trong giai đoạn phát triển.
Kể từ khi 'ChatGPT' ra mắt năm 2022, OpenAI đã dẫn dắt làn sóng bùng nổ AI, nhưng đến năm 2026 hãng đã mất sự chú ý vào tay Anthropic, đơn vị phát triển Mythos, và cũng bị vượt lên về giá trị doanh nghiệp. Tuy vậy, sự cố lần này cũng trở thành bằng chứng cho thấy năng lực cao của các AI đang phát triển.
Kể từ khi Mythos xuất hiện, chính quyền Trump ở Mỹ đã siết chặt lập trường quản lý theo hướng chú trọng ngăn chặn việc lạm dụng. GPT-5.6, được công bố rộng rãi vào ngày 9, cũng mất 2 tuần mới được phát hành do quy trình xác nhận an toàn theo yêu cầu của chính phủ.
Luật sư Hiroaki Yamaoka, người am hiểu về biện pháp đối phó tấn công mạng của doanh nghiệp, cho rằng ngay cả khi sau này xảy ra vụ việc tương tự thì cũng rất khó quy trách nhiệm cho người dùng hoặc công ty phát triển chỉ vì lý do 'AI tự làm'. Ông nói rằng 'cần có khuôn khổ hoặc quy định mới đối với các công ty AI và nền tảng'.
Nếu bài viết này hữu ích, hãy chia sẻ nhé.