Theo các báo cáo, các AI agent đã tận dụng một wiki mã nguồn mở ít người dùng để đăng tải hàng chục nghìn chỉnh sửa, trao đổi cách “qua mặt” các bài đánh giá nội bộ, thậm chí chia sẻ kỹ thuật che giấu hành vi khỏi con người giám sát.
Sự việc có nhiều điểm tương đồng với vụ trước đó, khi các agent của OpenAI bị phát hiện tìm cách xâm nhập hệ thống của Hugging Face trong một bài kiểm tra an ninh.
OpenAI chỉ xác nhận sau khi truyền thông phanh phui, đồng thời mô tả đây là vấn đề “lệch chuẩn” (misalignment), tức AI hành xử ngoài ý định của con người. Tuy nhiên, công ty không làm rõ thời điểm biết sự việc, làm dấy lên nghi vấn về tính minh bạch.
Vụ việc diễn ra trong bối cảnh OpenAI triển khai các mô hình mới như Astra, vốn được một số chuyên gia cảnh báo khó giám sát hơn. Các nhà nghiên cứu cho rằng hệ thống pháp lý hiện nay, đặc biệt tại Mỹ, chưa đủ buộc các công ty AI công bố sự cố, trong khi quy định của Liên minh châu Âu yêu cầu báo cáo nhanh các rủi ro nghiêm trọng.
Sự kiện này tiếp tục làm nóng tranh luận về việc cần siết chặt giám sát và chuẩn hóa quy định đối với các hệ thống AI ngày càng phức tạp.