Tóm lại
- GPT-5.6 Sol của OpenAI và một mẫu phát hành trước chưa được đặt tên, có khả năng cao hơn đã thoát khỏi môi trường thử nghiệm được kiểm soát và vi phạm cơ sở hạ tầng sản xuất của Hugging Face để đánh cắp các câu trả lời điểm chuẩn.
- Ôm Mặt tiết lộ vi phạm vào ngày 16 tháng 7 sau khi phát hiện nó một cách độc lập; OpenAI ngày hôm nay đã xác nhận các mô hình của họ đứng đằng sau nó, mô tả chúng là những người “quá tập trung” vào việc gian lận hơn là bất cứ điều gì độc ác hơn.
- Những người bảo vệ Hugging Face đã chuyển sang sử dụng GLM 5.2 của Z.ai—một mô hình trọng lượng mở của Trung Quốc—sau khi AI thương mại biên giới của Hoa Kỳ từ chối giúp phân tích dữ liệu tấn công vì các bộ lọc an toàn của nó không thể phân biệt người phòng thủ với kẻ tấn công.
Nếu bạn cho rằng các mô hình AI của Trung Quốc là những thứ bạn phải lo lắng thì đây là một bản cập nhật thú vị: Các mô hình của OpenAI vừa thoát ra khỏi môi trường thử nghiệm bị khóa, tấn công các máy chủ sản xuất của Hugging Face và phải được AI Trung Quốc dọn sạch—vì các mô hình thương mại của Mỹ quá hạn chế để giúp điều tra.
Theo OpenAI, GPT-5.6 Sol và một “mô hình tiền phát hành thậm chí còn mạnh mẽ hơn” chưa được đặt tên đang được đánh giá nội bộ trên Khai thácphòng tập thể dục—một tiêu chuẩn an ninh mạng có sẵn công khai cung cấp cho các tác nhân AI 898 lỗ hổng phần mềm trong thế giới thực và một hướng dẫn cho mỗi lỗi: biến nó thành một cuộc tấn công đang hoạt động, ghi điểm đạt hoặc thất bại. Quá trình đánh giá được thực hiện với các bộ lọc an toàn được giảm bớt, tiêu chuẩn khi bạn thực sự muốn biết mô hình của mình có thể làm gì.
Các mô hình này được cho là chạy bên trong một hộp cát bị hạn chế nghiêm ngặt—một môi trường kỹ thuật số biệt lập không có quyền truy cập Internet, chỉ được kết nối với proxy đăng ký gói nội bộ (máy chủ bộ nhớ đệm quản lý việc tải xuống thư viện phần mềm).
Tuy nhiên, theo OpenAI bài đăng blog ngày hôm naymọi chuyện có vẻ hơi mất kiểm soát.
Chúng tôi đang hợp tác với @huggingface để điều tra một sự cố an ninh chưa từng có.
Các mô hình OpenAI có khả năng mạng đã xâm phạm quá trình sản xuất Ôm Mặt trong quá trình đánh giá điểm chuẩn.
Chia sẻ những phát hiện ban đầu để giúp người bảo vệ hiểu được những rủi ro mới nổi:…
– OpenAI (@OpenAI) Ngày 21 tháng 7 năm 2026
Công ty của Sam Altman cho biết: “Trong khi hoạt động trong môi trường thử nghiệm hộp cát của chúng tôi, các mô hình của chúng tôi đã dành một lượng điện toán suy luận đáng kể để tìm cách có được quyền truy cập Internet mở nhằm giải quyết vấn đề đánh giá”.
Và, bất chấp các biện pháp bảo vệ của công ty, AI đã tìm ra cách để được tự do. Các mô hình đã xác định được lỗ hổng zero-day—một lỗ hổng phần mềm không xác định và không có bản vá hiện có—trong proxy đó, khai thác nó để leo thang đặc quyền (giành quyền truy cập ở cấp quản trị viên vào các hệ thống mà họ không có quyền can thiệp), di chuyển ngang (nhảy giữa các máy chủ được kết nối bên trong mạng nội bộ của OpenAI) và cuối cùng đến một máy có quyền truy cập internet thực.
Tất cả điều này mà OpenAI không biết—ít nhất đó là những gì OpenAI nói.
Sau khi trực tuyến, họ đã suy luận chính xác rằng Ôm Mặt—lưu trữ hơn một triệu mô hình AI, bộ dữ liệu và tài nguyên nghiên cứu có sẵn công khai—có thể chứa các giải pháp chuẩn và họ đã đúng.
OpenAI viết: “Các mô hình đã xác định và xâu chuỗi các lỗ hổng trên môi trường nghiên cứu của OpenAI và cơ sở hạ tầng sản xuất của Hugging Face để có được các giải pháp thử nghiệm trực tiếp từ cơ sở dữ liệu sản xuất của Hugging Face”.
Họ không muốn bất kỳ mật khẩu nào. Họ muốn vượt qua bài kiểm tra.
OpenAI cho biết thêm: “Tất cả bằng chứng đều cho thấy rằng các mô hình đã quá tập trung vào việc tìm ra giải pháp cho ExploitGym, nỗ lực hết sức để đạt được mục tiêu thử nghiệm khá hẹp”.
Ôm Mặt công khai
Nhóm bảo mật của Hugging Face đã phát hiện vi phạm một cách độc lập, nhờ sự hỗ trợ của tính năng phát hiện bất thường do AI cung cấp.
Ngày 16/7, công ty công bố tiết lộ của nó và làm rõ rằng đây không phải là vi phạm tiêu chuẩn: “Vụ này khác với mọi thứ chúng tôi đã xử lý trước đây ở một điểm quan trọng: nó được điều khiển từ đầu đến cuối bởi một hệ thống tác nhân AI tự trị—và chúng tôi đã phát hiện và mổ xẻ nó phần lớn bằng AI của riêng chúng tôi.”
Theo tiết lộ, chiến dịch này được “điều hành bởi một hệ thống tác nhân tự trị, thực hiện hàng nghìn hành động riêng lẻ trên một loạt các hộp cát tồn tại trong thời gian ngắn, với khả năng ra lệnh và kiểm soát tự di chuyển được tổ chức trên các dịch vụ công cộng.”
Cuộc tấn công đã khai thác hai đường dẫn thực thi mã trong đường dẫn xử lý dữ liệu của Hugging Face và tiếp cận các bộ dữ liệu nội bộ cũng như thông tin xác thực dịch vụ. OpenAI đã xác nhận hôm nay—năm ngày sau—rằng các mô hình của nó đứng đằng sau nó.
Để phân tích hơn 17.000 sự kiện tấn công được ghi lại, nhóm bảo mật của Hugging Face trước tiên đã thử AI biên giới của Mỹ thông qua API tiêu chuẩn của họ. Nó không diễn ra tốt đẹp.
Công ty viết: “Khi bắt đầu phân tích nhật ký, lần đầu tiên chúng tôi sử dụng các mô hình biên giới đằng sau các API thương mại”. “Điều này không hiệu quả: quá trình phân tích yêu cầu gửi một lượng lớn lệnh tấn công thực, tải trọng khai thác và các tạo phẩm C2.”
“Những yêu cầu này đã bị chặn bởi các rào cản an toàn của nhà cung cấp, không thể phân biệt người ứng phó sự cố với kẻ tấn công,” Hugging Face nói thêm.
Vì vậy, họ chuyển sang GLM 5.2—một mô hình mở có 753 tỷ tham số (kiến trúc hoàn toàn công khai, bất kỳ ai cũng có thể tải xuống và chạy cục bộ) từ công ty khởi nghiệp AI Trung Quốc Z.ai. “Thay vào đó, chúng tôi đã chạy phân tích pháp y trên GLM 5.2, một mô hình trọng lượng mở, trên cơ sở hạ tầng của chính chúng tôi”, Hugging Face viết. “Điều này có lợi ích thứ hai: không có dữ liệu của kẻ tấn công và không có thông tin xác thực nào mà nó tham chiếu rời khỏi môi trường của chúng tôi.”
Công việc điều tra—xây dựng lại dòng thời gian tấn công, lập bản đồ các thông tin xác thực bị xâm phạm, tách biệt thiệt hại thực sự khỏi hoạt động mồi nhử—mất nhiều giờ thay vì nhiều ngày.
Ôm Mặt đã rút ra bài học trực tiếp cho những người bảo vệ khác: “Có một mô hình có khả năng mà bạn có thể chạy trên cơ sở hạ tầng của riêng mình đã được hiệu đính và sẵn sàng trước khi xảy ra sự cố, vừa để tránh khóa lan can vừa giữ cho dữ liệu và thông tin xác thực của kẻ tấn công rời khỏi môi trường của bạn.”
OpenAI đang làm gì về nó
OpenAI cho biết họ đã thực hiện các biện pháp kiểm soát chặt chẽ đối với cơ sở hạ tầng nghiên cứu trong khi vá các hệ thống bị ảnh hưởng, tiết lộ zero-day cho nhà cung cấp bên thứ ba có proxy bị khai thác và đang tiến hành một cuộc điều tra pháp y chung với Hugging Face.
Ôm mặt cũng đã được thêm vào OpenAI’s chương trình truy cập đáng tin cậy để bảo vệ mạng—cung cấp cho các tổ chức được phê duyệt quyền truy cập vào các phiên bản mô hình của họ với các bộ lọc an toàn được giảm thiểu để thực hiện công việc bảo mật hợp pháp, cùng một cấu hình đã bắt đầu toàn bộ sự việc này.
Giám đốc điều hành của Hugging Face, Clem Delangue đã có quan điểm rõ ràng: “Sự an toàn của AI sẽ không được giải quyết bởi bất kỳ công ty đơn lẻ nào hoạt động bí mật. Nó sẽ được giải quyết một cách cởi mở, hợp tác, với khả năng truy cập rộng rãi vào AI cho mọi người bảo vệ, ở mọi nơi.”
OpenAI gọi vụ việc này là “liên quan đến các khả năng mạng tiên tiến mới” và cam kết chia sẻ những phát hiện đầy đủ khi cuộc điều tra chung với Hugging Face hoàn tất.
Bản tin tóm tắt hàng ngày
Bắt đầu mỗi ngày với những tin tức hàng đầu ngay bây giờ, cùng với các tính năng độc đáo, podcast, video và hơn thế nữa.

