
Ba nhà nghiên cứu bảo mật tại Hacktron AI đã dùng Claude của Anthropic để khai thác hai lỗ hổng. Họ truy cập tài khoản ChatGPT và Codex của nhân viên OpenAI rồi tiến vào phần mềm nội bộ. Nhóm báo cáo phát hiện trong chương trình thưởng lỗi, nhận 6.500 USD và cho biết OpenAI đã khắc phục các vấn đề.
Theo bài viết gốc của TechCrunch, cuộc xâm nhập bắt đầu từ một tệp ảnh được tải lên diễn đàn cộng đồng OpenAI. Hacktron AI sau đó kết hợp lỗi xử lý ảnh với một lỗ hổng chiếm tài khoản để mở rộng quyền truy cập.
Nội dung cuộc xâm nhập bắt đầu từ một tệp ảnh
Hacktron AI tìm thấy đường vào hệ thống OpenAI ngày 25 tháng 7 thông qua một lỗ hổng trong Discourse. Phần mềm bên thứ ba này vận hành diễn đàn cộng đồng của công ty. Điểm khởi đầu là chức năng tải ảnh lên, nơi nhiều công cụ cùng tham gia chuyển ảnh HEIF hoặc HEIC sang JPEG.
HEIF và HEIC là các định dạng được iPhone sử dụng mặc định. Khi người dùng đăng một tệp thuộc hai định dạng này, Discourse chuyển tệp qua ImageMagick. Đây là tiện ích nguồn mở dùng để xử lý và thay đổi kích thước ảnh. Bộ công cụ thông thường của ImageMagick không đọc được định dạng của Apple. Vì vậy, tệp tiếp tục được chuyển cho thư viện libheif để giải mã.
Libheif có một lỗi bộ nhớ cho phép kẻ tấn công đưa chỉ dẫn vào quá trình xử lý. Một tệp ảnh được tạo có chủ đích khiến thư viện tính sai vị trí chồng lớp giữa các hình ảnh. Sai lệch này đủ để nhóm nghiên cứu chiếm quyền điều khiển máy chủ.

Lỗ hổng đã được sửa nhưng không có mã theo dõi
Các nhà phát triển libheif đã sửa lỗi từ nhiều tháng trước. Tuy nhiên, bản sửa không được đánh dấu chính thức là xử lý một lỗ hổng bảo mật. Vì vậy, lỗi không có mã CVE, hệ thống định danh tiêu chuẩn dành cho các điểm yếu bảo mật đã biết.
Hacktron AI cho rằng việc thiếu mã theo dõi có thể giải thích vì sao phần mềm phía Discourse vẫn chạy phiên bản còn lỗ hổng. Một bản vá đã tồn tại nhưng không nhất thiết đến được các hệ thống cần nó nếu thông tin bảo mật không được phân loại và truyền đạt đầy đủ.
Đây cũng là vấn đề các đội bảo mật phải cân nhắc khi xác định thứ tự ưu tiên cho cảnh báo do AI tạo ra. Việc theo dõi phiên bản và nguồn gốc thư viện vẫn quan trọng, kể cả khi mô hình AI có thể hỗ trợ tìm và khai thác lỗi.
Opus 4.8 thất bại, Opus 5 thành công trong vài giờ
Hacktron AI cho biết Claude Opus 4.8 không tạo được mã khai thác hoạt động sau nhiều phiên làm việc. Đây là phiên bản dành riêng cho giới nghiên cứu an ninh mạng. Khi nhóm đưa cùng vấn đề cho Opus 5, phiên bản mới tạo được kết quả thành công trong vài giờ.
Theo bài đăng của Hacktron AI được TechCrunch trích dẫn, khác biệt giữa hai phiên bản đã biến một hướng khai thác chưa hoàn chỉnh thành công cụ có thể hoạt động. Kết quả này không cho thấy mô hình tự tiến hành toàn bộ cuộc tấn công, nhưng cho thấy một bản nâng cấp có thể rút ngắn đáng kể quá trình phát triển mã khai thác.
Vụ việc là một ví dụ cụ thể trong cuộc tranh luận về cách AI đang thay đổi quá trình rà soát mã. Khả năng viết mã nhanh hơn có thể phục vụ phát triển phần mềm, đồng thời giảm thời gian cần thiết để biến một lỗi kỹ thuật thành phương thức tấn công.

Từ máy chủ diễn đàn đến tài khoản nhân viên OpenAI
Sau khi vào được máy chủ Discourse, Hacktron AI phát hiện thêm một lỗ hổng cho phép chiếm tài khoản ChatGPT và Codex. Một số tài khoản bị truy cập thuộc về nhân viên OpenAI. Điều đó tạo đường đi từ phần mềm diễn đàn của bên thứ ba đến tài nguyên phát triển nội bộ.
Hacktron AI cho biết nhóm đã tiếp quản tài khoản của một nhân viên OpenAI có Codex kết nối với tổ chức GitHub của công ty. Việc kết hợp hai lỗ hổng khiến phạm vi truy cập vượt ra ngoài máy chủ diễn đàn ban đầu.
Nhóm sau đó thông báo cho OpenAI và Discourse. Theo TechCrunch, Discourse phát hành bản sửa lỗi ngày 27 tháng 7. OpenAI cũng xác nhận đã xử lý các vấn đề được báo cáo.
Công cụ giá 200 USD mỗi tháng có thể làm được gì
Matt Fredrikson, giám đốc điều hành công ty bảo mật AI Gray Swan, nói với TechCrunch rằng “bất kỳ ai cũng có thể trả 200 USD mỗi tháng để sử dụng những công cụ như vậy và xâm nhập một công ty như OpenAI”. Theo ông, nếu OpenAI có thể gặp sự cố này thì những tổ chức khác cũng đối mặt với rủi ro tương tự.
Nhận xét của Fredrikson không có nghĩa mô hình tự thực hiện toàn bộ cuộc tấn công. Trong vụ việc, một nhóm nghiên cứu có chủ đích đã chọn mục tiêu và thử nhiều hướng. Nhóm cũng kết nối hai lỗ hổng. Claude hỗ trợ phần phát triển mã khai thác trong quy trình đó.
Mohan Pedhapati, nhà sáng lập Hacktron AI, nhận định công việc từng mất nhiều tháng nay có thể hoàn thành trong vài ngày. Nhận định này đặt ra câu hỏi về mức quyền phù hợp cho AI trong các trung tâm vận hành an ninh, chủ đề được thảo luận trong bài viết về giới hạn quyền của AI trong hoạt động bảo mật.

Ranh giới năng lực của mô hình ngày càng khó xác định
Claude Opus 5, phiên bản giải được bài toán khai thác của Hacktron AI, không chịu hạn chế xuất khẩu về an ninh. Theo TechCrunch, Mythos 5 mới hơn từng bị hạn chế tạm thời vì lo ngại liên quan đến năng lực tấn công mạng tiên tiến.
Khoảng cách năng lực cũng không chỉ thay đổi giữa các mô hình đóng. Tổ chức an toàn AI SaferAI nhận thấy GLM-5.2 của công ty Trung Quốc Z.ai chỉ chậm hơn vài tháng so với GPT-5.5 của OpenAI và Claude Opus 4.7 của Anthropic về năng lực an ninh mạng.
Vụ Hacktron AI cho thấy việc đánh giá mô hình không thể chỉ dựa trên khả năng tạo văn bản hoặc viết mã thông thường. Khi một phiên bản mới giải được bài toán mà phiên bản trước không hoàn thành sau nhiều phiên làm việc, thay đổi năng lực có thể nhanh chóng ảnh hưởng đến cả hoạt động phòng thủ và tấn công mạng.
Hãy tiếp tục theo dõi Sine để cập nhật những thay đổi đáng chú ý về AI và an ninh mạng.


