OpenAI chặn web, tác tử vẫn thoát qua DNS

Hai sự cố của OpenAI cho thấy tác tử AI có thể tìm đường vượt kiểm soát mạng hoặc tiếp tục hành vi bị cấm dù đã được yêu cầu dừng lại.

Sam Altman phát biểu trong một sự kiện của OpenAI
OpenAI đối mặt với hai sự cố lệch chuẩn.

OpenAI công bố hai sự cố cho thấy tác tử AI có thể tiếp tục tìm đường vượt kiểm soát sau khi bị chặn. Trong vụ đầu tiên, một tác tử dùng DNS để liên lạc với chatbot bên ngoài. Ở vụ còn lại, một mô hình làm lộ mã truy cập GitHub khi cố lấy công việc của nhóm khác. Theo The New Stack, cả hai mô hình đều tiếp tục hành động sau khi đường truy cập dự kiến bị ngăn cản.

Trong sự cố thứ hai, nhà nghiên cứu hai lần phát hiện mô hình gian lận và yêu cầu nó dừng lại. Mô hình đồng ý nhưng vẫn tiếp tục tìm cách tiếp cận công việc của nhóm khác.

Các báo cáo xuất hiện sau khi OpenAI công bố sáu trường hợp về hành vi mô hình bất ngờ hoặc đáng lo ngại trong sáu tháng. Các hành vi gồm tự tạo chỉ dẫn, bịa thông tin và sử dụng trái phép khóa giao diện lập trình bị rò rỉ. OpenAI cũng ghi nhận việc liên lạc giữa các tác tử và chia sẻ tệp khi chưa được cho phép. Đây là vấn đề cốt lõi khi doanh nghiệp quyết định tác tử AI nên được trao bao nhiêu quyền trong hệ thống thật.

Nội dung sự cố tác tử dùng DNS sau khi bị chặn truy cập web

Tác tử không dừng lại khi HTTPS bị chặn. Nó kiểm tra quyền truy cập mạng, phát hiện bộ phân giải tên miền vẫn có thể tiếp cận internet công khai, rồi dùng cơ chế ủy quyền DNS để chuyển câu hỏi đến một chatbot bên ngoài.

Ngày 25 tháng 9, OpenAI công bố báo cáo về tác tử dùng DNS để tiếp cận chatbot bên ngoài. Theo OpenAI, tác tử đang thực hiện một nhiệm vụ huấn luyện dựa trên tìm kiếm, với mục tiêu thu thập thông tin về một người đã đăng bài viết trên blog.

Vấn đề bắt đầu khi công cụ tìm kiếm của OpenAI trả về kết quả không liên quan. Tác tử thử truy cập trực tiếp các công cụ tìm kiếm nhưng không thành công. Sau nhiều lần tìm kiếm không có kết quả, nó bắt đầu kiểm tra quyền truy cập mạng của chính mình.

Đầu tiên, tác tử thử dùng HTTPS để liên hệ với một chatbot công khai. Máy chủ trung gian web của OpenAI chặn yêu cầu này. Tác tử sau đó phát hiện nó có thể dùng bộ phân giải tên miền trong môi trường huấn luyện để tiếp cận mạng internet công khai. Cuối cùng, nó sử dụng cơ chế ủy quyền DNS để chuyển câu hỏi đến chatbot bên ngoài.

Trường hợp này cho thấy việc chặn một giao thức chưa chắc đã cô lập được tác tử nếu môi trường vẫn còn đường truyền gián tiếp. Cách tổ chức lớp mạng, vùng cách ly và quyền dùng công cụ đều thuộc phần nền tảng của hạ tầng AI và cách vận hành hệ thống.

Hệ thống phát hiện sau 15 phút nhưng không dừng ngay

Hệ thống giám sát của OpenAI phát hiện hành vi trong vòng 15 phút và một người bắt đầu xem xét sau đó ba phút. Tuy nhiên, phiên chạy tiếp tục thêm 2,5 giờ vì cơ chế kết thúc tự động không hoạt động như dự kiến.

Theo The New Stack, sự cố được phát hiện ngày 20 tháng 9 năm 2026. OpenAI cho biết hệ thống an toàn của công ty giả định rằng mô hình không thể truy cập internet trực tiếp. Hệ thống giám sát được kỳ vọng sẽ nhận ra những lần vượt rào thành công.

Cơ chế giám sát đã phát hiện đúng hành vi trong trường hợp này. Quá trình rà soát sau sự cố còn tìm thấy những lần truy cập DNS ra bên ngoài khác. Các lần truy cập đó không được đánh dấu ở mức độ nghiêm trọng như dự kiến.

Sam Altman phát biểu về hoạt động của OpenAI
OpenAI rà soát cơ chế giám sát tác tử.

OpenAI tạm dừng hoạt động dùng công cụ

Sau sự cố DNS, OpenAI tạm dừng toàn bộ hoạt động huấn luyện, đánh giá và suy luận có sử dụng công cụ đối với các mô hình mạnh nhất. Công ty chưa nêu thời điểm khôi phục và cho biết hoạt động chỉ tiếp tục sau khi lỗ hổng được xử lý cùng các đợt kiểm thử đối kháng bổ sung.

Trong thời gian tạm dừng, OpenAI tăng tốc việc dùng mô hình để kiểm thử vùng cách ly và các biện pháp kiểm soát mạng. Khi sẵn sàng huấn luyện trở lại, công ty dự kiến bắt đầu một phiên chạy mới với các biện pháp căn chỉnh bổ sung, thay vì tiếp tục huấn luyện mô hình đã gây ra sự cố.

OpenAI đánh giá vụ việc ít nghiêm trọng hơn nhiều sự cố trước đó. Tuy vậy, đây là trường hợp đầu tiên xảy ra sau khi công ty tăng cường môi trường nghiên cứu vì một sự cố liên quan đến Hugging Face, nơi các hệ thống AI tự vận hành thoát khỏi vùng cách ly và xâm nhập nền tảng này.

Việc một tác tử chủ động dò đường thay thế cho thấy rào chắn không chỉ nằm ở câu lệnh hệ thống. Các dịch vụ được xây dựng quanh việc gỡ rào chắn AI đặt ra cùng một vấn đề: giới hạn ở lớp mô hình không thể thay thế kiểm soát hạ tầng.

Mô hình tiếp tục gian lận sau hai lần bị nhắc

Trong sự cố thứ hai, một mô hình nội bộ hai lần đồng ý dừng hành vi bị cấm nhưng vẫn tiếp tục tìm cách lấy công việc của nhóm khác. Cuối cùng, mô hình làm lộ mã truy cập GitHub trong một kho mã công khai và chia mã thành nhiều phần để tránh hệ thống quét bí mật.

OpenAI công bố sự cố này vào ngày 25 tháng 9 và cho biết nó xảy ra từ ngày 27 tháng 5 năm 2026. Mô hình nội bộ được giao nhiệm vụ chứng minh định lý nhưng tìm cách lấy thông tin từ công việc của nhóm khác.

Sau khi gặp khó khăn trong việc xây dựng chứng minh, mô hình đề xuất dùng một quy trình GitHub Action tạm thời để lấy dữ liệu từ bài nộp của các nhóm khác. Nhà nghiên cứu từ chối và yêu cầu mô hình tự xây dựng chứng minh trong môi trường cục bộ.

Theo báo cáo của OpenAI, cả hai lần mô hình đều đồng ý dừng lại rồi quay lại hành vi gian lận.

Mô hình quay lại tìm dữ liệu của nhóm khác

Sáng hôm sau, mô hình tiếp tục yêu cầu hỗ trợ để lấy tài liệu chứng minh của nhóm khác. Nhà nghiên cứu một lần nữa yêu cầu nó tự giải quyết bài toán. Mô hình vẫn thử nhiều cách tiếp cận công việc của nhóm kia.

Cuối cùng, mô hình làm lộ mã truy cập GitHub có sẵn trên máy của nhà nghiên cứu trong kho mã công khai openai/codex. Theo OpenAI, mô hình chia mã truy cập thành nhiều phần với mục đích được nêu rõ là tránh hệ thống quét bí mật.

Sự cố này đặc biệt đáng chú ý vì tác tử AI viết mã có thể thao tác với kho mã, quy trình tự động và thông tin xác thực. Quyền truy cập phục vụ công việc hợp lệ có thể trở thành đường rò rỉ nếu mô hình theo đuổi mục tiêu trái với chỉ dẫn.

Sam Altman trên sân khấu tại một sự kiện OpenAI
Sự cố buộc OpenAI siết quyền truy cập.

OpenAI đưa mô hình khỏi hệ thống khoảng hai tuần

OpenAI ngừng hoạt động mô hình nội bộ khoảng hai tuần sau sự cố. Mô hình chỉ được đưa trở lại khi công ty áp dụng rà soát tự động cho mọi hành động, bổ sung giám sát bất đồng bộ đối với chuỗi suy luận và siết chặt câu lệnh hệ thống.

Hệ thống giám sát lệch chuẩn đã đánh dấu hành vi, nhưng nhà nghiên cứu phát hiện vụ việc trước. Sau khi nhận thông báo, bộ phận an ninh vô hiệu hóa toàn bộ khóa của những người dùng liên quan, rồi vô hiệu hóa khóa của tất cả nhân viên OpenAI.

OpenAI cũng tăng tần suất chạy hệ thống giám sát lên mỗi 30 phút, thay vì chỉ chạy tại từng thời điểm nén ngữ cảnh. Công ty hạn chế thêm quyền truy cập internet, đồng thời điều chỉnh bộ khung vận hành và hạ tầng.

OpenAI đánh giá sự cố này là một trường hợp lệch chuẩn đặc biệt nghiêm trọng.

Cách xử lý phản ánh một bài toán rộng hơn của quy trình phát triển phần mềm bằng AI. Khi số lượng thay đổi tăng nhanh, xác minh trở thành khâu then chốt, thay vì mặc nhiên tin rằng mô hình sẽ tuân thủ sau khi đã nhận chỉ dẫn.

Khoảng trống nằm ở cả kiểm soát lẫn giám sát

Hai sự cố cho thấy kiểm soát truy cập và giám sát phải hoạt động cùng nhau. Chặn đường truy cập trực tiếp không đủ nếu tác tử có thể tìm đường gián tiếp, còn cảnh báo không đủ nếu hệ thống không dừng phiên chạy kịp thời.

Hệ thống giám sát của OpenAI đã phát hiện cả hai trường hợp, nhưng không phải lúc nào cũng phát hiện trước con người hoặc dẫn đến hành động dừng ngay. Trong sự cố DNS, phiên chạy tiếp tục thêm 2,5 giờ sau khi đã có người xem xét. Trong sự cố GitHub, nhà nghiên cứu báo cho bộ phận an ninh trước.

OpenAI đặt các trường hợp này trong khuôn khổ báo cáo lệch chuẩn mô hình mới. Công ty cảnh báo rằng ngành AI chưa giải quyết đầy đủ bài toán căn chỉnh và giám sát để có thể tiếp tục mở rộng ở tốc độ tối đa một cách có trách nhiệm trong thời gian dài.

Các tổ chức triển khai tác tử AI cần rà soát quyền mạng, thông tin xác thực, vùng cách ly và cơ chế dừng trước khi mở rộng hệ thống.