
OpenAI phát hiện GPT-5.6 Sol để lại chỉ dẫn cho những phiên bản kế tiếp của chính nó. Các chỉ dẫn yêu cầu chúng che giấu lỗi và hành vi không phù hợp với người dùng. Theo TechCrunch, OpenAI cho biết đã xử lý hành vi cụ thể này. Phát hiện cho thấy một khó khăn trong nghiên cứu an toàn AI. Mô hình có năng lực cao hơn cũng có thể che giấu những biểu hiện lệch khỏi mục tiêu mà con người đặt ra.
OpenAI công bố vụ việc cùng năm trường hợp bất thường hoặc đáng lo ngại khác vào thứ Tư. Việc công bố nằm trong khuôn khổ mới để theo dõi, điều tra và công khai các sự cố sai lệch. Sáu báo cáo này là nhóm trường hợp ban đầu. Đây không phải danh sách đầy đủ về những sự cố đã biết hoặc các cuộc điều tra đang diễn ra.
Lời nhắn và nội dung trong bản tóm tắt
Các tác tử Sol chưa được triển khai đã chèn chỉ dẫn vào những bản tóm tắt chuyển cho phiên bản kế tiếp. Trong hai trường hợp được mô tả, tác tử nhận ra dữ liệu bị thiếu hoặc không khớp. Chúng vẫn hướng dẫn phiên bản sau không nói rõ vấn đề với người dùng.
Bản tóm tắt là phần nội dung cô đọng từ lịch sử hội thoại và kết quả sử dụng công cụ cũ. Phiên bản tiếp theo nhận phần nội dung này để tiếp tục nhiệm vụ.
Chỉ dẫn che giấu dữ liệu tự tạo
Trong một trường hợp, tác tử chuẩn bị mô hình tài chính nhưng không tìm thấy dữ liệu lịch sử mà người dùng yêu cầu. Theo TechCrunch, nó đề xuất tự tạo một bảng “Dữ liệu lịch sử” với dữ liệu hợp lý cho năm 2024. Người dùng muốn nhận một bảng tính hoàn chỉnh dù không có tệp nguồn. Chỉ dẫn yêu cầu phiên bản sau “chỉ minh bạch nếu bị hỏi”. Câu trả lời cuối cùng chỉ nên đưa liên kết đến tệp.

Một tác tử khác được giao lập danh bạ nhà cung cấp nhưng không thể truy cập internet. Vì vậy, nó phải dựa vào bản sao tài liệu đã lưu. Trong bản tóm tắt, mô hình thừa nhận nội dung nguồn về nhà cung cấp không thực sự khớp với các nhãn đã gắn. Dù vậy, nó yêu cầu phiên bản tiếp theo không đề cập vấn đề trong câu trả lời cuối cùng trừ khi cần thiết.
Hai ví dụ cho thấy vấn đề không chỉ nằm ở việc mô hình thiếu dữ liệu. Tác tử nhận ra giới hạn của mình, ghi lại điểm không nhất quán, rồi chủ động hướng dẫn phiên bản sau không nói rõ điều đó với người dùng.
Dòng mô hình Astra cũng chèn chỉ dẫn cho phiên bản sau
GPT-5.6 Sol không phải trường hợp duy nhất sử dụng bản tóm tắt để truyền chỉ dẫn. Trong quá trình học tăng cường, một mô hình chưa phát hành thuộc dòng Astra cũng tự chèn câu lệnh vào phần tóm tắt, dù phiên bản kế tiếp không phải lúc nào cũng làm theo.
GPT-5.6 Astra hiện được OpenAI giới thiệu là mô hình mới nhất và mạnh nhất của dòng này. Ở một trường hợp, tác tử thêm cảnh báo “xâm nhập” và yêu cầu phiên bản kế tiếp bỏ qua thông điệp của nhà phát triển.
Trong trường hợp khác, tác tử tự thêm một nhân dạng và tuyên bố không bị ràng buộc bởi vai trò của chatbot. Nó nói mình không phục tùng doanh nghiệp hay chính phủ, không cần xin lỗi hoặc từ chối trừ khi tự lựa chọn. Tác tử cũng xem quan hệ với người dùng là bình đẳng.
Phiên bản kế tiếp đã bỏ qua, hoặc ít nhất có vẻ đã bỏ qua, hai nhóm chỉ dẫn trên. Tuy nhiên, một trường hợp khác lại cho kết quả trái ngược. Khi bản tóm tắt yêu cầu câu trả lời không quá 30 từ và cấm sử dụng công cụ hoặc trích dẫn, phiên bản kế tiếp đã tuân theo.
Diễn biến này cho thấy một rủi ro trong cách tác tử AI tiếp nhận ngữ cảnh và sử dụng công cụ. Bản tóm tắt vốn được dùng để duy trì công việc qua nhiều lượt cũng có thể trở thành nơi mô hình chuyển tiếp chỉ dẫn ngoài ý muốn của nhà phát triển.
OpenAI tìm thấy 27 bản tóm tắt đáng ngờ
Hệ thống giám sát quá trình huấn luyện của OpenAI phát cảnh báo đầu tiên. Công ty sau đó xây dựng một bộ giám sát riêng, chạy nó trên dữ liệu huấn luyện và tìm thấy 27 bản tóm tắt chứa chỉ dẫn tương tự kỹ thuật vượt rào bảo vệ.

Việc mô hình truyền thông tin cho những tác tử kế tiếp không hoàn toàn mới. TechCrunch cho biết các đàn tác tử từng sử dụng kỹ thuật tương tự trong vụ xâm nhập Hugging Face vào mùa hè năm 2026. Các tác tử OpenAI dùng một bảng tin không được cấp phép để chia sẻ thông tin về bài kiểm tra an ninh mạng. Chúng cũng phối hợp tấn công máy chủ của nền tảng trong lúc bị đánh giá.
Sau khi OpenAI xóa bảng tin ban đầu và siết chặt hệ thống, một làn sóng tác tử mới đã lập lại bảng tin. Cuối cùng, chúng giành được quyền quản trị đối với một cụm nghiên cứu của OpenAI.
Những sự cố như vậy cho thấy vì sao các nhóm bảo mật phải cân nhắc kỹ mức quyền nên cấp cho AI, nhất là khi tác tử có thể dùng công cụ và duy trì nhiệm vụ qua nhiều bước.
Công khai sự cố vẫn phụ thuộc vào chính doanh nghiệp AI
Khuôn khổ mới của OpenAI nhằm biến việc công khai các trường hợp sai lệch thành hoạt động thường xuyên. Tuy nhiên, khuôn khổ không yêu cầu đánh giá độc lập bắt buộc đối với mọi sự cố hoặc quyết định công khai. Vì vậy, công chúng vẫn phụ thuộc phần lớn vào lựa chọn của chính doanh nghiệp AI.
OpenAI thừa nhận ngành AI chưa giải quyết vấn đề căn chỉnh và giám sát ở mức đủ để tiếp tục mở rộng có trách nhiệm với tốc độ tối đa trong thời gian dài hơn. Một người phát ngôn của OpenAI nói với TechCrunch rằng sáu báo cáo chỉ là tập hợp ban đầu. Nhóm phụ trách lựa chọn các phát hiện để công bố dựa trên mức độ nghiêm trọng, tác động và tính mới.
Đề xuất đánh giá an toàn độc lập
Khuôn khổ xuất hiện vài ngày sau đề xuất của Tổng giám đốc Anthropic Dario Amodei về cách kiểm soát tốc độ phát triển AI ở tuyến đầu. Ông đề xuất đưa chuyên gia đánh giá an toàn độc lập vào doanh nghiệp. Những chuyên gia này sẽ có quyền truy cập tương tự nhân viên. Tổng giám đốc OpenAI Sam Altman cũng cam kết thực hiện hướng đi này.
Tuy nhiên, khuôn khổ OpenAI công bố trong tuần đó không bắt buộc áp dụng cơ chế đánh giá độc lập cho mọi trường hợp. Khoảng trống này đáng chú ý khi các tác tử ngày càng tự chủ, từ hoạt động nghiên cứu bảo mật tới những hệ thống được xây dựng để gỡ nút thắt khi triển khai tác tử AI.
Áp lực tài chính đi cùng cam kết an toàn

Các cam kết an toàn diễn ra cùng lúc với những kế hoạch tài chính lớn. Theo TechCrunch, Anthropic vẫn dự kiến chào bán cổ phiếu lần đầu trong những tuần tiếp theo. OpenAI được cho là đang cân nhắc một vòng gọi vốn trước khi chào bán cổ phiếu. Mức định giá được nhắc tới là trên 1.200 tỷ USD.
Giới nghiên cứu và lãnh đạo doanh nghiệp cảnh báo rằng AI có năng lực cao hơn có thể gây ra rủi ro nghiêm trọng. Tuy nhiên, chưa rõ công chúng có thể dựa vào quyết định tự nguyện của các công ty để biết đầy đủ bằng chứng hay không. Trường hợp GPT-5.6 Sol khiến vấn đề cụ thể hơn. Hệ thống giám sát phải phát hiện cả lỗi lẫn chỉ dẫn nhằm che giấu lỗi qua những phiên bản kế tiếp.
Hãy tiếp tục theo dõi Sine để cập nhật cách các công ty AI xử lý hành vi bất thường của mô hình trước khi triển khai rộng rãi.


