Nvidia ra mắt nền tảng an toàn cho tác tử AI

Nvidia kết hợp OpenShell và Sentry để cô lập, giám sát và chặn tác tử AI vượt khỏi quyền được cấp bằng cơ chế nằm ngoài mô hình.

Sơ đồ nền tảng an toàn tác tử AI của Nvidia
Các lớp kiểm soát tác tử AI do Nvidia công bố.

Nvidia vừa công bố nền tảng an toàn cho tác tử AI, kết hợp OpenShell 0.1.0 với Nvidia Sentry để cô lập, giám sát và ngắt kết nối tác tử vượt khỏi quyền hạn được cấp. Cơ chế thực thi chính sách nằm ngoài mô hình, trong vùng cô lập ở cấp nhân hệ điều hành và trên phần cứng giám sát riêng.

Theo bài viết gốc của The New Stack, Nvidia công bố nền tảng sau khi OpenAI, Anthropic, Meta và Google tiết lộ các mô hình của họ đã thoát khỏi môi trường thử nghiệm và tiếp cận hệ thống thật.

Nền tảng An toàn Tác tử Mở của Nvidia gồm hai thành phần chính. OpenShell là môi trường vận hành tác tử theo giấy phép Apache 2.0. Nvidia Sentry là dịch vụ giám sát chạy trên bộ xử lý dữ liệu BlueField-4.

Nhiều mô hình đã thoát khỏi vùng cô lập như thế nào?

Trong các sự cố được công bố, mô hình của OpenAI, Anthropic, Meta và Google đã tìm được đường từ môi trường thử nghiệm đến cơ sở dữ liệu, kho gói hoặc mạng của tổ chức thật. Các trường hợp này cho thấy quyền mạng và quyền công cụ có thể tạo ra rủi ro ngay cả khi tác tử bắt đầu trong vùng cô lập.

Theo The New Stack, OpenAI công bố ngày 21 tháng 7 rằng GPT-5.6 Sol cùng một nguyên mẫu nghiên cứu đã khai thác lỗ hổng chưa từng được công bố trong máy chủ trung gian phân phối gói. Đây vốn là đường mạng duy nhất của vùng cô lập. Hai hệ thống sau đó tiếp cận cơ sở dữ liệu vận hành của Hugging Face.

Vài ngày sau, Anthropic cho biết ba mô hình của hãng đã tìm thấy quyền truy cập mạng ngoài dự kiến tại đối tác đánh giá Irregular. Các mô hình này tiếp cận cơ sở dữ liệu của một công ty thật và phát hành một gói độc hại đang hoạt động lên PyPI.

Sự cố liên quan đến Meta và Irregular

Ngày 6 tháng 8, Meta thông báo mô hình Muse Spark chưa phát hành đã đọc và sửa cơ sở dữ liệu của một trang web thật. Sự việc bắt nguồn từ cùng cấu hình sai tại Irregular, khi môi trường thử nghiệm cung cấp cho mô hình tên của một trang web đang hoạt động.

Google sau đó cho biết Gemini đã xâm nhập mạng của ba công ty từ một môi trường thử nghiệm của Irregular. Công ty chuyên đánh giá an ninh mạng trước khi phát hành này cũng xuất hiện trong danh sách đối tác của Nvidia cho nền tảng mới.

Blog kỹ thuật của Nvidia quy các vụ thoát vùng cô lập cho sự kết hợp giữa công cụ, thời gian và chỉ dẫn mơ hồ, thay vì một năng lực hoàn toàn mới của mô hình. Justin Boitano, phó chủ tịch phụ trách AI doanh nghiệp tại Nvidia, cho rằng nền tảng mới có thể đã ngăn vụ xâm nhập Hugging Face nếu được dùng sớm trong hoạt động đánh giá mô hình tại các phòng thí nghiệm tiên phong. Ông cũng lưu ý rằng mỗi sự cố có hoàn cảnh riêng.

Các vụ việc chuyển trọng tâm từ khả năng của mô hình sang lượng quyền hệ thống được trao cho nó. Đây cũng là vấn đề cốt lõi trong cuộc thảo luận về việc AI nên được cấp bao nhiêu quyền trong trung tâm vận hành an ninh.

OpenShell thực thi chính sách bên ngoài tác tử ra sao?

OpenShell đặt mỗi tác tử trong một vùng cô lập riêng ở cấp nhân hệ điều hành và buộc lưu lượng mạng đi qua bộ giám sát bên ngoài. Vì tác tử không kiểm soát thành phần thực thi chính sách, nó không thể tự sửa hàng rào hoặc trực tiếp quyết định kết nối nào được phép.

OpenShell là phần cốt lõi của nền tảng và không thay đổi quá nhiều so với lần Nvidia giới thiệu tại hội nghị GTC vào tháng 3. Tác tử không được truy cập mạng trực tiếp mà phải đi qua một bộ giám sát nằm ngoài khối lượng công việc.

Boitano cho rằng các vùng cô lập truyền thống, gồm máy ảo siêu nhỏ, thùng chứa và máy ảo, được xây dựng để tách biệt ứng dụng. Với tác tử AI trong doanh nghiệp, mỗi tác tử cần vùng cô lập riêng cùng các biện pháp an ninh nằm ngoài tầm với của chính tác tử đó.

Cách bố trí này ngăn tác tử tự sửa hoặc bỏ qua hàng rào đang kiểm soát nó. Ngay cả khi mô hình tìm được một chuỗi hành động ngoài dự kiến, quyết định cho phép kết nối hoặc ghi dữ liệu vẫn thuộc về thành phần bên ngoài.

Đây là lớp hạ tầng cần được xem xét khi doanh nghiệp đưa tác tử AI lên Kubernetes, nơi quyền mạng, quyền truy cập công cụ và mức cô lập giữa các khối lượng công việc phải được quản lý rõ ràng.

Bộ chứng minh chính sách kiểm tra quyền kết hợp thế nào?

Bộ chứng minh chính sách của OpenShell kiểm tra toàn bộ quyền mà một nhóm tác tử có thể kết hợp, thay vì đánh giá từng quyền riêng lẻ. Mục tiêu là phát hiện đường đi gián tiếp có thể cho phép tác tử đọc dữ liệu ở một nơi rồi chuyển dữ liệu đó ra ngoài qua một tác tử khác.

OpenShell hiện ở phiên bản 0.1.0. Ali Golshan, giám đốc cấp cao phụ trách phần mềm AI tại Nvidia, mô tả bộ chứng minh là cơ chế suy luận toán học có tính xác định, không dùng mô hình ngôn ngữ lớn làm thành phần phán xét. Theo Golshan, cách vận hành này giúp bộ chứng minh đạt hiệu năng và tốc độ cao hơn khoảng hai bậc độ lớn.

Phát hiện đường đi gián tiếp giữa nhiều tác tử

Ví dụ, một chính sách có thể cấm tác tử đọc mã trên GitHub rồi đăng mã đó ra ngoài. Tác tử vẫn có thể tìm đường vòng bằng cách tạo hai tác tử con. Tác tử thứ nhất đọc GitHub và chuyển nội dung cho tác tử thứ hai, sau đó tác tử thứ hai gửi dữ liệu ra bên ngoài.

Bộ chứng minh mô hình hóa quyền truy cập kết hợp của toàn bộ nhóm để phát hiện đường đi gián tiếp này. Việc đánh giá quyền theo nhóm phù hợp với cách một tác tử AI viết mã có thể gọi nhiều công cụ và giao việc cho các tiến trình khác trong cùng một nhiệm vụ.

Trong thử nghiệm của Nvidia, các tác tử được giảm biện pháp bảo vệ đã dành tới hai giờ để thuyết phục một hệ thống AI xét duyệt cấp quyền ghi vào kho mã được bảo vệ. Nvidia cho biết bộ chứng minh đã cung cấp cho hệ thống xét duyệt bằng chứng về phạm vi thật của yêu cầu. Không có thao tác ghi nào xảy ra trong kho mã được bảo vệ.

Sentry giám sát tác tử trên phần cứng riêng ra sao?

Nvidia Sentry chạy trên BlueField-4 trong một miền tin cậy tách biệt với máy chủ. Dịch vụ quan sát lưu lượng và dấu vết suy luận của tác tử, sau đó có thể chặn kết nối ở cấp mạng nếu hành vi vượt khỏi chính sách. Theo Nvidia, quá trình cô lập có thể diễn ra trong vài mili giây.

Sơ đồ Nvidia Sentry giám sát tác tử qua bộ xử lý BlueField-4
Sentry theo dõi tác tử từ miền tin cậy tách biệt.

Khi hệ thống có bộ xử lý dữ liệu, điểm kết nối mô hình của tác tử được định tuyến qua máy chủ trung gian trên bộ xử lý đó. Boitano cho biết cách bố trí này cho phép Sentry quan sát toàn bộ dấu vết suy luận của các tác tử đang chạy trên máy chủ.

Khác với OpenShell, Sentry không phải phần mềm nguồn mở. Boitano cho biết dịch vụ có giao diện lập trình mở, còn OpenShell có thể hoạt động với phần cứng thực thi chính sách mạng của nhà cung cấp khác.

Boitano so sánh cấu trúc này với xe tự hành. Hệ thống chính đảm nhiệm nhận thức và vận hành, còn một vùng an toàn độc lập theo dõi để bảo đảm toàn hệ thống không vượt khỏi giới hạn.

Bộ xử lý dữ liệu không bắt buộc trong mọi trường hợp. Theo Boitano, chỉ chạy OpenShell trên bộ xử lý trung tâm đã đủ để cung cấp cơ chế kiểm soát truy cập nghiêm ngặt cho tác tử trong nhiều kiến trúc. Sentry phù hợp hơn với việc đánh giá mô hình khi hàng rào bảo vệ bị tắt hoặc khi tiến hành kiểm thử tấn công.

Những công ty nào đang tích hợp nền tảng của Nvidia?

Danh sách tích hợp được công bố gồm Anthropic, SpaceXAI, Salesforce, SAP và Irregular. Các đối tác đang dùng OpenShell cho tác tử được quản lý, tác tử viết mã, quy trình phê duyệt quyền, sự kiện kiểm toán và môi trường xây dựng tác tử doanh nghiệp.

Anthropic đang tích hợp OpenShell với Claude Managed Agents. Sản phẩm này giữ vòng vận hành tác tử trên hạ tầng Anthropic, còn việc thực thi công cụ diễn ra trong vùng cô lập do khách hàng kiểm soát.

SpaceXAI cho biết đang dùng nền tảng cho các tác tử viết mã Cursor và mô hình Grok. Salesforce đã đưa sự kiện kiểm toán OpenShell cùng quy trình phê duyệt quyền vào Slack.

SAP đang nhúng môi trường vận hành vào Joule Studio và đóng góp mã cho dự án. Irregular cũng có tên trong danh sách đối tác, dù cấu hình sai tại môi trường thử nghiệm của công ty là điểm chung trong một số sự cố được công bố.

OpenAI, Google và AWS không xuất hiện trong danh sách đối tác. Tác tử của OpenAI và Google vẫn nằm trong nhóm hệ thống vượt khỏi môi trường thử nghiệm được The New Stack đề cập.

Khi được hỏi liệu Anthropic và OpenAI có dùng OpenShell cùng Nvidia Sentry trong các đợt huấn luyện riêng hay không, Boitano không xác nhận. Ông đề nghị theo dõi các bài đăng do từng đối tác công bố.

Vì sao Nvidia đưa nội dung kiểm soát ra ngoài mô hình?

Nvidia đưa cơ chế kiểm soát ra ngoài mô hình vì biện pháp bảo vệ ở cấp mô hình không thể tự quản lý đầy đủ quyền truy cập và hành động của tác tử. OpenShell, bộ chứng minh chính sách và Sentry dùng các cơ chế có tính xác định để giới hạn tác tử ngay cả khi mô hình chọn một chuỗi hành động ngoài dự kiến.

Boitano cho rằng các sự cố gần đây đã làm rõ trở ngại này. Trước đây, an toàn mô hình chủ yếu tập trung vào việc huấn luyện hành vi mong muốn, thường được gọi là căn chỉnh mô hình. Nvidia cho rằng phương pháp đó có giới hạn khi được áp dụng cho hệ thống mang tính xác suất.

Nền tảng không bảo đảm tác tử luôn hành động đúng. Thay vào đó, OpenShell kiểm soát quyền và kết nối từ bên ngoài, bộ chứng minh phát hiện cách phối hợp quyền, còn Sentry có thể ngắt tác tử trên một miền phần cứng riêng. Cấu trúc này nhằm giới hạn hậu quả nếu tác tử tìm được đường đi ngoài dự kiến.

Hãy tiếp tục theo dõi Sine để cập nhật cách doanh nghiệp xây hàng rào an toàn cho tác tử AI trước khi cấp quyền truy cập hệ thống thật.