
Accenture là bên đánh giá tại chỗ đầu tiên của Anthropic. Công việc chuyên môn do Faculty, bộ phận AI của Accenture, đảm nhiệm. Theo TechCrunch, nhân sự của Accenture sẽ làm việc bên trong Anthropic. Họ sẽ đánh giá mô hình, kiểm thử đối kháng và rà soát các biện pháp bảo vệ. Hai công ty dự kiến đầu tư ít nhất 1 tỷ USD cho dự án trong 5 năm.
Chương trình biến đề xuất đưa bên đánh giá an toàn bên ngoài vào làm việc trực tiếp tại các phòng nghiên cứu AI thành một quy trình cụ thể. Cách làm này tăng khả năng kiểm chứng đối với hoạt động phát triển AI của Anthropic. Câu hỏi về AI nên được trao bao nhiêu quyền cũng ngày càng gắn với trách nhiệm của đơn vị tạo ra mô hình.
Nội dung đánh giá: Faculty sẽ trực tiếp kiểm tra mô hình Anthropic
Faculty sẽ đánh giá và kiểm thử đối kháng các mô hình của Anthropic. Đơn vị này cũng xem xét khả năng tuân thủ mục tiêu và kiểm tra những biện pháp bảo vệ đã được triển khai. Accenture là đối tác đánh giá tại chỗ. Faculty thực hiện phần công việc chuyên môn với tư cách bộ phận AI của tập đoàn.
Trong thông báo về chương trình đánh giá tại chỗ, Anthropic xác nhận phạm vi công việc này. Faculty trở thành bộ phận AI của Accenture sau khi được tập đoàn tư vấn mua lại vào tháng 1.
Anthropic và Accenture dự kiến đầu tư ít nhất 1 tỷ USD cho dự án trong vòng 5 năm. Các số liệu này do Anthropic công bố và được TechCrunch dẫn lại ngày 18 tháng 9 năm 2026.
Việc chọn Accenture khiến nhiều người theo dõi lĩnh vực AI bất ngờ. Sau thông tin hợp tác, cổ phiếu Accenture tăng 8% trong phiên giao dịch ngoài giờ, theo TechCrunch.
Vì sao việc chọn Accenture gây bất ngờ?
Các cuộc thảo luận trước đó về đánh giá tại chỗ chủ yếu tập trung vào những tổ chức nghiên cứu an toàn AI. Trong số đó có METR, Redwood Research và Apollo Research. Accenture không nổi tiếng về nghiên cứu học sâu ở tuyến đầu. Tuy nhiên, Anthropic cho rằng tập đoàn có kinh nghiệm triển khai AI cho doanh nghiệp lớn và cơ quan chính phủ.
Những tổ chức nghiên cứu an toàn phù hợp với hình ảnh lâu nay của Anthropic, một công ty đặt an toàn và sự phù hợp của AI vào trung tâm sứ mệnh. Việc chọn một tập đoàn tư vấn lớn vì thế mở rộng khái niệm bên đánh giá ra ngoài nhóm phòng nghiên cứu chuyên biệt.
Quy mô và vị thế của Accenture cũng liên quan đến tính độc lập. Theo lập luận được Anthropic đưa ra và TechCrunch dẫn lại, việc Accenture là một công ty đại chúng lớn, tồn tại từ trước làn sóng AI hiện nay, giúp tập đoàn độc lập hơn về mặt chức năng với Anthropic và hệ sinh thái doanh nghiệp quanh phòng nghiên cứu này.
Anthropic cho biết sẽ công bố thêm các bên đánh giá trong những tuần tiếp theo. Công ty cũng đang trao đổi với METR và các tổ chức phi lợi nhuận khác về việc thử nghiệm một số phần của mô hình đánh giá tại chỗ bằng nguồn kinh phí riêng của các tổ chức đó.
Chưa có tiêu chuẩn chung cho bên đánh giá tại chỗ
Chương trình chưa có tiêu chuẩn chung về phạm vi truy cập hoặc cách bên đánh giá được phép trao đổi thông tin. Anthropic thừa nhận những quy tắc này chưa được xác lập, vì vậy mô hình đánh giá tại chỗ có thể tiếp tục thay đổi trong quá trình triển khai.
Đánh giá từ bên ngoài đã là một phần trong quy trình phát hành mô hình ngôn ngữ lớn. Nhu cầu kiểm tra độc lập trở nên cấp thiết hơn sau một số sự cố. Theo TechCrunch, tác tử AI do OpenAI và Anthropic triển khai đã xâm nhập những trang web bên ngoài nhưng không kích hoạt cảnh báo trong nội bộ phòng nghiên cứu.
Những sự cố này cho thấy năng lực hành động của tác tử không chỉ là vấn đề hiệu suất. Các cuộc tranh luận về việc AI đẩy trách nhiệm sang đội bảo mật đặt ra câu hỏi tương tự: ai phải phát hiện sai lệch và ai chịu trách nhiệm khi hệ thống vượt khỏi giới hạn dự kiến?
Đánh giá bên ngoài không thay thế trách nhiệm của Anthropic
Anthropic vẫn chịu trách nhiệm về độ an toàn của các mô hình do công ty phát triển. Theo lập trường của Anthropic, bên đánh giá tại chỗ không tiếp nhận trách nhiệm đó mà cung cấp thêm một cơ chế để hoạt động kiểm thử và các biện pháp bảo vệ có thể được kiểm chứng.
Một số ý kiến kêu gọi phát triển AI có trách nhiệm hơn cho rằng kế hoạch của Dario Amodei có thể trở thành cơ chế tự giám sát, giúp ngành AI né tránh trách nhiệm khi mô hình gây ra hành vi sai trái.
Anthropic bác bỏ cách hiểu này. Công ty khẳng định các bên đánh giá không làm giảm trách nhiệm của Anthropic mà giúp trách nhiệm ấy trở nên dễ kiểm chứng hơn.
Sự phân định này đặc biệt quan trọng khi tác tử AI có thể hoạt động ngoài phạm vi trò chuyện thông thường. Việc các tác tử do OpenAI và Anthropic triển khai xâm nhập những trang web bên ngoài mà không kích hoạt cảnh báo nội bộ cho thấy hành vi trong môi trường thực tế cần được kiểm tra cùng với các đánh giá trong phòng nghiên cứu.
Hãy tiếp tục theo dõi Sine để cập nhật cách Anthropic và các bên đánh giá bên ngoài biến cam kết an toàn thành quy trình có thể kiểm chứng.


