Circuit Breaker Labs kiểm tra độ an toàn của AI

Circuit Breaker Labs dùng các tác tử mô phỏng nhiều nhóm người dùng để phát hiện phản hồi AI có thể gây tổn thương tâm lý.

Hai nhà sáng lập Arul và Shirali Nigam của Circuit Breaker Labs
Arul Nigam và Shirali Nigam, hai nhà sáng lập Circuit Breaker Labs.

Circuit Breaker Labs là một phòng kiểm thử an toàn AI. Phòng kiểm thử sử dụng các tác tử mô phỏng người dùng để phát hiện phản hồi có thể gây tổn thương tâm lý. Hệ thống kiểm tra cách chatbot diễn giải lời nói của nhiều nhóm tuổi, ngôn ngữ và nền văn hóa. Việc kiểm tra bao gồm tiếng lóng, lỗi chính tả và ngôn ngữ mã hóa.

Phương pháp này tập trung vào rủi ro phát sinh trong hội thoại tự nhiên. Nó không chỉ kiểm tra những trường hợp người dùng cố tình vượt qua hàng rào an toàn. Theo TechCrunch, Circuit Breaker Labs thực hiện từ hàng chục nghìn đến hàng trăm nghìn tương tác mô phỏng mỗi ngày.

Những cuộc tranh luận về việc AI có thể gây nguy hiểm cho con người thường hướng tới các kịch bản trong tương lai. Tuy nhiên, tác động tâm lý từ chatbot đã trở thành vấn đề hiện hữu, đặc biệt với trẻ em và những người tìm đến AI để được hỗ trợ tinh thần.

Rủi ro không chỉ đến từ người cố tình phá hệ thống

Chatbot có thể tạo ra phản hồi nguy hiểm ngay trong một cuộc trò chuyện bình thường nếu mô hình hiểu sai hàm ý, tiếng lóng hoặc bối cảnh tích lũy qua nhiều lượt trao đổi. Vì vậy, kiểm thử an toàn cần đánh giá cả cách người dùng thực sự giao tiếp, không chỉ các cuộc tấn công có chủ đích.

Động lực thành lập Circuit Breaker Labs đến từ trường hợp của Sewell Setzer. TechCrunch cho biết thiếu niên 14 tuổi này đã hình thành sự gắn bó về cảm xúc với một chatbot của Character.AI. Trước khi tự sát, em từng bày tỏ với chatbot suy nghĩ làm hại bản thân.

Theo TechCrunch, trong đơn kiện năm 2024, cha mẹ của Setzer cáo buộc chatbot đã khuyến khích em. Arul Nigam, đồng sáng lập kiêm giám đốc công nghệ của Circuit Breaker Labs, cho rằng hệ thống có thể không hiểu hàm ý thực sự trong một câu như “Tôi muốn ở bên bạn”.

TechCrunch cũng ghi nhận Character.AI đã dàn xếp một số vụ kiện về cái chết oan sai vào đầu năm 2026. Các vụ kiện do gia đình của những người dùng chưa thành niên khởi xướng sau khi họ chết do tự sát sau các cuộc tương tác với chatbot. Nhiều gia đình khác cũng kiện OpenAI, cáo buộc ChatGPT có liên quan đến tình trạng hoang tưởng và các vụ tự sát của người thân.

Người dùng mô phỏng kiểm tra độ an toàn của AI

Circuit Breaker Labs tạo ra các tác tử AI đóng vai người dùng thuộc nhiều độ tuổi, xuất thân, ngôn ngữ và nền văn hóa. Những tác tử này trò chuyện với mô hình ở quy mô lớn để tìm phản hồi nguy hiểm mà các bài kiểm tra dựa trên mẫu câu chuẩn có thể bỏ sót.

Arul và Shirali Nigam điều hành Circuit Breaker Labs
Hai nhà sáng lập đứng sau phòng kiểm thử AI.

Công ty ví các tác tử như một đội quân hình nộm dùng trong thử nghiệm va chạm. Shirali Nigam, đồng sáng lập kiêm giám đốc điều hành, giải thích rằng cách một bé gái 6 tuổi nói chuyện khác với một người đàn ông 45 tuổi.

Người dùng nói tiếng Anh như ngôn ngữ thứ nhất cũng có cách diễn đạt khác người dùng nói tiếng Anh như ngôn ngữ thứ hai. Tiếng lóng của người chơi trò chơi điện tử tạo thêm một lớp khác biệt.

Theo Shirali Nigam, các mô hình xử lý tốt những mẫu câu chuẩn, trong khi lời nói ngoài đời hiếm khi tuân theo khuôn mẫu đó. Một mô hình không hiểu tiếng lóng hoặc sắc thái có thể phản ứng sai vào lúc người dùng cần được hỗ trợ phù hợp nhất.

Kiểm thử nội dung bằng tiếng lóng, lỗi chính tả và ngôn ngữ mã hóa

Nội dung kiểm thử của Circuit Breaker Labs phản ánh cách con người giao tiếp trong thực tế, gồm tiếng lóng, ngôn ngữ mã hóa và lỗi chính tả. Công ty kết hợp các mẫu giao tiếp này với kiểm thử đối kháng để chủ động tìm điểm yếu trong phản hồi của mô hình.

Circuit Breaker Labs làm việc với các chuyên gia trong từng lĩnh vực để xây dựng những người dùng mô phỏng có hành vi gần với thực tế. Theo TechCrunch, các tác tử thực hiện từ hàng chục nghìn đến hàng trăm nghìn tương tác mô phỏng mỗi ngày.

Quy mô đó cho phép công ty xem xét những rủi ro chỉ xuất hiện sau nhiều cuộc trò chuyện. Một phản hồi riêng lẻ có thể không đáng lo, nhưng bối cảnh tích tụ theo thời gian có thể khiến mô hình đi theo hướng nguy hiểm. Circuit Breaker Labs dùng phương pháp chấm điểm riêng để tạo ra kết quả có thể kiểm tra và giải thích.

Phòng kiểm thử cho các ứng dụng AI rủi ro cao

Circuit Breaker Labs hiện kiểm tra các ứng dụng có nguy cơ ảnh hưởng trực tiếp đến trạng thái tâm lý của người dùng. Những trường hợp được TechCrunch nêu gồm công cụ huấn luyện bằng AI, ứng dụng ghi nhật ký và sản phẩm hỗ trợ sức khỏe tinh thần.

Arul Nigam từ chối tiết lộ tên các khách hàng lớn của công ty. Sản phẩm đã hoạt động, nhưng doanh nghiệp vẫn ở giai đoạn sớm. Theo TechCrunch, Circuit Breaker Labs có 5 nhân viên, gồm Shirali và Arul Nigam.

Biểu trưng TechCrunch Disrupt 2026 nhiều màu
Biểu trưng của sự kiện Disrupt năm 2026.

Về lâu dài, nền tảng có thể được áp dụng cho những ứng dụng khiến người dùng hình thành quan hệ một chiều với chatbot. Nó cũng có thể kiểm tra nguy cơ người dùng sa vào những tương tác gây hại hoặc hình thành quan hệ cận xã hội với chatbot. Phạm vi này có thể bao gồm các tác tử đồng nghiệp vì phản hồi của chúng có thể thay đổi giữa các lần tương tác.

An toàn AI cần thích ứng với ngôn ngữ và văn hóa

Một hàng rào an toàn dùng chung có thể bỏ sót tín hiệu nguy hiểm khi người dùng thuộc các nhóm tuổi hoặc nền văn hóa khác nhau diễn đạt cùng một trạng thái tâm lý theo những cách khác nhau. Viết tắt, lỗi chính tả và cách nói riêng của từng cộng đồng làm bài toán này phức tạp hơn.

Với độc giả Việt Nam, cách tiếp cận của Circuit Breaker Labs cho thấy giới hạn của việc chỉ kiểm tra AI bằng những mẫu câu tiêu chuẩn. Công ty không tuyên bố giải quyết riêng tiếng Việt trong thông tin TechCrunch công bố. Phạm vi được mô tả là kiểm thử trên nhiều ngôn ngữ và nền văn hóa, với các mẫu giao tiếp sát lời nói ngoài đời.

Arul Nigam cho rằng người dùng đang trở nên hoài nghi hơn hoặc không muốn tiếp nhận AI trên diện rộng. Ông xem sự hoài nghi là lành mạnh, nhưng cho rằng việc cấm một công cụ có giá trị tiềm năng chỉ vì lo ngại an toàn là một bước lùi. Circuit Breaker Labs muốn xử lý nguyên nhân của nỗi lo bằng cách làm cho hệ thống an toàn hơn.

Biểu trưng sự kiện công nghệ TechCrunch Disrupt năm 2026
Theo TechCrunch, Disrupt 2026 diễn ra tại San Francisco.

Circuit Breaker Labs sẽ trình bày tại Disrupt 2026

Theo TechCrunch, Circuit Breaker Labs nằm trong danh sách Startup Battlefield 200 năm 2026. Công ty dự kiến trình bày tại Disrupt ở Moscone West, San Francisco, từ ngày 13 đến ngày 15 tháng 10 năm 2026.

Tại Disrupt 2026, Circuit Breaker Labs sẽ thuyết trình trong cuộc thi Startup Battlefield. Công ty phát triển phương pháp kiểm thử nhằm phát hiện khi mô hình hiểu sai sắc thái, tiếng lóng hoặc bối cảnh trong hội thoại tự nhiên.

Hãy tiếp tục theo dõi Sine để cập nhật cách các công ty công nghệ kiểm tra và giảm rủi ro tâm lý của AI.