
Vals muốn xây dựng một chuẩn đánh giá AI dựa trên khả năng hoàn thành công việc thực tế. Cách này thay thế việc chỉ đo kiến thức qua các bộ câu hỏi công khai. Công ty giữ kín nội dung kiểm tra và đánh giá nhiệm vụ trong luật, tài chính và lập trình. Vals cũng phân tích rủi ro khi mô hình được triển khai rộng rãi.
Cách tiếp cận này nhằm giải quyết một điểm yếu của các bài kiểm tra AI truyền thống. Nhà phát triển có thể huấn luyện mô hình trực tiếp trên những câu hỏi đã được công bố. Theo TechCrunch, Vals xác minh liệu mô hình có thực sự làm được điều doanh nghiệp quảng cáo hay không.
Nội dung: Vals chuyển trọng tâm sang đánh giá công việc thực tế
Vals được thành lập năm 2024 để xây dựng các bài kiểm tra theo kịp năng lực của mô hình AI hiện đại. Trong chưa đầy hai năm, công ty hoàn tất vòng vốn hạt giống do 8VC và Bloomberg Beta dẫn dắt. Sau đó, Vals huy động 40 triệu USD trong vòng gọi vốn hạng A do Andreessen Horowitz dẫn dắt.
Đồng sáng lập Rayan Krishnan, 25 tuổi, từng thực tập tại Palantir. Khi học tại Stanford, ông làm việc cho Microsoft và phòng thí nghiệm trí tuệ nhân tạo của trường. Krishnan cho biết các bài kiểm tra học thuật ngày càng tụt lại phía sau. Tốc độ phát triển của mô hình AI đã dẫn ông đến ý tưởng thành lập Vals.
Các mô hình mới liên tục mở rộng giới hạn năng lực. Trong khi đó, nhiều thước đo cũ không còn phản ánh đầy đủ khả năng này. Theo Krishnan, AI đang được đưa vào nhiều lĩnh vực. Vì vậy, bài kiểm tra cần xác minh liệu mô hình có hoàn thành nhiệm vụ mà nhà phát triển tuyên bố hay không.
Vì sao Vals không công khai đề kiểm tra
Vals giữ kín tài liệu kiểm tra để giảm nguy cơ nhà phát triển đưa câu hỏi vào dữ liệu huấn luyện. Nếu mô hình đã tiếp xúc với đề trước khi được đánh giá, điểm số có thể phản ánh khả năng ghi nhớ thay vì năng lực xử lý một nhiệm vụ mới.
Vals không chỉ kiểm tra lượng kiến thức tổng quát. Công ty xem xét cách mô hình giải quyết những nhiệm vụ phức tạp trong luật, tài chính và lập trình. Mục tiêu là xác định đầu ra có đạt chất lượng tương đương sản phẩm do con người tạo ra hay không. Việc đánh giá được thực hiện riêng trong từng lĩnh vực.
Cách đánh giá này cũng áp dụng cho cách tác tử AI xử lý công việc lập trình, nơi chất lượng đầu ra và khả năng hoàn thành nhiệm vụ quan trọng hơn điểm số trên một bộ câu hỏi cố định.
Vals đánh giá cả năng lực và hậu quả của AI
Vals không chỉ đo kết quả tích cực của mô hình. Công ty còn nghiên cứu những hậu quả có thể xuất hiện khi AI được triển khai rộng rãi mà thiếu cơ chế kiểm soát phù hợp.
Theo Krishnan, Vals đã xây dựng bài kiểm tra về khả năng tự cải thiện lặp lại của mô hình. Công ty cũng nghiên cứu sức khỏe tâm thần, an ninh mạng và an toàn sinh học. Một hướng khác là luật xung đột vũ trang, bao gồm cách mô hình áp dụng Công ước Geneva.
Phạm vi này cho thấy đánh giá AI không chỉ là so sánh điểm số. Kết quả kiểm tra giúp nhận diện rủi ro khi mô hình được triển khai rộng rãi, một vấn đề cũng xuất hiện trong các cuộc thảo luận về quyền hạn của AI trong hoạt động an ninh.
Vì sao doanh nghiệp trả tiền để tìm điểm yếu của mô hình
Khách hàng trả tiền cho Vals để kiểm tra chính mô hình của họ. Họ vẫn làm vậy ngay cả khi kết quả cho thấy sản phẩm chưa hoạt động như kỳ vọng. Một phép đo ổn định giúp doanh nghiệp xác định lỗi và theo dõi tiến bộ. Kết quả cũng hỗ trợ quyết định liệu mô hình đã phù hợp để triển khai hay chưa.
Krishnan so sánh mô hình doanh thu này với việc học sinh trả phí cho College Board để dự kỳ thi SAT. Bài đánh giá không bảo đảm kết quả tốt, nhưng cung cấp một thước đo phục vụ quá trình ra quyết định.
Đối với doanh nghiệp đang cân nhắc mua hoặc triển khai AI, kết quả đánh giá độc lập có thể trở thành căn cứ lựa chọn.
Vals tăng doanh thu và mở rộng đội ngũ
Theo số liệu do Vals công bố và được TechCrunch dẫn lại, doanh thu hiện tại của công ty cao gấp tám lần năm trước. Đội ngũ tăng từ tám người vào đầu năm lên 25 người. Vals dự định tuyển thêm từ 10 đến 15 nhân sự.
Krishnan cho biết công ty cũng sẽ chuyển sang một văn phòng lớn hơn. Bên cạnh khách hàng doanh nghiệp, Vals đã ra mắt một chương trình hướng tới việc cung cấp dịch vụ đánh giá mô hình cho các cơ quan liên bang Mỹ.
Đánh giá độc lập có thể trở thành hạ tầng niềm tin
Krishnan cho rằng các phép đánh giá như của Vals có thể định hướng cách doanh nghiệp phát triển AI. Chúng cũng có thể hỗ trợ việc xây dựng niềm tin với công chúng. Khi mô hình giữ vai trò lớn hơn trong nền kinh tế, kết quả kiểm tra có thể ảnh hưởng đến quyết định sử dụng. Hồ sơ công bố và kế hoạch đầu tư cũng có thể dựa vào những kết quả này.
Ông dẫn việc SpaceX đã niêm yết, Anthropic dự kiến thực hiện điều này vào cuối năm và OpenAI có thể sớm đi theo hướng tương tự. Đây là nhận định của Krishnan được TechCrunch ghi lại, không phải lịch trình đã được các công ty xác nhận trong bài viết.
Tham vọng của Vals là biến đánh giá độc lập thành một chuẩn chung đủ sát với công việc thực tế. Nếu đạt mục tiêu đó, nhà phát triển, khách hàng và nhà đầu tư sẽ có thêm cơ sở đánh giá mô hình. Họ có thể xác định mô hình làm được gì, thất bại ở đâu và có thể tạo ra rủi ro nào.
Hãy tiếp tục theo dõi Sine để cập nhật cách các công ty AI xây dựng thước đo năng lực và niềm tin cho thế hệ mô hình mới.


