Kỹ sư đánh giá mô hình AI có phải việc quan trọng nhất?

Kỹ sư đánh giá mô hình AI được tiếp cận sâu vào phòng thí nghiệm để kiểm tra quy trình huấn luyện, hành vi hệ thống và việc tuân thủ cam kết an toàn.

Kỹ sư quan sát hệ thống trí tuệ nhân tạo trong phòng làm việc
Kỹ sư có thể trở thành lớp giám sát AI độc lập.

Nội dung công việc của kỹ sư đánh giá mô hình AI

Kỹ sư đánh giá mô hình AI là chuyên gia độc lập có quyền tiếp cận sâu vào một phòng thí nghiệm. Họ kiểm tra cách phòng thí nghiệm xây dựng, huấn luyện và vận hành hệ thống. Công việc gồm xác minh cam kết an toàn và báo cáo sự cố. Họ cũng đánh giá hành vi của mô hình trong những điều kiện gần với thực tế. Đây là một vai trò an toàn được nhiều lãnh đạo AI ủng hộ, nhưng tài liệu được dẫn chưa đủ để khẳng định đó là công việc quan trọng nhất.

Dario Amodei, Tổng giám đốc Anthropic, đưa ra đề xuất này trong một kế hoạch gồm ba phần. Kế hoạch đề cập đến điều phối dân chủ và hợp tác toàn cầu. Theo The New Stack, Anthropic sẵn sàng đơn phương thực hiện bước đầu tiên. Công ty sẽ cấp quyền tiếp cận liên tục, gần giống quyền của nhân viên, cho các nhóm đánh giá bên thứ ba như METR.

Kỹ sư theo dõi hoạt động của hệ thống AI trên màn hình
Quyền tiếp cận sâu hỗ trợ hoạt động đánh giá độc lập.

Người đánh giá không chỉ xem một mô hình đã vượt qua những bài kiểm tra nào. Họ theo dõi cách phòng thí nghiệm xây dựng, huấn luyện và vận hành mô hình. Họ còn xác minh đội ngũ có thực hiện đúng các biện pháp an toàn đã công bố hay không. Nhu cầu này trở nên rõ hơn khi tác tử AI có thể tự thực hiện nhiều bước công việc. Mức độ tự chủ đó khó được đánh giá bằng một bài kiểm tra đơn lẻ.

Một giám sát viên độc lập ngay trong phòng thí nghiệm

Người đánh giá AI độc lập cần được quan sát hoạt động thường ngày của phòng thí nghiệm, thay vì chỉ tiếp cận một bản trình diễn đã chuẩn bị trước. Amodei so sánh vị trí này với giám sát viên quản lý được cử vào làm việc bên trong ngành ngân hàng.

Sam Altman, Tổng giám đốc OpenAI, mô tả mô hình này là quyền tiếp cận gần giống quyền của nhân viên. Elon Musk công khai đồng tình với hướng đi của Amodei. Demis Hassabis, người sáng lập Google DeepMind, cũng có cùng quan điểm. Mark Zuckerberg cho biết Meta Superintelligence Labs đã sử dụng các đơn vị đánh giá độc lập. Ông cho rằng hệ sinh thái này cần lớn hơn và đa dạng hơn.

Sự đồng thuận xuất hiện trong lúc cuộc đua AI vẫn diễn ra quyết liệt. Nikesh Arora, Chủ tịch kiêm Tổng giám đốc Palo Alto Networks, nhận xét rằng mong muốn giảm tốc có vẻ khó hiểu. Tuy nhiên, quy tắc cạnh tranh có thể giữ nguyên cho tất cả các bên nếu toàn bộ hệ thống cùng chậm lại.

Đối với kỹ sư, đây không chỉ là vấn đề chính sách. Khi AI làm thay đổi sản lượng và chất lượng mã nguồn, người hiểu cách phần mềm được xây dựng có thể kiểm tra hệ thống hành động ra sao sau khi rời môi trường thử nghiệm có kiểm soát.

Mức lương lên tới 687.000 USD đi cùng yêu cầu khắt khe

Một số vị trí đánh giá AI có mức lương cao nhưng đòi hỏi khả năng làm việc độc lập với các vấn đề chưa có quy trình chuẩn. Theo các tin tuyển dụng của METR được The New Stack ghi nhận, mức lương cao nhất cho một số vị trí vào khoảng 687.000 USD.

Mô tả tuyển dụng của METR được The New Stack trích dẫn nêu rõ yêu cầu đối với ứng viên:

“Bạn phải tháo vát, sáng tạo, độc lập và tự định hướng. Công việc còn mới, vì vậy phần lớn vấn đề phải được xử lý ngay trong quá trình làm. Bạn cần giỏi mô hình hóa nguy cơ mất kiểm soát và phân tích các lập luận an toàn.”

Công ty huấn luyện mô hình AI Mercor cũng tuyển các vị trí tương tự với mức lương từ 180.000 đến 300.000 USD. Theo thông tin tuyển dụng được The New Stack dẫn lại, ứng viên cần bằng tiến sĩ hoặc thạc sĩ. Họ cũng cần hơn hai năm kinh nghiệm trong khoa học máy tính, kỹ thuật điện hoặc kinh tế lượng. Một ngành khoa học, công nghệ, kỹ thuật và toán học khác cũng phù hợp nếu cung cấp nền tảng vững về học máy và đánh giá mô hình.

Quyền tiếp cận gần giống nhân viên chưa có chuẩn chung

Quyền tiếp cận của người đánh giá AI hiện phụ thuộc vào từng khách hàng và hợp đồng. Kadan Stadelmann, cố vấn an ninh AI kiêm Giám đốc công nghệ tại Komodo, cho biết phạm vi có thể bị giới hạn chặt hoặc mở rộng tới nhiều phần của hệ thống.

Stadelmann được mời vào các phòng thí nghiệm để kiểm tra nhiều loại rủi ro. Một trong số đó là hành vi của tác tử trong điều kiện gần với thực tế. Công việc có thể gồm giám sát chuỗi suy luận và câu lệnh, cùng việc đặt mục tiêu thử nghiệm. Người đánh giá còn xác định mức độ tự chủ của hệ thống và đo thời gian hoàn thành một nhiệm vụ cụ thể.

Theo Stadelmann, nhiệm vụ quan trọng nhất là kiểm tra xem đội phát triển có tuân thủ những quy trình an toàn mà họ tuyên bố hay không. Vấn đề tương tự xuất hiện trong các cuộc thảo luận về việc nên trao cho AI bao nhiêu quyền trong hoạt động an ninh. Năng lực của hệ thống phải được xem xét cùng cách con người kiểm soát nó.

Chuyên gia kiểm tra quy trình tự động trên màn hình máy tính
Đánh giá AI cần quan sát cả hệ thống và quy trình.

Kỹ năng kỹ thuật có thể quan trọng hơn học vị

Kỹ sư đánh giá mô hình cần hiểu phần mềm, học máy và bảo mật đủ sâu để thiết kế thử nghiệm và nhận ra hành vi bất thường. METR tìm kiếm ứng viên có bằng tiến sĩ, nhưng Stadelmann cho rằng năng lực kỹ thuật đã được chứng minh có thể quan trọng hơn học vị.

Người đánh giá phải có khả năng mô hình hóa nguy cơ mất kiểm soát và phân tích các lập luận an toàn. Kinh nghiệm bảo mật môi trường học máy cũng cần thiết vì quyền tiếp cận sâu có thể cho phép họ nhìn thấy dữ liệu, quy trình và những điểm yếu nhạy cảm.

Khi được hỏi liệu chi phí có tạo thành rào cản đối với các phòng thí nghiệm nhỏ hay không, Stadelmann cho biết một số hoạt động đánh giá được tổ chức phi lợi nhuận bên thứ ba tài trợ. Nguồn tài trợ này giúp duy trì tính độc lập. Tuy nhiên, ông cảnh báo lực lượng đánh giá khó theo kịp các công ty phát triển mô hình tiên tiến lớn. Nếu khoảng cách tiếp tục mở rộng, xã hội vẫn phải phụ thuộc vào chuẩn mực đạo đức nội bộ của chính các công ty phát triển AI.

Điều gì xảy ra khi người đánh giá phát hiện sai lệch?

Giám sát chỉ thực sự độc lập khi người đánh giá có thể báo cáo kết quả bất lợi và chất vấn quyết định triển khai. Dion Johnson, nhà sáng lập kiêm Tổng giám đốc Indie Me, cho rằng vấn đề chính không phải tên chức danh mà là điều sẽ xảy ra khi mô hình hành xử theo cách không ai dự kiến.

Nếu người đánh giá chỉ có thể nêu lo ngại vào lúc thuận tiện cho công ty, cơ chế này sẽ mất tính độc lập. Khi đó, nó chỉ trở thành một tầng thủ tục. Người đánh giá cần được xem những thử nghiệm thất bại và hành vi bất ngờ. Họ cũng cần biết những điểm mà nhóm phát triển vẫn chưa chắc chắn. Quyền tiếp cận phải bao gồm thông tin về quá trình huấn luyện, thay vì chỉ các bản trình diễn hoàn chỉnh.

Johnson mô tả phẩm chất ông tìm kiếm ở một người đánh giá:

“Tôi sẽ tìm một người thật sự thoải mái khi đối diện với điều chưa chắc chắn, nhưng rất khó chịu với việc giả vờ biết điều mình không biết.”

Theo Johnson, người phù hợp cần có chiều sâu kỹ thuật và kinh nghiệm bảo mật môi trường học máy. Họ cũng cần có nền tảng công nghệ phần mềm. Người đánh giá phải đủ phán đoán để nói rằng bằng chứng chưa thuyết phục. Điều đó vẫn cần thiết khi họ làm việc với những chuyên gia hàng đầu ngay trong ngày ra mắt mô hình.

Vì sao các lãnh đạo AI cùng kêu gọi giám sát độc lập?

Nhiều lãnh đạo AI đã công khai đồng tình với hướng đi của Amodei về đánh giá độc lập. Đề xuất của Amodei xuất hiện sau cảnh báo từ Jacob Coxon, cựu chuyên gia nghiên cứu tiền huấn luyện tại OpenAI và Anthropic.

Theo số liệu The New Stack ghi nhận, bài đăng ngày 8 tháng 9 của Coxon được xem 172 triệu lần. Coxon nói cảnh báo của ông không phải một màn quảng bá. Ông cho rằng nhiều lãnh đạo và nhà nghiên cứu cấp cao dùng ngôn từ thận trọng trước công chúng nhưng bày tỏ nỗi sợ rõ ràng hơn trong trao đổi riêng.

Coxon viết rằng những người xây dựng AI thực sự tin công nghệ này có thể khiến toàn bộ nhân loại thiệt mạng vào cuối thập niên. Nhận định đó giúp giải thích vì sao lãnh đạo của nhiều phòng thí nghiệm cạnh tranh trực tiếp vẫn đồng tình rằng cần thêm một lớp đánh giá độc lập.

Quyền tiếp cận của người đánh giá thay đổi theo từng khách hàng và các điều khoản được thống nhất trước khi công việc bắt đầu. Đề xuất của Amodei xác định một yêu cầu cụ thể. Người đánh giá phải đứng đủ gần để hiểu hệ thống, nhưng vẫn đủ độc lập để báo cáo điều đội phát triển không muốn nghe.

Nếu bạn đang làm công nghệ phần mềm hoặc an ninh AI, hãy theo dõi sự hình thành của nghề đánh giá mô hình để biết những kỹ năng nào sẽ cần thiết khi các hệ thống tự chủ được trao thêm quyền.