Liên Hợp Quốc nhờ Google chuẩn bị dữ liệu cho tác tử AI

Liên Hợp Quốc và Google xây dựng UN System Data Commons để con người và tác tử AI truy vấn dữ liệu thống kê chính thức, có thể kiểm tra nguồn.

Giao diện tra cứu thống kê trên UN System Data Commons
Nền tảng dữ liệu chung mới của Liên Hợp Quốc

Liên Hợp Quốc đang hợp tác với Google để đưa dữ liệu thống kê chính thức vào một hệ thống mới. Con người và tác tử AI có thể truy vấn hệ thống này bằng ngôn ngữ tự nhiên. Nền tảng UN System Data Commons hỗ trợ kết nối trực tiếp với AI. Nền tảng cũng giữ thông tin về cơ quan đã công bố từng số liệu để người dùng kiểm tra nguồn.

Theo bài viết gốc của TechCrunch, hệ thống mới thay thế cổng UNData. Trước đây, người dùng chủ yếu phải duyệt và tìm số liệu qua giao diện cơ sở dữ liệu truyền thống. Hệ thống mang tên UN System Data Commons. Nền tảng này được xây dựng trên mã nguồn mở Data Commons của Google.

Dữ liệu của Liên Hợp Quốc được chuẩn bị cho tác tử AI

UN System Data Commons cho phép tác tử AI truy vấn dữ liệu bên ngoài mô hình và kiểm tra nguồn gốc của từng kết quả. Hệ thống sử dụng Giao thức Bối cảnh Mô hình, thường được gọi tắt là MCP, để kết nối các ứng dụng AI với dữ liệu thống kê chính thức.

Khả năng lưu dấu nguồn giúp người dùng lần ngược một số liệu tới cơ quan Liên Hợp Quốc đã công bố thông tin ban đầu. João Pedro Azevedo, trưởng bộ phận thống kê của UNICEF, cho rằng khả năng truy xuất nguồn ngày càng quan trọng khi nhiều người dùng AI để tìm và diễn giải thông tin.

Shantanu Mukherjee, quyền giám đốc Ban Thống kê Liên Hợp Quốc, cho biết hệ thống mới mở rộng đáng kể về quy mô, phạm vi và độ linh hoạt. Đây cũng là lần đầu dữ liệu từ nhiều cơ quan trong toàn hệ thống được kết nối. Theo Liên Hợp Quốc, 26 đơn vị đã cam kết tham gia Data Commons. Dữ liệu của gần 20 đơn vị đã có mặt khi nền tảng ra mắt. Tổ chức đặt mục tiêu đưa 80% bộ dữ liệu thống kê của hệ thống lên nền tảng vào năm 2027.

Thử nghiệm cho thấy mô hình AI vẫn trả lời thiếu chính xác

Kết nối trực tiếp với dữ liệu chính thức nhằm khắc phục một hạn chế đã được UNICEF đo lường: các mô hình AI thường không trả lời chính xác câu hỏi về chỉ số phát triển toàn cầu. Trong thử nghiệm gồm hơn 133.000 câu trả lời, sáu mô hình đạt độ chính xác trung bình 21,2%.

Theo Azevedo, UNICEF đã đánh giá GPT-4o, GPT-4o-mini, Claude Sonnet 4.5, Claude Haiku 4.5, Gemini 2.5 Flash và Gemini 2.0 Flash. Khoảng ba trong năm câu trả lời không đưa ra được con số có thể sử dụng, thường do mô hình trả lời dè dặt.

UNICEF cũng đặt lại cùng câu hỏi cho đúng các phiên bản mô hình đó sau khoảng hai ngày. Trong số các mô hình đưa ra con số ở cả hai lần, kết quả chỉ trùng nhau trong khoảng một nửa trường hợp.

Nghiên cứu hiện là tài liệu làm việc của UNICEF, đang được chuẩn bị để gửi tới tạp chí và chưa trải qua bình duyệt. UNICEF dự kiến công bố phương pháp, mã nguồn và dữ liệu cùng bài nghiên cứu.

Lưu lượng từ trợ lý AI đang tăng nhanh

Trợ lý AI đã trở thành một nguồn truy cập đáng kể đối với dữ liệu của UNICEF. Từ ngày 1 tháng 1 đến ngày 14 tháng 9, số lượt truy cập từ liên kết trong câu trả lời của ChatGPT tăng 67% so với cùng kỳ năm trước. Nguồn truy cập này chiếm 6,4% tổng số phiên trong năm.

Theo số liệu Azevedo cung cấp cho TechCrunch, trang dữ liệu của UNICEF nhận hơn sáu triệu lượt truy cập mỗi tháng và là một trong những trang phổ biến nhất của cơ quan này. UNICEF ước tính các trợ lý AI nói chung hiện mang lại khoảng một trong 10 lượt truy cập.

Những con số này cho thấy trợ lý AI đang trở thành một kênh truy cập ngày càng đáng kể đối với dữ liệu công. Cách máy móc truy cập dữ liệu cũng liên quan trực tiếp đến cách tác tử AI tạo và kết hợp sản phẩm số. Khi nguồn dữ liệu có cấu trúc và có thể truy xuất, tác tử không phải dựa hoàn toàn vào nội dung đã được ghi nhớ trong mô hình.

Google hỗ trợ hạ tầng, Liên Hợp Quốc giữ quyền quản trị

Google hỗ trợ tài chính và kỹ thuật, còn Liên Hợp Quốc quản trị hệ thống dữ liệu. Theo TechCrunch, Google.org cung cấp 2 triệu USD để xây dựng năng lực và hỗ trợ kỹ thuật cho hạ tầng cốt lõi của UN System Data Commons.

Prem Ramaswamy, người phụ trách nhóm Data Commons của Google, cho biết hệ thống được lưu trữ trên một phiên bản do Liên Hợp Quốc quản trị. Mục tiêu dài hạn là để Liên Hợp Quốc tự duy trì, vận hành và mở rộng nền tảng. Cách tiếp cận đào tạo người hướng dẫn giúp đội ngũ Liên Hợp Quốc nhanh chóng nâng cao năng lực, hướng tới tự duy trì, vận hành và mở rộng nền tảng.

Google ra mắt Data Commons vào năm 2018 nhằm tổ chức dữ liệu công từ nhiều nguồn theo một khuôn khổ chung. Nền tảng bổ sung hỗ trợ MCP vào năm ngoái, cho phép tác tử AI truy vấn trực tiếp số liệu và nguồn gốc của chúng. Lớp kết nối này có thể bổ sung cho hạ tầng AI và cách hệ thống vận hành khi ứng dụng cần dữ liệu cập nhật từ bên ngoài mô hình.

Nội dung đầu ra: từ một câu hỏi đến biểu đồ và bản phân tích

Một hệ thống AI kết nối với dữ liệu Liên Hợp Quốc qua MCP có thể lấy nhiều chỉ số để tạo bảng điều khiển, biểu đồ và phần phân tích bằng văn bản. Cách tiếp cận này giảm việc người dùng phải tự tìm từng bộ dữ liệu rồi ghép chúng lại.

Trong một phần trình diễn, Google yêu cầu hệ thống đánh giá tác động của Kế hoạch Cứu trợ Khẩn cấp của Tổng thống Mỹ về phòng, chống AIDS tại châu Phi. Hệ thống tìm các số liệu liên quan của Liên Hợp Quốc. Các số liệu gồm số ca nhiễm HIV, tỷ lệ tử vong do AIDS và tuổi thọ. Sau đó, hệ thống dùng chúng để tạo một đồ họa thông tin.

Kết quả do AI tạo ra không phải là kết luận chính thức của Liên Hợp Quốc. Ramaswamy cảnh báo mô hình có thể hiểu sai sắc thái của dữ liệu, vì vậy con người phải kiểm tra đầu ra trước khi trích dẫn hoặc xuất bản.

Hãy tiếp tục theo dõi Sine để cập nhật cách dữ liệu chính thức đang thay đổi hoạt động của tác tử AI.