Tác tử AI đang đốt token cho lựa chọn không cần lời

Kev tách các lựa chọn có giới hạn khỏi quá trình sinh văn bản, giúp tác tử AI tránh dùng token để viết rồi phân tích những câu trả lời không cần thiết.

Minh họa tác tử AI xử lý nhiều lựa chọn trong một quy trình tính toán
Tách quyết định khỏi quá trình sinh văn bản

Phát hiện chính

Nhiều tác tử AI đang tốn token để tạo văn bản cho những bước chỉ cần chọn một phương án hoặc trả về xác suất. Theo The New Stack, Kev loại bỏ vòng sinh văn bản bằng cách tiếp nhận trạng thái, câu hỏi và phương án trong một lượt, sau đó chấm điểm từng lựa chọn.

Nội dung

Một tác tử AI thường đưa ra nhiều quyết định trước khi tạo câu trả lời cho người dùng. Tác tử có thể chọn công cụ, xếp hạng kết quả, kiểm tra an toàn hoặc chuyển nhiệm vụ cho hệ thống khác. Những bước này không nhất thiết cần đầu ra bằng ngôn ngữ tự nhiên.

Dù vậy, nhiều hệ thống vẫn gửi từng quyết định vào mô hình sinh. Hệ thống chờ mô hình viết câu trả lời rồi phân tích văn bản để lấy lại lựa chọn cần thiết. Quá trình vòng quanh này tiêu tốn token và thời gian tính toán. The New Stack dẫn công bố của các nhà nghiên cứu OpenAI. Việc vận hành khối lượng công việc tác tử từng tiêu tốn 7.000 USD mỗi ngày.

Kev bỏ qua bước sinh văn bản như thế nào

Kev là một họ mô hình quyết định mở, được xây dựng trên Qwen 3.5 để chấm điểm các phương án mà không giải mã câu trả lời theo từng token. Jared Palmer phát hành thế hệ mới với ba phiên bản gồm 0,8 tỷ, 4 tỷ và 9 tỷ tham số.

Kev chỉ thực hiện giai đoạn nạp trước. Mô hình tiếp nhận trạng thái, câu hỏi và các phương án trong một lượt truyền thẳng. Một đầu trỏ đọc kết quả và phân bổ xác suất cho những phương án đã được cung cấp, không cần vòng giải mã tự hồi quy.

Minh họa tác tử AI xử lý nhiều lựa chọn trong một quy trình tính toán
Kev chấm điểm các phương án trong một lượt

Cách tiếp cận này hỗ trợ ba loại quyết định. Noul xử lý câu hỏi có hoặc không, Choice chọn một phương án trong danh sách, còn Score đánh giá theo các mức có thứ tự. Ba dạng này tương ứng với giao diện lập trình System One của TypeSafe.

Trong một quyết định định tuyến công cụ, Kev có thể trả về kết quả như sau:

tìm kiếm: 0,82
cơ sở dữ liệu: 0,13
máy tính: 0,05

Kev vẫn có thể chọn sai công cụ. Vì mô hình chỉ chấm điểm những phương án nhận được, Kev không thể tự thêm một lựa chọn ngoài danh sách. Việc định tuyến, xếp hạng, kiểm tra an toàn và chuyển cấp có thể nằm ở tầng quyết định, còn mô hình lớn hơn tập trung vào suy luận mở và câu trả lời cuối cùng.

Sự phân chia này cũng áp dụng cho cách một tác tử AI viết mã hoạt động. Phần chọn công cụ có thể dùng một cơ chế quyết định giới hạn, trong khi phần sửa mã vẫn cần mô hình có khả năng tạo nội dung.

Nhiều lựa chọn trong một lượt xử lý

Kev có thể đánh giá nhiều câu hỏi dựa trên cùng một trạng thái trong một lượt truyền thẳng. Mặt nạ chú ý nhân quả theo khối tách các câu hỏi, còn đầu trỏ chấm điểm độc lập từng nhóm phương án.

Theo tài liệu của Palmer được The New Stack dẫn lại, mô hình 4 tỷ tham số xử lý ba câu hỏi trong 277 mili giây. Thử nghiệm dùng định dạng bf16 trên M5. Chưa có phép so sánh được kiểm soát với Qwen khi sinh câu trả lời tương đương trên cùng phần cứng. Vì vậy, kết quả chưa cho biết Kev nhanh hơn bao nhiêu trong thực tế.

Khả năng dùng chung ngữ cảnh cho nhiều quyết định có thể hữu ích khi vòng lặp tác tử trở nên phức tạp. Bỏ bước sinh văn bản không đồng nghĩa quyết định sẽ chính xác hơn.

Minh họa tác tử AI xử lý nhiều lựa chọn trong một quy trình tính toán
Nhiều quyết định dùng chung một ngữ cảnh

Độ chính xác không nói hết mức độ tin cậy

Kev-9B đạt độ chính xác 83,7% trong bài kiểm tra ngoài miền đã được khóa của dự án, theo thẻ mô hình Kev-9B của Jared Palmer. Đây là kết quả do nhà phát triển báo cáo, không phải một phép đánh giá độc lập.

Xác suất do Kev trả về không phải lúc nào cũng phản ánh đúng mức độ tin cậy của kết quả. Palmer nhận thấy hiệu chỉnh nhiệt độ có thể lệch khi mô hình gặp phân phối nguồn chưa từng thấy. Đây là hạn chế quan trọng với tác tử dùng ngưỡng xác suất để thực thi hành động hoặc chuyển cấp. Một lựa chọn có xác suất cao vẫn có thể sai.

Tinh chỉnh còn làm thay đổi một số năng lực kế thừa từ mô hình nền. Các đánh giá của Palmer ghi nhận mức suy giảm trong bài kiểm tra kiến thức phổ thông và số học, rõ hơn ở những mô hình nhỏ. Kết quả này phù hợp với vai trò chuyên biệt của Kev bên cạnh một mô hình đa dụng.

Hiệu quả trong môi trường tác tử thay đổi liên tục còn phụ thuộc vào khả năng xử lý công cụ và lựa chọn. Các nhãn đó có thể chưa xuất hiện trong dữ liệu huấn luyện. Không phải mọi lỗi đều bắt nguồn từ mô hình. Quá trình vận hành hạ tầng AI cũng có thể tạo ra sự cố ở các tầng khác.

Kev mở, nhưng cách tiếp cận không hoàn toàn mới

Kev dùng cùng ba dạng quyết định Noul, ChoiceScore đã xuất hiện trong Jev của TypeSafe. Kev cũng triển khai định dạng yêu cầu và phản hồi /v1/systemone, cho phép ứng dụng viết cho giao diện System One trỏ tới một máy chủ Kev cục bộ.

Khác biệt chính nằm ở mức độ mở. Palmer phát hành Kev theo giấy phép Apache 2.0, kèm trọng số mô hình, mã huấn luyện và công cụ đánh giá. Nhà phát triển có thể chạy hoặc huấn luyện mô hình trên hạ tầng của mình.

Trọng số và dữ liệu huấn luyện của Jev không được công khai. Việc so sánh trực tiếp vì thế gặp khó khăn do chưa thể tách ảnh hưởng của kiến trúc, kích thước mô hình và dữ liệu huấn luyện.

Khi nào cần thêm một mô hình quyết định

Kev phù hợp với các bước chỉ cần lựa chọn hoặc xác suất. Điều này đặc biệt đúng khi tác tử liên tục định tuyến, xếp hạng, kiểm tra an toàn, chọn công cụ và chuyển cấp. Với ứng dụng chỉ có vài quyết định giới hạn, giải mã có ràng buộc trên mô hình đang chạy có thể đơn giản hơn. Khi đó, hệ thống không cần bổ sung một mô hình khác.

Khi một bước chỉ cần lựa chọn hoặc xác suất, Kev có thể xử lý trực tiếp. Mô hình sinh lớn hơn được dành cho công việc cần suy luận mở và tạo câu trả lời cho người dùng. Cách phân công này không bảo đảm quyết định tốt hơn, nhưng loại bỏ việc viết rồi đọc lại một đoạn văn bản mà hệ thống không cần.

Nếu đang xây dựng tác tử AI, hãy rà lại từng bước chọn công cụ hoặc chuyển cấp để xác định bước nào thực sự cần sinh văn bản.