Tác tử chỉ tốt khi hạ tầng đủ tốt

Tác tử AI chỉ ổn định khi hạ tầng xử lý được cả chuỗi suy luận, gọi công cụ, thời gian chờ và các đợt tải tăng đột ngột.

Hệ thống máy chủ vận hành các tác tử trí tuệ nhân tạo
Hạ tầng quyết định hiệu quả của tác tử

Tác tử AI chỉ vận hành ổn định khi hạ tầng xử lý được toàn bộ chuỗi tác vụ. Chuỗi này gồm suy luận, gọi công cụ, chờ kết quả rồi tiếp tục thực thi. Chất lượng mô hình không thể bù cho độ trễ tích lũy hoặc lỗi ở công cụ bên ngoài. Nó cũng không thể khắc phục tải tăng đột ngột hay cách phân bổ tài nguyên không phù hợp. Vì vậy, hiệu năng của tác tử phải được đo trên cả quy trình, không chỉ trên một lần gọi mô hình.

Theo The New Stack, một tác tử rà soát mã có thể đọc phần thay đổi và tìm các vị trí sử dụng liên quan trong kho mã. Nó còn có thể chạy bộ kiểm thử, kiểm tra trạng thái tích hợp liên tục và soạn nhận xét trước khi kỹ sư đọc xong phần thay đổi.

Vấn đề xuất hiện khi cùng năm bước ấy chạy phía sau hàng loạt lượt rà soát khác trong một giờ. Có lượt hoàn tất trong vài giây, nhưng cũng có lượt phải chờ nhiều phút vì bước kiểm thử rơi vào một máy đang xử lý đợt tải tăng từ tác tử khác. Tác tử không thay đổi. Môi trường thực thi quyết định thời gian phản hồi có ổn định hay không.

Đây là lý do doanh nghiệp cần hiểu đúng cách hạ tầng trí tuệ nhân tạo vận hành khi chuyển từ thử nghiệm sang triển khai thật. Với ứng dụng tác tử, hạ tầng ảnh hưởng trực tiếp đến độ trễ, độ tin cậy và chi phí nhiều hơn so với một hệ thống trò chuyện đơn giản.

Tác tử khác trợ lý trò chuyện như thế nào?

Trợ lý trò chuyện thường thực hiện một lần suy luận cho mỗi tin nhắn, còn tác tử điều hành một quy trình gồm nhiều lần suy luận và tương tác với hệ thống bên ngoài. Mỗi kết quả có thể mở ra một bước mới, làm tăng số yêu cầu, độ dài ngữ cảnh và số điểm có thể gây chậm hoặc lỗi.

  • Một trợ lý trò chuyện thường thực hiện một lần suy luận cho mỗi tin nhắn. Mô hình nhận yêu cầu, tạo câu trả lời rồi chờ người dùng gửi nội dung tiếp theo.
  • Tác tử xử lý cả một quy trình. Từ một yêu cầu, nó có thể tìm tài liệu, truy xuất cơ sở dữ liệu, gọi giao diện lập trình ứng dụng, thực thi mã, đánh giá kết quả rồi lặp lại trước khi đưa ra câu trả lời.

Mỗi quyết định có thể kích hoạt thêm một lần suy luận. Kết quả từ công cụ bên ngoài lại trở thành ngữ cảnh cho bước kế tiếp. Cơ chế này giải thích vì sao một tác tử trí tuệ nhân tạo viết mã cần nhiều hơn một mô hình có khả năng tạo mã tốt.

Nội dung một câu hỏi có thể mở ra cả chuỗi tác vụ

Một yêu cầu gửi đến tác tử có thể trở thành chuỗi tác vụ gồm nhiều lần gọi mô hình, cơ sở dữ liệu, giao diện lập trình ứng dụng và công cụ thực thi. Hệ thống vì thế phải duy trì trạng thái và ngữ cảnh trong khi chờ từng thành phần hoàn tất, thay vì chỉ tối ưu một yêu cầu suy luận riêng lẻ.

Một yêu cầu được xử lý qua nhiều bước

Giả sử bạn hỏi tác tử vì sao độ trễ của bước thanh toán tăng mạnh trong đêm. Tác tử có thể lấy nhật ký triển khai, truy vấn hệ thống giám sát và kiểm tra nhóm kết nối cơ sở dữ liệu. Sau đó, nó cân nhắc nguyên nhân nằm ở bản triển khai lỗi hay thiếu năng lực xử lý. Toàn bộ kết quả được đưa vào một lần suy luận khác trước khi tác tử trả lời.

Mô hình luân phiên giữa suy luận và tương tác với hệ thống bên ngoài. Mỗi bước suy luận tạo thêm một yêu cầu mới, còn kết quả từ công cụ tiếp tục làm ngữ cảnh dài hơn. Độ trễ và độ tin cậy của câu trả lời cuối cùng phụ thuộc vào mọi thành phần tham gia.

Độ tin cậy phải được tính trên toàn bộ chuỗi

Độ tin cậy của tác tử là độ tin cậy từ đầu đến cuối của cả chuỗi, không phải riêng mô hình. Vì các bước thường phụ thuộc tuần tự, một công cụ chậm hoặc không ổn định có thể trì hoãn mọi bước phía sau dù tốc độ tạo nội dung của mô hình vẫn cao.

Một bước chậm ảnh hưởng cả quy trình

The New Stack nêu ví dụ một truy vấn cơ sở dữ liệu mất hai giây. Trong khoảng đó, mô hình chưa thể bắt đầu bước suy luận tiếp theo. Tốc độ tạo nội dung của mô hình không bù được thời gian chờ cơ sở dữ liệu, giao diện lập trình ứng dụng hoặc công cụ kiểm thử.

Máy chủ xử lý chuỗi tác vụ của tác tử trí tuệ nhân tạo
Mỗi bước phụ thuộc vào hạ tầng thực thi

“Mọi mắt xích đều phải hoạt động ổn định vì cả chuỗi chỉ mạnh bằng mắt xích chậm nhất.”

Tóm lược lập luận của The New Stack

Ngăn xếp suy luận phải điều phối nhiều lần gọi mô hình phụ thuộc lẫn nhau cùng các công cụ bên ngoài. Quy trình càng dài, hạ tầng càng có ảnh hưởng lớn đến tốc độ, độ ổn định và chi phí vận hành.

Người dùng không nhìn thấy lỗi điều phối bên trong. Họ chỉ thấy tác tử bị treo hoặc bỏ cuộc. Chất lượng mô hình vì thế chưa đủ bảo đảm độ tin cậy từ đầu đến cuối. Hạ tầng phải cấp đúng tài nguyên cho từng bước, kể cả khi tải hệ thống tăng lên.

Vì sao hiệu năng và hóa đơn khó đoán?

Hiệu năng và chi phí của tác tử khó dự đoán vì tải không tăng theo một nhịp đều. Quy trình có thể dừng để chờ công cụ bên ngoài, sau đó nhiều tác tử cùng hoạt động trở lại và cần tài nguyên suy luận trong một khoảng thời gian ngắn.

Phần lớn dịch vụ suy luận và cách tính giá đi kèm được xây dựng quanh lưu lượng tương đối đều. Khi số người dùng tăng, lượng yêu cầu tăng theo và hệ thống bổ sung năng lực xử lý thông qua tự động mở rộng, cân bằng tải và hoạch định dung lượng.

Nhịp chờ và đợt tải tăng

Tải từ tác tử không đi theo nhịp đó. Một quy trình có thể tạm dừng để chờ hệ thống bên ngoài rồi đồng loạt hoạt động trở lại ngay khi nhận được kết quả.

  • Trong lúc chờ, tác tử đợi giao diện lập trình ứng dụng hoặc cơ sở dữ liệu, nên bộ xử lý đồ họa không có tác vụ suy luận để thực hiện và ngữ cảnh đã tích lũy có thể bị đẩy khỏi bộ nhớ.
  • Khi kết quả trở về, nhiều quy trình có thể tiếp tục cùng lúc, khiến nhu cầu đối với bộ xử lý đồ họa tăng nhanh trong thời gian ngắn và buộc mỗi quy trình xử lý lại toàn bộ ngữ cảnh đã tích lũy.

Biểu đồ sử dụng bộ xử lý đồ họa khi đó giống nhịp tim hơn là một đường tải đều. Mức sử dụng nằm ngang trong thời gian chờ rồi tăng vọt khi công cụ trả kết quả. Nếu hạ tầng được cấp theo mức tải trung bình thay vì đỉnh tải, độ trễ ở nhóm yêu cầu chậm nhất có thể tăng mạnh.

Hạ tầng cũ khó hấp thụ tải biến động

Dịch vụ suy luận được thiết kế cho dòng yêu cầu ổn định sẽ khó phân bổ tài nguyên hiệu quả trước kiểu tải này. Hệ quả có thể là độ trễ thiếu nhất quán, bộ xử lý đồ họa không được khai thác hết hoặc chi phí vận hành cao hơn dự kiến.

Cụm máy chủ đáp ứng tải suy luận tăng đột ngột
Hạ tầng phải hấp thụ các đợt tải tăng

Khi hiệu năng biến động hoặc hóa đơn không khớp với dự tính, vấn đề có thể nằm ở chỗ hạ tầng được xây cho một loại tải khác. Việc đánh giá chi phí phải xét toàn bộ quy trình thực thi, thay vì chỉ nhìn vào một lần gọi mô hình.

Hạ tầng dành cho tác tử cần đáp ứng điều gì?

Hạ tầng dành cho tác tử phải duy trì hiệu năng trên chuỗi phụ thuộc dài, mở rộng theo các đợt tải đột ngột và kiểm soát chi phí khi quy trình liên tục thay đổi. Mục tiêu là làm cho độ trễ, độ tin cậy và chi phí có thể dự đoán được trong suốt vòng đời của tác vụ.

  • Hiệu năng phải ổn định trên toàn chuỗi, để độ trễ không biến động mạnh khi quy trình thực hiện nhiều lần gọi mô hình và công cụ.
  • Khả năng mở rộng phải theo kịp tải tăng đột ngột, nhưng không buộc doanh nghiệp duy trì toàn bộ dung lượng trong thời gian tác tử đang chờ.
  • Chi phí cần phản ánh mức sử dụng thực tế, kể cả khi tải không đều và mỗi quy trình tích lũy lượng ngữ cảnh khác nhau.

Mục tiêu là khả năng dự đoán

Hạ tầng phù hợp không làm tải tăng đột ngột biến mất. Một đợt hoạt động đồng thời đủ lớn hoặc một quy trình tích lũy nhiều ngữ cảnh trước khi tạm dừng vẫn tiêu tốn tài nguyên. Mục tiêu không phải đưa chi phí hay giới hạn về không, mà là khiến cả hai có thể dự đoán được.

Tác tử chỉ vận hành tốt khi hạ tầng giữ được độ phản hồi, độ tin cậy và chi phí trong suốt chuỗi công việc, không chỉ ở lần suy luận đầu tiên.

Hãy rà soát hạ tầng theo toàn bộ vòng đời của tác tử trước khi mở rộng quy mô triển khai.