Mô hình giọng nói OpenAI không trực tiếp xử lý suy luận phức tạp

GPT-Live-1 tách hội thoại thời gian thực khỏi suy luận để giảm độ trễ, nhưng buộc ứng dụng tự chuyển ngữ cảnh, quản lý công cụ và hủy tác vụ cũ.

Người dùng tương tác với một hệ thống hội thoại bằng giọng nói
Hội thoại thời gian thực đòi hỏi phản hồi nhanh.

Mô hình giọng nói OpenAI không trực tiếp xử lý suy luận phức tạp. GPT-Live-1 duy trì cuộc trò chuyện thời gian thực, còn một mô hình phía sau đảm nhận suy luận và gọi công cụ. Thiết kế này ưu tiên tốc độ phản hồi, nhưng buộc nhà phát triển tự chuyển ngữ cảnh, hủy tác vụ cũ và điều phối những gì tác tử nói trong lúc chờ kết quả.

Theo bài phân tích của The New Stack, Google và OpenAI công bố hai cách xử lý khác nhau trong vòng năm ngày. Google ra mắt Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking qua Gemini API và Google AI Studio vào thứ Ba, năm ngày sau khi OpenAI phát hành GPT-Live-1.

Cả hai kiến trúc đều cho phép tác tử tiếp tục nói khi công việc chạy nền. Gemini 3.8 Live Extended Thinking giữ hội thoại, suy luận và gọi công cụ trong cùng một phiên, còn bản tiêu chuẩn bỏ qua bước suy luận mở rộng. OpenAI giao cuộc trò chuyện cho GPT-Live-1 và chuyển phần việc phức tạp sang một mô hình phía sau.

Kiến trúcHội thoạiSuy luận và công cụTrách nhiệm của ứng dụng
Gemini 3.8 Live Extended ThinkingCùng một phiênCùng một phiênÍt lớp điều phối trung gian hơn
GPT-Live-1Mô hình giọng nóiMô hình phía sauTự chuyển ngữ cảnh và quản lý tác vụ

Nội dung: Gemini giữ suy luận trong cùng một phiên

Gemini 3.8 Live Extended Thinking duy trì lời nói, suy luận và thực thi công cụ trong một phiên có trạng thái. Tác tử có thể tiếp tục trò chuyện khi một lệnh gọi giao diện lập trình ứng dụng bên ngoài chưa hoàn tất, rồi xử lý tiếp sau khi công cụ trả kết quả.

Khi một hàm được đặt thành NON_BLOCKING, Gemini có thể hỏi thêm thông tin hoặc báo tiến độ trong lúc chờ. Theo The New Stack, nhà phát triển cũng có thể chọn mức suy luận thấp, trung bình hoặc cao cho từng yêu cầu.

Người dùng chờ tác tử giọng nói xử lý tác vụ nền
Tác tử vẫn trò chuyện khi công cụ đang chạy.

Gemini 3.8 Live tiêu chuẩn bỏ qua bước suy luận mở rộng nhằm giảm độ trễ và lượng token cần dùng. Mô hình nền này cũng được dùng cho Gemini Live trong ứng dụng Gemini dành cho người dùng phổ thông.

Google cho rằng Gemini Live phù hợp hơn để so sánh với ChatGPT và Claude Voice. Các mô hình dành cho nhà phát triển và doanh nghiệp không phải là sản phẩm hoàn chỉnh cùng loại với những ứng dụng tiêu dùng này.

Các mô hình âm thanh mới còn xử lý nhiều loại dữ liệu. Google nói với The New Stack rằng Gemini có khả năng hiểu hình ảnh và người dùng có thể trò chuyện với mô hình về nội dung đang được hiển thị cho hệ thống.

OpenAI tách hội thoại khỏi suy luận

GPT-Live-1 phụ trách cuộc trò chuyện song công, còn một mô hình phía sau như GPT-6 Astra, mô hình nhẹ hơn như Luna hoặc một lựa chọn của bên thứ ba xử lý suy luận và gọi công cụ. Mô hình giọng nói vì thế không phải tự hoàn thành tác vụ phức tạp.

Việc tách hai lớp giúp GPT-Live-1 duy trì khả năng phản hồi. Theo số liệu OpenAI cung cấp và được The New Stack dẫn lại, độ trễ khi chuyển lượt nói vào khoảng 800 mili giây.

Đổi lại, nhà phát triển phải chuyển ngữ cảnh giữa mô hình giọng nói và mô hình suy luận qua các kênh phụ. Ứng dụng cũng phải quyết định tác tử nên nói gì trong lúc công việc chạy nền. Phần điều phối này không hiện rõ với người dùng, nhưng trở thành một thành phần quan trọng của hạ tầng trí tuệ nhân tạo.

Kiến trúc tách lớp cho phép đội phát triển lựa chọn mô hình và công cụ phía sau cuộc hội thoại. Quyền kiểm soát đó đi kèm nhiều mã điều phối hơn, nhất là khi tác tử thực hiện nhiều việc cùng lúc. Đây cũng là bài toán thường gặp trong cách một tác tử trí tuệ nhân tạo hoạt động khi chia nhiệm vụ giữa mô hình, công cụ và ứng dụng.

Khi người dùng ngắt lời, công việc cũ vẫn có thể chạy

Cả hai kiến trúc đều phải xử lý tác vụ nền khi người dùng ngắt lời hoặc đổi yêu cầu. Nếu hệ thống không hủy đúng công việc, một kết quả đã lỗi thời có thể quay lại cuộc hội thoại dù người dùng không còn cần nó.

Với Gemini, công việc vẫn nằm trong cùng một phiên, nhưng nhà phát triển khó quan sát chính xác thời điểm một lệnh gọi công cụ dừng lại. Với OpenAI, ứng dụng phải tự hủy tác vụ đang chờ và chặn kết quả cũ sau khi người dùng chuyển sang yêu cầu khác.

Google nói với The New Stack rằng Extended Thinking xử lý tiếng ồn nền, giọng hoặc cách phát âm đậm và những lần ngắt lời bất ngờ tốt hơn các mô hình cạnh tranh. Đây là tuyên bố của Google, không phải kết quả từ một phép thử trực tiếp giữa hai kiến trúc.

Chi phí mỗi phút chênh lệch đáng kể

Chi phí của Gemini và GPT-Live-1 không chỉ khác nhau ở giá âm thanh mỗi phút. Gemini Extended Thinking tính thêm token suy luận, còn kiến trúc OpenAI tính riêng lớp giọng nói, mô hình phía sau, lệnh gọi hàm và tác tử bên ngoài.

Dịch vụMức giá được nêuChi phí bổ sung
Gemini 3.8 Live0,005 USD/phút đầu vào; 0,018 USD/phút đầu raToken suy luận với Extended Thinking, video và tài liệu
GPT-Live-10,05 USD/phút giọng nóiMô hình sau, hàm và tác tử

Theo mức giá Gemini Live API được The New Stack dẫn lại, Gemini 3.8 Live tiêu chuẩn có giá 0,005 USD cho mỗi phút âm thanh đầu vào và 0,018 USD cho mỗi phút đầu ra. Extended Thinking tính thêm token suy luận. Video trực tiếp và tài liệu cũng có thể phát sinh chi phí.

GPT-Live-1 có giá 0,05 USD cho mỗi phút giọng nói ở lớp giao tiếp phía trước, theo số liệu OpenAI được The New Stack nêu. Mô hình suy luận phía sau, lệnh gọi hàm và các tác tử bên ngoài được tính phí riêng. Tổng chi phí có thể tăng khi ứng dụng thường xuyên chuyển yêu cầu sang một mô hình suy luận mạnh hơn.

Giao diện hội thoại giọng nói trong kiến trúc tác tử
Lớp giọng nói và suy luận được tính riêng.

Nhà phát triển có thể điều chỉnh mức suy luận cho từng lệnh gọi GPT-6 Astra để kiểm soát chi phí. Google cũng nhúng dấu nhận dạng SynthID của DeepMind vào âm thanh do hệ thống tạo ra.

Các điểm chuẩn không phải phép đối đầu trực tiếp

Các điểm chuẩn do Google và OpenAI công bố không thể được đọc như kết quả của cùng một cuộc thi. Hai bên sử dụng bài kiểm tra, cấu hình và ngăn công nghệ khác nhau. Một số so sánh còn đặt mô hình dành cho nhà phát triển cạnh sản phẩm tiêu dùng hoàn chỉnh.

Theo Artificial Analysis và số liệu The New Stack tổng hợp, Gemini 3.8 Live Extended Thinking đạt 82,6 điểm trong Chỉ số chất lượng hội thoại giọng nói. Tỷ lệ hoàn thành tác vụ đạt 68,6% trên τ-Voice và 35,1% trên bài kiểm tra τ-Voice-banking của Sierra.

Google dựa vào các kết quả này để tuyên bố Extended Thinking đứng đầu Chỉ số chất lượng hội thoại giọng nói và dẫn đầu các bài đánh giá hoàn thành tác vụ phức tạp.

GPT-Live-1 kết hợp với GPT-6 Astra ở mức suy luận trung bình đạt 86,2% Pass@1 trong bài đánh giá dịch vụ khách hàng bằng lời nói Tau3. Bài kiểm tra bao gồm hàng không, bán lẻ và viễn thông. Trên Full Duplex Bench, hệ thống này cao hơn GPT-Realtime-2.1 30 điểm phần trăm, theo The New Stack.

Những con số trên mô tả hiệu suất trong từng thiết lập thử nghiệm. Chúng không chứng minh trực tiếp rằng một kiến trúc có chất lượng hội thoại hoặc khả năng hoàn thành tác vụ cao hơn kiến trúc còn lại trong cùng điều kiện.

Hai lựa chọn kiến trúc tạo ra hai loại ràng buộc

Google gom lời nói, suy luận và công cụ vào một phiên để giảm nhu cầu về lớp điều phối trung gian. OpenAI tách lớp giọng nói khỏi suy luận để duy trì phản hồi nhanh và cho phép ứng dụng chọn mô hình phía sau. Mỗi cách chuyển một phần độ phức tạp sang vị trí khác trong hệ thống.

Claude Voice hiện không nằm trong cùng nhóm công cụ dành cho nhà phát triển. Anthropic cung cấp tính năng giọng nói trong các ứng dụng tiêu dùng, nhưng chưa có giao diện lập trình hội thoại giọng nói thời gian thực tương đương Gemini Live hoặc GPT-Live-1. Đội ngũ xây tác tử quanh Claude vì thế vẫn phải tự lắp ghép nhiều thành phần của hệ thống giọng nói.

Kiến trúc của Google giảm nhu cầu về lớp trung gian nhưng khiến ứng dụng phụ thuộc chặt hơn vào môi trường vận hành của Google. Kiến trúc của OpenAI đặt thêm trách nhiệm lên ứng dụng, đồng thời cho phép nhà phát triển kiểm soát mô hình và công cụ chạy phía sau.

Với GPT-Live-1, việc tách suy luận phức tạp sang mô hình phía sau là một lựa chọn kiến trúc. OpenAI ưu tiên tốc độ hội thoại và chuyển phần xử lý phức tạp sang hệ thống mà nhà phát triển phải tự xây, giám sát và điều phối.

Theo dõi Sine để tiếp tục cập nhật cách các kiến trúc tác tử giọng nói thay đổi chi phí, độ trễ và công việc của đội phát triển.