
Google cho phép nhà phát triển thiết kế, sao chép và lưu giọng nói bằng Gemini 3.8 TTS qua giao diện tự phục vụ. OpenAI cũng có giọng tùy chỉnh, nhưng khách hàng phải liên hệ bộ phận bán hàng và chịu giới hạn thấp hơn về số giọng được lưu. Khác biệt này ảnh hưởng trực tiếp đến tốc độ thử nghiệm và cách các nhóm quản lý giọng trong ứng dụng.
Theo The New Stack, Google phát hành Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS thông qua Gemini API và Google AI Studio. Thay vì chỉ dùng giọng có sẵn, nhà phát triển có thể mô tả giọng mong muốn hoặc bắt đầu bằng một bản ghi ngắn, sau đó lưu giọng đã tạo để sử dụng lại.
Với các nhóm xây sản phẩm thoại tại Việt Nam, hồ sơ được lưu giúp ứng dụng duy trì giọng nhất quán. Nhóm phát triển không phải gửi lại mô tả dài hoặc bản ghi tham chiếu trong mỗi yêu cầu. Google quản lý hồ sơ và trả về một mã để ứng dụng gọi lại khi cần.
Biến bản ghi thành mã giọng nói
Gemini 3.8 TTS tạo hồ sơ giọng từ một mẫu sạch dài 10 đến 30 giây. Hệ thống còn yêu cầu một bản ghi đồng ý riêng của cùng người nói. Sau khi xác minh, Google trả về mã voice_ để lưu trong dự án. Trường hợp không lưu hồ sơ sẽ nhận khóa voicekey_.

Theo The New Stack, tính năng sao chép giọng chạy qua điểm cuối Voices mới với yêu cầu POST /v1beta/voices. Trong bản ghi đồng ý, người nói xác nhận giọng thuộc về mình và chấp thuận để Google tạo phiên bản tổng hợp. Google kiểm tra danh tính giữa bản ghi đồng ý và mẫu tham chiếu trước khi tiếp tục.
Sau khi được phê duyệt, Google trả về một mã bắt đầu bằng voice_. Mã được giữ trong dự án của nhà phát triển trong một năm, cùng với các giọng được tạo bằng công cụ thiết kế giọng nói. Theo The New Stack, mỗi dự án có thể lưu tối đa 200 giọng; nhà phát triển có thể truy xuất, liệt kê hoặc xóa chúng qua API.
Sao chép giọng mà không lưu hồ sơ
Google cũng cho phép sao chép giọng mà không lưu hồ sơ trong dự án. Khi đặt store=False, hệ thống trả về một khóa mã hóa bắt đầu bằng voicekey_. Ứng dụng giữ khóa này và gửi lại khi cần dùng giọng. Theo The New Stack, khóa hết hạn sau bảy ngày nên phù hợp hơn với công việc ngắn hạn.
voice_: hồ sơ được lưu trong dự án trong một năm.voicekey_: khóa do ứng dụng giữ, hết hạn sau bảy ngày.- Mỗi dự án có thể lưu tối đa 200 giọng.
Âm thanh do Gemini tạo được đánh dấu bằng SynthID. Giọng sao chép còn có thông tin xác thực nội dung C2PA để truy vết nguồn gốc. The New Stack cho biết Google AI Studio không cung cấp tính năng sao chép giọng tại Illinois, Texas, Khu vực Kinh tế Châu Âu, Vương quốc Anh, Thụy Sĩ và Ấn Độ.
Tạo giọng mới từ mô tả
Công cụ thiết kế giọng nói của Google tạo một giọng mới từ mô tả về vai trò, giọng vùng miền và tính cách. Giọng đã tạo được lưu bằng mã riêng để tái sử dụng, giúp giảm hiện tượng giọng thay đổi khi ứng dụng gửi lại một mô tả dài trong từng yêu cầu.

Theo số liệu The New Stack dẫn từ Google, tính năng này hoạt động với hơn 100 ngôn ngữ và phương ngữ. Tài liệu liệt kê 130 ngôn ngữ cho Flash TTS và 101 ngôn ngữ cho Flash-Lite. Thông báo của Google còn nói đến thư viện hơn 2.000 giọng sẵn sàng dùng trong môi trường sản xuất.
Tài liệu dành cho nhà phát triển mô tả 30 giọng phòng thu dựng sẵn và hàng trăm giọng khác trong thư viện mở rộng. Nhà phát triển có thể lọc theo ngôn ngữ, giọng địa phương, cao độ và mục đích sử dụng qua GET /v1beta/voices. Google cũng liệt kê khả năng điều chỉnh âm sắc, cao độ, tốc độ và giọng địa phương bằng câu lệnh là một tính năng sắp có.
Google khuyến nghị tạo giọng một lần rồi dùng lại mã của giọng đó. Theo tài liệu tạo giọng nói của Google AI Studio, việc gửi lặp lại mô tả nhân vật dài là nguyên nhân phổ biến nhất khiến giọng bị trôi. Sau khi giọng được tạo, mỗi yêu cầu tiếp theo chỉ cần một chỉ dẫn ngắn về phong cách nếu cần.
Cách lưu và tái sử dụng mã giọng cũng phản ánh một vấn đề rộng hơn trong hạ tầng trí tuệ nhân tạo: ứng dụng cần quản lý tài nguyên mô hình ổn định thay vì dựng lại cùng một cấu hình trong từng lượt gọi.
Nội dung kịch bản được Gemini 3.8 xử lý ra sao
Gemini 3.8 coi văn bản đầu vào là bản chép lời nguyên văn. Chỉ dẫn kéo dài trong cả lượt nói được chuyển sang speech_metadata, trong khi âm thanh tức thời vẫn nằm trong văn bản. Cách xử lý này có thể làm hỏng tích hợp cũ vốn đặt chỉ dẫn sân khấu trực tiếp trong câu lệnh.
Theo The New Stack, thay đổi này ảnh hưởng đến những ứng dụng từng dùng mô hình thử nghiệm 3.1. Các chỉ dẫn như nói thì thầm, châm biếm hoặc nói nhanh giờ được đặt trong chú thích speech_metadata.
Các âm thanh xuất hiện tức thời như <sigh>, <cough> và <short pause> vẫn nằm trực tiếp trong văn bản, đặt giữa dấu ngoặc nhọn. Với kịch bản hai người, phản ứng của người nghe có thể được đặt giữa hai dấu gạch đứng. Ví dụ, |mhm| tạo lời hưởng ứng hoặc tiếng nói chồng lên nhau mà không phải tách kịch bản thành lượt mới.
Kịch bản hai người vẫn có giới hạn
Một yêu cầu Gemini 3.8 TTS có thể tạo tối đa hai người nói khi dùng giọng dựng sẵn. Hội thoại sử dụng giọng được thiết kế hoặc sao chép phải được tạo theo từng lượt rồi ghép từ đầu ra PCM 24 kHz, nên ứng dụng cần tự quản lý thêm một bước xử lý âm thanh.
Yêu cầu đơn trả về WAV theo mặc định, còn yêu cầu truyền phát trả về PCM thô 16 bit. Hệ thống cũng hỗ trợ mã hóa mu-law và A-law cho quy trình điện thoại. Google cho biết Flash TTS duy trì chất lượng và âm sắc qua nhiều giờ âm thanh liên tục, hướng tới sản xuất sách nói và chương trình âm thanh.
Với ứng dụng đàm thoại, mô hình giọng nói chỉ là một lớp. Hệ thống còn phải xử lý vận chuyển âm thanh, nhận dạng lời nói, phát hiện lượt nói, ngắt lời và trạng thái phiên. Đây cũng là dạng phân quyền dữ liệu và mô hình cần được xem xét khi xây hệ thống trí tuệ nhân tạo có kiểm soát truy cập.
Flash ưu tiên hiệu năng, Flash-Lite phục vụ số lượng lớn
Gemini 3.8 Flash TTS phù hợp với nội dung cần diễn xuất và xử lý cách phát âm phức tạp. Flash-Lite TTS được định vị cho tốc độ, chi phí và khối lượng lớn. Hai mô hình dùng chung lược đồ API, hỗ trợ cả thiết kế lẫn sao chép giọng và có thể được chuyển đổi bằng một tham số.
| Mô hình | Mục đích chính | Trường hợp sử dụng |
|---|---|---|
| Flash TTS | Khả năng diễn xuất | Hội thoại, phương ngữ, nội dung dài |
| Flash-Lite TTS | Tốc độ và chi phí | Đọc thành tiếng, sản xuất số lượng lớn |
Google định vị Flash TTS cho hội thoại phức tạp, nhiều thẻ biểu cảm, cách phát âm khó, phương ngữ vùng miền và nội dung kể dài. Flash-Lite TTS thay thế trực tiếp gemini-3.1-flash-tts-preview và được tinh chỉnh cho tính năng đọc thành tiếng cùng tác tử thoại dạng chuỗi, nơi mô hình văn bản kết hợp với một bước tổng hợp giọng riêng.
Đối với tác tử thoại dạng này, Google khuyến nghị thực hiện một lệnh gọi TTS cho mỗi lượt khi văn bản từ mô hình ngôn ngữ được gửi đến. Giọng đã lưu duy trì danh tính xuyên suốt cuộc trò chuyện. Cách phân chia trách nhiệm giữa các thành phần tương tự kiến trúc của một tác tử trí tuệ nhân tạo, nơi nhiều bước chuyên biệt phối hợp thay vì dồn toàn bộ công việc vào một mô hình.
Tích hợp vào nền tảng tác tử thoại
Gemini TTS có thể làm lớp tổng hợp giọng trong Agora, LiveKit, Pipecat và AI Gateway của Vercel. Trước khi chọn nền tảng, nhóm cần kiểm tra nền tảng đó có chuyển tiếp mã voice_ tùy chỉnh hay không, đặc biệt khi ứng dụng sử dụng giọng sao chép.
Google nêu tên bốn nền tảng này là các lựa chọn hỗ trợ tạo giọng Gemini qua Gemini API. Nhờ đó, một nhóm có thể đưa Gemini vào quy trình hiện có mà không phải xây lại toàn bộ lớp vận chuyển và xử lý âm thanh.
The New Stack lưu ý rằng khả năng hỗ trợ Gemini API không tự động có nghĩa nền tảng sẽ chuyển tiếp mã giọng tùy chỉnh. Quyền truy cập API qua Gemini Enterprise hiện được Google ghi là sắp có.
Google và OpenAI khác nhau ở đâu
Google cung cấp thiết kế và sao chép giọng qua API tự phục vụ, với tối đa 200 giọng trong mỗi dự án theo The New Stack. OpenAI yêu cầu khách hàng làm việc với bộ phận bán hàng, giới hạn 20 giọng cho mỗi tổ chức và chưa cung cấp công cụ thiết kế giọng bằng mô tả văn bản.
| Tiêu chí | Google Gemini 3.8 TTS | OpenAI |
|---|---|---|
| Quyền truy cập | API tự phục vụ | Liên hệ bán hàng |
| Giới hạn lưu | 200 giọng mỗi dự án | 20 giọng mỗi tổ chức |
| Thiết kế bằng văn bản | Có | Chưa có |
| Mẫu giọng | 10 đến 30 giây | Tối đa 30 giây |
| Bản ghi đồng ý | Bắt buộc | Bắt buộc |
Theo The New Stack, mã giọng do OpenAI tạo có thể dùng với điểm cuối giọng nói, Realtime API và Chat Completions. OpenAI cung cấp 13 giọng dựng sẵn có thể được điều khiển về sắc thái hoặc tốc độ, đồng thời yêu cầu ứng dụng thông báo rằng âm thanh do trí tuệ nhân tạo tạo ra.
Khác biệt chính xuất hiện trước bước chuyển văn bản thành âm thanh. Quy trình tự phục vụ của Google giúp nhóm phát triển thử nghiệm và quản lý nhiều giọng hơn mà không phải bắt đầu bằng một cuộc trao đổi bán hàng. Cách tiếp cận này không loại bỏ trách nhiệm xác minh sự đồng ý, nguồn gốc âm thanh và quyền sử dụng giọng.
Nhóm xây sản phẩm thoại nên thử nghiệm với một trường hợp sử dụng nhỏ, xác nhận nền tảng có hỗ trợ mã giọng tùy chỉnh và kiểm tra toàn bộ vòng đời của hồ sơ giọng trước khi mở rộng.


