ElevenLabs v4 hỗ trợ hơn 90 ngôn ngữ

ElevenLabs v4 tăng khả năng kiểm soát biểu cảm, sao chép giọng từ 10 giây âm thanh, hỗ trợ hơn 90 ngôn ngữ và giảm độ trễ cho tác tử giọng nói.

Biểu trưng ElevenLabs trên nền giao diện tạo giọng nói
ElevenLabs giới thiệu thế hệ mô hình giọng nói mới.

ElevenLabs v4 và v4 Turbo là hai mô hình giọng nói mới có khả năng kiểm soát biểu cảm chi tiết hơn, sao chép giọng từ 10 giây âm thanh và hỗ trợ hơn 90 ngôn ngữ. Theo TechCrunch, thế hệ này cũng giảm độ trễ để tác tử giọng nói có thể bắt đầu phát âm thanh trước khi mô hình ngôn ngữ lớn hoàn thành toàn bộ câu trả lời.

Kiểm soát biểu cảm, nội dung và sao chép giọng nhanh hơn

ElevenLabs v4 sử dụng kiến trúc mới để cải thiện khả năng điều khiển giọng nói, rút ngắn quá trình sao chép giọng và giữ đặc điểm nhận diện ổn định hơn trong văn bản dài. Người dùng có thể tạo bản sao giọng nói từ một đoạn âm thanh dài 10 giây.

ElevenLabs phát hành v3 vào năm ngoái và giới thiệu trước thế hệ kế tiếp tại một sự kiện ở Warsaw vào đầu năm nay. TechCrunch cho biết kiến trúc của v4 được thiết kế để tăng mức độ kiểm soát cách giọng nói thể hiện nội dung.

Giao diện ElevenLabs dùng để tạo và điều khiển giọng nói
V4 tăng khả năng kiểm soát cách thể hiện giọng nói.

Khả năng đọc theo ngữ cảnh cũng được nâng cấp để mô hình điều chỉnh cách thể hiện dựa trên nội dung. V3 đã có các thẻ nội tuyến dùng để chỉ định biểu cảm. Với v4, người dùng có thể xếp chồng nhiều thẻ và yêu cầu mô hình thực hiện chúng theo đúng trình tự.

Hỗ trợ hơn 90 ngôn ngữ

ElevenLabs v4 hỗ trợ hơn 90 ngôn ngữ, tăng từ 70 ngôn ngữ ở phiên bản trước. ElevenLabs cho biết những cải thiện chất lượng lớn nhất xuất hiện ở tiếng Nhật, tiếng Bồ Đào Nha dùng tại Brazil, tiếng Quan thoại và tiếng Quảng Đông.

Số ngôn ngữ được mở rộng giúp v4 phù hợp hơn với các sản phẩm giọng nói hoạt động tại nhiều thị trường. Nguồn tin không cung cấp số liệu riêng về mức cải thiện chất lượng đối với tiếng Việt.

Giảm độ trễ cho tác tử giọng nói

ElevenLabs v4 giảm thời gian chờ bằng cách bắt đầu tạo âm thanh ngay khi mô hình ngôn ngữ lớn đứng phía sau bắt đầu sinh câu trả lời. Cơ chế này không yêu cầu hệ thống chờ toàn bộ nội dung hoàn tất rồi mới phát giọng nói.

ElevenLabs đang mở rộng hoạt động gọi điện dành cho doanh nghiệp. TechCrunch cho biết hơn 55% hoạt động kinh doanh của công ty hiện đến từ các doanh nghiệp lớn. Bối cảnh định giá của công ty cũng được đề cập trong bài trò chuyện với giám đốc điều hành ElevenLabs.

Theo ElevenLabs, mô hình mới có thể điều chỉnh cách xử lý khi cuộc gọi xuất hiện tình huống đối đầu, leo thang hoặc phải tạm giữ máy. Khả năng này nhằm giúp tác tử phản hồi phù hợp hơn với diễn biến của cuộc trao đổi. Đây là một phần của xu hướng đưa chức năng nghe và phản hồi bằng giọng nói vào nhiều thiết bị, bên cạnh các ứng dụng như trí tuệ nhân tạo luôn lắng nghe trên Apple Watch.

Cuộc cạnh tranh về mô hình giọng nói

ElevenLabs đang cạnh tranh với nhiều công ty phát triển công nghệ tạo giọng biểu cảm. TechCrunch ghi nhận Cartesia, Deepgram, Fish Audio, Boson và WellSaid Labs đều đã phát triển các mô hình trong lĩnh vực này, trong khi Google và OpenAI tiếp tục cải thiện công nghệ giọng nói của họ.

Biểu trưng ElevenLabs trong sản phẩm tạo giọng nói bằng AI
ElevenLabs cạnh tranh trong thị trường giọng nói biểu cảm.

V4 phục vụ hai nhóm nhu cầu chính. Khả năng kiểm soát cách thể hiện và duy trì đặc điểm giọng trong văn bản dài hướng đến hoạt động sáng tạo nội dung. Độ trễ thấp và cơ chế tạo âm thanh sớm phục vụ các tác tử doanh nghiệp cần phản hồi nhanh trong cuộc trò chuyện.

ElevenLabs tiếp tục tăng trưởng nhanh

ElevenLabs đã huy động 500 triệu USD trong vòng gọi vốn do Sequoia dẫn dắt vào đầu năm nay, đưa công ty đến mức định giá 11 tỷ USD, theo TechCrunch. Thị trường sau đó xuất hiện thông tin về một vòng gọi vốn tiếp theo có thể nâng mức định giá lên 22 tỷ USD.

TechCrunch cũng cho biết doanh thu thường niên quy đổi của ElevenLabs tăng từ khoảng 330 triệu USD vào đầu năm lên hơn 600 triệu USD. Công ty tuyển dụng tại Ấn Độ, châu Âu và Brazil, đưa tổng số nhân sự lên hơn 800 người.

Trong một cuộc phỏng vấn với TechCrunch, đồng sáng lập kiêm giám đốc điều hành Mati Staniszewski cho biết ElevenLabs đặt mục tiêu niêm yết cổ phiếu lần đầu trong vài năm tới. Ông không đưa ra thời điểm cụ thể.

Hãy tiếp tục theo dõi Sine để cập nhật cách các mô hình giọng nói mới được đưa vào sản phẩm và tác tử trí tuệ nhân tạo.