Avatar số tương tác: Tôi đã tạo bản sao của mình

Dominic-Madori Davis tạo một avatar số từ hình ảnh và giọng nói của mình để kiểm tra khả năng trò chuyện, giới hạn dữ liệu và vai trò của công nghệ này.

Avatar số của Dominic-Madori Davis xuất hiện trên màn hình
Bản sao số trò chuyện dựa trên một bài báo.

Avatar số tương tác trong thử nghiệm này có thể mang hình dáng và giọng nói của một người, nghe câu hỏi rồi trả lời trong phạm vi dữ liệu được cung cấp. Synthesia cho biết công nghệ này đã được dùng để hỗ trợ đào tạo, khảo sát và truyền đạt thông tin, còn trải nghiệm của nhà báo Dominic-Madori Davis chỉ trực tiếp cho thấy avatar có thể trả lời trong phạm vi một bài báo được cung cấp. Tuy nhiên, nó chưa thể thay thế sự hiện diện, phán đoán hoặc niềm tin mà con người tạo ra.

Mùa hè năm nay, Alexandru Voica, người phụ trách quan hệ doanh nghiệp tại Synthesia, gửi cho tôi đường dẫn tới một thành viên mới trong đội truyền thông của công ty. Đó là avatar số tương tác mang hình dáng của chính anh, được huấn luyện để trả lời những câu hỏi phổ biến về Synthesia, chẳng hạn công ty làm gì và công nghệ hoạt động ra sao.

Trước đó một ngày, tôi vừa tham gia một phiên thảo luận nơi những người làm quan hệ công chúng hỏi liệu tôi có phiền khi nhận các lời giới thiệu được viết bằng trí tuệ nhân tạo hay không. Avatar của Alexandru đã tiến xa hơn một đoạn văn do máy tạo ra. Nó cho thấy trí tuệ nhân tạo có thể tham gia trực tiếp vào cuộc trao đổi giữa doanh nghiệp và người nhận thông tin.

Bài viết này được viết lại cho độc giả Việt Nam từ bài trải nghiệm gốc của Dominic-Madori Davis trên TechCrunch. Các con số, tên riêng và diễn biến dưới đây được giữ theo nguồn đó.

Từ một chuyến thăm văn phòng đến bản sao số

Dominic-Madori Davis đồng ý tạo avatar trong một chuyến thăm văn phòng Synthesia tại New York. Bản sao tương tác được huấn luyện bằng một bài báo cụ thể và chỉ có thể trả lời câu hỏi liên quan đến nội dung đó, thay vì mô phỏng toàn bộ kiến thức hoặc đời sống của người thật.

Tháng 9, Synthesia mời tôi tới văn phòng mới của công ty tại New York. Có nguồn gốc từ Vương quốc Anh, Synthesia phát triển công nghệ avatar số, cùng lĩnh vực với D-ID, HeyGen và Colossyan. Theo TechCrunch, công ty đạt mức định giá 4 tỷ USD vào đầu năm nay. Synthesia cho biết doanh thu định kỳ hằng năm của họ đã vượt 100 triệu USD trong năm ngoái.

Công ty cung cấp cho doanh nghiệp công cụ làm video đào tạo tương tác bằng avatar trí tuệ nhân tạo. Roleplay Sessions cũng cho phép nhân viên thực hành những tình huống như thuyết trình bán hàng trước một avatar có thể phản hồi và chấm điểm câu trả lời.

Khi tới lễ khai trương văn phòng và được hỏi có muốn sở hữu avatar của riêng mình hay không, tôi đồng ý ngay. Một bản sao số nghe hấp dẫn, nhất là vào hôm tôi cảm thấy trang phục và mái tóc của mình đều ổn.

Từ ý tưởng trực tuyến đến trải nghiệm thực tế

Trước lần đó, tôi không có cảm xúc đặc biệt với avatar, dù vẫn nghĩ chúng sớm muộn cũng trở thành một phần của đời sống trực tuyến. Tôi từng nghe nói một số người tạo hình đại diện giống mình để hỗ trợ sản xuất nội dung trên mạng xã hội. Việc trực tiếp gặp bản sao số khiến ý tưởng ấy trở nên cụ thể hơn.

Đây là lần đầu Synthesia làm avatar số cho một nhà báo. Theo bài viết gốc, ngoài Alexandru Voica, công ty cũng chưa thực hiện trải nghiệm tương tự cho người nào khác. Avatar tương tác của tôi được huấn luyện bằng một bài báo về hành vi gian lận tại các công ty khởi nghiệp. Bài báo so sánh những công ty nhận vốn đầu tư mạo hiểm với những công ty không nhận loại vốn này. Nó chỉ trả lời câu hỏi liên quan đến bài báo đó.

Một phòng quay nhỏ và hai phút ghi âm

Quá trình tạo avatar bắt đầu bằng nhiều bức ảnh và hai phút ghi âm giọng nói. Người được mô phỏng cũng phải đồng ý với việc tạo avatar. Synthesia sau đó kết hợp các mô hình xử lý lời nói, ngôn ngữ, âm thanh và video để biến câu hỏi của người dùng thành câu trả lời có hình ảnh và giọng nói.

Chân dung nhà báo Dominic-Madori Davis, nguyên mẫu của avatar số
Dominic-Madori Davis là nguyên mẫu của avatar.

Để tạo avatar, tôi bước vào một phòng quay nhỏ nằm bên trong văn phòng Synthesia. Nhóm thực hiện chụp nhiều ảnh và ghi lại giọng nói của tôi trong hai phút. Tôi phải xác nhận đồng ý trước khi bản sao số mang tên Dom ra đời.

Dạng avatarCách hoạt độngPhạm vi
Avatar cá nhânĐọc kịch bản được cung cấpNội dung có sẵn
Avatar tương tácNghe và trả lời người dùngDữ liệu được huấn luyện

Mỗi dạng có một phiên bản đeo kính và một phiên bản không đeo kính. Nhóm phát triển chọn một bài báo làm nguồn kiến thức cho avatar tương tác.

Cách hệ thống xử lý một cuộc trò chuyện

Hệ thống phía sau xử lý cuộc trò chuyện theo bốn bước:

  1. Mô hình chuyển giọng nói thành văn bản ghi lại câu hỏi của người dùng.
  2. Tiếp theo, mô hình ngôn ngữ hiểu nội dung và quyết định phản hồi phù hợp.
  3. Sau đó, văn bản được chuyển thành giọng nói để tạo câu trả lời bằng âm thanh.
  4. Cuối cùng, mô hình video của Synthesia làm avatar chuyển động khi nói.

Avatar của tôi sử dụng các mô hình video và giọng nói riêng của Synthesia. Khách hàng của công ty cũng có thể chọn công nghệ từ Cartesia, ElevenLabs, Google hoặc OpenAI. ElevenLabs từng được đề cập trong cuộc trò chuyện với giám đốc điều hành ElevenLabs. Doanh nghiệp có thể đặt avatar trên dịch vụ điện toán đám mây mình lựa chọn hoặc trả phí để Synthesia lưu trữ.

Ba nhóm nội dung và sản phẩm của Synthesia

Synthesia chia công nghệ avatar của mình thành ba nhóm: video theo kịch bản, phiên tương tác và giao diện lập trình ứng dụng. Các nhóm này phục vụ những nhu cầu khác nhau, từ phân phối nội dung có sẵn đến xây dựng một sản phẩm có thể phản hồi người dùng.

Nhóm sản phẩmChức năng chínhVí dụ sử dụng
Nền tảng videoAvatar đọc kịch bảnVideo đào tạo
SessionsAvatar tiếp nhận và phản hồiKhảo sát, nhập vai
Nền tảng APIKết hợp các dịch vụSản phẩm avatar riêng

Với nền tảng video truyền thống, người dùng nhập kịch bản và avatar đọc lại nội dung. Sessions cho phép mọi người tương tác với avatar trong khảo sát hoặc các buổi thực hành nhập vai. Thay vì chỉ phát một đoạn ghi hình, avatar có thể tiếp nhận câu trả lời và phản hồi trong phạm vi nhiệm vụ đã được thiết lập.

Nền tảng giao diện lập trình ứng dụng cho phép khách hàng kết hợp mô hình video và giọng nói của Synthesia với các dịch vụ công nghệ khác. Việc ghép nhiều thành phần thành một trải nghiệm hoàn chỉnh cũng liên quan đến nguyên lý tạo sản phẩm bằng tác tử, dù avatar trong thử nghiệm này bị giới hạn chặt bởi dữ liệu huấn luyện.

Giọng nói khá giống, nhưng cảm giác vẫn kỳ lạ

Các avatar hoàn thành sau vài ngày và tái tạo được nhiều đặc điểm của người thật, nhưng chưa thuyết phục hoàn toàn những người quen biết cô. Trong các lần thử này, avatar từ chối câu hỏi ngoài phạm vi và chuyển cuộc trò chuyện về bài báo. Hành vi đó cho thấy avatar chỉ phản hồi trong phạm vi dữ liệu giới hạn, chứ không phải là bản sao đầy đủ của con người.

Tôi thử phiên bản cá nhân trước bằng một kịch bản đơn giản về mùa thu đã đến New York, thời điểm tôi thích nhất trong năm. Giọng nói nghe tương đối chính xác. Hệ thống không sao chép chất giọng khàn xuất hiện trong lúc thu mẫu âm thanh, điều khiến tôi nhẹ nhõm.

Một số người bạn không làm trong ngành công nghệ thấy kết quả vừa thú vị vừa đáng sợ. Cảm giác ấy rõ hơn khi họ nhìn thấy avatar tương tác.

Giới hạn của phiên bản tương tác

Phiên bản này hoạt động theo cách tất định, nghĩa là nó chỉ nói những gì nằm trong phạm vi được huấn luyện. Với avatar của tôi, phạm vi đó là bài báo về gian lận tại các công ty khởi nghiệp nhận vốn đầu tư mạo hiểm.

Tôi thử hỏi mình từng làm việc ở đâu trước TechCrunch và sống tại khu vực nào của New York. Mỗi lần như vậy, avatar đều đưa cuộc trò chuyện trở lại bài báo. Nó không đoán và cũng không tạo thêm câu trả lời ngoài dữ liệu.

Chân dung nhà báo Dominic-Madori Davis
Chân dung nhà báo Dominic-Madori Davis.

Bạn bè tôi cho rằng giọng nói chưa thật sự giống tôi. Họ cũng thấy khuôn mặt của avatar tương tác kém giống hơn phiên bản cá nhân, nhưng mức độ tương đồng vẫn đủ tạo cảm giác kỳ lạ.

Mẹ tôi gọi nó là “tuyệt vời”, một lời khen rất cao từ bà. Bố mẹ liên tục đặt những câu hỏi mà theo họ chỉ người trong gia đình mới biết. Avatar không trả lời mà lần nào cũng chuyển họ về chủ đề gian lận trong giới khởi nghiệp.

“Mẹ không nhớ đã sinh ra hai đứa”, mẹ tôi nói đùa sau khi thử avatar.

Avatar có thể đứng trước bản tin không?

Trong phạm vi được giới hạn rõ, avatar có thể trình bày thông tin hoặc xử lý một số cuộc trao đổi, nhưng trải nghiệm này chưa cho thấy nó có thể thay thế nhà báo. Báo chí phụ thuộc vào nghiên cứu, tiếp xúc với con người, phán đoán và niềm tin, trong khi avatar thử nghiệm chỉ phản hồi từ một nguồn dữ liệu đã chọn.

Trải nghiệm này khiến tôi nghĩ về tương lai của báo chí. Liệu khán giả có chấp nhận mở một bản tin và thấy người dẫn là avatar hay không? Một nhà đầu tư trả lời không ngay lập tức. Những người khác chưa chắc chắn.

Nội dung trí tuệ nhân tạo chất lượng thấp đang vấp phải phản ứng trên mạng xã hội và các nền tảng chia sẻ tin tức. Avatar đặt ra một câu hỏi khác: chúng sẽ hỗ trợ nhà báo hay thay thế nhà báo? Một giám đốc điều hành có muốn nói chuyện với avatar của phóng viên thay vì gặp chính người đó không?

Điều tôi thích trong nghề là gặp gỡ con người, viết bài và nghiên cứu chủ đề mới. Phần quan trọng nhất của báo chí là niềm tin. Đó không phải thứ có thể dễ dàng giao cho trí tuệ nhân tạo.

Trong thử nghiệm này, hệ thống chuyển giọng nói thành văn bản khi người dùng chủ động tương tác. Cơ chế đó không đồng nghĩa với trí tuệ nhân tạo luôn lắng nghe trên đồng hồ thông minh.

Một bản sao luôn có mặt khi bạn vắng mặt

Bản sao số có thể tiếp nhận những câu hỏi lặp lại khi người thật không có mặt, miễn là nhiệm vụ và nguồn dữ liệu được giới hạn. Cũng chính giới hạn này phân biệt một công cụ hỗ trợ có thể kiểm soát với một hệ thống trò chuyện tự do diễn giải về nhiều chủ đề.

Sau một kỳ nghỉ, một phiên bản số có thể xử lý các câu hỏi đã tích tụ trong phạm vi được giao. Tuy nhiên, chưa thể biết doanh nghiệp Mỹ sẽ sử dụng avatar theo hướng nào.

Cảm giác khi bản sao ngừng nói

Sau khi có một bản sao riêng, cảm xúc của tôi vẫn lẫn lộn. Khi sự mới lạ ban đầu qua đi, tôi nhìn kỹ avatar sau lúc nó ngừng nói và cứ chờ đợi. Tôi không rõ mình đang chờ điều gì. Có thể là một cái chớp mắt, một câu nói mới, một nụ cười hoặc dấu hiệu cho thấy nó thật sự biết mình đang hiện diện.

Những bản sao số của tôi sẽ không làm vậy vì chúng hoạt động theo cách tất định. Nhưng không khó để hình dung một người có thể cảm thấy bất ổn khi tiếp xúc với phiên bản không tất định, được điều khiển bởi một hệ thống trò chuyện có thể tự do diễn giải và nói về nhiều chủ đề.

Tôi từng nói với một nhà đầu tư rằng dù tương lai của bản sao số đi theo hướng nào, thế hệ của tôi, thế hệ Z, có lẽ sẽ không dễ quen với chúng. Những gì từng chỉ xuất hiện trong phim khoa học viễn tưởng nay đã bước vào đời thực.

Dù vậy, avatar số vẫn ít gây bất an hơn robot hình người. Nếu cuộc trò chuyện trở nên kỳ quặc, tôi vẫn có thể tắt cửa sổ và rời mạng.

Hãy tiếp tục theo dõi Sine để quan sát cách những bản sao số thay đổi công việc, truyền thông và quan hệ giữa con người với trí tuệ nhân tạo.