TANGO – Bước đột phá công nghệ AI tạo người nói chuyện cực chân thực

công nghệ AI tango
Thư mục bài viết

Các nhà nghiên cứu gần đây đã ra mắt TANGO, một công cụ AI mang tính cách mạng cho phép tạo ra các video người nói chuyện mô phỏng với toàn thân chuyển động vô cùng tự nhiên. Qua đó, TANGO giúp khắc phục những khó khăn trong việc tạo dựng sản phẩm truyền thông tổng hợp bằng công nghệ AI hiện đại. 

Tại sao Tango được xem là một bước đột phá lớn? Tìm hiểu về mức độ cải thiện chân thực cùng những hứa hẹn về sự đóng góp cho tương của sản phẩm AI này qua bài viết của RG66 News!

Khả năng mô phỏng thực tế của TANGO

Khả năng mô phỏng thực tế của TANGO
Khả năng mô phỏng thực tế của TANGO

TANGO không chỉ tạo ra hình ảnh chân thực của người nói mà còn tạo ra các chuyển động tay, chân, cơ thể đồng bộ một cách tự nhiên, mang lại cảm giác người nói thực sự đang đứng trước màn hình.

Trong một video mẫu đáng chú ý, có đến 10 người khác nhau đang lặp lại cùng một câu thoại, tất cả đều thể hiện với cử rất tự nhiên, đồng bộ hoàn toàn với giọng nói. 

Điều này là một ưu điểm rất lớn của TANGO, bởi đa số các hệ thống AI hiện nay vẫn gặp khó khăn trong việc đồng bộ cử chỉ với lời nói một cách tự nhiên.

Hiện nay, TANGO đã có mặt trên Hugging Face, một nền tảng phát triển và thử nghiệm AI nổi tiếng, cho phép người dùng trực tiếp trải nghiệm với các video mẫu, giúp người xem đánh giá độ chính xác và chân thực mà công nghệ này mang lại.

Cách thức hoạt động của công nghệ AI TANGO 

TANGO được xây dựng trên nền tảng công nghệ “Reenactment Video Gesture” – phương pháp tái hiện cử chỉ qua video, sử dụng cấu trúc đồ thị để chia nhỏ và trích xuất các đoạn video tương thích. 

Điều đặc biệt ở TANGO là khả năng khắc phục các hạn chế phổ biến khi tạo dựng video AI, chẳng hạn như sự lệch lạc giữa âm thanh và cử chỉ hoặc các lỗi “giả tạo” trong các khung hình do GAN (Generative Adversarial Network) tạo ra.

Để đảm bảo video vận hành mượt mà và chân thực, nhóm nghiên cứu đã phát triển phương pháp tính toán khoảng cách, giúp cải thiện khả năng đồng bộ giữa âm thanh và chuyển động.

Mối liên kết giữa âm thanh và cử chỉ trong TANGO được xây dựng một cách chi tiết, tạo nên các video mô phỏng không chỉ chính xác về lời nói mà còn biểu cảm đồng bộ với nội dung.

Đáng chú ý, nhóm nghiên cứu cho biết TANGO là công cụ đầu tiên áp dụng quy tắc tương phản kiểu “CLIP-Like” trên hai phương thức âm thanh và chuyển động. Hệ thống đồ thị chuyển động này không chỉ là công cụ đầu tiên hỗ trợ mã nguồn mở mà còn cho phép mở rộng trong việc tạo dựng video với âm thanh.

Tầm nhìn phát triển của TANGO

Mục tiêu lâu dài của nhóm nghiên cứu không chỉ dừng lại ở việc tạo dựng video người nói. Họ đang tích cực nghiên cứu để mở rộng khả năng của TANGO trong các lĩnh vực nghệ thuậtthể thao như:

  • Nhảy múa
  • Biểu diễn thể thao
  • Biểu diễn văn hóa

Các video AI hiện nay chủ yếu tập trung vào khía cạnh lời nói, trong khi đó TANGO đang mở rộng nghiên cứu để phát triển công nghệ bao gồm cả chuyển động cơ thể phức tạp hơn, phục vụ cho các ứng dụng tương tác cao.

Với các ứng dụng rộng rãi trong nhiều lĩnh vực và khả năng tạo ra nội dung tổng hợp chất lượng cao, TANGO đã và đang đánh dấu một bước tiến lớn trong ngành công nghiệp AI.

Những phát triển tiếp theo từ TANGO có thể sẽ tạo nên một nền tảng chuẩn mực cho những công nghệ AI tương tự trong tương lai, đảm bảo rằng chúng không chỉ có thể đáp ứng các tiêu chuẩn kỹ thuật mà còn mang đến trải nghiệm người dùng vượt trội.

Xem thêm: Boston Dynamics bắt tay với Toyota để phát triển robot AI

Kết luận

Dựa vào những thông tin được phân tích trên về khả năng mô phỏng thực tế, cách thức hoạt động và tầm nhìn phát triển của Tango, có thể thấy đây là sản phẩm AI đột phá của nhân loại.

Hy vọng bài viết chi tiết này cung cấp đầy đủ thông tin và tạo nên một cái nhìn tổng quan về tiềm năng của công nghệ TANGO trong lĩnh vực truyền thông AI.

Bạn cũng có thể thích

Thư mục bài viết
Danh mục phổ biến
[list_all_cats]
Thẻ phổ biến
[list_tags number=20]
Thư mục bài viết