Компания Meta совершила революционный скачок в цифровой коммуникации, представив Muse Realtime Avatar. Эта технология превращает голос в фотореалистичную мимику в режиме реального времени. Интегрированная в новые очки Ray-Ban Display и Meta VR Glasses, инновация позволяет цифровой личности пользователя проявляться через ИИ-аватаров, полностью избавляя от необходимости использовать фронтальные камеры во время звонков.

Традиционные видеозвонки уходят в прошлое, уступая место эре "синтетического присутствия". Согласно данным Mixed News, Meta представила Muse Realtime Avatar — модель на базе *Diffusion Transformer* (трансформер диффузии), способную синхронизировать голосовые токены с движением губ и мимикой менее чем за секунду. Это не просто фильтр, а полноценное цифровое представление, которое определяет эмоции пользователя по тону его голоса.

От мультяшных лиц к фотореализму

Долгое время аватары Meta воспринимались как стилизованные и неестественные фигуры. Однако нынешний прорыв стал возможен благодаря архитектуре Muse Spark Frontier и методу дистилляции, который сократил вычислительные затраты в 60 раз. В результате задержка (latency) снизилась до 870 мс, что делает общение плавным и естественным, почти как при личной встрече.

Ray-Ban Display

$799 USD

В этой модели аватар полностью управляется голосом. В очках нет датчиков мимики; ИИ сам выводит выражение лица, основываясь на том, что и как говорит пользователь. Запуск планируется на осень 2026 года для пользователей WhatsApp в США.

Meta VR Glasses

$1,299 USD

Ожидаются весной 2027 года. Эти очки предлагают полноразмерные голограммы. В отличие от Ray-Ban, здесь используются встроенные камеры и сенсоры для отслеживания реальных реакций лица в реальном времени с эффектом пространственного аудио.

Технический двигатель: Muse Realtime Voice

Система представляет собой массивную экосистему обработки данных. На серверах GB200 модель может поддерживать до 12 одновременных сессий с передачей видео в разрешении 448x768 при 25 кадрах в секунду. Чтобы предотвратить распространение дипфейков (deepfakes), Meta внедрила Meta Video Seal — невидимый водяной знак, подтверждающий, что контент создан ИИ.

Характеристика Детали конфигурации
Процесс настройки 5 минут первичного захвата (фото и голос) через приложение Meta AI
Визуальное ограничение Преимущественно фронтальный вид (возможны искажения при боковых ракурсах)
Совместимость Нативная поддержка WhatsApp и Zoom в VR-очках

Технологические перспективы

Возможность создавать фотореалистичных аватаров только с помощью голоса могла бы демократизировать доступ к виртуальной реальности для людей с ограниченной мобильностью или тех, кто предпочитает визуальную анонимность, не теряя эмоциональной связи. Вероятно, Meta будет интегрировать этих аватаров в экосистему Muse Charm для звонков в режиме hands-free. Возможно, проблема фронтального обзора будет решена с помощью моделей 3D-генерации в реальном времени, что позволит собеседнику обходить вокруг голограммы без искажений.