Традиционные видеозвонки уходят в прошлое, уступая место эре "синтетического присутствия". Согласно данным Mixed News, Meta представила Muse Realtime Avatar — модель на базе *Diffusion Transformer* (трансформер диффузии), способную синхронизировать голосовые токены с движением губ и мимикой менее чем за секунду. Это не просто фильтр, а полноценное цифровое представление, которое определяет эмоции пользователя по тону его голоса.
От мультяшных лиц к фотореализму
Долгое время аватары Meta воспринимались как стилизованные и неестественные фигуры. Однако нынешний прорыв стал возможен благодаря архитектуре Muse Spark Frontier и методу дистилляции, который сократил вычислительные затраты в 60 раз. В результате задержка (latency) снизилась до 870 мс, что делает общение плавным и естественным, почти как при личной встрече.
Ray-Ban Display
$799 USD
В этой модели аватар полностью управляется голосом. В очках нет датчиков мимики; ИИ сам выводит выражение лица, основываясь на том, что и как говорит пользователь. Запуск планируется на осень 2026 года для пользователей WhatsApp в США.
Meta VR Glasses
$1,299 USD
Ожидаются весной 2027 года. Эти очки предлагают полноразмерные голограммы. В отличие от Ray-Ban, здесь используются встроенные камеры и сенсоры для отслеживания реальных реакций лица в реальном времени с эффектом пространственного аудио.
Технический двигатель: Muse Realtime Voice
Система представляет собой массивную экосистему обработки данных. На серверах GB200 модель может поддерживать до 12 одновременных сессий с передачей видео в разрешении 448x768 при 25 кадрах в секунду. Чтобы предотвратить распространение дипфейков (deepfakes), Meta внедрила Meta Video Seal — невидимый водяной знак, подтверждающий, что контент создан ИИ.
| Характеристика | Детали конфигурации |
|---|---|
| Процесс настройки | 5 минут первичного захвата (фото и голос) через приложение Meta AI |
| Визуальное ограничение | Преимущественно фронтальный вид (возможны искажения при боковых ракурсах) |
| Совместимость | Нативная поддержка WhatsApp и Zoom в VR-очках |
Технологические перспективы
Возможность создавать фотореалистичных аватаров только с помощью голоса могла бы демократизировать доступ к виртуальной реальности для людей с ограниченной мобильностью или тех, кто предпочитает визуальную анонимность, не теряя эмоциональной связи. Вероятно, Meta будет интегрировать этих аватаров в экосистему Muse Charm для звонков в режиме hands-free. Возможно, проблема фронтального обзора будет решена с помощью моделей 3D-генерации в реальном времени, что позволит собеседнику обходить вокруг голограммы без искажений.