A videochamada tradicional como a conhecemos poderia estar chegando ao fim para dar lugar à era da presença sintética. Segundo informações detalhadas pelo portal Mixed News, a Meta apresentou o Muse Realtime Avatar, um modelo baseado em *Diffusion Transformer* (um tipo de arquitetura de IA avançada que gera dados de forma incremental) capaz de sincronizar o fluxo de voz com lábios e gestos faciais em menos de um segundo.
Do "Desenho Animado" ao Fotorrealismo
Durante anos, os avatares da Meta eram vistos como figuras estilizadas, quase como personagens de jogos simples. No entanto, a grande mudança ocorre agora com a integração da arquitetura Muse Spark Frontier. Através de uma técnica de 'destilação' (que simplifica a IA para que ela rode mais rápido), a Meta conseguiu reduzir o custo computacional em 60 vezes.
O resultado? A latência — que é o tempo de atraso entre a fala e a reação visual — caiu para apenas 870 ms, tornando a conversa fluida e natural, simulando a sensação de estar frente a frente com a pessoa.
Tecnologia em Dois Níveis: Escolha o seu Hardware
Para que essa experiência seja possível, a Meta implementou a tecnologia em dois dispositivos distintos, adaptando a forma como os dados são capturados:
Com um custo estimado de US$ 799, nestes óculos o avatar é 100% impulsionado pela voz. Não existem sensores faciais; a IA deduz a expressão emocional baseando-se no tom e no que o usuário diz. O lançamento estaria previsto para o outono de 2026 para usuários de WhatsApp nos EUA.
Com valor de US$ 1.299 e previsão de lançamento para a primavera de 2027, estes óculos oferecem hologramas de corpo inteiro. Diferente dos Ray-Ban, eles usam câmeras e sensores internos para rastrear reações reais, projetando avatares em tamanho real com áudio espacial.
O Coração do Sistema: Muse Realtime Voice
Toda essa mágica acontece em servidores de alta performance GB200, que permitem sustentar até 12 sessões simultâneas com vídeo em 448x768 a 25 fps. Para evitar o problema dos deepfakes (vídeos manipulados por IA que imitam pessoas reais), a Meta criou o Meta Video Seal, uma marca d'água invisível que certifica que aquele conteúdo foi gerado por inteligência artificial.
| Recurso | Detalhe Técnico |
|---|---|
| Configuração Inicial | 5 minutos de captura (fotos e voz) via app Meta AI |
| Limitação Atual | Vista frontal predominante (algumas distorções em ângulos laterais) |
| Integração | Suporte nativo para WhatsApp e Zoom nos óculos VR |
Perspectivas para o Futuro
Esta inovação poderia democratizar o acesso à realidade virtual, especialmente para pessoas com mobilidade reduzida ou que preferem manter certa privacidade visual sem perder a emotividade da conversa. É provável que a Meta estaria integrando esses avatares ao ecossistema Muse Charm para chamadas mãos livres. Além disso, a limitação da visão frontal poderia ser resolvida futuramente com modelos 3D em tempo real, permitindo que você caminhe ao redor do holograma do seu interlocutor!