Meta apresenta Muse Voice Transcribe com suporte a mais de 70 idiomas
O Muse Voice Transcribe também se destaca pela capacidade de ajustar o tempo de resposta conforme a complexidade de cada trecho de áudio processado.
O avanço das interfaces de voz ganhou uma nova frente com o Muse Voice Transcribe, tecnologia apresentada pela Meta para interpretar conversas enquanto o áudio ainda acontece. O modelo reúne recursos destinados a reconhecer diferentes idiomas, separar participantes e identificar momentos relevantes da fala dentro de uma única experiência de transcrição.
Sistema reúne diferentes recursos de áudio
Desenvolvido pela Meta Superintelligence Labs, o Muse Voice Transcribe representa a primeira iniciativa da empresa nessa nova geração de modelos voltados à percepção de voz em tempo real.
A tecnologia combina reconhecimento automático de fala com recursos capazes de distinguir mais de 20 participantes, além de identificar os momentos nos quais cada intervenção começa ou termina.
Essa estrutura permite acompanhar conversas extensas com várias pessoas sem exigir uma etapa posterior de processamento, característica importante para reuniões, entrevistas e outras situações com múltiplos interlocutores.
O suporte linguístico também ocupa posição relevante no projeto, pois o treinamento incluiu mais de 70 idiomas, embora 25 tenham recebido uma verificação mais ampla antes do lançamento inicial, incluindo o português.
Outro diferencial aparece em conversas bilíngues, nas quais o sistema reconhece alternâncias entre idiomas dentro de uma mesma frase ou ao longo de diferentes trechos do diálogo.
Palavras específicas, informações contextuais e preferências linguísticas também podem orientar o reconhecimento, recurso criado para elevar a precisão diante de nomes, locais e termos particulares.
Nos testes apresentados pela Meta, o modelo alcançou taxa de erro de 3,1% na transcrição final por streaming, resultado inferior aos percentuais dos outros sistemas incluídos nessa comparação.
Modelo ajusta tempo de resposta conforme a dificuldade da fala
O Muse Voice Transcribe processa o áudio em pequenas parcelas de 80 milissegundos e decide, a cada etapa, se precisa ouvir mais conteúdo antes de produzir determinada parte do texto.
Esse mecanismo permite ajustar automaticamente o intervalo necessário para interpretar cada palavra, com maior espera diante de trechos complexos e respostas mais rápidas quando existe contexto suficiente.
A estratégia procura equilibrar dois fatores importantes para sistemas de voz em tempo real, pois respostas muito rápidas podem prejudicar a precisão, enquanto esperas maiores aumentam a latência.
A separação entre participantes utiliza marcadores próprios para reconhecer mudanças de interlocutor, enquanto outro conjunto de sinais identifica o começo e o encerramento das falas durante a conversa.
Segundo os resultados divulgados pela empresa, a tecnologia também alcançou a primeira posição nos testes públicos citados para separação de interlocutores e reconhecimento de fala por streaming.
Tecnologia chega ao Meta AI e ao Muse Code
A aplicação prática do Muse Voice Transcribe ultrapassa a geração convencional de transcrições, com integração a ferramentas que utilizam comandos falados como parte da interação entre usuários e sistemas de inteligência artificial.
A Meta passou a utilizar o modelo na função de ditado por voz presente no Meta AI e no Muse Code, o que amplia seu alcance para diferentes tarefas executadas no computador.
O sistema também aceita conteúdos de áudio superiores a uma hora e mantém a identificação de mais de 20 participantes, sem necessidade de processamento adicional após a conversa.
O Muse Voice Transcribe está disponível por meio da Meta Model API, do Meta AI para computadores Mac e do Muse Code, conforme as opções anunciadas pela companhia.



