Hugging Face lança placar aberto para avaliar TTS multilíngue

Hugging Face lança placar aberto para avaliar TTS multilíngue

O Hugging Face apresentou, no fim de setembro de 2026, o Open TTS Leaderboard, um placar aberto para avaliar modelos de síntese de voz (text-to-speech) e de clonagem de voz com métricas objetivas. O anúncio é assinado por Eric Bezzam, Steven Zheng, Eustache Le Bihan e pelo usuário mrfakename e foi publicado no blog da companhia.

A proposta central é de escala: com avaliação automática, o tempo necessário para medir um modelo cai de cerca de duas semanas para algumas horas. Duas semanas é o intervalo típico de coleta de votos em arenas.

O placar está disponível publicamente.

Um gargalo chamado avaliação

O volume de modelos abertos de TTS cresceu muito. Até o fim de setembro de 2026, o Hugging Face Hub reunia mais de 8 mil modelos com a tag text-to-speech.

A avaliação, porém, não acompanhou esse ritmo e continua fragmentada. O padrão-ouro são notas de preferência humana, como MOS e MUSHRA.

Algumas arenas viraram referência da comunidade: a TTS Arena v2, o Artificial Analysis e o Voice Arena. Nelas, o usuário ouve as saídas de dois modelos e escolhe a melhor.

Depois de votos suficientes, calcula-se uma pontuação Elo, normalmente com o modelo Bradley-Terry.

O problema é que arenas não escalam. Os autores observam que, no mesmo período, apenas 16 dos 92 modelos listados no Artificial Analysis eram de pesos abertos, com desequilíbrio semelhante no Voice Arena.

Adicionar um modelo de API exige pouco mais do que uma chave de acesso. Um modelo aberto precisa ser hospedado e servido pela própria arena.

Fornecedores comerciais também têm mais incentivo para buscar posição no ranking do que autores de projetos abertos.

A isso se soma a consistência dos votantes. Nenhuma arena garante que as mesmas pessoas, com os mesmos critérios de "melhor", avaliem modelos ao longo do tempo.

Nem que uma única pessoa mantenha o próprio julgamento estável.

Três métricas complementares

O Open TTS Leaderboard ataca o problema com três eixos objetivos. O primeiro é inteligibilidade: a taxa de erro de palavra e de caractere (WER e CER) entre o texto de entrada e a transcrição do áudio gerado.

A transcrição usa o Qwen3 ASR, apontado como o modelo aberto mais bem colocado no Open ASR Leaderboard.

O segundo eixo é velocidade, medido de duas formas: o fator inverso de tempo real (RTFx) em inferência offline com lotes em uma GPU H200, e o tempo até o primeiro áudio (TTFA), que quantifica a latência de streaming com lote de tamanho 1 em H200 e em CPU.

O terceiro é similaridade de locutor: a similaridade de cosseno entre os embeddings de locutor do WavLM extraídos do áudio gerado e da gravação de referência, com base no modelo WavLM disponibilizado pelos autores.

Multilíngue e clonagem de voz

Na visão padrão, os modelos são ordenados pela média macro de WER nas divisões em inglês de dois conjuntos de avaliação: o Seed TTS Eval e o CV3 Eval.

O CV3 Eval é usado no cenário zero-shot, em que o sistema precisa reproduzir uma voz que nunca viu durante o treinamento. Entre os modelos citados no anúncio estão o hexgrad/Kokoro-82M e o Supertone/supertonic-3.

A combinação de WER, latência e similaridade permite comparar sistemas que falam vários idiomas e que fazem clonagem de voz sem depender de uma fila de votos humanos.

O que o placar não mede

Os próprios autores fazem questão de delimitar o alcance da ferramenta. O novo placar não substitui o ranking por preferência humana.

O WER calculado a partir de reconhecimento automático de fala é apenas um indicador indireto de inteligibilidade. A similaridade de locutor estima a preservação da identidade vocal.

Nenhuma das duas métricas mede diretamente naturalidade, expressividade ou a preferência do ouvinte. A utilidade, segundo o texto, é complementar: os resultados objetivos podem até orientar arenas baseadas em votação sobre quais modelos vale a pena incluir em suas avaliações.

Um placar para a comunidade

A intenção declarada é que o leaderboard seja moldado pela comunidade, com espaço para feedback que mantenha as avaliações relevantes ao longo do tempo.

Para quem desenvolve ou consome modelos de voz em português e em outros idiomas, o placar oferece um caminho mais rápido para triagem técnica antes de testes com ouvintes humanos. Sem, no entanto, dispensar esses testes quando o critério for a qualidade percebida.

Fontes e links

Matéria publicada originalmente em Hugging Face

Últimas Notícias

OpenAI e Meta apostam em "Tamagotchis" de IA para vender hardware
Jev: o modelo que decide sem gerar texto chega ao LangChain
Gemini 4 Argon: Google lança modelo de fronteira com 1M tokens
Anthropic lança verificação para uso de IA em ciências da vida