Modelos

TII lança Falcon-ASR, modelo de áudio com 1,6 bi de parâmetros e suporte a português

Desenvolvido em Abu Dhabi, o modelo foca em dialetos árabes, mas processa inglês, português, espanhol e francês nos mesmos pesos e sem flag de idioma.

Capa ilustrativa da editoria Modelos

Por que importa. Modelos compactos de reconhecimento de fala que dispensam a identificação prévia do idioma reduzem a complexidade de pipelines de áudio e barateiam a infraestrutura de transcrição.

O Technology Innovation Institute (TII), centro de pesquisa sediado em Abu Dhabi, anunciou o Falcon-ASR, um modelo de reconhecimento automático de fala (ASR) com 1,6 bilhão de parâmetros. O sistema foi construído a partir de pesquisas anteriores da organização com o Falcon3-Audio e já está disponível para testes em um espaço de demonstração no Hugging Face.

Embora o objetivo principal do projeto seja transcrever o árabe moderno padrão e dialetos regionais, com foco particular no árabe dos Emirados Árabes Unidos, o Falcon-ASR também foi treinado para transcrever inglês, francês, espanhol e português. Todas as cinco línguas são atendidas pelo mesmo conjunto de pesos, sem que o usuário precise especificar previamente qual idioma está sendo falado no arquivo.

Desempenho em testes e marcação temporal

Segundo os dados publicados pelo TII, o modelo alcançou uma taxa média de erro de palavras (WER) de 20,92% em seis conjuntos de teste na tabela pública de áudio árabe mantida pelo ELM Research Center. O índice superou sistemas como o Audar-ASR-V1-Turbo (23,17%) e o omniASR LLM 7B (28,32%). Em testes internos focados na fala dos Emirados, o Falcon-ASR atingiu 22,73% de WER, à frente dos 26,80% registrados pelo Qwen3-Omni-30B.

Nos benchmarks públicos em inglês avaliados na plataforma da Hugging Face, a taxa média de erro de palavras ficou em 5,74%. O instituto afirma ter submetido os dados de treino a cenários de ruído de fundo, sobreposição de falas, reverberação de ambiente e distorções comuns em chamadas telefônicas. O modelo também gera marcações temporais no nível de cada palavra individual, e a instituição planeja lançar futuramente o acesso via API e aplicativos nativos.

Fontes

Reportagem produzida pela redação do Flipters com apoio de inteligência artificial, a partir das fontes acima. Como trabalhamos.

WhatsAppLinkedInX
Voltar para a edição

Mais em Modelos

Ver todas

Quem constrói lê

Receba o Flipters no seu e-mail. A newsletter de IA para quem está tirando produto do papel.