El Technology Innovation Institute (TII) ha presentado Falcon-ASR en el blog de Hugging Face. El modelo convierte voz en texto con especial atención al árabe emiratí. El equipo afirma que también reconoce árabe estándar y otras variantes regionales, además de inglés, francés, español y portugués con los mismos pesos. En seis conjuntos de prueba públicos de árabe, TII informa de un promedio del 20,92 % en tasa de error de palabras: cuanto menor, mejor. El equipo lo compara con el 23,17 % de la mejor puntuación publicada en la clasificación que consultó el 30 de septiembre. En una evaluación interna de habla emiratí comunica un 22,73 % de error de palabras y un 10,19 % de error de caracteres. Esos datos internos no ofrecen la misma posibilidad de comprobación externa que las pruebas públicas. El modelo incluye marcas de tiempo por palabra y una demostración para clips breves. TII dice que el acceso por API y las aplicaciones nativas están planificados. La precisión real en reuniones o llamadas dependerá del acento, el ruido, la mezcla de hablantes y el tipo de grabación; las cifras del anuncio no equivalen a una garantía para todos esos casos. Imagen ilustrativa: micrófono estéreo fotografiado por Maupao70; no es el equipo usado en las evaluaciones de Falcon-ASR.
Falcon-ASR busca transcribir el árabe hablado y sus dialectos
Imagen ilustrativa: Maupao70 · CC BY-SA 4.0
Fuente principal:
Hugging Face Blog →
Hugging Face Blog →
