Attentionless Streaming ASR


Date

Formats

Catégories

Contenu

attentionless-streaming-asr contient le code associé à l’article Do we really need Self-Attention for Streaming Automatic Speech Recognition?, qui explore l’importance des mécanismes d’auto-attention dans la reconnaissance automatique de la parole en flux continu.

La publication du code vise à renforcer la transparence, la reproductibilité, et à stimuler l’innovation dans la communauté de la reconnaissance vocale. Elle comprend une implémentation minimaliste des modèles basés sur l’architecture Conformer-Transducer, accompagnée de scripts d’entraînement, de fichiers de configuration, et d’une documentation détaillée. Les jeux de données utilisés, tels que LibriSpeech et TEDLIUM, sont accessibles publiquement, permettant à d’autres chercheurs de reproduire les résultats, et de s’appuyer sur cette recherche, dans le but d’encourager le développement collaboratif de modèles de reconnaissance vocale en flux plus efficaces, notamment, ceux, qui réduisent la charge computationnelle, en remplaçant, ou en supprimant, les modules d’auto-attention.

Le code est disponible sur GitHub sous licence MIT.