YODAS v3: Mehr als eine Million Stunden Sprache für offene Audiomodelle

Für leistungsfähige Spracherkennung genügt es nicht, ein gutes Modell zu entwerfen. Es braucht auch Aufnahmen aus unterschiedlichen Sprachen und Aufnahmebedingungen. Das ESPnet-Team hat am 27. September YODAS v3 vorgestellt: einen frei zugänglichen Korpus mit rund 1,1 Millionen Stunden Audio. Neben Sprachaufnahmen enthält er Transkripte, teilweise englische Übersetzungen und Angaben zur Tonqualität. Anders als viele große Sprachdatensätze bewahrt er auch mehrkanaliges Audio auf.

Was in den Daten steckt

YODAS v3 sammelt Tonspuren aus Videos, die unter einer Creative-Commons-Lizenz veröffentlicht wurden. Das Team suchte auf YouTube mit sprachspezifischen Begriffen statt mit einer einzigen, für alle Sprachen gemeinsamen Wortliste. Diese Begriffe leitete es aus den jeweiligen Wikipedia-Sprachversionen ab. So sollten auch Videos gefunden werden, die eine von englischen Suchbegriffen geprägte Abfrage leicht übersehen hätte. Laut Forschungsarbeit wurden Video-IDs aus YODAS v2 bei der Sammlung ausgeschlossen, damit beide Korpora zusammen genutzt werden können.

Die Audiodateien liegen im WebM/Opus-Format vor. Zu ihnen gehören Metadaten wie Dauer, Sprache, Kanalzahl und geschätzte effektive Bandbreite. Wo Untertitel vorhanden waren, übernahm das Team bevorzugt manuell erstellte Fassungen; andernfalls nutzte es automatisch erzeugte Untertitel. Auch englische Übersetzungen für nicht englischsprachige Videos sind teilweise enthalten. Die Datensatzbeschreibung nennt Transkripte für ungefähr drei Viertel der Daten und Übersetzungen für rund 60 Prozent der nicht englischsprachigen Daten. Diese Angaben sind wichtig für die Planung: Wer ein überwachtes Spracherkennungsmodell trainieren will, kann nicht jede Audiostunde gleichermaßen verwenden.

Warum die Tonqualität zählt

ESPnet verteilt die Aufnahmen mit einer nominellen Abtastrate von 48 kHz. Diese Zahl allein sagt allerdings wenig darüber aus, welche Frequenzen ursprünglich aufgenommen wurden. Ein schwaches Signal gewinnt durch eine höhere Abtastrate keine verlorenen Details zurück. Das Team hat deshalb den tatsächlichen Frequenzgehalt analysiert: Nach seinen Angaben erreichen mehr als 92 Prozent des Korpus eine effektive Rate von mindestens 32 kHz. Bei mehr als 70 Prozent unterscheiden sich zudem mindestens zwei Audiokanäle tatsächlich voneinander; als Stereo gespeichertes Mono wurde dabei nicht einfach als räumliches Signal gezählt. Die Messmethode und die Verteilung beschreibt die Forschungsarbeit, die entsprechenden Filtermerkmale führt die Datensatzkarte auf.

Für Entwickler von Sprachsynthese, Audiocodecs oder Verfahren zur Verarbeitung mehrerer Sprecher ist das ein wesentlicher Unterschied. Sie benötigen nicht nur den gesprochenen Text, sondern auch Eigenschaften des Schallsignals, die eine reine 16-kHz-Monospur nicht abbildet. Ob die Aufnahmen für eine konkrete Aufgabe taugen, hängt trotzdem von ihrer Zusammensetzung ab: Ein Webvideo mit Musik, Hall und wechselnden Sprechern ist kein Ersatz für sauber aufgenommene Studiosprache.

Das Team hat die Daten bereits in eigenen Experimenten erprobt. Für Spracherkennung trainierte es Modelle auf Teilmengen von sieben Sprachen und testete sie mit Common Voice. Weitere Versuche betrafen neuronale Audiocodecs. Die Ergebnisse zeigen, dass sich aus dem Korpus nutzbare Trainingsdaten gewinnen lassen; sie belegen weder die Qualität eines künftig auf allen 1,1 Millionen Stunden trainierten Modells noch einen allgemeinen Vorsprung gegenüber anderen Datensätzen. Modellarchitektur, Filterung und Testmaterial beeinflussen solche Vergleiche erheblich.

Was Teams vor dem Einsatz prüfen sollten

YODAS v3 ist ein schwach annotierter Webkorpus. Automatisch erzeugte Untertitel können Wörter auslassen oder falsch erkennen, und eine Sprachkennung auf Dateiebene beschreibt nicht zwingend jeden Satz in einem Video korrekt. Die Datensatzkarte weist außerdem darauf hin, dass die Sprachverteilung je nach Messmethode anders aussieht: Die Forschungsarbeit zählt 147 Sprachen anhand der beim Upload zugeordneten Sprachinformationen; die aktuelle Ablage organisiert Transkripte nach 102 Sprachcodes und sammelt Aufnahmen ohne entsprechende Untertitel in einer eigenen Gruppe. Wer Daten für eine bestimmte Sprache auswählt, sollte deshalb die tatsächlichen Transkripte und Hörproben prüfen, statt nur eine globale Sprachzahl zu übernehmen.

Der Korpus ist auf Hugging Face unter CC BY 3.0 ausgewiesen. Das erleichtert die Nachnutzung, ersetzt aber keine Prüfung der Lizenz- und Quellenanforderungen für das eigene Vorhaben. Bei einem großen Korpus aus Webvideos sollten Teams außerdem Stichproben auf ungeeignete Inhalte, Fehler in Untertiteln und Übersetzungen sowie mögliche Überschneidungen mit ihren Testdaten untersuchen. Auch der Umfang setzt Infrastruktur voraus: Das ESPnet-Team beziffert die komprimierten Audiodaten auf etwa 60 Terabyte.

Fazit

YODAS v3 erweitert den Spielraum für offene Forschung an Sprache und Audio, weil es große Datenmengen mit mehrkanaligen Tonspuren und nutzbaren Qualitätsmerkmalen verbindet. Für ein konkretes Modell ist aber nicht die Gesamtzahl der Stunden entscheidend. Erst eine sorgfältige Auswahl nach Sprache, Tonqualität, Annotation und Lizenz macht aus dem offenen Korpus einen verlässlichen Trainingsbestand.

Quellen

Nach oben scrollen