Monatliches Ranking · Stand: Juni 2026
Top 5: KI-Transkription (Speech-to-Text)
Unsere Marktbeobachtungen im Juni 2026
Google hat Chirp 3: Transcription im Juni 2026 allgemein verfügbar gemacht. Das generative ASR-Modell ist über die Speech-to-Text-API V2 zugänglich, bietet Sprechertrennung, automatische Spracherkennung, einen integrierten Entstörer sowie eine Sprachanpassung für eigenes Vokabular und deckt nach Anbieterangaben mehr als 85 Sprachen ab. Der Neueinstieg betrifft vor allem die Kriterien Sprachenumfang, Sprechertrennung, Robustheit und Anpassbarkeit.
AssemblyAI führt zum Stand 8. Juni 2026 Universal-3.5 Pro Realtime als aktuelles Echtzeit-Modell. Es trägt den Gesprächskontext über Sprecherwechsel hinweg, um Fehler in zusammenhängender Rede zu senken, unterstützt 19 Sprachen mit Code-Switching mitten im Satz und misst nach Anbieterangaben rund 534 Millisekunden Latenz im 95. Perzentil. Die Neuerung betrifft die Kriterien Genauigkeit und Kontextverständnis, ohne die Rangordnung der Kategorie zu verschieben.
Rangverlauf
Januar–Juni 2026
- MicrosoftMAI-Transcribe-1
- GladiaSolaria
- Alibaba CloudQwen3-ASR
- CohereCohere Transcribe
| Tool | Januar 2026 | Februar 2026 | März 2026 | April 2026 | Mai 2026 | Juni 2026 |
|---|---|---|---|---|---|---|
| Scribe v2 | 1 | 1 | 1 | 1 | 1 | 1 |
| Universal | 3 | 3 | 2 | 2 | 2 | 2 |
| Nova Nova-3 | 2 | 2 | 3 | 3 | 3 | 3 |
| Chirp | – | – | – | – | – | 4 |
| Voxtral Transcribe 2 | – | 4 | 4 | 4 | 4 | 5 |
Aktuelles Ranking
-
Scribe v2
- Deckt nach Anbieterangaben über 90 Sprachen einschließlich Deutsch ab; die Echtzeit-Variante liefert Transkripte mit rund 150 Millisekunden Latenz.
- Bietet Keyterms mit bis zu 50 Begriffen und einen No-Verbatim-Modus sowohl in der Batch- als auch in der Echtzeit-Schnittstelle, was Anpassbarkeit und Textaufbereitung stärkt.
- Trennt mehrere Sprecher in langen Aufnahmen und kennzeichnet nicht-sprachliche Audio-Ereignisse wie Lachen oder Hintergrundgeräusche.
- Bietet neben der Echtzeit-Variante eine Batch-Verarbeitung mit Entity-Redaction zur Entfernung personenbezogener Daten während der Transkription.
-
Universal
- Bietet Sprechertrennung, Keyterm-Prompting und Code-Switching sowohl in der Echtzeit- als auch in der Batch-Verarbeitung.
- Deckt nach Anbieterangaben über 99 Sprachen einschließlich Deutsch in der Batch-Transkription ab; das Echtzeit-Modell trägt den Gesprächskontext über Sprecherwechsel hinweg.
- Ergänzt eine PII-Redaction für Text und Audio und ist auf strukturierte Transkripte ausgelegt.
- Ist als Enterprise-API für Batch- und Streaming-Transkription in eigene Systeme integrierbar.
-
Nova Nova-3
- Bietet Echtzeit- und Batch-Transkription mit niedriger Latenz und ist auf Kundenservice- und Telefonie-Szenarien ausgelegt.
- Trennt mehrere Sprecher über ein optionales v2-Diarisierungsmodell und unterstützt Code-Switching innerhalb einer Aufnahme.
- Deckt nach Anbieterangaben über 50 Sprachen ab und bietet eine Profanitäts-Filterung sowie spezialisierte Modelle, etwa für den medizinischen Bereich.
- Ist als Enterprise-API mit umfangreicher Entwickler-Dokumentation und Self-Hosting-Option in eigene Abläufe integrierbar.
-
Chirp Neu
- Deckt nach Anbieterangaben mehr als 85 Sprachen und Lokalisierungen ab und erkennt die gesprochene Sprache automatisch, was mehrsprachiges Audio innerhalb einer Aufnahme erleichtert.
- Trennt mehrere Sprecher in einkanaligem Audio über eine Diarisierung und eignet sich damit für Besprechungen, Interviews und Podcasts.
- Unterstützt Streaming- sowie Batch-Verarbeitung über die Speech-to-Text-API in Version 2 und deckt damit Echtzeit- und Datei-Szenarien ab.
- Enthält einen integrierten Entstörer und eine Sprachanpassung für eigenes Vokabular, was die Kriterien Robustheit und Anpassbarkeit adressiert.
-
Voxtral Transcribe 2
- Kombiniert ein Batch-Modell mit Sprechertrennung, Wort-Zeitstempeln und Kontext-Biasing für eigenes Vokabular mit einem Echtzeit-Modell unter offenen Gewichten.
- Das Echtzeit-Modell arbeitet nach Anbieterangaben mit einer auf unter 200 Millisekunden konfigurierbaren Latenz und transkribiert den Audiostrom fortlaufend.
- Durch offene Gewichte lokal oder in der privaten Cloud betreibbar, womit sensible Audiodaten das eigene Unternehmen nicht verlassen müssen.
- Unterstützt nach Anbieterangaben 13 Sprachen einschließlich Deutsch; der Sprachenumfang ist damit enger als bei den höher platzierten Anbietern.
Methodik & Transparenz
Diese Rankings dienen der Marktorientierung. Sie sind ein redaktioneller, kostenloser Überblick auf Basis öffentlich verfügbarer Quellen, keine abschließende oder absolute Bewertung. Jede Ausgabe ist eine Momentaufnahme; der Markt verändert sich schnell, und die Auswahl erhebt keinen Anspruch auf Vollständigkeit. Bewertet wird ausschließlich anhand der je Kategorie veröffentlichten Kriterien; ein eigener Labortest findet nicht statt. Die vergleichende Einordnung ist unsere redaktionelle Meinung, keine Tatsachenbehauptung über die Eignung einzelner Produkte, und sie wertet keinen Anbieter pauschal ab. Sie ersetzt keine eigene Prüfung. Stand: 01.07.2026.
Bei Recherche und Zusammenfassung kommen KI-Technologien zum Einsatz. Auswahl, Einordnung und Veröffentlichung werden von einer Person geprüft, freigegeben und redaktionell verantwortet. Genannte Produkt-, Marken- und Unternehmensnamen sind Eigentum der jeweiligen Inhaber; ihre Nennung dient allein der Information und Identifikation und bedeutet weder eine Empfehlung noch eine geschäftliche Verbindung zu diesen Anbietern. FORGEINITY hostet oder vervielfältigt keine fremden Inhalte, sondern verweist auf die Originalquellen.
Soweit wir auf externe Seiten verlinken, sind für deren Inhalte ausschließlich die jeweiligen Betreiber verantwortlich. Wir machen uns verlinkte Inhalte nicht zu eigen und übernehmen für sie keine Haftung; zum Zeitpunkt der Verlinkung waren keine Rechtsverstöße erkennbar, und bei Kenntnis einer Rechtsverletzung entfernen wir den betreffenden Link unverzüglich. Unabhängigkeit: Kein Anbieter hat für Platzierung oder Bewertung bezahlt; es bestehen keine Provisions-, Affiliate- oder Werbevereinbarungen. FORGEINITY arbeitet technologie-offen und bewertet ausschließlich anhand der veröffentlichten Kriterien. Alle Angaben erfolgen ohne Gewähr; eine Haftung für Richtigkeit, Vollständigkeit oder für Entscheidungen, die auf Grundlage dieser Rankings getroffen werden, ist ausgeschlossen.
Rechteinhaber, Betroffene und Dritte können eine Korrektur oder Entfernung einzelner Angaben unter legal@forgeinity.com anfragen oder einen rechtswidrigen verlinkten Inhalt melden. Wir prüfen berechtigte Hinweise und reagieren zeitnah.
Bewertet wird anhand dieser Kriterien:
- Transkriptionsgenauigkeit (bewertet, wie verlässlich gesprochene Sprache in korrekten Text überführt wird, üblicherweise gemessen als Wortfehlerrate, WER)
- Latenz (bewertet, wie schnell das Transkript vorliegt, von der Verzögerung im Echtzeit-Streaming bis zur Durchlaufzeit bei der Datei-Verarbeitung)
- Robustheit (bewertet die Erkennungsqualität bei Akzenten, Dialekten, Umgebungsgeräuschen und schwieriger Audioqualität)
- Sprachenumfang (bewertet Anzahl und Qualität der unterstützten Sprachen, einschließlich Deutsch, sowie den Umgang mit Sprachwechseln innerhalb einer Aufnahme)
- Sprechertrennung (bewertet die Diarisierung, also wie zuverlässig mehrere Sprecher erkannt und ihren Redebeiträgen zugeordnet werden)
- Kontextverständnis und Textaufbereitung (bewertet sinnvolle Zeichensetzung, die korrekte Wiedergabe von Zahlen, Eigennamen und Fachbegriffen sowie das Verständnis des inhaltlichen Zusammenhangs)
- Anpassbarkeit (bewertet die Domain-Adaption an Branchen- und Unternehmensvokabular, etwa über Custom Vocabulary oder Fine-Tuning)