Monatliches Ranking · Stand: August 2026

Top 5: KI-Transkription (Speech-to-Text)

Unsere Marktbeobachtungen im August 2026

Google hat am 26. August 2026 Gemini 3.5 Transcribe als Public Preview in der Gemini API vorgestellt. Angeboten werden zwei Modelle: eines für Echtzeit-Streaming mit Latenz unter einer Sekunde und eines für Aufnahmen mit Sprecherzuordnung und Wort-Zeitstempeln. Der Anbieter nennt eine automatische Erkennung von mehr als 85 Sprachen; die unabhängige Messstelle Artificial Analysis weist im selben Beitrag Wortfehlerraten von 4,0 Prozent im Streaming und 2,6 Prozent bei Aufnahmen aus. Als Vorschau ist das Modell noch nicht allgemein freigegeben und bleibt daher auf der Beobachtungsliste.

ElevenLabs hat am 3. August 2026 die Echtzeit-Variante Scribe v2 Realtime um eine Entity-Erkennung erweitert; erkannte Einheiten werden im laufenden Transkript ausgewiesen. Im selben Changelog wurde das Standardmodell des MCP-Servers auf scribe_v2 umgestellt, während die Speech-to-Text-Schnittstelle das Modell weiterhin als Pflichtangabe verlangt. Die Aktualisierung stärkt das Kriterium Textaufbereitung, verschiebt die Rangordnung der Kategorie aber nicht.

Deepgram hat sein Nova-3-Angebot im August 2026 mehrfach erweitert: am 5. August um Punjabi und Nepali, am 4. und 7. August um verbesserte monolinguale Modelle und am 27. August um Assamesisch, Mongolisch und Paschtu sowie weitere verbesserte monolinguale Modelle. Die Erweiterungen betreffen die Kriterien Sprachenumfang und Textaufbereitung, ändern die relative Ordnung der Kategorie jedoch nicht.

Rangverlauf

März–August 2026

Rangverlauf der aktuellen Top-Tools über die letzten Monate Scribe v2 aktuell Rang 1; Universal aktuell Rang 2; Nova Nova-3 aktuell Rang 3; Chirp aktuell Rang 4; Voxtral Transcribe 2 aktuell Rang 5. Scribe v2 · März 2026 · Rang 1 – Rang 1 unverändert gegenüber der Vorausgabe; im Berichtsmonat gab es keine datierte Neuerung, die die Position an der Spitze der Kategorie verschoben hätte. Scribe v2 · April 2026 · Rang 1 – Rang 1 unverändert gegenüber der Vorausgabe; der April-Ausbau von Scribe v2 festigt die Spitzenposition, verschob aber nichts an der relativen Ordnung der Kategorie. Scribe v2 · Mai 2026 · Rang 1 – Rang 1 unverändert gegenüber der Vorausgabe; die Mai-Erweiterung der Echtzeit-Schnittstelle festigt die Position, verschob aber nichts an der relativen Ordnung der Kategorie. Scribe v2 · Juni 2026 · Rang 1 – Rang 1 unverändert gegenüber der Vorausgabe; im Berichtsmonat wurde lediglich das Vorgängermodell scribe_v1 abgekündigt, was die Spitzenposition von Scribe v2 nicht berührt. Scribe v2 · Juli 2026 · Rang 1 – Rang 1 unverändert gegenüber der Vorausgabe; die Recherche im Berichtsmonat ergab keine datierte Verschiebung an der Spitze der Kategorie. Scribe v2 · August 2026 · Rang 1 – Rang 1 unverändert gegenüber der Vorausgabe; die Recherche im Berichtsmonat ergab eine Produktpflege, aber keine datierte Verschiebung an der Spitze der Kategorie. S 1Scribev2 Universal · März 2026 · Rang 2 – Von Rang 3 auf Rang 2: Die am 3. März 2026 veröffentlichte Streaming-Variante von Universal-3 Pro bringt Echtzeit-Sprechertrennung, Keyterm-Prompting und über 99 Sprachen in den Echtzeit-Betrieb und verbessert damit die Abdeckung der Kriterien Latenz, Sprechertrennung und Sprachenumfang. Universal · April 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; im April kam mit dem Medical Mode eine Vertikal-Erweiterung hinzu, die die Position stützt, ohne die Ordnung zu verschieben. Universal · Mai 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; im Berichtsmonat gab es keine datierte Verschiebung an den Bewertungskriterien gegenüber den benachbarten Plätzen. Universal · Juni 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; im Berichtsmonat ist Universal-3.5 Pro Realtime als aktuelles Echtzeit-Modell belegt, was die Position festigt, ohne die relative Ordnung der Kategorie zu verschieben. Universal · Juli 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; im Berichtsmonat gab es keine datierte Verschiebung an den Bewertungskriterien gegenüber den benachbarten Plätzen. Universal · August 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; im Berichtsmonat gab es keine datierte Verschiebung an den Bewertungskriterien gegenüber den benachbarten Plätzen. U 2UniversalUniversal-3.5 Pro Realtime Nova Nova-3 · März 2026 · Rang 3 – Von Rang 2 auf Rang 3: Am Produkt selbst gab es im Berichtsmonat keine datierte Neuerung; die datierte März-Neuerung bei AssemblyAI schiebt sich an der Kriterienabdeckung vorbei. Nova-3 bleibt unverändert verfügbar und ein leistungsstarkes Angebot. Nova Nova-3 · April 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; am Modell Nova-3 selbst gab es im April keine datierte Neuerung, das separat eingeführte Flux bildet eine eigene Produktlinie. Nova Nova-3 · Mai 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; die Mai-Aktualisierungen an Nova-3 stärken das Angebot, ohne die relative Ordnung der Kategorie zu verschieben. Nova Nova-3 · Juni 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; im Berichtsmonat gab es keine datierte Verschiebung an den Bewertungskriterien gegenüber den benachbarten Plätzen. Nova Nova-3 · Juli 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; im Berichtsmonat verbesserte Deepgram die Nova-3 Monolingual-Modelle, was die Qualität festigt, ohne die relative Ordnung der Kategorie zu verschieben. Nova Nova-3 · August 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; im Berichtsmonat erweiterte Deepgram Nova-3 um weitere Sprachen, was die Qualität festigt, ohne die relative Ordnung der Kategorie zu verschieben. N 3NovaNova-3 Chirp · Juni 2026 · Rang 4 – Neueinstieg in das Ranking: Google gab Chirp 3: Transcription im Berichtsmonat allgemein frei; das Modell erfüllt Sprachenumfang und Sprechertrennung mindestens so gut wie das verdrängte Angebot auf Platz 5. Chirp · Juli 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; nach der allgemeinen Verfügbarkeit im Vormonat gab es im Berichtsmonat keine datierte Verschiebung an den Bewertungskriterien. Chirp · August 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; am Cloud-Produkt Chirp 3 gab es im Berichtsmonat keine datierte Verschiebung an den Bewertungskriterien. C 4Chirp3 Transcription Voxtral Transcribe 2 · März 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; im Berichtsmonat keine datierte Neuerung, das Modell mit offenen Gewichten bleibt auf seiner Position platziert. Voxtral Transcribe 2 · April 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; im April gab es kein neues Release, das im Februar veröffentlichte Modell bleibt die aktuelle Version der Produktfamilie. Voxtral Transcribe 2 · Mai 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; im Berichtsmonat gab es keine datierte Neuerung, die im Februar veröffentlichte Modellgeneration bleibt die aktuelle Version der Produktfamilie. Voxtral Transcribe 2 · Juni 2026 · Rang 5 – Fällt von Rang 4 auf Rang 5, weil mit Chirp 3 ein Angebot mit deutlich breiterem Sprachenumfang oberhalb eingestiegen ist; am Produkt selbst gab es im Berichtsmonat keine datierte Neuerung. Voxtral Transcribe 2 · Juli 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; am Produkt selbst gab es im Berichtsmonat keine datierte Neuerung an den Bewertungskriterien. Voxtral Transcribe 2 · August 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; am Produkt selbst gab es im Berichtsmonat keine datierte Neuerung an den Bewertungskriterien. V 5Voxtral Transcribe2
Watchlist
  • GoogleGemini 3.5 Transcribe
  • OpenAIGPT-Transcribe ↓ zuletzt Rang 5 · Mai
  • IBMGranite Speech 5.0
  • Alibaba CloudQwen3-ASR
Rangverlauf je Tool über die letzten Monate
ToolMärz 2026April 2026Mai 2026Juni 2026Juli 2026August 2026
Scribe v2111111
Universal222222
Nova Nova-3333333
Chirp444
Voxtral Transcribe 2444555

Aktuelles Ranking

  1. Scribe v2

    ElevenLabs Tendenz: unverändert

    • Deckt nach Anbieterangaben über 90 Sprachen einschließlich Deutsch ab; die Echtzeit-Variante liefert Transkripte mit rund 150 Millisekunden Latenz.
    • Die Echtzeit-Variante Scribe v2 Realtime erhielt am 3. August 2026 eine Entity-Erkennung, die erkannte Einheiten im laufenden Transkript ausweist und die Textaufbereitung stärkt.
    • Trennt mehrere Sprecher in langen Aufnahmen und kennzeichnet nicht-sprachliche Audio-Ereignisse wie Lachen oder Hintergrundgeräusche.
    • Bietet in der Batch-Verarbeitung eine Entity-Redaction zur Entfernung personenbezogener Daten während der Transkription.
    Zum Anbieter
  2. Universal

    AssemblyAI Tendenz: unverändert

    • Der gereihte Strang Universal-3.5 Pro deckt 18 Sprachen einschließlich Deutsch ab; die Batch-Transkription mit Universal-2 erreicht 99 Sprachen mit Sprechertrennung für einen Großteil davon.
    • Bietet Keyterm-Prompting und Code-Switching sowohl in der Echtzeit- als auch in der Batch-Verarbeitung; das Echtzeit-Modell trägt den Gesprächskontext über Sprecherwechsel hinweg.
    • Ergänzt eine PII-Redaction für Text und Audio und ist auf strukturierte Transkripte ausgelegt.
    • Ist als Enterprise-API für Batch- und Streaming-Transkription in eigene Systeme integrierbar.

    Preis: 0,45 $/Stunde (Universal-3.5 Pro Realtime, Pay-as-you-go, Grundpreis)

    Zum Anbieter
  3. Nova Nova-3

    Deepgram Tendenz: unverändert

    • Bietet Echtzeit- und Batch-Transkription mit niedriger Latenz und ist auf Kundenservice- und Telefonie-Szenarien ausgelegt.
    • Erweiterte das Nova-3-Sprachangebot am 27. August 2026 um Assamesisch, Mongolisch und Paschtu und veröffentlichte verbesserte monolinguale Modelle für weitere Sprachen.
    • Trennt mehrere Sprecher über ein optionales Diarisierungsmodell und unterstützt Code-Switching innerhalb einer Aufnahme.
    • Ist als Enterprise-API mit umfangreicher Entwickler-Dokumentation und Self-Hosting-Option in eigene Abläufe integrierbar.
    Zum Anbieter
  4. Chirp

    Google Tendenz: unverändert

    • Die Modell-Dokumentation führt rund 100 Sprachen und Lokalisierungen, davon etwa ein Viertel allgemein verfügbar und den Rest als Vorschau; die gesprochene Sprache wird auf Wunsch automatisch erkannt, was mehrsprachiges Audio innerhalb einer Aufnahme erleichtert.
    • Trennt mehrere Sprecher in einkanaligem Audio über eine Diarisierung und eignet sich damit für Besprechungen, Interviews und Podcasts.
    • Unterstützt Streaming- sowie Batch-Verarbeitung über die Speech-to-Text-API und deckt damit Echtzeit- und Datei-Szenarien ab.
    • Enthält einen integrierten Entstörer und eine Sprachanpassung für eigenes Vokabular, was die Kriterien Robustheit und Anpassbarkeit adressiert.
    Zum Anbieter
  5. Voxtral Transcribe 2

    Mistral AI Tendenz: unverändert

    • Kombiniert ein Batch-Modell mit Sprechertrennung, Wort-Zeitstempeln und Kontext-Biasing für eigenes Vokabular mit einem Echtzeit-Modell unter offenen Gewichten.
    • Das Echtzeit-Modell arbeitet nach Anbieterangaben mit einer auf unter 200 Millisekunden konfigurierbaren Latenz und transkribiert den Audiostrom fortlaufend.
    • Das Echtzeit-Modell Voxtral Realtime steht unter Apache 2.0 und lässt sich lokal oder in der privaten Cloud betreiben, womit sensible Audiodaten das eigene Unternehmen nicht verlassen müssen; die Stapelverarbeitung mit Voxtral Mini Transcribe V2 läuft über die Schnittstelle des Anbieters.
    • Unterstützt nach Anbieterangaben 13 Sprachen einschließlich Deutsch; der Sprachenumfang ist damit enger als bei den höher platzierten Anbietern.
    Zum Anbieter

Methodik & Transparenz

Diese Rankings dienen der Marktorientierung. Sie sind ein redaktioneller, kostenloser Überblick auf Basis öffentlich verfügbarer Quellen, keine abschließende oder absolute Bewertung. Jede Ausgabe ist eine Momentaufnahme; der Markt verändert sich schnell, und die Auswahl erhebt keinen Anspruch auf Vollständigkeit. Bewertet wird ausschließlich anhand der je Kategorie veröffentlichten Kriterien; ein eigener Labortest findet nicht statt. Die vergleichende Einordnung ist unsere redaktionelle Meinung, keine Tatsachenbehauptung über die Eignung einzelner Produkte, und sie wertet keinen Anbieter pauschal ab. Sie ersetzt keine eigene Prüfung. Stand: 01.09.2026.

Bei Recherche und Zusammenfassung kommen KI-Technologien zum Einsatz. Auswahl, Einordnung und Veröffentlichung werden von einer Person geprüft, freigegeben und redaktionell verantwortet. Genannte Produkt-, Marken- und Unternehmensnamen sind Eigentum der jeweiligen Inhaber; ihre Nennung dient allein der Information und Identifikation und bedeutet weder eine Empfehlung noch eine geschäftliche Verbindung zu diesen Anbietern. FORGEINITY hostet oder vervielfältigt keine fremden Inhalte, sondern verweist auf die Originalquellen.

Soweit wir auf externe Seiten verlinken, sind für deren Inhalte ausschließlich die jeweiligen Betreiber verantwortlich. Wir machen uns verlinkte Inhalte nicht zu eigen und übernehmen für sie keine Haftung; zum Zeitpunkt der Verlinkung waren keine Rechtsverstöße erkennbar, und bei Kenntnis einer Rechtsverletzung entfernen wir den betreffenden Link unverzüglich. Unabhängigkeit: Kein Anbieter hat für Platzierung oder Bewertung bezahlt; es bestehen keine Provisions-, Affiliate- oder Werbevereinbarungen. FORGEINITY arbeitet technologie-offen und bewertet ausschließlich anhand der veröffentlichten Kriterien. Alle Angaben erfolgen ohne Gewähr; eine Haftung für Richtigkeit, Vollständigkeit oder für Entscheidungen, die auf Grundlage dieser Rankings getroffen werden, ist ausgeschlossen.

Rechteinhaber, Betroffene und Dritte können eine Korrektur oder Entfernung einzelner Angaben unter legal@forgeinity.com anfragen oder einen rechtswidrigen verlinkten Inhalt melden. Wir prüfen berechtigte Hinweise und reagieren zeitnah.

Bewertet wird anhand dieser Kriterien:

  1. Transkriptionsgenauigkeit (bewertet, wie verlässlich gesprochene Sprache in korrekten Text überführt wird, üblicherweise gemessen als Wortfehlerrate, WER)
  2. Latenz (bewertet, wie schnell das Transkript vorliegt, von der Verzögerung im Echtzeit-Streaming bis zur Durchlaufzeit bei der Datei-Verarbeitung)
  3. Robustheit (bewertet die Erkennungsqualität bei Akzenten, Dialekten, Umgebungsgeräuschen und schwieriger Audioqualität)
  4. Sprachenumfang (bewertet Anzahl und Qualität der unterstützten Sprachen, einschließlich Deutsch, sowie den Umgang mit Sprachwechseln innerhalb einer Aufnahme)
  5. Sprechertrennung (bewertet die Diarisierung, also wie zuverlässig mehrere Sprecher erkannt und ihren Redebeiträgen zugeordnet werden)
  6. Kontextverständnis und Textaufbereitung (bewertet sinnvolle Zeichensetzung, die korrekte Wiedergabe von Zahlen, Eigennamen und Fachbegriffen sowie das Verständnis des inhaltlichen Zusammenhangs)
  7. Anpassbarkeit (bewertet die Domain-Adaption an Branchen- und Unternehmensvokabular, etwa über Custom Vocabulary oder Fine-Tuning)