Monatliches Ranking · Stand: August 2026

Top 5: Große Sprachmodelle (LLMs)

Unsere Marktbeobachtungen im August 2026

Im August verdichtete sich die Spitze: SpaceXAI veröffentlichte am 12. August Grok 4.6, das im Artificial-Analysis-Intelligenz-Index mit GPT-5.6 Sol gleichzieht (je 61 Punkte) und auf Rang 3 vorrückt. OpenAI schärfte GPT-5.6 Sol nach: eine ChatGPT-Aktualisierung vom 6. August reduziert sachliche Fehler deutlich, der neue Modus Ultrafast beschleunigt die Antworterzeugung. Claude Opus 5 bleibt mit 63 Punkten an der Spitze des Index.

Das Feld der offenen Modelle wurde im August breiter: Alibaba stellte Qwen3.8-Max am 3. August zunächst über die API bereit (multimodal, rund 2,4 Billionen Parameter, 1 Mio. Token Kontext) und veröffentlichte die Gewichte am 12. August unter einer eigenen Lizenz, allerdings als reine Text-Fassung. DeepSeek überführte V4-Pro am 13. August in die allgemeine Verfügbarkeit, und Moonshots Kimi K3 war über mehrere Anbieter breit verfügbar. Im Intelligenz-Index liegen Kimi K3 (60) und Qwen3.8-Max (58) nahe an der geschlossenen Spitzengruppe.

Google verschob das Flaggschiff-Update Gemini 3.5 Pro ein drittes Mal; es blieb im August in einer begrenzten Vertex-AI-Vorschau für Unternehmen und damit ohne allgemeine Verfügbarkeit, und die DeepMind-Modellseite führt Gemini 3.1 Pro aus dem Februar als aktuelles Pro-Modell. Im August-Stand des Artificial-Analysis-Index liegt Gemini 3.1 Pro mit 48 Punkten hinter der Spitzengruppe (63 bis 60), was den Rückgang von Rang 3 auf Rang 4 trägt; der auf Rang 5 gereihte DeepSeek V4-Pro erreicht dort 53 Punkte, Gemini hält Rang 4 also über Multimodalität und Unternehmens-Ökosystem.

Rangverlauf

März–August 2026

Rangverlauf der aktuellen Top-Tools über die letzten Monate Claude Opus 5 aktuell Rang 1; GPT aktuell Rang 2; Grok 4.6 aktuell Rang 3; Gemini aktuell Rang 4; DeepSeek V4 aktuell Rang 5. Claude Opus 5 · März 2026 · Rang 3 – Rang 3 wie in der Vorausgabe; Anthropic veröffentlichte im Berichtsmonat kein neues Opus-Modell (der Nachfolger Opus 4.7 folgte erst nach dem Berichtsmonat), Opus 4.6 bleibt die aktuelle Version und die Reihenfolge unverändert. Claude Opus 5 · April 2026 · Rang 3 – Rang 3 wie in der Vorausgabe: Anthropic veröffentlichte am 16. April 2026 Claude Opus 4.7 als Nachfolger von Opus 4.6 mit deutlichen Zugewinnen bei Programmierung und Agentenfähigkeit; die relative Reihenfolge der Kategorie verschob sich dadurch nicht. Claude Opus 5 · Mai 2026 · Rang 1 – Aufstieg von Rang 3 auf Rang 1: Mit Opus 4.8 (28. Mai 2026) liegt das aktuellste Frontier-Flaggschiff vor, das nach unabhängigen Vergleichsmessungen Ende Mai knapp vor GPT-5.5 die Spitze der Kategorie übernimmt. Claude Opus 5 · Juni 2026 · Rang 1 – Rang 1 wie in der Vorausgabe. Die Recherche ergab keine Verschiebung an der Spitze der allgemein verfügbaren Modelle; die im Juni kurz verfügbare Mythos-Klasse (Fable 5) wurde behördlich gesperrt und zählt nicht zum verfügbaren Feld. Claude Opus 5 · Juli 2026 · Rang 1 – Rang 1 wie in der Vorausgabe. Anthropic löste die bisher gerankte Version 4.8 am 24. Juli durch Claude Opus 5 ab, das an der Spitze des Feldes bleibt; die relative Ordnung an der Spitze verschob sich nicht. Claude Opus 5 · August 2026 · Rang 1 – Rang 1 wie in der Vorausgabe. Anthropic veröffentlichte im August kein neues Flaggschiff; Claude Opus 5 vom 24. Juli bleibt an der Spitze der aktuellen Vergleichsmessungen, die relative Ordnung an der Spitze verschob sich nicht. C 1Claude Opus5 GPT · März 2026 · Rang 2 – Rang 2 wie in der Vorausgabe; OpenAI löste am 5. März 2026 GPT-5.2 durch GPT-5.4 ab, was die Position an den Kriterien festigt, die relative Reihenfolge der Kategorie aber nicht verändert. GPT · April 2026 · Rang 1 – Aufstieg von Rang 2 auf Rang 1: OpenAI löste am 23. April 2026 GPT-5.4 durch GPT-5.5 ab. Das zuvor erstplatzierte Gemini 3.1 Pro erhielt im Berichtsmonat keine neue Version, sodass das aktuellste Frontier-Flaggschiff an die Spitze rückt. GPT · Mai 2026 · Rang 2 – Abstieg von Rang 1 auf Rang 2: GPT-5.5 blieb im Mai das Reasoning-Flaggschiff (am 5. Mai wurde lediglich die Instant-Variante neuer ChatGPT-Standard); mit Opus 4.8 rückte am 28. Mai ein neueres, in unabhängigen Messungen knapp vorn liegendes Modell an die Spitze. GPT · Juni 2026 · Rang 2 – Rang 2 wie in der Vorausgabe. GPT-5.5 bleibt das allgemein verfügbare Flaggschiff; die neuere GPT-5.6-Reihe lief im Juni nur als behördlich beschränkte Vorschau und veränderte die Ordnung nicht. GPT · Juli 2026 · Rang 2 – Rang 2 wie in der Vorausgabe. OpenAI überführte die GPT-5.6-Reihe am 9. Juli aus der beschränkten Vorschau in die allgemeine Verfügbarkeit; das Flaggschiff Sol löst damit das bisher gerankte GPT-5.5 ab, ohne die Ordnung an der Spitze zu verschieben. GPT · August 2026 · Rang 2 – Rang 2 wie in der Vorausgabe. GPT-5.6 Sol blieb im August das OpenAI-Flaggschiff und erhielt mehrere Verbesserungen; die relative Ordnung an der Spitze änderte sich nicht. G 2GPT5.6 Sol Grok 4.6 · März 2026 · Rang 4 – Rang 4 wie in der Vorausgabe; Grok 4.20 bleibt im Berichtsmonat die aktuelle Version, der Februar-Beta-Start ging in eine breitere API-Verfügbarkeit über, ohne die relative Ordnung der Kategorie zu verändern. Grok 4.6 · April 2026 · Rang 4 – Rang 4 wie in der Vorausgabe: Die allgemein verfügbare Version blieb im Berichtsmonat Grok 4.20. Am 17. April 2026 erschien Grok 4.3 zunächst als Early-Access-Beta hinter der höchsten Abostufe, ohne die relative Ordnung der Kategorie zu verändern. Grok 4.6 · Mai 2026 · Rang 4 – Rang 4 wie in der Vorausgabe: Grok 4.3 wurde Anfang Mai allgemein verfügbar und löste die zuvor allgemein verfügbare Version 4.20 ab; die relative Ordnung der Kategorie verschob sich dadurch nicht, das Modell bleibt knapp hinter den frontiernahen Flaggschiffen. Grok 4.6 · Juni 2026 · Rang 4 – Rang 4 wie in der Vorausgabe. Grok 4.3 bleibt die allgemein verfügbare Version; eine neuere Generation erreichte im Juni keine öffentliche Verfügbarkeit, sodass sich die relative Ordnung nicht verschob. Grok 4.6 · Juli 2026 · Rang 4 – Rang 4 wie in der Vorausgabe. Der in der Juni-Vorausgabe noch als private Beta geführte Nachfolger Grok 4.5 wurde am 9. Juli öffentlich freigegeben (Anbieter jetzt SpaceXAI, vormals xAI) und löst die gerankte Version 4.3 ab, ohne die relative Ordnung zu verändern. Grok 4.6 · August 2026 · Rang 3 – Steigt von Rang 4 auf Rang 3. SpaceXAI löste Grok 4.5 am 12. August durch Grok 4.6 ab, das im August-Index mit GPT-5.6 Sol gleichzieht und die darunter liegenden Modelle überholt; damit verschiebt sich die Ordnung im Mittelfeld. G 3Grok4.6 Gemini · März 2026 · Rang 1 – Rang 1 wie in der Vorausgabe; im Berichtsmonat erschien kein neues Google-Flaggschiff, Gemini 3.1 Pro bleibt die aktuelle Version und die Spitze der Kategorie verschob sich an den Kriterien nicht. Gemini · April 2026 · Rang 2 – Abstieg von Rang 1 auf Rang 2: Im Berichtsmonat erschien kein neues Google-Flaggschiff, Gemini 3.1 Pro blieb die aktuelle Version. Mit GPT-5.5 rückte am 23. April 2026 ein neueres Frontier-Modell nach und übernahm die Spitzenposition. Gemini · Mai 2026 · Rang 3 – Abstieg von Rang 2 auf Rang 3: Im Mai erschien kein neues Gemini-Flaggschiff; auf der Google I/O kam nur Gemini 3.5 Flash, das Pro-Flaggschiff der 3.5-Reihe wurde auf Juni verschoben, sodass 3.1 Pro die Spitzenversion blieb und von Opus 4.8 überholt wurde. Gemini · Juni 2026 · Rang 3 – Rang 3 wie in der Vorausgabe. Im Juni erschien keine neue allgemein verfügbare Gemini-Spitzenversion, sodass 3.1 Pro der aktuelle Stand des Anbieters bleibt. Gemini · Juli 2026 · Rang 3 – Rang 3 wie in der Vorausgabe. Google veröffentlichte im Juli nur effizienzorientierte Flash-Modelle und verschob das Flaggschiff-Update; damit bleibt Gemini 3.1 Pro die aktuelle Spitzenversion des Anbieters ohne Rangwirkung. Gemini · August 2026 · Rang 4 – Fällt von Rang 3 auf Rang 4. Google verschob das Flaggschiff-Update Gemini 3.5 Pro ein drittes Mal; Gemini 3.1 Pro bleibt die aktuelle Spitzenversion, fällt aber im August-Intelligenz-Index deutlich zurück, während Grok 4.6 aufstieg. G 4Gemini3.1 Pro DeepSeek V4 · März 2026 · Rang 5 – Rang 5 wie in der Vorausgabe; DeepSeek V3.2 bleibt im Berichtsmonat die aktuelle Version, da im März keine Nachfolgegeneration verfügbar wurde. Es bleibt das höchstgereihte offene Modell der Auswahl. DeepSeek V4 · April 2026 · Rang 5 – Rang 5 wie in der Vorausgabe: DeepSeek stellte am 24. April 2026 mit V4 (Flash und Pro) einen Nachfolger von V3.2 vor. Das offene Modell stärkt seine Position, bleibt aber das höchstgereihte offene Modell der Auswahl, ohne die relative Ordnung zu verändern. DeepSeek V4 · Mai 2026 · Rang 5 – Rang 5 wie in der Vorausgabe: DeepSeek V4 (Pro und Flash) blieb im Mai die aktuelle Open-Weights-Version ohne neue Modellgeneration; es bleibt das höchstgereihte offene Modell der Auswahl. DeepSeek V4 · Juni 2026 · Rang 5 – Rang 5 wie in der Vorausgabe. DeepSeek V4 bleibt die aktuelle Open-Weights-Version ohne neue Modellgeneration im Juni und damit das höchstgereihte offene Modell der Auswahl. DeepSeek V4 · Juli 2026 · Rang 5 – Rang 5 wie in der Vorausgabe. Im Juli erschien keine neue DeepSeek-Generation; V4 (Pro und Flash) bleibt die aktuelle Open-Weights-Version und damit das höchstgereihte offene Modell der Auswahl. DeepSeek V4 · August 2026 · Rang 5 – Rang 5 wie in der Vorausgabe. DeepSeek überführte V4-Pro am 13. August in die allgemeine Verfügbarkeit; V4 bleibt die aktuelle Open-Weights-Version und damit das höchstgereihte offene Modell der Auswahl. D 5DeepSeekV4
Watchlist
  • Moonshot AIKimi K3
  • AlibabaQwen3.8-Max
Rangverlauf je Tool über die letzten Monate
ToolMärz 2026April 2026Mai 2026Juni 2026Juli 2026August 2026
Claude Opus 5331111
GPT212222
Grok 4.6444443
Gemini123334
DeepSeek V4555555

Aktuelles Ranking

  1. Claude Opus 5

    Anthropic Tendenz: unverändert

    • Kontextfenster von rund 1 Mio. Token für die Verarbeitung langer Dokumente in einem Durchgang.
    • Deckt mehrstufiges Schlussfolgern und zuverlässige Werkzeug-Nutzung in agentischen Abläufen nach den datierten Vergleichsmessungen sehr breit ab.
    • Über claude.ai, die Claude API und große Cloud-Plattformen zugänglich, mit Kontrollmöglichkeiten für den Firmeneinsatz.
    • Behauptet sich im August trotz mehrerer Konkurrenz-Updates an der Spitze des zusammengesetzten Intelligenz-Index.

    Preis: 5 $ je 1 Mio. Input-Token, 25 $ je 1 Mio. Output-Token (Claude API)

    Zum Anbieter
  2. GPT

    OpenAI Tendenz: unverändert

    • Die ChatGPT-Aktualisierung vom 6. August senkt nach OpenAIs eigener Auswertung die Rate sachlicher Fehler um rund 60 Prozent gegenüber GPT-5.5 Instant und stärkt damit das Kriterium Verlässlichkeit und Robustheit.
    • Der am 13. August angekündigte Modus Ultrafast erreicht nach Anbieterangaben bis zu 750 Ausgabe-Token je Sekunde, steht bislang aber nur einem ausgewählten Kundenkreis in einer beschränkten Vorschau offen und zählt deshalb noch nicht als allgemein nutzbare Eigenschaft.
    • Auf agentische Abläufe und Werkzeug-Nutzung ausgelegt, eingebettet in ein ausgereiftes Entwickler-Ökosystem mit breiter API-Kompatibilität.
    • Über ChatGPT, Codex und die OpenAI API allgemein und im EU-Raum verfügbar.
    • OpenAI senkte den API-Preis am 21. August um mehr als 20 Prozent auf 4 US-Dollar je 1 Mio. Input- und 20 US-Dollar je 1 Mio. Output-Token.

    Preis: 4 $ je 1 Mio. Input-Token, 20 $ je 1 Mio. Output-Token (OpenAI API)

    Zum Anbieter
  3. Grok 4.6

    SpaceXAI Tendenz: verbessert

    • Am 12. August veröffentlicht, als Post-Training-Upgrade auf lang laufende Agenten, Coding und Wissensarbeit ausgelegt.
    • Zieht im August-Stand des Artificial-Analysis-Index mit GPT-5.6 Sol gleich (je 61 Punkte) und überholt dabei Kimi K3.
    • Kontextfenster von 500.000 Token, das hinter den rund 1 Mio. Token der beiden höher gereihten Flaggschiffe zurückbleibt.
    • Über die SpaceXAI-API sowie OpenRouter, Vercel und Cloudflare beziehbar, seit dem 19. August zusätzlich allgemein über Amazon Bedrock. Eine eigene EU-Freigabe hat SpaceXAI zum Start am 12. August nicht ausgewiesen; der API-Konsolenzugang steht EU-Kunden seit dem 17. Juli offen.

    Preis: 2 $ je 1 Mio. Input-Token, 6 $ je 1 Mio. Output-Token (SpaceXAI API)

    Zum Anbieter
  4. Gemini

    Google Tendenz: verschlechtert

    • Verarbeitet Text, Bild, Audio und Video in einem Modell und deckt das Kriterium Multimodalität besonders breit ab.
    • Kontextfenster im Bereich von rund 1 Mio. Token zur Verarbeitung langer Dokumente in einem Durchgang.
    • Über Gemini-App, Gemini API, Vertex AI und Google AI Studio mit EU-Datenresidenz-Optionen zugänglich; Google führt Gemini 3.1 Pro in der eigenen Modell-Dokumentation weiterhin als Vorschau-Version, während die Flash-Modelle dort als stabil ausgewiesen sind.
    • Bleibt als Februar-Flaggschiff ohne Update und trailt an den neuesten Vergleichsmessungen für Sprachverständnis und Schlussfolgern.
    Zum Anbieter
  5. DeepSeek V4

    Tendenz: unverändert

    • Frei verfügbare Gewichte unter permissiver MIT-Lizenz ermöglichen den Betrieb auf eigener Infrastruktur und volle Datenkontrolle für den Firmeneinsatz.
    • V4-Pro (Version 0813) am 13. August aus der Vorschau in die allgemeine Verfügbarkeit überführt, mit Schwerpunkt auf Agentenfähigkeit.
    • MoE-Architektur mit rund 1,6 Billionen Parametern und einem Kontextfenster von bis zu 1 Mio. Token.
    • Über Chat-Produkt, App und API zugänglich, mit gängiger API-Kompatibilität für Entwickler.
    Zum Anbieter

Methodik & Transparenz

Diese Rankings dienen der Marktorientierung. Sie sind ein redaktioneller, kostenloser Überblick auf Basis öffentlich verfügbarer Quellen, keine abschließende oder absolute Bewertung. Jede Ausgabe ist eine Momentaufnahme; der Markt verändert sich schnell, und die Auswahl erhebt keinen Anspruch auf Vollständigkeit. Bewertet wird ausschließlich anhand der je Kategorie veröffentlichten Kriterien; ein eigener Labortest findet nicht statt. Die vergleichende Einordnung ist unsere redaktionelle Meinung, keine Tatsachenbehauptung über die Eignung einzelner Produkte, und sie wertet keinen Anbieter pauschal ab. Sie ersetzt keine eigene Prüfung. Stand: 01.09.2026.

Bei Recherche und Zusammenfassung kommen KI-Technologien zum Einsatz. Auswahl, Einordnung und Veröffentlichung werden von einer Person geprüft, freigegeben und redaktionell verantwortet. Genannte Produkt-, Marken- und Unternehmensnamen sind Eigentum der jeweiligen Inhaber; ihre Nennung dient allein der Information und Identifikation und bedeutet weder eine Empfehlung noch eine geschäftliche Verbindung zu diesen Anbietern. FORGEINITY hostet oder vervielfältigt keine fremden Inhalte, sondern verweist auf die Originalquellen.

Soweit wir auf externe Seiten verlinken, sind für deren Inhalte ausschließlich die jeweiligen Betreiber verantwortlich. Wir machen uns verlinkte Inhalte nicht zu eigen und übernehmen für sie keine Haftung; zum Zeitpunkt der Verlinkung waren keine Rechtsverstöße erkennbar, und bei Kenntnis einer Rechtsverletzung entfernen wir den betreffenden Link unverzüglich. Unabhängigkeit: Kein Anbieter hat für Platzierung oder Bewertung bezahlt; es bestehen keine Provisions-, Affiliate- oder Werbevereinbarungen. FORGEINITY arbeitet technologie-offen und bewertet ausschließlich anhand der veröffentlichten Kriterien. Alle Angaben erfolgen ohne Gewähr; eine Haftung für Richtigkeit, Vollständigkeit oder für Entscheidungen, die auf Grundlage dieser Rankings getroffen werden, ist ausgeschlossen.

Rechteinhaber, Betroffene und Dritte können eine Korrektur oder Entfernung einzelner Angaben unter legal@forgeinity.com anfragen oder einen rechtswidrigen verlinkten Inhalt melden. Wir prüfen berechtigte Hinweise und reagieren zeitnah.

Bewertet wird anhand dieser Kriterien:

  1. Sprachverständnis und Schlussfolgern (bewertet die Qualität der Antworten bei anspruchsvollen Wissens-, Logik-, Mathematik- und Programmieraufgaben anhand veröffentlichter, datierter Vergleichsmessungen)
  2. Multimodalität (bewertet, welche Eingabe- und Ausgabeformen neben Text verarbeitet werden, etwa Bilder, Audio oder Video)
  3. Kontextfenster und Informationsabruf (bewertet, wie viel Material das Modell in einem Durchgang verarbeiten kann und wie zuverlässig es Inhalte aus langen Dokumenten wiederfindet)
  4. Antwortgeschwindigkeit und Latenz (bewertet das Tempo der Antworterzeugung im Chat-Einsatz und bei Nutzung über die API)
  5. Werkzeug-Nutzung und Agentenfähigkeit (bewertet, wie zuverlässig das Modell externe Funktionen aufruft, etwa über das Model Context Protocol (MCP), mehrstufige Aufgaben plant und sich in Automatisierungs-Abläufe einbinden lässt)
  6. Verlässlichkeit und Robustheit (bewertet die Neigung zu erfundenen Inhalten, sogenannten Halluzinationen, sowie die Widerstandsfähigkeit gegen gezielte Manipulationsversuche)
  7. Zugang und Ökosystem (bewertet API-Zugang, Entwickler-Werkzeuge, Dokumentation und die Kompatibilität zu verbreiteten API-Standards)
  8. Datenschutz und Unternehmenstauglichkeit (bewertet Kontrollmöglichkeiten für den Firmeneinsatz, den wählbaren Speicherort der Daten, Nachvollziehbarkeit und den Ausschluss von Firmendaten aus dem Modell-Training)