Monatliches Ranking · Stand: Juni 2026

Top 5: Große Sprachmodelle (LLMs)

Unsere Marktbeobachtungen im Juni 2026

Die auffälligste Entwicklung des Berichtsmonats betraf die Verfügbarkeit statt der Rangordnung: Anthropic führte am 9. Juni 2026 Claude Fable 5 als erste öffentlich verfügbare Modellversion der Mythos-Klasse oberhalb der Opus-Linie ein, musste den Zugang zu Fable 5 und Mythos 5 jedoch nach einer US-Exportkontroll-Anordnung drei Tage später für alle Kunden abschalten. Opus, Sonnet und Haiku blieben unberührt, sodass Claude Opus 4.8 das allgemein verfügbare Anthropic-Flaggschiff und der Spitzenreiter des verfügbaren Feldes bleibt.

OpenAI stellte am 26. Juni 2026 die GPT-5.6-Reihe mit den Modellen Sol, Terra und Luna vor, begrenzte den Zugang aber auf eine Vorschau für rund 20 von der US-Regierung freigegebene Unternehmen. Eine allgemeine Verfügbarkeit kündigte OpenAI erst für die folgenden Wochen an. Im Berichtsmonat blieb damit GPT-5.5 das allgemein verfügbare OpenAI-Flaggschiff, das im Ranking geführt wird.

Unterhalb der Top 5 nahm die Bewegung zu, ohne die Rangordnung zu verändern: Alibaba überführte Qwen3.7-Plus am 1. Juni 2026 in die allgemeine Verfügbarkeit, ein multimodales Modell mit Bild- und Videoverständnis, agentischen Fähigkeiten und rund einer Million Token Kontext. Parallel bestätigte xAI Ende Juni eine private Beta von Grok 4.5 bei SpaceX und Tesla, allerdings ohne öffentlichen Zugang und ohne unabhängige Vergleichsmessungen.

Rangverlauf

Januar–Juni 2026

Rangverlauf der aktuellen Top-Tools über die letzten Monate Claude Opus 4.8 aktuell Rang 1; GPT 5.5 aktuell Rang 2; Gemini aktuell Rang 3; Grok 4.3 aktuell Rang 4; DeepSeek V4 aktuell Rang 5. Claude Opus 4.8 · Januar 2026 · Rang 3 – Erstausgabe; Rang gemäß Baseline auf stable. Claude Opus 4.5 ist im Berichtsmonat das aktuelle Spitzenmodell von Anthropic mit besonderen Stärken bei Programmierung und Agenten-Aufgaben; die Leistungsfähigkeit ist frontier-nah, der dritte Rang folgt der relativen Ordnung der breiten Kriterienabdeckung. Claude Opus 4.8 · Februar 2026 · Rang 3 – Rang 3 wie in der Vorausgabe; Anthropic löste am 5. Februar 2026 Opus 4.5 durch Opus 4.6 ab, was die Position an den Kriterien festigt, die relative Reihenfolge aber nicht verändert. Claude Opus 4.8 · März 2026 · Rang 3 – Rang 3 wie in der Vorausgabe; Anthropic veröffentlichte im Berichtsmonat kein neues Opus-Modell (der Nachfolger Opus 4.7 folgte erst nach dem Berichtsmonat), Opus 4.6 bleibt die aktuelle Version und die Reihenfolge unverändert. Claude Opus 4.8 · April 2026 · Rang 3 – Rang 3 wie in der Vorausgabe: Anthropic veröffentlichte am 16. April 2026 Claude Opus 4.7 als Nachfolger von Opus 4.6 mit deutlichen Zugewinnen bei Programmierung und Agentenfähigkeit; die relative Reihenfolge der Kategorie verschob sich dadurch nicht. Claude Opus 4.8 · Mai 2026 · Rang 1 – Aufstieg von Rang 3 auf Rang 1: Mit Opus 4.8 (28. Mai 2026) liegt das aktuellste Frontier-Flaggschiff vor, das nach unabhängigen Vergleichsmessungen Ende Mai knapp vor GPT-5.5 die Spitze der Kategorie übernimmt. Claude Opus 4.8 · Juni 2026 · Rang 1 – Rang 1 wie in der Vorausgabe. Die Recherche ergab keine Verschiebung an der Spitze der allgemein verfügbaren Modelle; die im Juni kurz verfügbare Mythos-Klasse (Fable 5) wurde behördlich gesperrt und zählt nicht zum verfügbaren Feld. C 1Claude Opus4.8 GPT 5.5 · Januar 2026 · Rang 2 – Erstausgabe; Rang gemäß Baseline auf stable. GPT-5.2 ist im Berichtsmonat das aktuell verfügbare Flaggschiff von OpenAI und ordnet sich an den Kriterien knapp hinter Gemini 3 Pro ein; die Leistungsfähigkeit liegt auf gleichem Stern-Niveau, der Rang folgt der breiten Kriterienabdeckung. GPT 5.5 · Februar 2026 · Rang 2 – Rang 2 wie in der Vorausgabe; GPT-5.2 bleibt im Berichtsmonat das aktuelle Allzweck-Flaggschiff von OpenAI. Die Februar-Veröffentlichungen betrafen die coding-spezialisierte Codex-Linie, nicht das hier bewertete Allzweckmodell. GPT 5.5 · März 2026 · Rang 2 – Rang 2 wie in der Vorausgabe; OpenAI löste am 5. März 2026 GPT-5.2 durch GPT-5.4 ab, was die Position an den Kriterien festigt, die relative Reihenfolge der Kategorie aber nicht verändert. GPT 5.5 · April 2026 · Rang 1 – Aufstieg von Rang 2 auf Rang 1: OpenAI löste am 23. April 2026 GPT-5.4 durch GPT-5.5 ab. Das zuvor erstplatzierte Gemini 3.1 Pro erhielt im Berichtsmonat keine neue Version, sodass das aktuellste Frontier-Flaggschiff an die Spitze rückt. GPT 5.5 · Mai 2026 · Rang 2 – Abstieg von Rang 1 auf Rang 2: GPT-5.5 blieb im Mai das Reasoning-Flaggschiff (am 5. Mai wurde lediglich die Instant-Variante neuer ChatGPT-Standard); mit Opus 4.8 rückte am 28. Mai ein neueres, in unabhängigen Messungen knapp vorn liegendes Modell an die Spitze. GPT 5.5 · Juni 2026 · Rang 2 – Rang 2 wie in der Vorausgabe. GPT-5.5 bleibt das allgemein verfügbare Flaggschiff; die neuere GPT-5.6-Reihe lief im Juni nur als behördlich beschränkte Vorschau und veränderte die Ordnung nicht. G 2GPT5.5 Gemini · Januar 2026 · Rang 1 – Erstausgabe ohne Vormonat; alle Ränge starten gemäß Baseline-Vorgabe auf stable. Gemini 3 Pro nimmt an den übergebenen Kriterien den ersten Rang ein; die Kapazität ist frontier-nah wie bei den folgenden zwei Modellen, der Rang spiegelt die breite Abdeckung der Kriterien. Gemini · Februar 2026 · Rang 1 – Rang 1 wie in der Vorausgabe; mit Gemini 3.1 Pro (Vorschau, 19. Februar 2026) erneuerte Google die aktuelle Modellversion, ohne dass sich die Spitze der Kategorie an den Kriterien verschob. Gemini · März 2026 · Rang 1 – Rang 1 wie in der Vorausgabe; im Berichtsmonat erschien kein neues Google-Flaggschiff, Gemini 3.1 Pro bleibt die aktuelle Version und die Spitze der Kategorie verschob sich an den Kriterien nicht. Gemini · April 2026 · Rang 2 – Abstieg von Rang 1 auf Rang 2: Im Berichtsmonat erschien kein neues Google-Flaggschiff, Gemini 3.1 Pro blieb die aktuelle Version. Mit GPT-5.5 rückte am 23. April 2026 ein neueres Frontier-Modell nach und übernahm die Spitzenposition. Gemini · Mai 2026 · Rang 3 – Abstieg von Rang 2 auf Rang 3: Im Mai erschien kein neues Gemini-Flaggschiff; auf der Google I/O kam nur Gemini 3.5 Flash, das Pro-Flaggschiff der 3.5-Reihe wurde auf Juni verschoben, sodass 3.1 Pro die Spitzenversion blieb und von Opus 4.8 überholt wurde. Gemini · Juni 2026 · Rang 3 – Rang 3 wie in der Vorausgabe. Im Juni erschien keine neue allgemein verfügbare Gemini-Spitzenversion, sodass 3.1 Pro der aktuelle Stand des Anbieters bleibt. G 3Gemini3.1 Pro Grok 4.3 · Januar 2026 · Rang 4 – Erstausgabe; Rang gemäß Baseline auf stable. Grok 4.1 ist im Berichtsmonat das aktuelle Standardmodell von xAI und ordnet sich an den übergebenen Kriterien hinter den drei vordersten Anbietern ein. Grok 4.3 · Februar 2026 · Rang 4 – Rang 4 wie in der Vorausgabe; xAI startete am 17. Februar 2026 Grok 4.20 zunächst als Beta für zahlende Nutzer (volle API ab 10. März) und löste damit Grok 4.1 als aktuelle Version ab. Die relative Ordnung bleibt unverändert. Grok 4.3 · März 2026 · Rang 4 – Rang 4 wie in der Vorausgabe; Grok 4.20 bleibt im Berichtsmonat die aktuelle Version, der Februar-Beta-Start ging in eine breitere API-Verfügbarkeit über, ohne die relative Ordnung der Kategorie zu verändern. Grok 4.3 · April 2026 · Rang 4 – Rang 4 wie in der Vorausgabe: Die allgemein verfügbare Version blieb im Berichtsmonat Grok 4.20. Am 17. April 2026 erschien Grok 4.3 zunächst als Early-Access-Beta hinter der höchsten Abostufe, ohne die relative Ordnung der Kategorie zu verändern. Grok 4.3 · Mai 2026 · Rang 4 – Rang 4 wie in der Vorausgabe: Grok 4.3 wurde Anfang Mai allgemein verfügbar und löste die zuvor allgemein verfügbare Version 4.20 ab; die relative Ordnung der Kategorie verschob sich dadurch nicht, das Modell bleibt knapp hinter den frontiernahen Flaggschiffen. Grok 4.3 · Juni 2026 · Rang 4 – Rang 4 wie in der Vorausgabe. Grok 4.3 bleibt die allgemein verfügbare Version; eine neuere Generation erreichte im Juni keine öffentliche Verfügbarkeit, sodass sich die relative Ordnung nicht verschob. G 4Grok4.3 DeepSeek V4 · Januar 2026 · Rang 5 – Erstausgabe; Rang gemäß Baseline auf stable. DeepSeek V3.2 ist als offenes Modell mit frei verfügbaren Gewichten das in dieser Auswahl am höchsten eingestufte quelloffene Angebot und rundet die Spitzengruppe der Kategorie ab. DeepSeek V4 · Februar 2026 · Rang 5 – Rang 5 wie in der Vorausgabe; DeepSeek V3.2 bleibt im Berichtsmonat die aktuelle Version, da im Februar keine Nachfolgegeneration verfügbar wurde. Es bleibt das in dieser Auswahl höchstgereihte offene Modell. DeepSeek V4 · März 2026 · Rang 5 – Rang 5 wie in der Vorausgabe; DeepSeek V3.2 bleibt im Berichtsmonat die aktuelle Version, da im März keine Nachfolgegeneration verfügbar wurde. Es bleibt das höchstgereihte offene Modell der Auswahl. DeepSeek V4 · April 2026 · Rang 5 – Rang 5 wie in der Vorausgabe: DeepSeek stellte am 24. April 2026 mit V4 (Flash und Pro) einen Nachfolger von V3.2 vor. Das offene Modell stärkt seine Position, bleibt aber das höchstgereihte offene Modell der Auswahl, ohne die relative Ordnung zu verändern. DeepSeek V4 · Mai 2026 · Rang 5 – Rang 5 wie in der Vorausgabe: DeepSeek V4 (Pro und Flash) blieb im Mai die aktuelle Open-Weights-Version ohne neue Modellgeneration; es bleibt das höchstgereihte offene Modell der Auswahl. DeepSeek V4 · Juni 2026 · Rang 5 – Rang 5 wie in der Vorausgabe. DeepSeek V4 bleibt die aktuelle Open-Weights-Version ohne neue Modellgeneration im Juni und damit das höchstgereihte offene Modell der Auswahl. D 5DeepSeekV4
Watchlist
  • AlibabaQwen3.7-Plus
  • xAIGrok 4.5
Rangverlauf je Tool über die letzten Monate
ToolJanuar 2026Februar 2026März 2026April 2026Mai 2026Juni 2026
Claude Opus 4.8333311
GPT 5.5222122
Gemini111233
Grok 4.3444444
DeepSeek V4555555

Aktuelles Ranking

  1. Claude Opus 4.8

    Anthropic Tendenz: unverändert

    • Erfüllt Schlussfolgern und mehrstufiges Werkzeug-Handeln nach veröffentlichten, datierten Vergleichsmessungen unter den allgemein verfügbaren Modellen am vollständigsten.
    • Bleibt die aktuelle, allgemein verfügbare Anthropic-Spitzenversion; die im Juni kurz verfügbare Mythos-Klasse (Fable 5) wurde behördlich gesperrt und ist nicht nutzbar.
    • Stark bei realer Software-Entwicklung und zuverlässiger Werkzeug-Nutzung in mehrstufigen Agenten-Abläufen.
    • Über claude.ai, die Claude API und große Cloud-Plattformen zugänglich, mit Kontrollmöglichkeiten für den Firmeneinsatz.
    Zum Anbieter
  2. GPT 5.5

    OpenAI Tendenz: unverändert

    • Reasoning-Flaggschiff (Standard, Thinking, Pro) deckt schnelle wie schlussfolgerungsintensive Aufgaben breit ab.
    • Liegt im unabhängigen Intelligenz-Index knapp hinter Opus 4.8 und vor den nachfolgenden Modellen der Auswahl.
    • Bleibt im Juni das allgemein verfügbare Flaggschiff; die neuere GPT-5.6-Reihe lief nur als behördlich beschränkte Vorschau für wenige Unternehmen.
    • Auf agentische Abläufe und Werkzeug-Nutzung ausgelegt, eingebettet in ein ausgereiftes Entwickler-Ökosystem.
    Zum Anbieter
  3. Gemini

    Google Tendenz: unverändert

    • Verarbeitet Text, Bild, Audio und Video in einem Modell und deckt das Kriterium Multimodalität sehr breit ab.
    • Kontextfenster im Bereich von rund einer Million Token zur Verarbeitung langer Dokumente in einem Durchgang.
    • Bleibt im Juni die aktuelle Gemini-Spitzenversion, da keine neue allgemein verfügbare Pro-Version erschien.
    • Über Gemini-App, Gemini API, Vertex AI und Google AI Studio zugänglich, mit breitem Unternehmens-Ökosystem.
    Zum Anbieter
  4. Grok 4.3

    xAI Tendenz: unverändert

    • Bietet eine Reasoning-Variante für komplexe Aufgaben und eine schnelle Variante für hohen Durchsatz.
    • Native Video-Eingabe und ein Kontextfenster von rund einer Million Token stärken die Multimodalität.
    • Bleibt die allgemein verfügbare Version; eine neuere Generation erreichte im Juni nur eine nicht-öffentliche Erprobung.
    • Zeigt Stärke bei agentischer Werkzeug-Nutzung, liegt in unabhängigen Vergleichsindizes hinter den frontiernahen Flaggschiffen.
    Zum Anbieter
  5. DeepSeek V4

    Tendenz: unverändert

    • Frei verfügbare Gewichte ermöglichen den Betrieb auf eigener Infrastruktur und volle Datenkontrolle für den Firmeneinsatz.
    • Zwei Varianten (V4 Pro und V4 Flash) mit einem Kontextfenster von jeweils rund einer Million Token und Thinking-/Non-Thinking-Modus.
    • Erreicht als Open-Weights-Modell ein frontiernahes Niveau bei Schlussfolgern und langem Kontext.
    • Über Chat-Produkt, App und API zugänglich, mit gängiger API-Kompatibilität für Entwickler.
    Zum Anbieter

Methodik & Transparenz

Diese Rankings dienen der Marktorientierung. Sie sind ein redaktioneller, kostenloser Überblick auf Basis öffentlich verfügbarer Quellen, keine abschließende oder absolute Bewertung. Jede Ausgabe ist eine Momentaufnahme; der Markt verändert sich schnell, und die Auswahl erhebt keinen Anspruch auf Vollständigkeit. Bewertet wird ausschließlich anhand der je Kategorie veröffentlichten Kriterien; ein eigener Labortest findet nicht statt. Die vergleichende Einordnung ist unsere redaktionelle Meinung, keine Tatsachenbehauptung über die Eignung einzelner Produkte, und sie wertet keinen Anbieter pauschal ab. Sie ersetzt keine eigene Prüfung. Stand: 01.07.2026.

Bei Recherche und Zusammenfassung kommen KI-Technologien zum Einsatz. Auswahl, Einordnung und Veröffentlichung werden von einer Person geprüft, freigegeben und redaktionell verantwortet. Genannte Produkt-, Marken- und Unternehmensnamen sind Eigentum der jeweiligen Inhaber; ihre Nennung dient allein der Information und Identifikation und bedeutet weder eine Empfehlung noch eine geschäftliche Verbindung zu diesen Anbietern. FORGEINITY hostet oder vervielfältigt keine fremden Inhalte, sondern verweist auf die Originalquellen.

Soweit wir auf externe Seiten verlinken, sind für deren Inhalte ausschließlich die jeweiligen Betreiber verantwortlich. Wir machen uns verlinkte Inhalte nicht zu eigen und übernehmen für sie keine Haftung; zum Zeitpunkt der Verlinkung waren keine Rechtsverstöße erkennbar, und bei Kenntnis einer Rechtsverletzung entfernen wir den betreffenden Link unverzüglich. Unabhängigkeit: Kein Anbieter hat für Platzierung oder Bewertung bezahlt; es bestehen keine Provisions-, Affiliate- oder Werbevereinbarungen. FORGEINITY arbeitet technologie-offen und bewertet ausschließlich anhand der veröffentlichten Kriterien. Alle Angaben erfolgen ohne Gewähr; eine Haftung für Richtigkeit, Vollständigkeit oder für Entscheidungen, die auf Grundlage dieser Rankings getroffen werden, ist ausgeschlossen.

Rechteinhaber, Betroffene und Dritte können eine Korrektur oder Entfernung einzelner Angaben unter legal@forgeinity.com anfragen oder einen rechtswidrigen verlinkten Inhalt melden. Wir prüfen berechtigte Hinweise und reagieren zeitnah.

Bewertet wird anhand dieser Kriterien:

  1. Sprachverständnis und Schlussfolgern (bewertet die Qualität der Antworten bei anspruchsvollen Wissens-, Logik-, Mathematik- und Programmieraufgaben anhand veröffentlichter, datierter Vergleichsmessungen)
  2. Multimodalität (bewertet, welche Eingabe- und Ausgabeformen neben Text verarbeitet werden, etwa Bilder, Audio oder Video)
  3. Kontextfenster und Informationsabruf (bewertet, wie viel Material das Modell in einem Durchgang verarbeiten kann und wie zuverlässig es Inhalte aus langen Dokumenten wiederfindet)
  4. Antwortgeschwindigkeit und Latenz (bewertet das Tempo der Antworterzeugung im Chat-Einsatz und bei Nutzung über die API)
  5. Werkzeug-Nutzung und Agentenfähigkeit (bewertet, wie zuverlässig das Modell externe Funktionen aufruft, etwa über das Model Context Protocol (MCP), mehrstufige Aufgaben plant und sich in Automatisierungs-Abläufe einbinden lässt)
  6. Verlässlichkeit und Robustheit (bewertet die Neigung zu erfundenen Inhalten, sogenannten Halluzinationen, sowie die Widerstandsfähigkeit gegen gezielte Manipulationsversuche)
  7. Zugang und Ökosystem (bewertet API-Zugang, Entwickler-Werkzeuge, Dokumentation und die Kompatibilität zu verbreiteten API-Standards)
  8. Datenschutz und Unternehmenstauglichkeit (bewertet Kontrollmöglichkeiten für den Firmeneinsatz, den wählbaren Speicherort der Daten, Nachvollziehbarkeit und den Ausschluss von Firmendaten aus dem Modell-Training)