Monatliches Ranking · Stand: August 2026
Top 5: Große Sprachmodelle (LLMs)
Unsere Marktbeobachtungen im August 2026
Im August verdichtete sich die Spitze: SpaceXAI veröffentlichte am 12. August Grok 4.6, das im Artificial-Analysis-Intelligenz-Index mit GPT-5.6 Sol gleichzieht (je 61 Punkte) und auf Rang 3 vorrückt. OpenAI schärfte GPT-5.6 Sol nach: eine ChatGPT-Aktualisierung vom 6. August reduziert sachliche Fehler deutlich, der neue Modus Ultrafast beschleunigt die Antworterzeugung. Claude Opus 5 bleibt mit 63 Punkten an der Spitze des Index.
Das Feld der offenen Modelle wurde im August breiter: Alibaba stellte Qwen3.8-Max am 3. August zunächst über die API bereit (multimodal, rund 2,4 Billionen Parameter, 1 Mio. Token Kontext) und veröffentlichte die Gewichte am 12. August unter einer eigenen Lizenz, allerdings als reine Text-Fassung. DeepSeek überführte V4-Pro am 13. August in die allgemeine Verfügbarkeit, und Moonshots Kimi K3 war über mehrere Anbieter breit verfügbar. Im Intelligenz-Index liegen Kimi K3 (60) und Qwen3.8-Max (58) nahe an der geschlossenen Spitzengruppe.
Google verschob das Flaggschiff-Update Gemini 3.5 Pro ein drittes Mal; es blieb im August in einer begrenzten Vertex-AI-Vorschau für Unternehmen und damit ohne allgemeine Verfügbarkeit, und die DeepMind-Modellseite führt Gemini 3.1 Pro aus dem Februar als aktuelles Pro-Modell. Im August-Stand des Artificial-Analysis-Index liegt Gemini 3.1 Pro mit 48 Punkten hinter der Spitzengruppe (63 bis 60), was den Rückgang von Rang 3 auf Rang 4 trägt; der auf Rang 5 gereihte DeepSeek V4-Pro erreicht dort 53 Punkte, Gemini hält Rang 4 also über Multimodalität und Unternehmens-Ökosystem.
Rangverlauf
März–August 2026
- Moonshot AIKimi K3
- AlibabaQwen3.8-Max
| Tool | März 2026 | April 2026 | Mai 2026 | Juni 2026 | Juli 2026 | August 2026 |
|---|---|---|---|---|---|---|
| Claude Opus 5 | 3 | 3 | 1 | 1 | 1 | 1 |
| GPT | 2 | 1 | 2 | 2 | 2 | 2 |
| Grok 4.6 | 4 | 4 | 4 | 4 | 4 | 3 |
| Gemini | 1 | 2 | 3 | 3 | 3 | 4 |
| DeepSeek V4 | 5 | 5 | 5 | 5 | 5 | 5 |
Aktuelles Ranking
-
Claude Opus 5
- Kontextfenster von rund 1 Mio. Token für die Verarbeitung langer Dokumente in einem Durchgang.
- Deckt mehrstufiges Schlussfolgern und zuverlässige Werkzeug-Nutzung in agentischen Abläufen nach den datierten Vergleichsmessungen sehr breit ab.
- Über claude.ai, die Claude API und große Cloud-Plattformen zugänglich, mit Kontrollmöglichkeiten für den Firmeneinsatz.
- Behauptet sich im August trotz mehrerer Konkurrenz-Updates an der Spitze des zusammengesetzten Intelligenz-Index.
Preis: 5 $ je 1 Mio. Input-Token, 25 $ je 1 Mio. Output-Token (Claude API)
Zum Anbieter -
GPT
- Die ChatGPT-Aktualisierung vom 6. August senkt nach OpenAIs eigener Auswertung die Rate sachlicher Fehler um rund 60 Prozent gegenüber GPT-5.5 Instant und stärkt damit das Kriterium Verlässlichkeit und Robustheit.
- Der am 13. August angekündigte Modus Ultrafast erreicht nach Anbieterangaben bis zu 750 Ausgabe-Token je Sekunde, steht bislang aber nur einem ausgewählten Kundenkreis in einer beschränkten Vorschau offen und zählt deshalb noch nicht als allgemein nutzbare Eigenschaft.
- Auf agentische Abläufe und Werkzeug-Nutzung ausgelegt, eingebettet in ein ausgereiftes Entwickler-Ökosystem mit breiter API-Kompatibilität.
- Über ChatGPT, Codex und die OpenAI API allgemein und im EU-Raum verfügbar.
- OpenAI senkte den API-Preis am 21. August um mehr als 20 Prozent auf 4 US-Dollar je 1 Mio. Input- und 20 US-Dollar je 1 Mio. Output-Token.
Preis: 4 $ je 1 Mio. Input-Token, 20 $ je 1 Mio. Output-Token (OpenAI API)
Zum Anbieter -
Grok 4.6
- Am 12. August veröffentlicht, als Post-Training-Upgrade auf lang laufende Agenten, Coding und Wissensarbeit ausgelegt.
- Zieht im August-Stand des Artificial-Analysis-Index mit GPT-5.6 Sol gleich (je 61 Punkte) und überholt dabei Kimi K3.
- Kontextfenster von 500.000 Token, das hinter den rund 1 Mio. Token der beiden höher gereihten Flaggschiffe zurückbleibt.
- Über die SpaceXAI-API sowie OpenRouter, Vercel und Cloudflare beziehbar, seit dem 19. August zusätzlich allgemein über Amazon Bedrock. Eine eigene EU-Freigabe hat SpaceXAI zum Start am 12. August nicht ausgewiesen; der API-Konsolenzugang steht EU-Kunden seit dem 17. Juli offen.
Preis: 2 $ je 1 Mio. Input-Token, 6 $ je 1 Mio. Output-Token (SpaceXAI API)
Zum Anbieter -
Gemini
- Verarbeitet Text, Bild, Audio und Video in einem Modell und deckt das Kriterium Multimodalität besonders breit ab.
- Kontextfenster im Bereich von rund 1 Mio. Token zur Verarbeitung langer Dokumente in einem Durchgang.
- Über Gemini-App, Gemini API, Vertex AI und Google AI Studio mit EU-Datenresidenz-Optionen zugänglich; Google führt Gemini 3.1 Pro in der eigenen Modell-Dokumentation weiterhin als Vorschau-Version, während die Flash-Modelle dort als stabil ausgewiesen sind.
- Bleibt als Februar-Flaggschiff ohne Update und trailt an den neuesten Vergleichsmessungen für Sprachverständnis und Schlussfolgern.
-
DeepSeek V4
- Frei verfügbare Gewichte unter permissiver MIT-Lizenz ermöglichen den Betrieb auf eigener Infrastruktur und volle Datenkontrolle für den Firmeneinsatz.
- V4-Pro (Version 0813) am 13. August aus der Vorschau in die allgemeine Verfügbarkeit überführt, mit Schwerpunkt auf Agentenfähigkeit.
- MoE-Architektur mit rund 1,6 Billionen Parametern und einem Kontextfenster von bis zu 1 Mio. Token.
- Über Chat-Produkt, App und API zugänglich, mit gängiger API-Kompatibilität für Entwickler.
Methodik & Transparenz
Diese Rankings dienen der Marktorientierung. Sie sind ein redaktioneller, kostenloser Überblick auf Basis öffentlich verfügbarer Quellen, keine abschließende oder absolute Bewertung. Jede Ausgabe ist eine Momentaufnahme; der Markt verändert sich schnell, und die Auswahl erhebt keinen Anspruch auf Vollständigkeit. Bewertet wird ausschließlich anhand der je Kategorie veröffentlichten Kriterien; ein eigener Labortest findet nicht statt. Die vergleichende Einordnung ist unsere redaktionelle Meinung, keine Tatsachenbehauptung über die Eignung einzelner Produkte, und sie wertet keinen Anbieter pauschal ab. Sie ersetzt keine eigene Prüfung. Stand: 01.09.2026.
Bei Recherche und Zusammenfassung kommen KI-Technologien zum Einsatz. Auswahl, Einordnung und Veröffentlichung werden von einer Person geprüft, freigegeben und redaktionell verantwortet. Genannte Produkt-, Marken- und Unternehmensnamen sind Eigentum der jeweiligen Inhaber; ihre Nennung dient allein der Information und Identifikation und bedeutet weder eine Empfehlung noch eine geschäftliche Verbindung zu diesen Anbietern. FORGEINITY hostet oder vervielfältigt keine fremden Inhalte, sondern verweist auf die Originalquellen.
Soweit wir auf externe Seiten verlinken, sind für deren Inhalte ausschließlich die jeweiligen Betreiber verantwortlich. Wir machen uns verlinkte Inhalte nicht zu eigen und übernehmen für sie keine Haftung; zum Zeitpunkt der Verlinkung waren keine Rechtsverstöße erkennbar, und bei Kenntnis einer Rechtsverletzung entfernen wir den betreffenden Link unverzüglich. Unabhängigkeit: Kein Anbieter hat für Platzierung oder Bewertung bezahlt; es bestehen keine Provisions-, Affiliate- oder Werbevereinbarungen. FORGEINITY arbeitet technologie-offen und bewertet ausschließlich anhand der veröffentlichten Kriterien. Alle Angaben erfolgen ohne Gewähr; eine Haftung für Richtigkeit, Vollständigkeit oder für Entscheidungen, die auf Grundlage dieser Rankings getroffen werden, ist ausgeschlossen.
Rechteinhaber, Betroffene und Dritte können eine Korrektur oder Entfernung einzelner Angaben unter legal@forgeinity.com anfragen oder einen rechtswidrigen verlinkten Inhalt melden. Wir prüfen berechtigte Hinweise und reagieren zeitnah.
Bewertet wird anhand dieser Kriterien:
- Sprachverständnis und Schlussfolgern (bewertet die Qualität der Antworten bei anspruchsvollen Wissens-, Logik-, Mathematik- und Programmieraufgaben anhand veröffentlichter, datierter Vergleichsmessungen)
- Multimodalität (bewertet, welche Eingabe- und Ausgabeformen neben Text verarbeitet werden, etwa Bilder, Audio oder Video)
- Kontextfenster und Informationsabruf (bewertet, wie viel Material das Modell in einem Durchgang verarbeiten kann und wie zuverlässig es Inhalte aus langen Dokumenten wiederfindet)
- Antwortgeschwindigkeit und Latenz (bewertet das Tempo der Antworterzeugung im Chat-Einsatz und bei Nutzung über die API)
- Werkzeug-Nutzung und Agentenfähigkeit (bewertet, wie zuverlässig das Modell externe Funktionen aufruft, etwa über das Model Context Protocol (MCP), mehrstufige Aufgaben plant und sich in Automatisierungs-Abläufe einbinden lässt)
- Verlässlichkeit und Robustheit (bewertet die Neigung zu erfundenen Inhalten, sogenannten Halluzinationen, sowie die Widerstandsfähigkeit gegen gezielte Manipulationsversuche)
- Zugang und Ökosystem (bewertet API-Zugang, Entwickler-Werkzeuge, Dokumentation und die Kompatibilität zu verbreiteten API-Standards)
- Datenschutz und Unternehmenstauglichkeit (bewertet Kontrollmöglichkeiten für den Firmeneinsatz, den wählbaren Speicherort der Daten, Nachvollziehbarkeit und den Ausschluss von Firmendaten aus dem Modell-Training)