Monatliches Ranking · Stand: August 2026
Top 5: Offene LLM-Modelle (Open Weight LLMs)
Unsere Marktbeobachtungen im August 2026
Der Berichtsmonat war der bisher dichteste des Jahres: Alibaba stellte am 12. August die Gewichte des nachtrainierten Qwen3.8-Max-Modells bereit, DeepSeek löste V4-Pro am 13. August aus der Vorschau, und Z.ai gab am 28. August die Gewichte von GLM-5.3 frei. Für den Mittelstand wichtiger als diese Schwergewichte sind die kleinen Ausgaben desselben Monats: Qwen3.8-27B unter Apache 2.0, GLM-5.3-Flash unter MIT und Metas Muse Glimmer 30B unter Apache 2.0 laufen auf einer einzelnen Grafikkarte.
GLM-5.3 ist laut den Angaben des Berichtsmonats eine reine Post-Training-Weiterentwicklung von GLM-5.2 auf demselben Basismodell und legt vor allem bei Programmier- und langlaufenden Aufgaben zu. Die offenen Gewichte erschienen am 28. August 2026 auf Hugging Face, allerdings unter einer eigenen GLM-5.3-Lizenz; die zwei Tage zuvor veröffentlichte kleinere Variante GLM-5.3-Flash trägt dagegen eine unveränderte MIT-Lizenz.
Rangverlauf
März–August 2026
- MetaMuse Glimmer 30B
- MiniMaxMiniMax M3 ↓ zuletzt Rang 5 · Mär
- NVIDIANemotron 3.5 Lightning
| Tool | März 2026 | April 2026 | Mai 2026 | Juni 2026 | Juli 2026 | August 2026 |
|---|---|---|---|---|---|---|
| GLM 5.3 | 2 | 2 | 2 | 1 | 1 | 1 |
| Kimi K3 | 4 | 3 | 3 | 3 | 2 | 2 |
| DeepSeek-V4 | 3 | 1 | 1 | 2 | 3 | 3 |
| Qwen3.8 2.4T-A95B | 1 | 4 | 4 | 4 | 4 | 4 |
| Gemma 4 | – | 5 | 5 | 5 | 5 | 5 |
Aktuelles Ranking
-
GLM 5.3 Neu
- Offene Gewichte auf Hugging Face unter der eigenen GLM-5.3-Lizenz: kommerzielle Nutzung und Self-Hosting sind frei, nur Anbieter von Model-as-a-Service ab zehn Milliarden US-Dollar Umsatz in zwölf zusammenhängenden Monaten müssen vorher eine Sicherheitsprüfung von Z.ai durchlaufen.
- GLM-5.3 ist laut den Angaben des Berichtsmonats eine Post-Training-Weiterentwicklung von GLM-5.2 mit deutlichem Zugewinn bei Programmier- und langlaufenden Aufgaben.
- Mixture-of-Experts mit rund 753 Milliarden Gesamtparametern, im Feld der offenen Spitzenmodelle vergleichsweise praktikabel zu betreiben.
- Kontextfenster von rund einer Million Token, ausgelegt auf lange Dokumente und umfangreichen Informationsabruf.
- Die kleinere Schwestervariante GLM-5.3-Flash (320 Milliarden Gesamt-, 18 Milliarden aktive Parameter) erschien am 26. August 2026 unter unveränderter MIT-Lizenz.
-
Kimi K3
- Mixture-of-Experts mit rund 2,8 Billionen Gesamt- und etwa 104 Milliarden aktiven Parametern je Token.
- Der hohe Speicherbedarf erzwingt einen Mehr-Knoten-GPU-Cluster statt einer Arbeitsplatzmaschine.
- Kimi K3 License mit offen herunterladbaren Gewichten; die kommerzielle Selbstnutzung ist erlaubt, für große Model-as-a-Service-Anbieter gelten Sondervereinbarungen.
- Ordnet sich laut den bisher veröffentlichten Angaben bei Programmieraufgaben nahe an den geschlossenen Spitzenmodellen ein.
-
DeepSeek-V4
- MIT-Lizenz mit frei verfügbaren Gewichten auf Hugging Face, uneingeschränkt für den kommerziellen Self-Hosted-Einsatz geeignet.
- Ordnet sich laut den bisher veröffentlichten Angaben bei Schlussfolgern und Programmierung im vorderen Feld der offenen Modelle ein.
- Mixture-of-Experts in zwei Größen: V4-Pro-0813 mit rund 1,7 Billionen Gesamt- und etwa 49 Milliarden aktiven Parametern, dazu die kleinere V4-Flash-Variante.
- Million-Token-Kontextfenster als Standard, ausgelegt auf lange Dokumente und umfangreichen Informationsabruf.
-
Qwen3.8 2.4T-A95B Neu
- Offen veröffentlichte, nachtrainierte Gewichte der Max-Klasse Qwen3.8-2.4T-A95B (rund 2,4 Billionen Gesamt- und etwa 95 Milliarden aktive Parameter) auf Hugging Face.
- Erste offen herunterladbare Max-Klasse der Qwen-Familie; die Lizenz ist für die meiste kommerzielle Nutzung frei, trägt aber umsatzabhängige Auflagen.
- Zwei Größenklassen im Berichtsmonat: Das offen veröffentlichte Max-Modell mit 2,4 Billionen Parametern verlangt Mehr-Knoten-Betrieb, das am 14. August 2026 zusätzlich freigegebene dichte Qwen3.8-27B läuft unter Apache 2.0 auf einer einzelnen Arbeitsplatz-Grafikkarte.
- Breite Mehrsprachfähigkeit einschließlich Deutsch und ein großes, etabliertes Werkzeug- und Fine-Tuning-Ökosystem rund um die Qwen-Familie.
-
Gemma 4
- Apache-2.0-Lizenz mit offen veröffentlichten Gewichten, freizügig und rechtssicher für den kommerziellen Unternehmenseinsatz.
- Das gereihte dichte 31B-Modell läuft mit geringem Hardware-Bedarf auf einer einzelnen Grafikkarte; die Familie deckt daneben kleinere Größen ab.
- Breite Mehrsprachfähigkeit einschließlich Deutsch und ein großes Kontextfenster.
- Verfügbar über Hugging Face, Ollama und weitere Kataloge in gängigen offenen Formaten, damit ohne Umwege lokal lauffähig.
Methodik & Transparenz
Diese Rankings dienen der Marktorientierung. Sie sind ein redaktioneller, kostenloser Überblick auf Basis öffentlich verfügbarer Quellen, keine abschließende oder absolute Bewertung. Jede Ausgabe ist eine Momentaufnahme; der Markt verändert sich schnell, und die Auswahl erhebt keinen Anspruch auf Vollständigkeit. Bewertet wird ausschließlich anhand der je Kategorie veröffentlichten Kriterien; ein eigener Labortest findet nicht statt. Die vergleichende Einordnung ist unsere redaktionelle Meinung, keine Tatsachenbehauptung über die Eignung einzelner Produkte, und sie wertet keinen Anbieter pauschal ab. Sie ersetzt keine eigene Prüfung. Stand: 01.09.2026.
Bei Recherche und Zusammenfassung kommen KI-Technologien zum Einsatz. Auswahl, Einordnung und Veröffentlichung werden von einer Person geprüft, freigegeben und redaktionell verantwortet. Genannte Produkt-, Marken- und Unternehmensnamen sind Eigentum der jeweiligen Inhaber; ihre Nennung dient allein der Information und Identifikation und bedeutet weder eine Empfehlung noch eine geschäftliche Verbindung zu diesen Anbietern. FORGEINITY hostet oder vervielfältigt keine fremden Inhalte, sondern verweist auf die Originalquellen.
Soweit wir auf externe Seiten verlinken, sind für deren Inhalte ausschließlich die jeweiligen Betreiber verantwortlich. Wir machen uns verlinkte Inhalte nicht zu eigen und übernehmen für sie keine Haftung; zum Zeitpunkt der Verlinkung waren keine Rechtsverstöße erkennbar, und bei Kenntnis einer Rechtsverletzung entfernen wir den betreffenden Link unverzüglich. Unabhängigkeit: Kein Anbieter hat für Platzierung oder Bewertung bezahlt; es bestehen keine Provisions-, Affiliate- oder Werbevereinbarungen. FORGEINITY arbeitet technologie-offen und bewertet ausschließlich anhand der veröffentlichten Kriterien. Alle Angaben erfolgen ohne Gewähr; eine Haftung für Richtigkeit, Vollständigkeit oder für Entscheidungen, die auf Grundlage dieser Rankings getroffen werden, ist ausgeschlossen.
Rechteinhaber, Betroffene und Dritte können eine Korrektur oder Entfernung einzelner Angaben unter legal@forgeinity.com anfragen oder einen rechtswidrigen verlinkten Inhalt melden. Wir prüfen berechtigte Hinweise und reagieren zeitnah.
Bewertet wird anhand dieser Kriterien:
- Modellqualität und Schlussfolgern (bewertet die Antwortgüte bei Wissens-, Logik-, Mathematik- und Programmieraufgaben im Vergleich offener Modelle, anhand veröffentlichter, datierter Vergleichsmessungen)
- Lizenz und kommerzielle Nutzbarkeit (bewertet, wie freizügig und rechtssicher die Lizenz für den Unternehmenseinsatz ist, von permissiven Lizenzen wie Apache 2.0 bis zu Nutzungsbeschränkungen mancher Community-Lizenzen)
- Hardware-Bedarf und Effizienz (bewertet Parametergröße, Architektur als dichtes oder Mixture-of-Experts-Modell sowie Arbeits- und Grafikspeicher-Bedarf, und damit, ob das Modell auf erschwinglicher oder Arbeitsplatz-Hardware lauffähig ist)
- Quantisierung und Formatverfügbarkeit (bewertet, ob etablierte quantisierte Varianten und gängige Formate wie GGUF oder Safetensors vorliegen und das Modell ohne Umwege über verbreitete lokale Kataloge wie Ollama oder Hugging Face bereitsteht)
- Kontextfenster und Informationsabruf (bewertet, wie viel Material das Modell in einem Durchgang verarbeitet und wie zuverlässig es Inhalte aus langen Dokumenten wiederfindet)
- Werkzeug-Nutzung und Agentenfähigkeit (bewertet, wie zuverlässig das Modell externe Funktionen aufruft, etwa über das Model Context Protocol (MCP), und sich in lokale Automatisierungs-Abläufe einbinden lässt)
- Deutsche Sprach- und Mehrsprachfähigkeit (bewertet die Ausdrucks- und Verständnisqualität in Deutsch und weiteren Sprachen, die bei offenen Modellen stark schwankt und für den Mittelstand entscheidend ist)
- Feinabstimmbarkeit und Ökosystem (bewertet die Eignung für firmeneigenes Anpassen und Fine-Tuning sowie die Reife von Werkzeugen, Dokumentation und verfügbaren Modellgrößen rund um das Modell)