Monatliches Ranking · Stand: Juni 2026

Top 5: Offene Sprachmodelle fürs Programmieren

Unsere Marktbeobachtungen im Juni 2026

Der Juni war ein ungewöhnlich dichter Release-Monat für offene Coding-Modelle: Innerhalb von knapp zwei Wochen erschienen MiniMax M3 (1. Juni), Kimi K2.7-Code (12. Juni) und GLM-5.2 (13. Juni). GLM-5.2 übernahm dabei die Spitze des offenen Felds beim agentischen, mehrstufigen Coding, gemessen an SWE-bench Pro und Terminal-Bench, während DeepSeek V4 bei den reinen Code-Erzeugungs-Benchmarks weiter vorne bleibt.

MiniMax M3 gilt als erstes offenes Modell, das Coding-Leistung auf Spitzenniveau, ein Kontextfenster von rund einer Million Token und native Multimodalität in einer Architektur vereint. Für den Mittelstand ist dabei die Lizenz zu beachten: M3 steht nicht unter MIT oder Apache 2.0, sondern unter der MiniMax Community License, die die kommerzielle Nutzung an Auflagen bindet. Beim Kriterium rechtssichere kommerzielle Nutzung bleibt es damit hinter den MIT-Modellen GLM-5.2 und DeepSeek V4.

Bei Kimi K2.7-Code ist Vorsicht geboten: Die gemeldeten Coding-Zuwächse gegenüber K2.6 stützen sich zum Release ausschließlich auf anbietereigene Benchmarks; unabhängige Werte auf den etablierten öffentlichen Suiten lagen noch nicht vor. Für das Ranking wird die Fassung daher an den zuletzt unabhängig belegten Werten der K2-Reihe gemessen, nicht an den selbst ausgewiesenen Zuwächsen.

Rangverlauf

Januar–Juni 2026

Rangverlauf der aktuellen Top-Tools über die letzten Monate DeepSeek V4 aktuell Rang 1; GLM 5.2 aktuell Rang 2; MiniMax M3 aktuell Rang 3; Kimi K2 K2.7-Code aktuell Rang 4; Qwen3-Coder Next aktuell Rang 5. DeepSeek V4 · Januar 2026 · Rang 3 – Erstausgabe ohne Vorausgabe, stabiler Rang. DeepSeek-V3.2 liegt auf Platz 3 wegen hoher allgemeiner Schlussfolgerungs- und Programmierleistung, tritt aber als sehr großes, nur auf Server-Hardware lauffähiges Generalisten-Modell an. DeepSeek V4 · Februar 2026 · Rang 4 – Fällt von Rang 3 auf Rang 4: Im Berichtsmonat erschien keine neue offene DeepSeek-Fassung, während MiniMax M2.5 an die Spitze zog. DeepSeek-V3.2 bleibt die aktuelle offene DeepSeek-Version. DeepSeek V4 · März 2026 · Rang 4 – Hält Rang 4 durch Bestandsschutz: Im März erschien keine neue offene DeepSeek-Fassung; V3.2 bleibt die aktuelle offene Version und die Position unverändert. DeepSeek V4 · April 2026 · Rang 1 – Steigt von Rang 4 auf Rang 1: DeepSeek veröffentlichte am 24. April 2026 die offene Version V4, die laut Hersteller-Angaben mit rund 80,6 Prozent auf SWE-bench Verified den höchsten offenen Wert des Monats erreicht und V3.2 als aktuelle Fassung ablöst. DeepSeek V4 · Mai 2026 · Rang 1 – Hält Rang 1 durch Bestandsschutz: Im Mai erschien kein neues, sofort nutzbares offenes Coding-Modell, das DeepSeek V4 verdrängt; der laut Hersteller-Angaben höchste offene SWE-bench-Verified-Wert bleibt führend. DeepSeek V4 · Juni 2026 · Rang 1 – Hält Rang 1: Im Juni erschien keine neue DeepSeek-Fassung, doch das Modell steht laut veröffentlichten Benchmark-Angaben weiterhin an der Spitze bei LiveCodeBench und der Codeforces-Wertung, die kein anderes offenes Modell erreicht. D 1DeepSeekV4 GLM 5.2 · Januar 2026 · Rang 2 – Erstausgabe ohne Vorausgabe, der Rang wird stabil geführt. GLM-4.7 belegt Platz 2 wegen sehr starker Programmier- und Agentenleistung unter freizügiger MIT-Lizenz und einem großen Kontextfenster für umfangreiche Codebasen. GLM 5.2 · Februar 2026 · Rang 2 – Hält Rang 2 wie in der Vorausgabe: Z.ai löste Mitte Februar 2026 GLM-4.7 durch die offenen GLM-5-Gewichte unter MIT-Lizenz ab, die Position an zweiter Stelle der Kategorie bleibt jedoch unverändert. GLM 5.2 · März 2026 · Rang 2 – Hält Rang 2 durch Bestandsschutz: Z.ai veröffentlichte im März keine neue offene GLM-Version; GLM-5 bleibt die aktuelle offene Z.ai-Coding-Fassung und die Position unverändert. GLM 5.2 · April 2026 · Rang 3 – Fällt von Rang 2 auf Rang 3: Z.ai löste am 7. April 2026 GLM-5 durch die offenen GLM-5.1-Gewichte ab; trotz starker SWE-bench-Pro-Leistung zogen DeepSeek V4 und Kimi K2.6 im Berichtsmonat vorbei. GLM 5.2 · Mai 2026 · Rang 3 – Hält Rang 3 durch Bestandsschutz: Z.ai veröffentlichte im Mai keine neue offene GLM-Version; GLM-5.1 bleibt die aktuelle offene Z.ai-Coding-Fassung und die Position unverändert. GLM 5.2 · Juni 2026 · Rang 2 – Steigt von Rang 3 auf Rang 2: Die am 13. Juni veröffentlichte Fassung GLM-5.2 führt das offene Feld beim agentischen, mehrstufigen Coding an (SWE-bench Pro, Terminal-Bench) und zieht damit an Kimi vorbei. G 2GLM5.2 MiniMax M3 · Januar 2026 · Rang 4 – Erstausgabe ohne Vorausgabe, stabiler Rang. MiniMax-M2 liegt auf Platz 4 wegen sehr effizienter agentischer Coding-Leistung mit nur rund 10 Milliarden aktiven Parametern bei freizügiger MIT-Lizenz. MiniMax M3 · Februar 2026 · Rang 1 – Steigt von Rang 4 auf Rang 1: MiniMax veröffentlichte am 12. Februar 2026 die offene Version M2.5, die laut Hersteller-Angaben mit rund 80,2 Prozent auf SWE-bench Verified den höchsten offenen Coding-Wert des Monats erreicht und M2 als aktuelle Coding-Fassung ablöst. MiniMax M3 · März 2026 · Rang 1 – Hält Rang 1 durch Bestandsschutz: Im März erschien keine neue offene Coding-Fassung, die M2.5 verdrängt; der laut Hersteller-Angaben höchste offen belegte SWE-bench-Verified-Wert bleibt im gewerteten Feld führend. MiniMax M3 · April 2026 · Rang 4 – Fällt von Rang 1 auf Rang 4: Im Berichtsmonat zogen DeepSeek V4, Kimi K2.6 und GLM-5.1 mit neuen offenen Fassungen vorbei, während MiniMax keine neue im gewerteten Feld qualifizierende Fassung nachlegte. M2.5 bleibt die aktuelle offene MiniMax-Coding-Fassung. MiniMax M3 · Mai 2026 · Rang 4 – Hält Rang 4 durch Bestandsschutz: Im Mai erschien keine neue im gewerteten Feld qualifizierende MiniMax-Fassung; M2.5 bleibt die aktuelle offene MiniMax-Coding-Fassung. Das angekündigte M3 stand mit offenen Gewichten noch aus. MiniMax M3 · Juni 2026 · Rang 3 – Steigt von Rang 4 auf Rang 3: Die Anfang Juni veröffentlichte Fassung M3 löst M2.5 ab und überholt Kimi mit unabhängig ausgewiesenen Juni-Benchmarks sowie nativer Multimodalität und Million-Token-Kontext. M 3MiniMaxM3 Kimi K2 K2.7-Code · Januar 2026 · Rang 1 – Erstausgabe der Kategorie ohne Vorausgabe, daher wird der Rang stabil geführt. Kimi K2.5 belegt Platz 1, weil es Ende Januar mit dem höchsten offen belegten SWE-bench-Verified-Wert des Monats erscheint und agentisches Programmieren mit nativer Werkzeug-Nutzung verbindet. Kimi K2 K2.7-Code · Februar 2026 · Rang 3 – Fällt von Rang 1 auf Rang 3: Im Berichtsmonat erschien keine neue offene Kimi-Fassung, während MiniMax M2.5 und GLM-5 laut Hersteller-Angaben bei agentischem Coding vorbeizogen. Kimi K2.5 bleibt die aktuelle offene Moonshot-Coding-Fassung. Kimi K2 K2.7-Code · März 2026 · Rang 3 – Hält Rang 3 durch Bestandsschutz: Moonshot AI brachte im März keine neue offene Kimi-Fassung; K2.5 bleibt die aktuelle offene Coding-Fassung und die Position unverändert. Kimi K2 K2.7-Code · April 2026 · Rang 2 – Steigt von Rang 3 auf Rang 2: Moonshot AI veröffentlichte am 20. April 2026 Kimi K2.6, das laut Hersteller-Angaben mit rund 58,6 Prozent auf SWE-bench Pro das offene Feld beim agentischen Coding anführt und K2.5 ablöst. Kimi K2 K2.7-Code · Mai 2026 · Rang 2 – Hält Rang 2 durch Bestandsschutz: Moonshot AI brachte im Mai keine neue offene Kimi-Fassung; K2.6 bleibt die aktuelle offene Coding-Fassung und der agentische Spitzenreiter im offenen Feld. Kimi K2 K2.7-Code · Juni 2026 · Rang 4 – Fällt von Rang 2 auf Rang 4: Zwar erschien am 12. Juni mit K2.7-Code eine verbesserte Coding-Fassung, doch GLM-5.2 und MiniMax M3 sind im Juni beim unabhängig belegten agentischen Coding vorbeigezogen. K 4Kimi K2K2.7-Code Qwen3-Coder Next · Januar 2026 · Rang 5 – Erstausgabe ohne Vorausgabe, stabiler Rang. Qwen3-Coder-480B schließt die Top 5 als einziger dedizierter Coding-Spezialist unter freizügiger Apache-2.0-Lizenz, mit etwas älterem Release-Stand als das übrige Feld. Qwen3-Coder Next · Februar 2026 · Rang 5 – Hält Rang 5: Alibaba veröffentlichte Anfang Februar 2026 Qwen3-Coder-Next als jüngere, effizienzorientierte Coding-Fassung; sie löst Qwen3-Coder-480B ab, die Position am Ende der Top 5 bleibt unverändert. Qwen3-Coder Next · März 2026 · Rang 5 – Hält Rang 5 durch Bestandsschutz: Im März erschien keine neue offene Qwen-Coding-Fassung; Qwen3-Coder-Next bleibt als effizienter dedizierter Coding-Spezialist im Feld. Qwen3-Coder Next · April 2026 · Rang 5 – Hält Rang 5 durch Bestandsschutz: Im April erschien keine neue offene Qwen-Coding-Fassung; Qwen3-Coder-Next bleibt als effizienter dedizierter Coding-Spezialist im Feld. Qwen3-Coder Next · Mai 2026 · Rang 5 – Hält Rang 5 durch Bestandsschutz: Im Mai erschien keine neue offene Qwen-Coding-Fassung; Qwen3-Coder-Next bleibt als effizienter dedizierter Coding-Spezialist im Feld. Qwen3-Coder Next · Juni 2026 · Rang 5 – Hält Rang 5: Im Juni erschien keine neue offene Qwen-Coding-Fassung; Qwen3-Coder-Next bleibt der effiziente dedizierte Coding-Spezialist im Feld und wird nicht verdrängt. Q 5Qwen3-CoderNext
Watchlist
  • NVIDIANemotron 3 Ultra
  • Mistral AIDevstral 2
Rangverlauf je Tool über die letzten Monate
ToolJanuar 2026Februar 2026März 2026April 2026Mai 2026Juni 2026
DeepSeek V4344111
GLM 5.2222332
MiniMax M3411443
Kimi K2 K2.7-Code133224
Qwen3-Coder Next555555

Aktuelles Ranking

  1. DeepSeek V4

    Tendenz: unverändert

    • Laut veröffentlichten Benchmark-Angaben an der Spitze der offenen Modelle bei LiveCodeBench (93,5) und der Codeforces-Wertung (3206), zwei Maßen für die Erzeugung korrekten, lauffähigen Codes.
    • Rund 80,6 Prozent auf SWE-bench Verified, statistisch gleichauf mit geschlossenen Spitzenmodellen und auf dem Niveau der offenen Spitze bei realen Software-Aufgaben.
    • MIT-Lizenz mit frei herunterladbaren Gewichten auf Hugging Face, uneingeschränkt für den kommerziellen Self-Hosted-Betrieb und die Verwertung des erzeugten Codes.
    • Mixture-of-Experts mit rund 1,6 Billionen Gesamt- und etwa 49 Milliarden aktiven Parametern je Token, dazu ein Kontextfenster von rund einer Million Token für sehr große Codebasen.
    Zum Anbieter
  2. GLM 5.2 Neu

    Z.ai Tendenz: verbessert

    • Laut Anbieter- und Fachpresse-Angaben des Juni rund 62,1 Prozent auf SWE-bench Pro und 81,0 Prozent auf Terminal-Bench 2.1, der höchste offene Wert beim agentischen, mehrstufigen Coding.
    • Führt im Juni die offene Kategorie des Artificial-Analysis-Intelligence-Index (v4.1) an, vor den übrigen offenen Modellen des gewerteten Felds.
    • MIT-Lizenz mit frei veröffentlichten Gewichten, freizügig für den kommerziellen Self-Hosted-Betrieb und die Verwertung des erzeugten Codes.
    • Mixture-of-Experts mit rund 744 Milliarden Gesamt- und etwa 40 Milliarden aktiven Parametern je Token, ausgelegt auf lange Aufgabenketten, mit nutzbarem Kontext von rund einer Million Token.
    Zum Anbieter
  3. MiniMax M3 Neu

    Tendenz: verbessert

    • Laut Fachpresse-Angaben des Juni rund 80,5 Prozent auf SWE-bench Verified und 59,0 Prozent auf SWE-bench Pro, auf dem Niveau des offenen Spitzenfelds beim Coding.
    • Erstes offenes Modell, das Coding-Leistung auf Spitzenniveau, ein Kontextfenster von rund einer Million Token und native Multimodalität in einer Architektur vereint.
    • Mixture-of-Experts mit rund 428 Milliarden Gesamt- und etwa 23 Milliarden aktiven Parametern je Token mit einem Sparse-Attention-Ansatz für effiziente lange Kontexte.
    • Veröffentlicht unter der MiniMax Community License, die weniger freizügig ist als MIT oder Apache 2.0 und die kommerzielle Nutzung an Auflagen bindet, ein Nachteil beim Kriterium rechtssichere kommerzielle Nutzung.
    Zum Anbieter
  4. Kimi K2 K2.7-Code Neu

    Moonshot AI Tendenz: verschlechtert

    • Auf Programmierung spezialisierte, agentische Fassung mit rund 30 Prozent geringerem Verbrauch an Reasoning-Tokens gegenüber K2.6, ausgelegt auf lange Software-Engineering-Aufgaben über viele Schritte.
    • Mixture-of-Experts mit rund einer Billion Gesamt- und etwa 32 Milliarden aktiven Parametern je Token; verarbeitet Text-, Bild- und Video-Eingaben.
    • Veröffentlicht unter einer angepassten MIT-Lizenz mit offenen Gewichten auf Hugging Face für den kommerziellen Self-Hosted-Betrieb.
    • Die im Juni gemeldeten Coding-Zuwächse stützen sich ausschließlich auf anbietereigene Benchmarks; unabhängige Werte auf den etablierten öffentlichen Suiten lagen zum Release noch nicht vor.
    Zum Anbieter
  5. Qwen3-Coder Next

    Alibaba Tendenz: unverändert

    • Dedizierter Coding-Spezialist als Mixture-of-Experts mit rund 80 Milliarden Gesamt- und etwa 3 Milliarden aktiven Parametern, ausgelegt auf lokale Coding-Agenten.
    • Apache-2.0-Lizenz ohne Nutzungsbeschränkung für den kommerziellen Eigenbetrieb und die Verwertung des erzeugten Codes.
    • Sehr niedriger Grafikspeicher-Bedarf ermöglicht den datensouveränen Betrieb auf einer einzelnen Arbeitsplatz-GPU.
    • Native Coding-Ausrichtung mit erweiterbarem Kontext bis in den Bereich mehrerer Hunderttausend Token für zusammenhängende Repository-Aufgaben.
    Zum Anbieter

Methodik & Transparenz

Diese Rankings dienen der Marktorientierung. Sie sind ein redaktioneller, kostenloser Überblick auf Basis öffentlich verfügbarer Quellen, keine abschließende oder absolute Bewertung. Jede Ausgabe ist eine Momentaufnahme; der Markt verändert sich schnell, und die Auswahl erhebt keinen Anspruch auf Vollständigkeit. Bewertet wird ausschließlich anhand der je Kategorie veröffentlichten Kriterien; ein eigener Labortest findet nicht statt. Die vergleichende Einordnung ist unsere redaktionelle Meinung, keine Tatsachenbehauptung über die Eignung einzelner Produkte, und sie wertet keinen Anbieter pauschal ab. Sie ersetzt keine eigene Prüfung. Stand: 01.07.2026.

Bei Recherche und Zusammenfassung kommen KI-Technologien zum Einsatz. Auswahl, Einordnung und Veröffentlichung werden von einer Person geprüft, freigegeben und redaktionell verantwortet. Genannte Produkt-, Marken- und Unternehmensnamen sind Eigentum der jeweiligen Inhaber; ihre Nennung dient allein der Information und Identifikation und bedeutet weder eine Empfehlung noch eine geschäftliche Verbindung zu diesen Anbietern. FORGEINITY hostet oder vervielfältigt keine fremden Inhalte, sondern verweist auf die Originalquellen.

Soweit wir auf externe Seiten verlinken, sind für deren Inhalte ausschließlich die jeweiligen Betreiber verantwortlich. Wir machen uns verlinkte Inhalte nicht zu eigen und übernehmen für sie keine Haftung; zum Zeitpunkt der Verlinkung waren keine Rechtsverstöße erkennbar, und bei Kenntnis einer Rechtsverletzung entfernen wir den betreffenden Link unverzüglich. Unabhängigkeit: Kein Anbieter hat für Platzierung oder Bewertung bezahlt; es bestehen keine Provisions-, Affiliate- oder Werbevereinbarungen. FORGEINITY arbeitet technologie-offen und bewertet ausschließlich anhand der veröffentlichten Kriterien. Alle Angaben erfolgen ohne Gewähr; eine Haftung für Richtigkeit, Vollständigkeit oder für Entscheidungen, die auf Grundlage dieser Rankings getroffen werden, ist ausgeschlossen.

Rechteinhaber, Betroffene und Dritte können eine Korrektur oder Entfernung einzelner Angaben unter legal@forgeinity.com anfragen oder einen rechtswidrigen verlinkten Inhalt melden. Wir prüfen berechtigte Hinweise und reagieren zeitnah.

Bewertet wird anhand dieser Kriterien:

  1. Korrektheit und Lauffähigkeit des erzeugten Codes (bewertet, wie zuverlässig das Modell fachlich richtigen, kompilierenden und in der Praxis laufenden Quellcode neu erzeugt, gemessen an veröffentlichten, datierten Coding-Vergleichsmessungen wie HumanEval, MBPP oder LiveCodeBench)
  2. Lösen realer Software-Aufgaben und agentisches Coding (bewertet, wie eigenständig das Modell mehrschrittige Entwicklungsaufgaben über mehrere Dateien eines Repositories plant und umsetzt und dabei Werkzeuge sowie Terminal-Befehle bis zu einem lauffähigen Ergebnis durchhält, belegt über agentische Vergleichsmessungen wie SWE-bench Verified oder Terminal-Bench)
  3. Repository-Kontext und Erfassung großer Codebasen (bewertet, wie viel zusammenhängenden Quellcode das Modell in einem Durchgang verarbeitet und wie zuverlässig es Abhängigkeiten, Konventionen und relevante Stellen aus langen, gewachsenen Codebasen wiederfindet und einbezieht)
  4. Breite der Programmiersprachen und Frameworks (bewertet, wie ausgewogen die Leistung über die verbreiteten Sprachen und Werkzeugketten des Mittelstands trägt, von Python, JavaScript und TypeScript bis zu System- und Unternehmenssprachen wie Java, Go, Rust und C++, statt nur in wenigen Sprachen stark zu sein)
  5. Fehlersuche in bestehendem, fremdem Code (bewertet, wie verlässlich das Modell Fehlerursachen in vorgegebenem, nicht selbst geschriebenem Quellcode aufspürt, vorgegebene Bugfix-Fälle besteht und die Korrektur über mehrstufiges Schlussfolgern statt durch Raten herleitet)
  6. Lizenz und rechtssichere kommerzielle Nutzung des Codes (bewertet, wie freizügig und rechtssicher die Lizenz den kommerziellen Eigenbetrieb des Modells und die Verwertung des erzeugten Codes erlaubt, von permissiven Lizenzen wie Apache 2.0 oder MIT bis zu Nutzungsbeschränkungen mancher Community-Lizenzen)
  7. Self-Host-Betreibbarkeit und Coding-Gesamtaufwand (bewertet Parametergröße, Architektur als dichtes oder Mixture-of-Experts-Modell, Grafikspeicher-Bedarf und Antworttempo, und damit, ob sich gerade die oft sehr großen Coding-Modelle datensouverän und produktiv auf bezahlbarer Hardware mit vertretbarem Aufwand betreiben lassen)
  8. Reife des Coding-Ökosystems und Werkzeug-Anbindung (bewertet, ob etablierte quantisierte Coding-Varianten und gängige Formate vorliegen und wie ausgereift die Einbindung als Modell-Backend in verbreitete Coding-Werkzeuge und über das Model Context Protocol (MCP) ohne Anbieter-Cloud ist)