Monatliches Ranking · Stand: Juli 2026

Top 5: Offene Sprachmodelle fürs Programmieren

Unsere Marktbeobachtungen im Juli 2026

Im Juli trat mit Kimi K3 von Moonshot AI eine neue offene Modellgeneration an: Das Mixture-of-Experts-Modell mit rund 2,8 Billionen Parametern führt als erstes offenes Modell ein Frontend-Coding-Board an und hält lange, mehrstündige agentische Aufgaben durch. Die offenen Gewichte gingen Ende Juli auf Hugging Face live.

Das offene Spitzenfeld teilt sich im Juli in zwei Führungsrollen auf: Kimi K3 führt sowohl die coding-spezifischen Boards als auch den breiten Artificial-Analysis-Intelligence-Index an, DeepSeek V4 das etablierte SWE-bench Verified. Für den Mittelstand heißt das: Es gibt nicht das eine offene Modell, sondern je nach Aufgabe unterschiedliche Bestleistungen.

Bei Kimi K3 ist die Lizenz zu beachten: Anders als die MIT-Modelle DeepSeek V4 und GLM-5.2 steht K3 unter einer anbietereigenen Lizenz, die den kommerziellen Betrieb an Umsatz- und Nutzerschwellen (rund 20 Millionen Dollar Monatsumsatz beziehungsweise 100 Millionen monatliche Nutzer) bindet. Für den Mittelstand unterhalb dieser Schwellen ist das Modell nutzbar, beim Kriterium rechtssichere kommerzielle Nutzung bleibt es dennoch hinter den MIT-Modellen zurück.

Rangverlauf

Februar–Juli 2026

Rangverlauf der aktuellen Top-Tools über die letzten Monate DeepSeek V4 aktuell Rang 1; Kimi K3 aktuell Rang 2; GLM 5.2 aktuell Rang 3; MiniMax M3 aktuell Rang 4; Qwen3-Coder Next aktuell Rang 5. DeepSeek V4 · Februar 2026 · Rang 4 – Fällt von Rang 3 auf Rang 4: Im Berichtsmonat erschien keine neue offene DeepSeek-Fassung, während MiniMax M2.5 an die Spitze zog. DeepSeek-V3.2 bleibt die aktuelle offene DeepSeek-Version. DeepSeek V4 · März 2026 · Rang 4 – Hält Rang 4 durch Bestandsschutz: Im März erschien keine neue offene DeepSeek-Fassung; V3.2 bleibt die aktuelle offene Version und die Position unverändert. DeepSeek V4 · April 2026 · Rang 1 – Steigt von Rang 4 auf Rang 1: DeepSeek veröffentlichte am 24. April 2026 die offene Version V4, die laut Hersteller-Angaben mit rund 80,6 Prozent auf SWE-bench Verified den höchsten offenen Wert des Monats erreicht und V3.2 als aktuelle Fassung ablöst. DeepSeek V4 · Mai 2026 · Rang 1 – Hält Rang 1 durch Bestandsschutz: Im Mai erschien kein neues, sofort nutzbares offenes Coding-Modell, das DeepSeek V4 verdrängt; der laut Hersteller-Angaben höchste offene SWE-bench-Verified-Wert bleibt führend. DeepSeek V4 · Juni 2026 · Rang 1 – Hält Rang 1: Im Juni erschien keine neue DeepSeek-Fassung, doch das Modell steht laut veröffentlichten Benchmark-Angaben weiterhin an der Spitze bei LiveCodeBench und der Codeforces-Wertung, die kein anderes offenes Modell erreicht. DeepSeek V4 · Juli 2026 · Rang 1 – Hält Rang 1: Im Juli erschien keine neue DeepSeek-Fassung. Das Modell führt unter den offen herunterladbaren Gewichten weiterhin das etablierte SWE-bench Verified an und verbindet dies mit MIT-Lizenz und dem günstigsten Betriebsaufwand der Billionen-Klasse. D 1DeepSeekV4 Kimi K3 · Februar 2026 · Rang 3 – Fällt von Rang 1 auf Rang 3: Im Berichtsmonat erschien keine neue offene Kimi-Fassung, während MiniMax M2.5 und GLM-5 laut Hersteller-Angaben bei agentischem Coding vorbeizogen. Kimi K2.5 bleibt die aktuelle offene Moonshot-Coding-Fassung. Kimi K3 · März 2026 · Rang 3 – Hält Rang 3 durch Bestandsschutz: Moonshot AI brachte im März keine neue offene Kimi-Fassung; K2.5 bleibt die aktuelle offene Coding-Fassung und die Position unverändert. Kimi K3 · April 2026 · Rang 2 – Steigt von Rang 3 auf Rang 2: Moonshot AI veröffentlichte am 20. April 2026 Kimi K2.6, das laut Hersteller-Angaben mit rund 58,6 Prozent auf SWE-bench Pro das offene Feld beim agentischen Coding anführt und K2.5 ablöst. Kimi K3 · Mai 2026 · Rang 2 – Hält Rang 2 durch Bestandsschutz: Moonshot AI brachte im Mai keine neue offene Kimi-Fassung; K2.6 bleibt die aktuelle offene Coding-Fassung und der agentische Spitzenreiter im offenen Feld. Kimi K3 · Juni 2026 · Rang 4 – Fällt von Rang 2 auf Rang 4: Zwar erschien am 12. Juni mit K2.7-Code eine verbesserte Coding-Fassung, doch GLM-5.2 und MiniMax M3 sind im Juni beim unabhängig belegten agentischen Coding vorbeigezogen. Kimi K3 · Juli 2026 · Rang 2 – Steigt von Rang 4 auf Rang 2: Mit Kimi K3 veröffentlichte Moonshot AI im Juli eine neue offene Modellgeneration, die als erstes offenes Modell ein Frontend-Coding-Board anführt und auch beim mehrstündigen agentischen Coding vor mehreren geschlossenen Modellen liegt. K 2Kimi K3 GLM 5.2 · Februar 2026 · Rang 2 – Hält Rang 2 wie in der Vorausgabe: Z.ai löste Mitte Februar 2026 GLM-4.7 durch die offenen GLM-5-Gewichte unter MIT-Lizenz ab, die Position an zweiter Stelle der Kategorie bleibt jedoch unverändert. GLM 5.2 · März 2026 · Rang 2 – Hält Rang 2 durch Bestandsschutz: Z.ai veröffentlichte im März keine neue offene GLM-Version; GLM-5 bleibt die aktuelle offene Z.ai-Coding-Fassung und die Position unverändert. GLM 5.2 · April 2026 · Rang 3 – Fällt von Rang 2 auf Rang 3: Z.ai löste am 7. April 2026 GLM-5 durch die offenen GLM-5.1-Gewichte ab; trotz starker SWE-bench-Pro-Leistung zogen DeepSeek V4 und Kimi K2.6 im Berichtsmonat vorbei. GLM 5.2 · Mai 2026 · Rang 3 – Hält Rang 3 durch Bestandsschutz: Z.ai veröffentlichte im Mai keine neue offene GLM-Version; GLM-5.1 bleibt die aktuelle offene Z.ai-Coding-Fassung und die Position unverändert. GLM 5.2 · Juni 2026 · Rang 2 – Steigt von Rang 3 auf Rang 2: Die am 13. Juni veröffentlichte Fassung GLM-5.2 führt das offene Feld beim agentischen, mehrstufigen Coding an (SWE-bench Pro, Terminal-Bench) und zieht damit an Kimi vorbei. GLM 5.2 · Juli 2026 · Rang 3 – Fällt von Rang 2 auf Rang 3: GLM-5.2 bleibt technisch unverändert und weiter stark, wird aber vom neuen Kimi K3 überholt, das die coding-spezifischen Boards des Juli anführt. G 3GLM5.2 MiniMax M3 · Februar 2026 · Rang 1 – Steigt von Rang 4 auf Rang 1: MiniMax veröffentlichte am 12. Februar 2026 die offene Version M2.5, die laut Hersteller-Angaben mit rund 80,2 Prozent auf SWE-bench Verified den höchsten offenen Coding-Wert des Monats erreicht und M2 als aktuelle Coding-Fassung ablöst. MiniMax M3 · März 2026 · Rang 1 – Hält Rang 1 durch Bestandsschutz: Im März erschien keine neue offene Coding-Fassung, die M2.5 verdrängt; der laut Hersteller-Angaben höchste offen belegte SWE-bench-Verified-Wert bleibt im gewerteten Feld führend. MiniMax M3 · April 2026 · Rang 4 – Fällt von Rang 1 auf Rang 4: Im Berichtsmonat zogen DeepSeek V4, Kimi K2.6 und GLM-5.1 mit neuen offenen Fassungen vorbei, während MiniMax keine neue im gewerteten Feld qualifizierende Fassung nachlegte. M2.5 bleibt die aktuelle offene MiniMax-Coding-Fassung. MiniMax M3 · Mai 2026 · Rang 4 – Hält Rang 4 durch Bestandsschutz: Im Mai erschien keine neue im gewerteten Feld qualifizierende MiniMax-Fassung; M2.5 bleibt die aktuelle offene MiniMax-Coding-Fassung. Das angekündigte M3 stand mit offenen Gewichten noch aus. MiniMax M3 · Juni 2026 · Rang 3 – Steigt von Rang 4 auf Rang 3: Die Anfang Juni veröffentlichte Fassung M3 löst M2.5 ab und überholt Kimi mit unabhängig ausgewiesenen Juni-Benchmarks sowie nativer Multimodalität und Million-Token-Kontext. MiniMax M3 · Juli 2026 · Rang 4 – Fällt von Rang 3 auf Rang 4: M3 bleibt technisch unverändert und stark, rutscht aber eine Position, weil mit Kimi K3 ein neues Modell in das obere Feld eintritt. M 4MiniMaxM3 Qwen3-Coder Next · Februar 2026 · Rang 5 – Hält Rang 5: Alibaba veröffentlichte Anfang Februar 2026 Qwen3-Coder-Next als jüngere, effizienzorientierte Coding-Fassung; sie löst Qwen3-Coder-480B ab, die Position am Ende der Top 5 bleibt unverändert. Qwen3-Coder Next · März 2026 · Rang 5 – Hält Rang 5 durch Bestandsschutz: Im März erschien keine neue offene Qwen-Coding-Fassung; Qwen3-Coder-Next bleibt als effizienter dedizierter Coding-Spezialist im Feld. Qwen3-Coder Next · April 2026 · Rang 5 – Hält Rang 5 durch Bestandsschutz: Im April erschien keine neue offene Qwen-Coding-Fassung; Qwen3-Coder-Next bleibt als effizienter dedizierter Coding-Spezialist im Feld. Qwen3-Coder Next · Mai 2026 · Rang 5 – Hält Rang 5 durch Bestandsschutz: Im Mai erschien keine neue offene Qwen-Coding-Fassung; Qwen3-Coder-Next bleibt als effizienter dedizierter Coding-Spezialist im Feld. Qwen3-Coder Next · Juni 2026 · Rang 5 – Hält Rang 5: Im Juni erschien keine neue offene Qwen-Coding-Fassung; Qwen3-Coder-Next bleibt der effiziente dedizierte Coding-Spezialist im Feld und wird nicht verdrängt. Qwen3-Coder Next · Juli 2026 · Rang 5 – Hält Rang 5: Im Juli erschien keine neue offene Qwen-Coding-Fassung. Qwen3-Coder-Next bleibt der effiziente dedizierte Coding-Spezialist im Feld und wird nicht verdrängt. Q 5Qwen3-CoderNext
Watchlist
  • AlibabaQwen3.8-Max
  • Mistral AIDevstral 2
Rangverlauf je Tool über die letzten Monate
ToolFebruar 2026März 2026April 2026Mai 2026Juni 2026Juli 2026
DeepSeek V4441111
Kimi K3332242
GLM 5.2223323
MiniMax M3114434
Qwen3-Coder Next555555

Aktuelles Ranking

  1. DeepSeek V4

    Tendenz: unverändert

    • Führt unter den offen herunterladbaren Modellen das etablierte SWE-bench Verified an (rund 80,6 Prozent laut Anbieterangabe), ein zentrales Maß für agentisch gelösten, lauffähigen Code.
    • MIT-Lizenz mit frei herunterladbaren Gewichten für den uneingeschränkten kommerziellen Self-Hosted-Betrieb und die Verwertung des erzeugten Codes.
    • Mixture-of-Experts mit rund 1,6 Billionen Gesamt- und etwa 49 Milliarden aktiven Parametern je Token, dazu ein Kontextfenster von rund einer Million Token für sehr große Codebasen.
    • Deutlich geringerer Betriebsaufwand je erzeugtem Token als die übrigen Billionen-Modelle des Felds, ein Vorteil beim Kriterium Self-Host-Gesamtaufwand.
    Zum Anbieter
  2. Kimi K3

    Moonshot AI Tendenz: verbessert

    • Führt laut Juli-Berichten als erstes offenes Modell die Frontend Code Arena an (rund 1.679 Punkte) und rangiert dort vor mehreren geschlossenen Spitzenmodellen, ein Beleg für praxisnahe Code-Erzeugung.
    • Hält mehrstündige, mehrschrittige Software-Aufgaben bis zu einem Ergebnis durch (SWE Marathon rund 42,0), ein zentrales Maß für eigenständiges, agentisches Coding.
    • Mixture-of-Experts mit rund 2,8 Billionen Gesamt- und etwa 104 Milliarden aktiven Parametern je Token, nativer Bildverarbeitung und einem Kontextfenster von rund einer Million Token.
    • Offen veröffentlichte Gewichte auf Hugging Face (Ende Juli); die anbietereigene Lizenz bindet den kommerziellen Betrieb jedoch an Umsatz- und Nutzerschwellen und ist damit weniger freizügig als MIT.
    Zum Anbieter
  3. GLM 5.2

    Z.ai Tendenz: verschlechtert

    • Erreicht im Artificial-Analysis-Intelligence-Index 51 Punkte, ein breites Mass über Coding und Schlussfolgern hinweg, und liegt damit im vorderen Feld der offenen Modelle.
    • MIT-Lizenz mit frei veröffentlichten Gewichten, freizügig für den kommerziellen Self-Hosted-Betrieb und die Verwertung des erzeugten Codes.
    • Mit rund 744 Milliarden Gesamt- und etwa 40 Milliarden aktiven Parametern das kompakteste Modell des Spitzenfelds und damit am ehesten datensouverän auf bezahlbarer Hardware zu betreiben.
    • Kontextfenster von rund einer Million Token für lange, zusammenhängende Repository-Aufgaben.
    Zum Anbieter
  4. MiniMax M3

    Tendenz: verschlechtert

    • Verbindet eine starke Coding-Leistung, ein Kontextfenster von rund einer Million Token und native Multimodalität (Text, Bild, Video) in einer Architektur.
    • Mixture-of-Experts mit rund 428 Milliarden Gesamt- und etwa 23 Milliarden aktiven Parametern je Token mit einem Sparse-Attention-Ansatz für effiziente lange Kontexte.
    • Offen herunterladbare Gewichte auf Hugging Face mit offiziellem quantisiertem Format, geeignet für den datensouveränen Self-Hosted-Betrieb.
    • Veröffentlicht unter der MiniMax Community License, die die kommerzielle Nutzung an Auflagen bindet und damit weniger freizügig ist als MIT oder Apache 2.0.
    Zum Anbieter
  5. Qwen3-Coder Next

    Alibaba Tendenz: unverändert

    • Dedizierter Coding-Spezialist als Mixture-of-Experts mit rund 80 Milliarden Gesamt- und etwa 3 Milliarden aktiven Parametern, ausgelegt auf lokale Coding-Agenten.
    • Apache-2.0-Lizenz ohne Nutzungsbeschränkung für den kommerziellen Eigenbetrieb und die Verwertung des erzeugten Codes.
    • Sehr niedriger Grafikspeicher-Bedarf ermöglicht den datensouveränen Betrieb auf einer einzelnen Arbeitsplatz-GPU.
    • Native Coding-Ausrichtung mit erweiterbarem Kontext bis in den Bereich mehrerer Hunderttausend Token für zusammenhängende Repository-Aufgaben.
    Zum Anbieter

Methodik & Transparenz

Diese Rankings dienen der Marktorientierung. Sie sind ein redaktioneller, kostenloser Überblick auf Basis öffentlich verfügbarer Quellen, keine abschließende oder absolute Bewertung. Jede Ausgabe ist eine Momentaufnahme; der Markt verändert sich schnell, und die Auswahl erhebt keinen Anspruch auf Vollständigkeit. Bewertet wird ausschließlich anhand der je Kategorie veröffentlichten Kriterien; ein eigener Labortest findet nicht statt. Die vergleichende Einordnung ist unsere redaktionelle Meinung, keine Tatsachenbehauptung über die Eignung einzelner Produkte, und sie wertet keinen Anbieter pauschal ab. Sie ersetzt keine eigene Prüfung. Stand: 30.07.2026.

Bei Recherche und Zusammenfassung kommen KI-Technologien zum Einsatz. Auswahl, Einordnung und Veröffentlichung werden von einer Person geprüft, freigegeben und redaktionell verantwortet. Genannte Produkt-, Marken- und Unternehmensnamen sind Eigentum der jeweiligen Inhaber; ihre Nennung dient allein der Information und Identifikation und bedeutet weder eine Empfehlung noch eine geschäftliche Verbindung zu diesen Anbietern. FORGEINITY hostet oder vervielfältigt keine fremden Inhalte, sondern verweist auf die Originalquellen.

Soweit wir auf externe Seiten verlinken, sind für deren Inhalte ausschließlich die jeweiligen Betreiber verantwortlich. Wir machen uns verlinkte Inhalte nicht zu eigen und übernehmen für sie keine Haftung; zum Zeitpunkt der Verlinkung waren keine Rechtsverstöße erkennbar, und bei Kenntnis einer Rechtsverletzung entfernen wir den betreffenden Link unverzüglich. Unabhängigkeit: Kein Anbieter hat für Platzierung oder Bewertung bezahlt; es bestehen keine Provisions-, Affiliate- oder Werbevereinbarungen. FORGEINITY arbeitet technologie-offen und bewertet ausschließlich anhand der veröffentlichten Kriterien. Alle Angaben erfolgen ohne Gewähr; eine Haftung für Richtigkeit, Vollständigkeit oder für Entscheidungen, die auf Grundlage dieser Rankings getroffen werden, ist ausgeschlossen.

Rechteinhaber, Betroffene und Dritte können eine Korrektur oder Entfernung einzelner Angaben unter legal@forgeinity.com anfragen oder einen rechtswidrigen verlinkten Inhalt melden. Wir prüfen berechtigte Hinweise und reagieren zeitnah.

Bewertet wird anhand dieser Kriterien:

  1. Korrektheit und Lauffähigkeit des erzeugten Codes (bewertet, wie zuverlässig das Modell fachlich richtigen, kompilierenden und in der Praxis laufenden Quellcode neu erzeugt, gemessen an veröffentlichten, datierten Coding-Vergleichsmessungen wie HumanEval, MBPP oder LiveCodeBench)
  2. Lösen realer Software-Aufgaben und agentisches Coding (bewertet, wie eigenständig das Modell mehrschrittige Entwicklungsaufgaben über mehrere Dateien eines Repositories plant und umsetzt und dabei Werkzeuge sowie Terminal-Befehle bis zu einem lauffähigen Ergebnis durchhält, belegt über agentische Vergleichsmessungen wie SWE-bench Verified oder Terminal-Bench)
  3. Repository-Kontext und Erfassung großer Codebasen (bewertet, wie viel zusammenhängenden Quellcode das Modell in einem Durchgang verarbeitet und wie zuverlässig es Abhängigkeiten, Konventionen und relevante Stellen aus langen, gewachsenen Codebasen wiederfindet und einbezieht)
  4. Breite der Programmiersprachen und Frameworks (bewertet, wie ausgewogen die Leistung über die verbreiteten Sprachen und Werkzeugketten des Mittelstands trägt, von Python, JavaScript und TypeScript bis zu System- und Unternehmenssprachen wie Java, Go, Rust und C++, statt nur in wenigen Sprachen stark zu sein)
  5. Fehlersuche in bestehendem, fremdem Code (bewertet, wie verlässlich das Modell Fehlerursachen in vorgegebenem, nicht selbst geschriebenem Quellcode aufspürt, vorgegebene Bugfix-Fälle besteht und die Korrektur über mehrstufiges Schlussfolgern statt durch Raten herleitet)
  6. Lizenz und rechtssichere kommerzielle Nutzung des Codes (bewertet, wie freizügig und rechtssicher die Lizenz den kommerziellen Eigenbetrieb des Modells und die Verwertung des erzeugten Codes erlaubt, von permissiven Lizenzen wie Apache 2.0 oder MIT bis zu Nutzungsbeschränkungen mancher Community-Lizenzen)
  7. Self-Host-Betreibbarkeit und Coding-Gesamtaufwand (bewertet Parametergröße, Architektur als dichtes oder Mixture-of-Experts-Modell, Grafikspeicher-Bedarf und Antworttempo, und damit, ob sich gerade die oft sehr großen Coding-Modelle datensouverän und produktiv auf bezahlbarer Hardware mit vertretbarem Aufwand betreiben lassen)
  8. Reife des Coding-Ökosystems und Werkzeug-Anbindung (bewertet, ob etablierte quantisierte Coding-Varianten und gängige Formate vorliegen und wie ausgereift die Einbindung als Modell-Backend in verbreitete Coding-Werkzeuge und über das Model Context Protocol (MCP) ohne Anbieter-Cloud ist)