Monatliches Ranking · Stand: Juni 2026
Top 5: Lokale LLM-Runtimes (Self-Hosted KI)
Unsere Marktbeobachtungen im Juni 2026
Die Anpassung der lokalen Runtimes an die offene DeepSeek-V4-Familie setzte sich im Juni 2026 fort und erweiterte sich um neue offene Flaggschiff-Modelle. vLLM brachte mit Version 0.24.0 vom 30. Juni eine weitere DeepSeek-V4-Optimierung sowie mehrstufiges KV-Cache-Offloading über mehrere Speicherebenen. Ollama rollte mit Version 0.31.0 vom 29. Juni die Unterstützung für das offene Modell MiniMax M3 aus. Für den Self-Hosted-Betrieb betrifft das vor allem die Kriterien Modell-Unterstützung und Inference-Geschwindigkeit, ohne die lokale Datenhoheit aufzugeben.
LM Studio erweiterte im Juni 2026 den Mehr-GPU-Betrieb auf dem Desktop. Version 0.4.15 vom 4. Juni ergänzte CUDA-Tensor-Parallelismus für das Laden von Modellen über mehrere GPUs, Version 0.4.16 vom 8. Juni führte die Fernzugriffsfunktion LM Link aus der Warteliste in die allgemeine Verfügbarkeit. Das betrifft im Arbeitsplatz-Betrieb die Kriterien Hardware-Anforderungen und -Auslastung sowie Integrationsfähigkeit.
Rangverlauf
Januar–Juni 2026
- LocalAI
- Menlo ResearchJan
| Tool | Januar 2026 | Februar 2026 | März 2026 | April 2026 | Mai 2026 | Juni 2026 |
|---|---|---|---|---|---|---|
| Ollama 0.31.0 | 1 | 1 | 1 | 1 | 1 | 1 |
| vLLM 0.24.0 | 2 | 2 | 2 | 2 | 2 | 2 |
| llama.cpp | 3 | 3 | 3 | 3 | 3 | 3 |
| LM Studio 0.4.18 | 4 | 4 | 4 | 4 | 4 | 4 |
| SGLang | 5 | 5 | 5 | 5 | 5 | 5 |
Aktuelles Ranking
-
Ollama 0.31.0
- Breite Modell-Unterstützung über das GGUF-Format mit integrierter Verwaltung zum Herunterladen und Versionieren lokaler Modelle.
- Lokale, OpenAI-kompatible Programmierschnittstelle bindet bestehende Anwendungen vollständig offline an.
- Geringer Einrichtungs- und Pflegeaufwand, dadurch auch ohne tiefes Technikwissen auf eigener Hardware betreibbar.
- Version 0.31.0 vom 29. Juni 2026 rollte die Unterstützung für das offene Modell MiniMax M3 aus und ergänzte die Erkennung von Thinking-Modellen sowie Auto-Installation für Codex-nahe Werkzeuge.
-
vLLM 0.24.0
- Auf hohen Durchsatz im Mehr-Nutzer-Betrieb ausgelegt durch kontinuierliches Batching und die PagedAttention-Speicherverwaltung.
- Verteilte Inference über Tensor- und Pipeline-Parallelismus auf mehreren GPUs, geeignet vom Einzelserver bis zum Cluster.
- Version 0.24.0 vom 30. Juni 2026 ergänzte eine weitere DeepSeek-V4-Optimierung und mehrstufiges KV-Cache-Offloading über mehrere Speicherebenen.
- Version 0.23.0 vom 13. Juni 2026 als Zwischenrelease erweiterte die Modell- und Kompatibilitätsabdeckung im Berichtsmonat.
- Stellt einen OpenAI-kompatiblen Server bereit und bleibt vollständig self-hosted und offline betreibbar.
-
llama.cpp
- Sehr breite Hardware-Unterstützung von reiner CPU über NVIDIA- und AMD-GPUs bis Apple-Metal, dadurch auf nahezu jeder Maschine lauffähig.
- Effiziente Ausführung quantisierter Modelle im GGUF-Format mit geringem Arbeitsspeicherbedarf.
- Fortlaufende Build-Releases bis Build b9843 vom 30. Juni 2026 lieferten aktuelle Binaries für Ubuntu, Android, macOS und Windows.
- Bildet als Inference-Engine die Grundlage mehrerer Desktop-Runtimes und ist vollständig offline betreibbar.
-
LM Studio 0.4.18
- Grafische Oberfläche für Auswahl, Download und Verwaltung lokaler Modelle, dadurch besonders einsteigerfreundlich.
- Stellt einen lokalen, OpenAI-kompatiblen Server bereit und ist vollständig offline betreibbar.
- Version 0.4.15 vom 4. Juni 2026 ergänzte CUDA-Tensor-Parallelismus für das Laden von Modellen über mehrere GPUs.
- Version 0.4.16 vom 8. Juni 2026 führte die Fernzugriffsfunktion LM Link aus der Warteliste in die allgemeine Verfügbarkeit.
-
SGLang
- Auf hohen Durchsatz ausgelegte Server-Inference-Engine mit RadixAttention zur automatischen Wiederverwendung des KV-Caches.
- Besonders effizient bei mehrstufigen Dialogen und RAG-Abläufen mit gemeinsamen Prompt-Präfixen.
- Unterstützt Tensor-Parallelismus über mehrere GPUs und einen OpenAI-kompatiblen Endpunkt für die Anbindung.
- Bietet Unterstützung für aktuelle MoE-Modelle wie DeepSeek V4 und bleibt vollständig self-hosted betreibbar.
Methodik & Transparenz
Diese Rankings dienen der Marktorientierung. Sie sind ein redaktioneller, kostenloser Überblick auf Basis öffentlich verfügbarer Quellen, keine abschließende oder absolute Bewertung. Jede Ausgabe ist eine Momentaufnahme; der Markt verändert sich schnell, und die Auswahl erhebt keinen Anspruch auf Vollständigkeit. Bewertet wird ausschließlich anhand der je Kategorie veröffentlichten Kriterien; ein eigener Labortest findet nicht statt. Die vergleichende Einordnung ist unsere redaktionelle Meinung, keine Tatsachenbehauptung über die Eignung einzelner Produkte, und sie wertet keinen Anbieter pauschal ab. Sie ersetzt keine eigene Prüfung. Stand: 01.07.2026.
Bei Recherche und Zusammenfassung kommen KI-Technologien zum Einsatz. Auswahl, Einordnung und Veröffentlichung werden von einer Person geprüft, freigegeben und redaktionell verantwortet. Genannte Produkt-, Marken- und Unternehmensnamen sind Eigentum der jeweiligen Inhaber; ihre Nennung dient allein der Information und Identifikation und bedeutet weder eine Empfehlung noch eine geschäftliche Verbindung zu diesen Anbietern. FORGEINITY hostet oder vervielfältigt keine fremden Inhalte, sondern verweist auf die Originalquellen.
Soweit wir auf externe Seiten verlinken, sind für deren Inhalte ausschließlich die jeweiligen Betreiber verantwortlich. Wir machen uns verlinkte Inhalte nicht zu eigen und übernehmen für sie keine Haftung; zum Zeitpunkt der Verlinkung waren keine Rechtsverstöße erkennbar, und bei Kenntnis einer Rechtsverletzung entfernen wir den betreffenden Link unverzüglich. Unabhängigkeit: Kein Anbieter hat für Platzierung oder Bewertung bezahlt; es bestehen keine Provisions-, Affiliate- oder Werbevereinbarungen. FORGEINITY arbeitet technologie-offen und bewertet ausschließlich anhand der veröffentlichten Kriterien. Alle Angaben erfolgen ohne Gewähr; eine Haftung für Richtigkeit, Vollständigkeit oder für Entscheidungen, die auf Grundlage dieser Rankings getroffen werden, ist ausgeschlossen.
Rechteinhaber, Betroffene und Dritte können eine Korrektur oder Entfernung einzelner Angaben unter legal@forgeinity.com anfragen oder einen rechtswidrigen verlinkten Inhalt melden. Wir prüfen berechtigte Hinweise und reagieren zeitnah.
Bewertet wird anhand dieser Kriterien:
- Datensouveränität und Offline-Betrieb (bewertet, ob die Verarbeitung vollständig auf eigener Hardware ohne Cloud-Verbindung läuft und keine Unternehmensdaten das Haus verlassen)
- Modell-Unterstützung (bewertet, wie breit das Spektrum lauffähiger Sprachmodelle, offener Modell-Formate und Quantisierungs-Varianten ist)
- Inference-Geschwindigkeit (bewertet das Antwort-Tempo in Tokens pro Sekunde und die Effizienz quantisierter Modelle auf gegebener Hardware)
- Hardware-Anforderungen und -Auslastung (bewertet, welche Hardware-Klasse für den Betrieb nötig ist und wie gut CPU, GPU und Arbeitsspeicher genutzt werden)
- Stabilität und Betriebsreife (bewertet die Zuverlässigkeit im Dauerbetrieb und die Eignung für den produktiven Einsatz im Unternehmen)
- Bedienbarkeit und Administration (bewertet Einrichtung, Bedienoberfläche und den laufenden Pflegeaufwand für Modelle und Updates)
- Integrationsfähigkeit (bewertet die lokale API-Bereitstellung, die Kompatibilität zu verbreiteten API-Standards und die Anbindung an bestehende Systeme)
- Erweiterbarkeit und Agenten-Unterstützung (bewertet, wie gut Werkzeug-Anbindung über offene Standards wie das Model Context Protocol (MCP), Plugins und mehrstufige KI-Abläufe unterstützt werden)