Monatliches Ranking · Stand: August 2026
Top 5: Lokale LLM-Runtimes (Self-Hosted KI)
Unsere Marktbeobachtungen im August 2026
Die Anpassung der Server-Runtimes an neue offene Modelle setzte sich im August 2026 fort. vLLM ergänzte mit Version 0.27.0 vom 10. August die Unterstützung für Kimi K3 und Qwen3.5 und machte mit Version 0.28.0 vom 26. August die Sparse-MLA-Unterstützung für DeepSeek V4 durchgängig nutzbar. SGLang beschleunigte mit Version 0.5.17 vom 8. August DeepSeek-V4 über einen FP8-MegaMoE-Pfad und verkürzte mit Version 0.5.18 vom 22. August den Serverstart. Betroffen sind die Kriterien Modell-Unterstützung und Inference-Geschwindigkeit, ohne die lokale Datenhoheit aufzugeben.
Desktop-Runtimes bauten im August 2026 ihre Unternehmens- und Beschleunigungsfunktionen aus. LM Studio ergänzte mit Version 0.4.21 vom 12. August einen Server-API-Schlüssel für den Endpunkt-Betrieb im unternehmensinternen Netzwerk und mit Version 0.4.22 vom 28. August die spekulative Dekodierung über die Assistant-Drafter DFlash, DSpark und MTP. Das betrifft vor allem die Kriterien Integrationsfähigkeit und Inference-Geschwindigkeit im lokalen Betrieb.
Ollama verbesserte mit Version 0.33.0 vom 21. August 2026 das Zwischenspeichern beim Prefill: Abgebrochene Anfragen setzen an ihren Wiederaufsetzpunkten fort, statt von vorn zu beginnen. Zusätzlich lässt sich Ollama als Gateway-Anbieter in Claude Desktop einbinden. Zum Monatsende steht die Reihe bei Version 0.33.2 vom 27. August. Das betrifft die Kriterien Inference-Geschwindigkeit und Integrationsfähigkeit; der eigentliche Modellbetrieb bleibt vollständig lokal.
Rangverlauf
März–August 2026
- Menlo ResearchJan
- LocalAI
| Tool | März 2026 | April 2026 | Mai 2026 | Juni 2026 | Juli 2026 | August 2026 |
|---|---|---|---|---|---|---|
| Ollama 0.33.2 | 1 | 1 | 1 | 1 | 1 | 1 |
| vLLM 0.28.0 | 2 | 2 | 2 | 2 | 2 | 2 |
| llama.cpp | 3 | 3 | 3 | 3 | 3 | 3 |
| LM Studio 0.4.23 | 4 | 4 | 4 | 4 | 4 | 4 |
| SGLang 0.5.18 | 5 | 5 | 5 | 5 | 5 | 5 |
Aktuelles Ranking
-
Ollama 0.33.2
- Breite Modell-Unterstützung über das GGUF-Format mit integrierter Verwaltung zum Herunterladen und Versionieren lokaler Modelle.
- Lokale, OpenAI-kompatible Programmierschnittstelle bindet bestehende Anwendungen vollständig offline an.
- Geringer Einrichtungs- und Pflegeaufwand, dadurch auch ohne tiefes Technikwissen auf eigener Hardware betreibbar.
- Version 0.33.0 vom 21. August 2026 macht die Wiederaufsetzpunkte beim Prefill verlässlich: Ein abgebrochener Prefill behält alle durchlaufenen Punkte, sodass eine Wiederholung dort fortsetzt, wo sie abgebrochen wurde, statt von vorn zu beginnen; zusätzlich lässt sich Ollama als Gateway-Anbieter in Claude Desktop einbinden. Die Punktversionen 0.33.1 vom 26. August und 0.33.2 vom 27. August ergänzten MLX-Unterstützung für Qwen3.8 Flash Next und strukturierte Ausgaben im MLX-Runner.
-
vLLM 0.28.0
- Auf hohen Durchsatz im Mehr-Nutzer-Betrieb ausgelegt durch kontinuierliches Batching und die PagedAttention-Speicherverwaltung.
- Verteilte Inference über Tensor- und Pipeline-Parallelismus auf mehreren GPUs, geeignet vom Einzelserver bis zum Cluster.
- Version 0.27.0 vom 10. August 2026 ergänzte Unterstützung für die Modelle Kimi K3 und Qwen3.5 sowie weitere DeepSeek-V4-Optimierungen und hob den PyTorch-Unterbau auf Version 2.13 an; Version 0.28.0 vom 26. August 2026 setzte diese Arbeit fort, machte die Sparse-MLA-Unterstützung für DeepSeek V4 durchgängig nutzbar und ergänzte gestuftes KV-Cache-Offloading bis auf die Festplatten-Ebene.
- Stellt einen OpenAI-kompatiblen Server bereit und bleibt vollständig self-hosted und offline betreibbar.
-
llama.cpp
- Sehr breite Hardware-Unterstützung von reiner CPU über NVIDIA-, AMD- und Intel-GPUs bis Apple-Metal, dadurch auf nahezu jeder Maschine lauffähig.
- Effiziente Ausführung quantisierter Modelle im GGUF-Format mit geringem Arbeitsspeicherbedarf.
- Fortlaufende Build-Releases im August 2026 bis Build b10729 vom 31. August pflegten die Hardware-Unterstützung weiter: Build b10488 vom 18. August hob die OpenVINO-Werkzeugkette auf Version 2026.3, Build b10729 ergänzte Metal-Feinabstimmungen für den Apple M1 Ultra.
- Bildet als Inference-Engine die Grundlage mehrerer Desktop-Runtimes und ist vollständig offline betreibbar.
-
LM Studio 0.4.23
- Grafische Oberfläche für Auswahl, Download und Verwaltung lokaler Modelle, dadurch besonders einsteigerfreundlich.
- Stellt einen lokalen, OpenAI-kompatiblen Server bereit und ist vollständig offline betreibbar.
- Version 0.4.21 vom 12. August 2026 ergänzte einen Server-API-Schlüssel für den Endpunkt-Betrieb im unternehmensinternen Netzwerk.
- Version 0.4.22 vom 28. August 2026 ergänzte Unterstützung für spekulative Dekodierung über die Assistant-Drafter DFlash, DSpark und MTP sowie von Werkzeugen zurückgegebene Bilder in OpenAI- und Anthropic-kompatiblen Endpunkten.
-
SGLang 0.5.18
- Auf hohen Durchsatz ausgelegte Server-Inference-Engine mit RadixAttention zur automatischen Wiederverwendung des KV-Caches.
- Besonders effizient bei mehrstufigen Dialogen und RAG-Abläufen mit gemeinsamen Prompt-Präfixen.
- Unterstützt Tensor-Parallelismus über mehrere GPUs und einen OpenAI-kompatiblen Endpunkt für die Anbindung.
- Version 0.5.17 vom 8. August 2026 ergänzte einen FP8-MegaMoE-Pfad für DeepSeek-V4 und beschleunigte das Laden sehr großer MoE-Modelle deutlich (DeepSeek-V4-Pro auf acht GPUs von rund 35 auf gut 6 Minuten); Version 0.5.18 vom 22. August lädt Checkpoint-Seiten während der Aufzeichnung der CUDA-Graphen und verkürzt den Start von Qwen3-32B auf einer H100 von 84,8 auf 35,6 Sekunden.
Methodik & Transparenz
Diese Rankings dienen der Marktorientierung. Sie sind ein redaktioneller, kostenloser Überblick auf Basis öffentlich verfügbarer Quellen, keine abschließende oder absolute Bewertung. Jede Ausgabe ist eine Momentaufnahme; der Markt verändert sich schnell, und die Auswahl erhebt keinen Anspruch auf Vollständigkeit. Bewertet wird ausschließlich anhand der je Kategorie veröffentlichten Kriterien; ein eigener Labortest findet nicht statt. Die vergleichende Einordnung ist unsere redaktionelle Meinung, keine Tatsachenbehauptung über die Eignung einzelner Produkte, und sie wertet keinen Anbieter pauschal ab. Sie ersetzt keine eigene Prüfung. Stand: 01.09.2026.
Bei Recherche und Zusammenfassung kommen KI-Technologien zum Einsatz. Auswahl, Einordnung und Veröffentlichung werden von einer Person geprüft, freigegeben und redaktionell verantwortet. Genannte Produkt-, Marken- und Unternehmensnamen sind Eigentum der jeweiligen Inhaber; ihre Nennung dient allein der Information und Identifikation und bedeutet weder eine Empfehlung noch eine geschäftliche Verbindung zu diesen Anbietern. FORGEINITY hostet oder vervielfältigt keine fremden Inhalte, sondern verweist auf die Originalquellen.
Soweit wir auf externe Seiten verlinken, sind für deren Inhalte ausschließlich die jeweiligen Betreiber verantwortlich. Wir machen uns verlinkte Inhalte nicht zu eigen und übernehmen für sie keine Haftung; zum Zeitpunkt der Verlinkung waren keine Rechtsverstöße erkennbar, und bei Kenntnis einer Rechtsverletzung entfernen wir den betreffenden Link unverzüglich. Unabhängigkeit: Kein Anbieter hat für Platzierung oder Bewertung bezahlt; es bestehen keine Provisions-, Affiliate- oder Werbevereinbarungen. FORGEINITY arbeitet technologie-offen und bewertet ausschließlich anhand der veröffentlichten Kriterien. Alle Angaben erfolgen ohne Gewähr; eine Haftung für Richtigkeit, Vollständigkeit oder für Entscheidungen, die auf Grundlage dieser Rankings getroffen werden, ist ausgeschlossen.
Rechteinhaber, Betroffene und Dritte können eine Korrektur oder Entfernung einzelner Angaben unter legal@forgeinity.com anfragen oder einen rechtswidrigen verlinkten Inhalt melden. Wir prüfen berechtigte Hinweise und reagieren zeitnah.
Bewertet wird anhand dieser Kriterien:
- Datensouveränität und Offline-Betrieb (bewertet, ob die Verarbeitung vollständig auf eigener Hardware ohne Cloud-Verbindung läuft und keine Unternehmensdaten das Haus verlassen)
- Modell-Unterstützung (bewertet, wie breit das Spektrum lauffähiger Sprachmodelle, offener Modell-Formate und Quantisierungs-Varianten ist)
- Inference-Geschwindigkeit (bewertet das Antwort-Tempo in Tokens pro Sekunde und die Effizienz quantisierter Modelle auf gegebener Hardware)
- Hardware-Anforderungen und -Auslastung (bewertet, welche Hardware-Klasse für den Betrieb nötig ist und wie gut CPU, GPU und Arbeitsspeicher genutzt werden)
- Stabilität und Betriebsreife (bewertet die Zuverlässigkeit im Dauerbetrieb und die Eignung für den produktiven Einsatz im Unternehmen)
- Bedienbarkeit und Administration (bewertet Einrichtung, Bedienoberfläche und den laufenden Pflegeaufwand für Modelle und Updates)
- Integrationsfähigkeit (bewertet die lokale API-Bereitstellung, die Kompatibilität zu verbreiteten API-Standards und die Anbindung an bestehende Systeme)
- Erweiterbarkeit und Agenten-Unterstützung (bewertet, wie gut Werkzeug-Anbindung über offene Standards wie das Model Context Protocol (MCP), Plugins und mehrstufige KI-Abläufe unterstützt werden)