Monatliches Ranking · Stand: August 2026

Top 5: Lokale LLM-Runtimes (Self-Hosted KI)

Unsere Marktbeobachtungen im August 2026

Die Anpassung der Server-Runtimes an neue offene Modelle setzte sich im August 2026 fort. vLLM ergänzte mit Version 0.27.0 vom 10. August die Unterstützung für Kimi K3 und Qwen3.5 und machte mit Version 0.28.0 vom 26. August die Sparse-MLA-Unterstützung für DeepSeek V4 durchgängig nutzbar. SGLang beschleunigte mit Version 0.5.17 vom 8. August DeepSeek-V4 über einen FP8-MegaMoE-Pfad und verkürzte mit Version 0.5.18 vom 22. August den Serverstart. Betroffen sind die Kriterien Modell-Unterstützung und Inference-Geschwindigkeit, ohne die lokale Datenhoheit aufzugeben.

Desktop-Runtimes bauten im August 2026 ihre Unternehmens- und Beschleunigungsfunktionen aus. LM Studio ergänzte mit Version 0.4.21 vom 12. August einen Server-API-Schlüssel für den Endpunkt-Betrieb im unternehmensinternen Netzwerk und mit Version 0.4.22 vom 28. August die spekulative Dekodierung über die Assistant-Drafter DFlash, DSpark und MTP. Das betrifft vor allem die Kriterien Integrationsfähigkeit und Inference-Geschwindigkeit im lokalen Betrieb.

Ollama verbesserte mit Version 0.33.0 vom 21. August 2026 das Zwischenspeichern beim Prefill: Abgebrochene Anfragen setzen an ihren Wiederaufsetzpunkten fort, statt von vorn zu beginnen. Zusätzlich lässt sich Ollama als Gateway-Anbieter in Claude Desktop einbinden. Zum Monatsende steht die Reihe bei Version 0.33.2 vom 27. August. Das betrifft die Kriterien Inference-Geschwindigkeit und Integrationsfähigkeit; der eigentliche Modellbetrieb bleibt vollständig lokal.

Rangverlauf

März–August 2026

Rangverlauf der aktuellen Top-Tools über die letzten Monate Ollama 0.33.2 aktuell Rang 1; vLLM 0.28.0 aktuell Rang 2; llama.cpp aktuell Rang 3; LM Studio 0.4.23 aktuell Rang 4; SGLang 0.5.18 aktuell Rang 5. Ollama 0.33.2 · März 2026 · Rang 1 – Bleibt auf Rang 1 wie in der Vorausgabe; die März-Recherche ergab keine datierte Verschiebung an der Spitze der Kategorie. Ollama 0.33.2 · April 2026 · Rang 1 – Bleibt auf Rang 1 wie in der Vorausgabe; die April-Recherche ergab keine datierte Verschiebung an der Spitze der Kategorie. Ollama 0.33.2 · Mai 2026 · Rang 1 – Bleibt auf Rang 1 wie in der Vorausgabe; die Mai-Recherche ergab trotz dichter Release-Kadenz keine datierte Verschiebung an der Spitze der Kategorie. Ollama 0.33.2 · Juni 2026 · Rang 1 – Bleibt auf Rang 1 wie in der Vorausgabe; die Juni-Recherche ergab trotz dichter Release-Kadenz keine datierte Verschiebung an der Spitze der Kategorie. Ollama 0.33.2 · Juli 2026 · Rang 1 – Bleibt auf Rang 1 wie in der Vorausgabe; die Juli-Recherche ergab trotz dichter Release-Kadenz keine datierte Verschiebung an der Spitze der Kategorie. Ollama 0.33.2 · August 2026 · Rang 1 – Bleibt auf Rang 1 wie in der Vorausgabe; die August-Recherche ergab trotz der neuen Version 0.33 keine datierte Verschiebung an der Spitze der Kategorie. O 1Ollama0.33.2 vLLM 0.28.0 · März 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; die März-Version 0.17.0 verstärkt das Werkzeug, verschiebt die relative Ordnung an der Spitze aber nicht. vLLM 0.28.0 · April 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; die April-Releases verstärken das Werkzeug, verschieben die relative Ordnung an der Spitze aber nicht. vLLM 0.28.0 · Mai 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; die beiden Mai-Releases verstärken das Werkzeug, verschieben die relative Ordnung an der Spitze aber nicht. vLLM 0.28.0 · Juni 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; die beiden Juni-Releases verstärken das Werkzeug, verschieben die relative Ordnung an der Spitze aber nicht. vLLM 0.28.0 · Juli 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; die Juli-Releases verstärken das Werkzeug, verschieben die relative Ordnung an der Spitze aber nicht. vLLM 0.28.0 · August 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; die August-Versionen 0.27.0, 0.27.1 und 0.28.0 verstärken das Werkzeug, verschieben die relative Ordnung an der Spitze aber nicht. V 2vLLM0.28.0 llama.cpp · März 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; an der relativen Position hat sich im März nichts geändert. llama.cpp · April 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; an der relativen Position hat sich im April nichts geändert. llama.cpp · Mai 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; die Mai-Neuerungen erweitern die Modellunterstützung, ändern die relative Position in der Kategorie jedoch nicht. llama.cpp · Juni 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; die fortlaufenden Juni-Builds erweitern die Modell- und Plattformabdeckung, ändern die relative Position in der Kategorie jedoch nicht. llama.cpp · Juli 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; die fortlaufenden Juli-Builds erweitern die Modell- und Plattformabdeckung, ändern die relative Position in der Kategorie jedoch nicht. llama.cpp · August 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; die fortlaufenden August-Builds erweitern die Hardware- und Modellabdeckung, ändern die relative Position in der Kategorie jedoch nicht. L 3llama.cpp LM Studio 0.4.23 · März 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; die März-Version ändert die relative Ordnung gegenüber den Server-Engines nicht. LM Studio 0.4.23 · April 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; die April-Versionen ändern die relative Ordnung gegenüber den Server-Engines nicht. LM Studio 0.4.23 · Mai 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; die Mai-Versionen 0.4.13 und 0.4.14 ändern die relative Ordnung gegenüber den Server-Engines nicht. LM Studio 0.4.23 · Juni 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; die Juni-Versionen von 0.4.15 bis 0.4.18 stärken den Mehr-GPU-Betrieb, ändern die relative Ordnung gegenüber den Server-Engines aber nicht. LM Studio 0.4.23 · Juli 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; die Juli-Versionen bis 0.4.20 ergänzen einen integrierten Agenten und Unternehmens-Endpunkte, ändern die relative Ordnung gegenüber den Server-Engines aber nicht. LM Studio 0.4.23 · August 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; die August-Versionen bis 0.4.23 ergänzen Unternehmens-Endpunkte und spekulative Dekodierung, ändern die relative Ordnung gegenüber den Server-Engines aber nicht. L 4LM Studio0.4.23 SGLang 0.5.18 · März 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; im März ergab sich keine kriterienrelevante Verschiebung der Position. SGLang 0.5.18 · April 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; im April ergab sich keine kriterienrelevante Verschiebung der Position. SGLang 0.5.18 · Mai 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; im Berichtsmonat ergab sich keine datierte, kriterienrelevante Verschiebung der Position. SGLang 0.5.18 · Juni 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; im Berichtsmonat ergab sich keine datierte, kriterienrelevante Verschiebung der Position. SGLang 0.5.18 · Juli 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; die Juli-Version 0.5.16 vom 25. Juli ergänzt das DSpark-Verfahren zur spekulativen Dekodierung und die Unterstützung des Inkling-Modells, ergibt aber keine datierte Verschiebung der relativen Position. SGLang 0.5.18 · August 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; die August-Versionen 0.5.17 und 0.5.18 ergänzen DeepSeek-V4-Beschleunigungen und einen schnelleren Modellstart, ergeben aber keine datierte Verschiebung der relativen Position. S 5SGLang0.5.18
Watchlist
  • Menlo ResearchJan
  • LocalAI
Rangverlauf je Tool über die letzten Monate
ToolMärz 2026April 2026Mai 2026Juni 2026Juli 2026August 2026
Ollama 0.33.2111111
vLLM 0.28.0222222
llama.cpp333333
LM Studio 0.4.23444444
SGLang 0.5.18555555

Aktuelles Ranking

  1. Ollama 0.33.2

    Tendenz: unverändert

    • Breite Modell-Unterstützung über das GGUF-Format mit integrierter Verwaltung zum Herunterladen und Versionieren lokaler Modelle.
    • Lokale, OpenAI-kompatible Programmierschnittstelle bindet bestehende Anwendungen vollständig offline an.
    • Geringer Einrichtungs- und Pflegeaufwand, dadurch auch ohne tiefes Technikwissen auf eigener Hardware betreibbar.
    • Version 0.33.0 vom 21. August 2026 macht die Wiederaufsetzpunkte beim Prefill verlässlich: Ein abgebrochener Prefill behält alle durchlaufenen Punkte, sodass eine Wiederholung dort fortsetzt, wo sie abgebrochen wurde, statt von vorn zu beginnen; zusätzlich lässt sich Ollama als Gateway-Anbieter in Claude Desktop einbinden. Die Punktversionen 0.33.1 vom 26. August und 0.33.2 vom 27. August ergänzten MLX-Unterstützung für Qwen3.8 Flash Next und strukturierte Ausgaben im MLX-Runner.
    Zum Anbieter
  2. vLLM 0.28.0

    Tendenz: unverändert

    • Auf hohen Durchsatz im Mehr-Nutzer-Betrieb ausgelegt durch kontinuierliches Batching und die PagedAttention-Speicherverwaltung.
    • Verteilte Inference über Tensor- und Pipeline-Parallelismus auf mehreren GPUs, geeignet vom Einzelserver bis zum Cluster.
    • Version 0.27.0 vom 10. August 2026 ergänzte Unterstützung für die Modelle Kimi K3 und Qwen3.5 sowie weitere DeepSeek-V4-Optimierungen und hob den PyTorch-Unterbau auf Version 2.13 an; Version 0.28.0 vom 26. August 2026 setzte diese Arbeit fort, machte die Sparse-MLA-Unterstützung für DeepSeek V4 durchgängig nutzbar und ergänzte gestuftes KV-Cache-Offloading bis auf die Festplatten-Ebene.
    • Stellt einen OpenAI-kompatiblen Server bereit und bleibt vollständig self-hosted und offline betreibbar.
    Zum Anbieter
  3. llama.cpp

    ggml.ai Tendenz: unverändert

    • Sehr breite Hardware-Unterstützung von reiner CPU über NVIDIA-, AMD- und Intel-GPUs bis Apple-Metal, dadurch auf nahezu jeder Maschine lauffähig.
    • Effiziente Ausführung quantisierter Modelle im GGUF-Format mit geringem Arbeitsspeicherbedarf.
    • Fortlaufende Build-Releases im August 2026 bis Build b10729 vom 31. August pflegten die Hardware-Unterstützung weiter: Build b10488 vom 18. August hob die OpenVINO-Werkzeugkette auf Version 2026.3, Build b10729 ergänzte Metal-Feinabstimmungen für den Apple M1 Ultra.
    • Bildet als Inference-Engine die Grundlage mehrerer Desktop-Runtimes und ist vollständig offline betreibbar.
    Zum Anbieter
  4. LM Studio 0.4.23

    Tendenz: unverändert

    • Grafische Oberfläche für Auswahl, Download und Verwaltung lokaler Modelle, dadurch besonders einsteigerfreundlich.
    • Stellt einen lokalen, OpenAI-kompatiblen Server bereit und ist vollständig offline betreibbar.
    • Version 0.4.21 vom 12. August 2026 ergänzte einen Server-API-Schlüssel für den Endpunkt-Betrieb im unternehmensinternen Netzwerk.
    • Version 0.4.22 vom 28. August 2026 ergänzte Unterstützung für spekulative Dekodierung über die Assistant-Drafter DFlash, DSpark und MTP sowie von Werkzeugen zurückgegebene Bilder in OpenAI- und Anthropic-kompatiblen Endpunkten.
    Zum Anbieter
  5. SGLang 0.5.18

    sgl-project Tendenz: unverändert

    • Auf hohen Durchsatz ausgelegte Server-Inference-Engine mit RadixAttention zur automatischen Wiederverwendung des KV-Caches.
    • Besonders effizient bei mehrstufigen Dialogen und RAG-Abläufen mit gemeinsamen Prompt-Präfixen.
    • Unterstützt Tensor-Parallelismus über mehrere GPUs und einen OpenAI-kompatiblen Endpunkt für die Anbindung.
    • Version 0.5.17 vom 8. August 2026 ergänzte einen FP8-MegaMoE-Pfad für DeepSeek-V4 und beschleunigte das Laden sehr großer MoE-Modelle deutlich (DeepSeek-V4-Pro auf acht GPUs von rund 35 auf gut 6 Minuten); Version 0.5.18 vom 22. August lädt Checkpoint-Seiten während der Aufzeichnung der CUDA-Graphen und verkürzt den Start von Qwen3-32B auf einer H100 von 84,8 auf 35,6 Sekunden.
    Zum Anbieter

Methodik & Transparenz

Diese Rankings dienen der Marktorientierung. Sie sind ein redaktioneller, kostenloser Überblick auf Basis öffentlich verfügbarer Quellen, keine abschließende oder absolute Bewertung. Jede Ausgabe ist eine Momentaufnahme; der Markt verändert sich schnell, und die Auswahl erhebt keinen Anspruch auf Vollständigkeit. Bewertet wird ausschließlich anhand der je Kategorie veröffentlichten Kriterien; ein eigener Labortest findet nicht statt. Die vergleichende Einordnung ist unsere redaktionelle Meinung, keine Tatsachenbehauptung über die Eignung einzelner Produkte, und sie wertet keinen Anbieter pauschal ab. Sie ersetzt keine eigene Prüfung. Stand: 01.09.2026.

Bei Recherche und Zusammenfassung kommen KI-Technologien zum Einsatz. Auswahl, Einordnung und Veröffentlichung werden von einer Person geprüft, freigegeben und redaktionell verantwortet. Genannte Produkt-, Marken- und Unternehmensnamen sind Eigentum der jeweiligen Inhaber; ihre Nennung dient allein der Information und Identifikation und bedeutet weder eine Empfehlung noch eine geschäftliche Verbindung zu diesen Anbietern. FORGEINITY hostet oder vervielfältigt keine fremden Inhalte, sondern verweist auf die Originalquellen.

Soweit wir auf externe Seiten verlinken, sind für deren Inhalte ausschließlich die jeweiligen Betreiber verantwortlich. Wir machen uns verlinkte Inhalte nicht zu eigen und übernehmen für sie keine Haftung; zum Zeitpunkt der Verlinkung waren keine Rechtsverstöße erkennbar, und bei Kenntnis einer Rechtsverletzung entfernen wir den betreffenden Link unverzüglich. Unabhängigkeit: Kein Anbieter hat für Platzierung oder Bewertung bezahlt; es bestehen keine Provisions-, Affiliate- oder Werbevereinbarungen. FORGEINITY arbeitet technologie-offen und bewertet ausschließlich anhand der veröffentlichten Kriterien. Alle Angaben erfolgen ohne Gewähr; eine Haftung für Richtigkeit, Vollständigkeit oder für Entscheidungen, die auf Grundlage dieser Rankings getroffen werden, ist ausgeschlossen.

Rechteinhaber, Betroffene und Dritte können eine Korrektur oder Entfernung einzelner Angaben unter legal@forgeinity.com anfragen oder einen rechtswidrigen verlinkten Inhalt melden. Wir prüfen berechtigte Hinweise und reagieren zeitnah.

Bewertet wird anhand dieser Kriterien:

  1. Datensouveränität und Offline-Betrieb (bewertet, ob die Verarbeitung vollständig auf eigener Hardware ohne Cloud-Verbindung läuft und keine Unternehmensdaten das Haus verlassen)
  2. Modell-Unterstützung (bewertet, wie breit das Spektrum lauffähiger Sprachmodelle, offener Modell-Formate und Quantisierungs-Varianten ist)
  3. Inference-Geschwindigkeit (bewertet das Antwort-Tempo in Tokens pro Sekunde und die Effizienz quantisierter Modelle auf gegebener Hardware)
  4. Hardware-Anforderungen und -Auslastung (bewertet, welche Hardware-Klasse für den Betrieb nötig ist und wie gut CPU, GPU und Arbeitsspeicher genutzt werden)
  5. Stabilität und Betriebsreife (bewertet die Zuverlässigkeit im Dauerbetrieb und die Eignung für den produktiven Einsatz im Unternehmen)
  6. Bedienbarkeit und Administration (bewertet Einrichtung, Bedienoberfläche und den laufenden Pflegeaufwand für Modelle und Updates)
  7. Integrationsfähigkeit (bewertet die lokale API-Bereitstellung, die Kompatibilität zu verbreiteten API-Standards und die Anbindung an bestehende Systeme)
  8. Erweiterbarkeit und Agenten-Unterstützung (bewertet, wie gut Werkzeug-Anbindung über offene Standards wie das Model Context Protocol (MCP), Plugins und mehrstufige KI-Abläufe unterstützt werden)