Monatliches Ranking · Stand: Juni 2026

Top 5: Lokale LLM-Runtimes (Self-Hosted KI)

Unsere Marktbeobachtungen im Juni 2026

Die Anpassung der lokalen Runtimes an die offene DeepSeek-V4-Familie setzte sich im Juni 2026 fort und erweiterte sich um neue offene Flaggschiff-Modelle. vLLM brachte mit Version 0.24.0 vom 30. Juni eine weitere DeepSeek-V4-Optimierung sowie mehrstufiges KV-Cache-Offloading über mehrere Speicherebenen. Ollama rollte mit Version 0.31.0 vom 29. Juni die Unterstützung für das offene Modell MiniMax M3 aus. Für den Self-Hosted-Betrieb betrifft das vor allem die Kriterien Modell-Unterstützung und Inference-Geschwindigkeit, ohne die lokale Datenhoheit aufzugeben.

LM Studio erweiterte im Juni 2026 den Mehr-GPU-Betrieb auf dem Desktop. Version 0.4.15 vom 4. Juni ergänzte CUDA-Tensor-Parallelismus für das Laden von Modellen über mehrere GPUs, Version 0.4.16 vom 8. Juni führte die Fernzugriffsfunktion LM Link aus der Warteliste in die allgemeine Verfügbarkeit. Das betrifft im Arbeitsplatz-Betrieb die Kriterien Hardware-Anforderungen und -Auslastung sowie Integrationsfähigkeit.

Rangverlauf

Januar–Juni 2026

Rangverlauf der aktuellen Top-Tools über die letzten Monate Ollama 0.31.0 aktuell Rang 1; vLLM 0.24.0 aktuell Rang 2; llama.cpp aktuell Rang 3; LM Studio 0.4.18 aktuell Rang 4; SGLang aktuell Rang 5. Ollama 0.31.0 · Januar 2026 · Rang 1 – Erstausgabe dieser Kategorie ohne Vorausgabe; ein Rangvergleich ist nicht möglich, daher wird der Eintrag als stable geführt. Ollama 0.31.0 · Februar 2026 · Rang 1 – Bleibt auf Rang 1 wie in der Vorausgabe; die Februar-Recherche ergab keine datierte Verschiebung an der Spitze der Kategorie. Ollama 0.31.0 · März 2026 · Rang 1 – Bleibt auf Rang 1 wie in der Vorausgabe; die März-Recherche ergab keine datierte Verschiebung an der Spitze der Kategorie. Ollama 0.31.0 · April 2026 · Rang 1 – Bleibt auf Rang 1 wie in der Vorausgabe; die April-Recherche ergab keine datierte Verschiebung an der Spitze der Kategorie. Ollama 0.31.0 · Mai 2026 · Rang 1 – Bleibt auf Rang 1 wie in der Vorausgabe; die Mai-Recherche ergab trotz dichter Release-Kadenz keine datierte Verschiebung an der Spitze der Kategorie. Ollama 0.31.0 · Juni 2026 · Rang 1 – Bleibt auf Rang 1 wie in der Vorausgabe; die Juni-Recherche ergab trotz dichter Release-Kadenz keine datierte Verschiebung an der Spitze der Kategorie. O 1Ollama0.31.0 vLLM 0.24.0 · Januar 2026 · Rang 2 – Erstausgabe dieser Kategorie ohne Vorausgabe; ein Rangvergleich ist nicht möglich, daher wird der Eintrag als stable geführt. vLLM 0.24.0 · Februar 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; die Februar-Version verstärkt das Werkzeug, verschiebt die relative Ordnung an der Spitze aber nicht. vLLM 0.24.0 · März 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; die März-Version 0.17.0 verstärkt das Werkzeug, verschiebt die relative Ordnung an der Spitze aber nicht. vLLM 0.24.0 · April 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; die April-Releases verstärken das Werkzeug, verschieben die relative Ordnung an der Spitze aber nicht. vLLM 0.24.0 · Mai 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; die beiden Mai-Releases verstärken das Werkzeug, verschieben die relative Ordnung an der Spitze aber nicht. vLLM 0.24.0 · Juni 2026 · Rang 2 – Rang 2 unverändert gegenüber der Vorausgabe; die beiden Juni-Releases verstärken das Werkzeug, verschieben die relative Ordnung an der Spitze aber nicht. V 2vLLM0.24.0 llama.cpp · Januar 2026 · Rang 3 – Erstausgabe dieser Kategorie ohne Vorausgabe; ein Rangvergleich ist nicht möglich, daher wird der Eintrag als stable geführt. llama.cpp · Februar 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; an der relativen Position hat sich im Februar nichts geändert. llama.cpp · März 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; an der relativen Position hat sich im März nichts geändert. llama.cpp · April 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; an der relativen Position hat sich im April nichts geändert. llama.cpp · Mai 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; die Mai-Neuerungen erweitern die Modellunterstützung, ändern die relative Position in der Kategorie jedoch nicht. llama.cpp · Juni 2026 · Rang 3 – Rang 3 unverändert gegenüber der Vorausgabe; die fortlaufenden Juni-Builds erweitern die Modell- und Plattformabdeckung, ändern die relative Position in der Kategorie jedoch nicht. L 3llama.cpp LM Studio 0.4.18 · Januar 2026 · Rang 4 – Erstausgabe dieser Kategorie ohne Vorausgabe; ein Rangvergleich ist nicht möglich, daher wird der Eintrag als stable geführt. LM Studio 0.4.18 · Februar 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; die Februar-Version ändert die relative Ordnung gegenüber den Server-Engines nicht. LM Studio 0.4.18 · März 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; die März-Version ändert die relative Ordnung gegenüber den Server-Engines nicht. LM Studio 0.4.18 · April 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; die April-Versionen ändern die relative Ordnung gegenüber den Server-Engines nicht. LM Studio 0.4.18 · Mai 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; die Mai-Versionen 0.4.13 und 0.4.14 ändern die relative Ordnung gegenüber den Server-Engines nicht. LM Studio 0.4.18 · Juni 2026 · Rang 4 – Rang 4 unverändert gegenüber der Vorausgabe; die Juni-Versionen von 0.4.15 bis 0.4.18 stärken den Mehr-GPU-Betrieb, ändern die relative Ordnung gegenüber den Server-Engines aber nicht. L 4LM Studio0.4.18 SGLang · Januar 2026 · Rang 5 – Erstausgabe dieser Kategorie ohne Vorausgabe; ein Rangvergleich ist nicht möglich, daher wird der Eintrag als stable geführt. SGLang · Februar 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; im Februar ergab sich keine kriterienrelevante Verschiebung der Position. SGLang · März 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; im März ergab sich keine kriterienrelevante Verschiebung der Position. SGLang · April 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; im April ergab sich keine kriterienrelevante Verschiebung der Position. SGLang · Mai 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; im Berichtsmonat ergab sich keine datierte, kriterienrelevante Verschiebung der Position. SGLang · Juni 2026 · Rang 5 – Rang 5 unverändert gegenüber der Vorausgabe; im Berichtsmonat ergab sich keine datierte, kriterienrelevante Verschiebung der Position. S 5SGLang
Watchlist
  • LocalAI
  • Menlo ResearchJan
Rangverlauf je Tool über die letzten Monate
ToolJanuar 2026Februar 2026März 2026April 2026Mai 2026Juni 2026
Ollama 0.31.0111111
vLLM 0.24.0222222
llama.cpp333333
LM Studio 0.4.18444444
SGLang555555

Aktuelles Ranking

  1. Ollama 0.31.0

    Tendenz: unverändert

    • Breite Modell-Unterstützung über das GGUF-Format mit integrierter Verwaltung zum Herunterladen und Versionieren lokaler Modelle.
    • Lokale, OpenAI-kompatible Programmierschnittstelle bindet bestehende Anwendungen vollständig offline an.
    • Geringer Einrichtungs- und Pflegeaufwand, dadurch auch ohne tiefes Technikwissen auf eigener Hardware betreibbar.
    • Version 0.31.0 vom 29. Juni 2026 rollte die Unterstützung für das offene Modell MiniMax M3 aus und ergänzte die Erkennung von Thinking-Modellen sowie Auto-Installation für Codex-nahe Werkzeuge.
    Zum Anbieter
  2. vLLM 0.24.0

    Tendenz: unverändert

    • Auf hohen Durchsatz im Mehr-Nutzer-Betrieb ausgelegt durch kontinuierliches Batching und die PagedAttention-Speicherverwaltung.
    • Verteilte Inference über Tensor- und Pipeline-Parallelismus auf mehreren GPUs, geeignet vom Einzelserver bis zum Cluster.
    • Version 0.24.0 vom 30. Juni 2026 ergänzte eine weitere DeepSeek-V4-Optimierung und mehrstufiges KV-Cache-Offloading über mehrere Speicherebenen.
    • Version 0.23.0 vom 13. Juni 2026 als Zwischenrelease erweiterte die Modell- und Kompatibilitätsabdeckung im Berichtsmonat.
    • Stellt einen OpenAI-kompatiblen Server bereit und bleibt vollständig self-hosted und offline betreibbar.
    Zum Anbieter
  3. llama.cpp

    ggml.ai Tendenz: unverändert

    • Sehr breite Hardware-Unterstützung von reiner CPU über NVIDIA- und AMD-GPUs bis Apple-Metal, dadurch auf nahezu jeder Maschine lauffähig.
    • Effiziente Ausführung quantisierter Modelle im GGUF-Format mit geringem Arbeitsspeicherbedarf.
    • Fortlaufende Build-Releases bis Build b9843 vom 30. Juni 2026 lieferten aktuelle Binaries für Ubuntu, Android, macOS und Windows.
    • Bildet als Inference-Engine die Grundlage mehrerer Desktop-Runtimes und ist vollständig offline betreibbar.
    Zum Anbieter
  4. LM Studio 0.4.18

    Tendenz: unverändert

    • Grafische Oberfläche für Auswahl, Download und Verwaltung lokaler Modelle, dadurch besonders einsteigerfreundlich.
    • Stellt einen lokalen, OpenAI-kompatiblen Server bereit und ist vollständig offline betreibbar.
    • Version 0.4.15 vom 4. Juni 2026 ergänzte CUDA-Tensor-Parallelismus für das Laden von Modellen über mehrere GPUs.
    • Version 0.4.16 vom 8. Juni 2026 führte die Fernzugriffsfunktion LM Link aus der Warteliste in die allgemeine Verfügbarkeit.
    Zum Anbieter
  5. SGLang

    sgl-project Tendenz: unverändert

    • Auf hohen Durchsatz ausgelegte Server-Inference-Engine mit RadixAttention zur automatischen Wiederverwendung des KV-Caches.
    • Besonders effizient bei mehrstufigen Dialogen und RAG-Abläufen mit gemeinsamen Prompt-Präfixen.
    • Unterstützt Tensor-Parallelismus über mehrere GPUs und einen OpenAI-kompatiblen Endpunkt für die Anbindung.
    • Bietet Unterstützung für aktuelle MoE-Modelle wie DeepSeek V4 und bleibt vollständig self-hosted betreibbar.
    Zum Anbieter

Methodik & Transparenz

Diese Rankings dienen der Marktorientierung. Sie sind ein redaktioneller, kostenloser Überblick auf Basis öffentlich verfügbarer Quellen, keine abschließende oder absolute Bewertung. Jede Ausgabe ist eine Momentaufnahme; der Markt verändert sich schnell, und die Auswahl erhebt keinen Anspruch auf Vollständigkeit. Bewertet wird ausschließlich anhand der je Kategorie veröffentlichten Kriterien; ein eigener Labortest findet nicht statt. Die vergleichende Einordnung ist unsere redaktionelle Meinung, keine Tatsachenbehauptung über die Eignung einzelner Produkte, und sie wertet keinen Anbieter pauschal ab. Sie ersetzt keine eigene Prüfung. Stand: 01.07.2026.

Bei Recherche und Zusammenfassung kommen KI-Technologien zum Einsatz. Auswahl, Einordnung und Veröffentlichung werden von einer Person geprüft, freigegeben und redaktionell verantwortet. Genannte Produkt-, Marken- und Unternehmensnamen sind Eigentum der jeweiligen Inhaber; ihre Nennung dient allein der Information und Identifikation und bedeutet weder eine Empfehlung noch eine geschäftliche Verbindung zu diesen Anbietern. FORGEINITY hostet oder vervielfältigt keine fremden Inhalte, sondern verweist auf die Originalquellen.

Soweit wir auf externe Seiten verlinken, sind für deren Inhalte ausschließlich die jeweiligen Betreiber verantwortlich. Wir machen uns verlinkte Inhalte nicht zu eigen und übernehmen für sie keine Haftung; zum Zeitpunkt der Verlinkung waren keine Rechtsverstöße erkennbar, und bei Kenntnis einer Rechtsverletzung entfernen wir den betreffenden Link unverzüglich. Unabhängigkeit: Kein Anbieter hat für Platzierung oder Bewertung bezahlt; es bestehen keine Provisions-, Affiliate- oder Werbevereinbarungen. FORGEINITY arbeitet technologie-offen und bewertet ausschließlich anhand der veröffentlichten Kriterien. Alle Angaben erfolgen ohne Gewähr; eine Haftung für Richtigkeit, Vollständigkeit oder für Entscheidungen, die auf Grundlage dieser Rankings getroffen werden, ist ausgeschlossen.

Rechteinhaber, Betroffene und Dritte können eine Korrektur oder Entfernung einzelner Angaben unter legal@forgeinity.com anfragen oder einen rechtswidrigen verlinkten Inhalt melden. Wir prüfen berechtigte Hinweise und reagieren zeitnah.

Bewertet wird anhand dieser Kriterien:

  1. Datensouveränität und Offline-Betrieb (bewertet, ob die Verarbeitung vollständig auf eigener Hardware ohne Cloud-Verbindung läuft und keine Unternehmensdaten das Haus verlassen)
  2. Modell-Unterstützung (bewertet, wie breit das Spektrum lauffähiger Sprachmodelle, offener Modell-Formate und Quantisierungs-Varianten ist)
  3. Inference-Geschwindigkeit (bewertet das Antwort-Tempo in Tokens pro Sekunde und die Effizienz quantisierter Modelle auf gegebener Hardware)
  4. Hardware-Anforderungen und -Auslastung (bewertet, welche Hardware-Klasse für den Betrieb nötig ist und wie gut CPU, GPU und Arbeitsspeicher genutzt werden)
  5. Stabilität und Betriebsreife (bewertet die Zuverlässigkeit im Dauerbetrieb und die Eignung für den produktiven Einsatz im Unternehmen)
  6. Bedienbarkeit und Administration (bewertet Einrichtung, Bedienoberfläche und den laufenden Pflegeaufwand für Modelle und Updates)
  7. Integrationsfähigkeit (bewertet die lokale API-Bereitstellung, die Kompatibilität zu verbreiteten API-Standards und die Anbindung an bestehende Systeme)
  8. Erweiterbarkeit und Agenten-Unterstützung (bewertet, wie gut Werkzeug-Anbindung über offene Standards wie das Model Context Protocol (MCP), Plugins und mehrstufige KI-Abläufe unterstützt werden)