Lokale LLM Modelle im Vergleich: Was 2026 zählt
Ein seriöser Vergleich lokaler LLMs beginnt nicht bei den Werbe-Benchmarks der Hersteller, sondern bei Kriterien, die über Ihren Betrieb entscheiden: Parameterzahl, Kontextfenster, Quantisierung und VRAM-Bedarf, Geschwindigkeit, Lizenz und Deutsch-Qualität. Diese Seite zeigt, wie Sie mit diesen Kriterien arbeiten, und liefert die konkreten Zahlen der wichtigsten Modelle, Stand August 2026.
Fakten geprüft, Stand: August 2026
Die 7 Kriterien, die wirklich zählen
- Parameterzahl: bestimmt Qualität und Hardwarebedarf. Die neuen Spitzenmodelle sind MoE-Systeme mit einer Billion Parametern und damit Server-Klasse; für Arbeitsplatz-Hardware zählen kompakte Modelle von 7 bis 35 Mrd.
- Kontextfenster: wie viele Tokens das Modell pro Anfrage verarbeiten kann. 2026 sind 128k der Standard, die neue Spitze liegt bei 256k bis 1 Mio. Token.
- Quantisierung und VRAM-Bedarf: Q4 (GGUF) ist der lokale Standard, der Speicherbedarf sinkt auf etwa ein Drittel der Vollversion. Faustregel: 0,5 GB VRAM pro Milliarde Parameter, plus Reserve.
- Geschwindigkeit: Tokens pro Sekunde. Auf einer RTX 5090 schafft Llama 3.3 70B in Q4 rund 14 Tokens pro Sekunde, ein Mac Studio M4 Ultra liegt ähnlich, Dual-RTX-4090-Setups bei rund 22.
- Lizenz: Apache 2.0 erlaubt freie kommerzielle Nutzung; Open-Weight-Lizenzen erlauben sie teils mit Auflagen; Research-Lizenzen verbieten sie ohne Zusatzvertrag.
- Hardwarebedarf: Single-GPU-tauglich oder Multi-GPU-Pflicht. DeepSeek V4 (1,6T) und Kimi K2.6 (1T) sind nur auf Server-Hardware betreibbar, Qwen 3.6-27B passt auf eine 24-GB-Karte.
- Deutsch-Qualität: Mistral dokumentiert seine Modelle als nativ deutschsprachig, Qwen und Llama sind multilingual stark. Im deutschen Alltag trennt das die Kandidaten stärker als englische Benchmarks.
Die Vergleichstabelle 2026
Die Zahlen stammen aus den Modell-Dokumentationen auf Hugging Face und öffentlichen Benchmarks, Stand August 2026. Der VRAM-Bedarf gilt für Q4-Quantisierung inklusive Reserve für Kontext und Zwischenspeicher.
| Modell | Parameter | Kontext | VRAM (Q4) | Lizenz | Deutsch |
|---|---|---|---|---|---|
| Qwen 3.6-27B | 27B (dicht) | 128k | ca. 15 bis 18 GB | Open-Weight | Sehr gut |
| Qwen 3.6-35B-A3B | 35B (MoE, 3B aktiv) | 128k | ca. 20 bis 24 GB | Open-Weight | Sehr gut |
| Qwen3 14B | 14B | 128k | ca. 8 bis 10 GB | Apache 2.0 | Gut |
| Qwen2.5-Coder 7B | 7B | 128k | ca. 5 bis 8 GB | Apache 2.0 | Gut, Stärke Code |
| Mistral Small 3 | 24B | 128k | ca. 14 bis 16 GB | Apache 2.0 | Sehr gut |
| Llama 3.3 70B | 70B | 128k | ca. 40 bis 45 GB | Llama Community License | Gut bis sehr gut |
| Kimi K2.6 | 1T (MoE, 32B aktiv) | 256k | Server (Multi-GPU) | Open (modifizierte MIT) | Gut |
| DeepSeek V4 | 1,6T (MoE) | 1 Mio. | Server (Multi-GPU) | frei (Open-Weight) | Gut |
Lokal gegen Cloud: der ehrliche Vergleich
Der Befund von 2026: Bei Code, Reasoning, Extraktion und Klassifikation sind die besten offenen Modelle gleichauf oder vorn; bei Vision, sehr langen Kontexten und kreativem Schreiben bleiben die Cloud-Spitzenmodelle vorn. Viele Unternehmen fahren hybrid: lokal für Routine und sensible Daten, Cloud für Spitzenaufgaben.
| Kriterium | Lokale Modelle (2026) | Cloud-Modelle (2026) |
|---|---|---|
| SWE-bench Pro (Code) | Qwen 3.6: 73,4 % | Claude Opus 4.7: 64,3 %, GPT-5.5: 58,6 % |
| GPQA Diamond (Experten-Reasoning) | Nicht auf Spitzenniveau | Claude 4.7: 94,2 %, Gemini 3.1 Pro: 94,3 % |
| Kontextfenster | Meist 128k, Spitze 256k bis 1 Mio. | 400k bis 1 Mio. Tokens |
| Kostenmodell | Einmalige Hardware + Strom | Laufende API-Gebühren |
| Datenschutz | Daten verlassen das Haus nicht | AVV und EU-Server nötig |
| Vision / multimodal | Schwachpunkt | Deutlich vorn |
So vergleichen Sie selbst: 4 Schritte
- Schritt 1: Hardware als Filter. Ermitteln Sie Ihren verfügbaren VRAM und streichen Sie alles, was nicht passt.
- Schritt 2: Lizenz prüfen. Nur Modelle mit belastbarer kommerzieller Lizenz kommen in die engere Wahl.
- Schritt 3: Eigene Testfragen stellen. Fünf bis zehn Aufgaben aus Ihrem Alltag trennen die Kandidaten besser als jeder Benchmark, gerade auf Deutsch.
- Schritt 4: Tempo und Kosten messen. Tokens pro Sekunde und Stromverbrauch gehören in die Rechnung, nicht nur die Qualität.
Was ein Vergleich über drei Jahre kostet
Ein Rechenbeispiel mit Marktpreisen von August 2026: Wer monatlich 50 Mio. Input- und 10 Mio. Output-Token über GPT-5.5 verarbeitet, zahlt bei 5 Dollar pro Mio. Input und 30 Dollar pro Mio. Output rund 550 Dollar im Monat, etwa 6.600 Dollar pro Jahr, ohne Preisvolatilität. Derselbe Bedarf auf einem Mac Studio M4 Max (einmalig ca. 4.500 bis 5.000 €, Strom ca. 400 € pro Jahr) amortisiert sich je nach Nutzung innerhalb von etwa einem Jahr, und die Daten bleiben im Haus. Bei DeepSeek-APIs (V4-Flash ab 0,14 Dollar pro Mio. Input) verschiebt sich die Rechnung Richtung Cloud, der Datenschutz bleibt aber das Argument für lokal.
Die häufigsten Vergleichsfehler
- Hersteller-Benchmarks als Wahrheit nehmen: Veröffentlichte Spitzenwerte sind oft nicht unabhängig verifiziert. Auf unabhängige Vergleichsübersichten und eigene Tests setzen.
- Veraltete Bestenlisten nutzen: Die Modellgeneration von April 2026 hat 2025er-Rankings überholt. Immer auf den Stand achten.
- Nur auf Qualität schauen: Ein Modell, das 14 Tokens pro Sekunde liefert, fühlt sich im Betrieb wie eine andere Welt an als eines mit 60.
- Lizenz übersehen: Das beste Modell nützt nichts, wenn die Lizenz den kommerziellen Betrieb verbietet.
Häufige Fragen
Qwen 3.6-27B auf einer 24-GB-Karte oder ein Mac Studio. Beste offene Gesamtleistung auf Consumer-Hardware, sehr gutes Deutsch, Open-Weight-Lizenz.
Für die meisten Unternehmensaufgaben gewinnt das größere Modell in Q4. Der Qualitätsverlust durch Quantisierung ist bei modernen Modellen gering, der Qualitätsgewinn durch mehr Parameter spürbar.
Rechnerisch oft ja, bei sensiblen Daten zwingend: Lokal verlassen Ihre Daten das Haus nie, es gibt keine Token-Kosten und keine Preisvolatilität. Die API ist die pragmatische Ergänzung für Spitzenaufgaben ohne Datenschutzbedarf.
Mit einem Pilot: zehn bis zwanzig typische Aufgaben, gemessen auf zwei bis drei Kandidatenmodellen, Qualität, Tempo, Kosten. Genau so ein Pilot ist Teil unserer Vorgehensweise; der kostenlose Projekt-Check ist der erste Schritt.
Weiterlesen
Kostenloser Projekt-Check
Sieben kurze Fragen – und Sie erhalten eine ehrliche Einschätzung, welcher Einstieg zu Ihrem Unternehmen passt. Unverbindlich und kostenlos.
