Zum Inhalt springen
Corporate LLM Agentur – Der Prozessmeister
Modell-Übersicht

Lokale LLM-Modelle: Die Übersicht für 2026

Das beste lokale LLM ist nicht das größte, sondern das passende: Für deutsche Unternehmen entscheiden vier Faktoren: Deutsch-Qualität, Lizenz (darf ich kommerziell nutzen?), Hardware-Bedarf und Aktualität. Diese Übersicht ordnet die relevanten Open-Weights-Modelle ein, Stand August 2026, mit Angaben aus den offiziellen Modell-Dokumentationen und Hugging Face.

Fakten geprüft, Stand: August 2026

Die Modellfamilien im Überblick

Für den Produktiveinsatz in Deutschland empfehlen wir aktuell Llama 3.3, Qwen2.5 oder Mistral: Alle drei liefern belastbare Deutsch-Qualität und sind gut dokumentiert. Neuere Veröffentlichungen prüfen wir laufend, die Tabelle spiegelt den Stand der Recherche wider.

ModellfamilieAktuelle GrößenLizenzDeutsch-Eignung
Meta Llama 3.3 / 3.18B / 70BLlama Community LicenseGut bis sehr gut, explizit multilingual trainiert
Qwen2.5 / Qwen30,5B bis 72BMeist Apache 2.0, einzelne Varianten Qwen-LizenzSehr gut, über 29 Sprachen inklusive Deutsch
Mistral (Small/Ministral)7B bis 119BMeist Apache 2.0, Flaggschiffe mit Research-LizenzSehr gut, europäische Sprachen im Fokus
Google Gemma 31B / 4B / 12B / 27BGemma-Lizenz (permissiv mit Missbrauchsverboten)Gut, Unterstützung für über 140 Sprachen
Microsoft Phi-4ca. 3,8B bis 14BMicrosoft Research LicenseGut, stark bei geringem Ressourcenbedarf
DeepSeek (V3.1 / R1)MoE, 671B gesamtMIT (Basis), pro Modell prüfenGut, Stärke bei Code und Reasoning

VRAM-Bedarf: Was auf Ihre Hardware passt

Die Modellwahl folgt in der Praxis der Hardware, nicht umgekehrt. Bei Q4-Quantisierung gelten diese Richtwerte: 7 bis 8B brauchen 4 bis 8 GB, 13 bis 14B rund 8 bis 12 GB, 32B rund 18 bis 22 GB und 70B rund 40 bis 48 GB Grafikspeicher. Auf einer 24-GB-Karte ist bei 32B Schluss, alles darüber verlangt Profi-Hardware.

  • Unter 8 GB VRAM: Gemma 3 4B, Qwen2.5 3B, kleine Phi-4-Varianten.
  • 8 bis 16 GB VRAM: Qwen2.5 7B/14B, Gemma 3 12B, Mistral Small.
  • 24 GB VRAM: Qwen2.5 32B, Gemma 3 27B, die Komfortzone für Unternehmen.
  • 48 GB und mehr: Llama 3.3 70B, Qwen2.5 72B, die Qualitätsspitze der offenen Modelle.

Lizenzen: der unterschätzte Punkt

Open Weights bedeutet nicht automatisch freie kommerzielle Nutzung. Apache-2.0-Modelle (Mistral-Basis, die meisten Qwen2.5-Größen) sind unkompliziert. Meta knüpft an Llama Bedingungen wie Namensnennung und Nutzungsobergrenzen für sehr große Plattformen. Und Vorsicht bei Flaggschiffen: Mistral Large 2 etwa steht unter einer Research-Lizenz, kommerzielle Nutzung erfordert einen separaten Vertrag.

Wir prüfen in jedem Projekt die Lizenz des konkreten Modells in der konkreten Version und dokumentieren die Freigabe. Das klingt pedantisch, ist aber genau die Stelle, an der aus einer Bastellösung ein revisionsfestes Unternehmenssystem wird.

Größe ist nicht alles: die richtige Modellklasse wählen

  • 7 bis 8B: Standardantworten, Zusammenfassungen, einfache Fachfragen. Läuft auf Büro-Hardware, antwortet schnell.
  • 13 bis 32B: spürbar bessere Textqualität und Logik. Die Komfortzone für Unternehmenswissen und Kundenkommunikation.
  • 70B+: nahe am Niveau großer Cloud-Modelle, aber 40 bis 48 GB VRAM Pflicht. Lohnt für komplexe Analysen und hohe Ansprüche.
  • Spezialmodelle: für Aufgaben wie Code oder Tabellen existieren eigene Varianten, oft effizienter als ein größeres Universalmodell.

Womit betreiben? Ollama, LM Studio oder vLLM

Das Modell ist die eine Hälfte, die Laufzeitumgebung die andere: LM Studio für den grafischen Einzelplatz, Ollama für Server und Skripte, vLLM für den performanten Mehrbenutzerbetrieb. Die Details stehen auf unserer LM-Studio-Seite und im verlinkten Praxisvergleich.

Häufige Fragen

Aktuell liefern Qwen2.5, Llama 3.3 und Mistral die beste Deutsch-Qualität unter den offenen Modellen. In der Praxis testen wir zwei bis drei Kandidaten mit Ihren echten Fragen, die Unterschiede zeigen sich erst an Ihrem Fachvokabular.

Bei Apache-2.0-Modellen (Mistral-Basis, die meisten Qwen2.5-Größen) uneingeschränkt ja. Llama erlaubt kommerzielle Nutzung mit Bedingungen. Research-Lizenzen (z. B. Mistral Large 2) verbieten sie ohne Zusatzvertrag. Wir prüfen und dokumentieren das pro Modell.

Große lokale Modelle (70B) kommen an die Qualität von Cloud-Modellen heran, erreichen sie im Allgemeinen aber nicht ganz. Für die meisten Unternehmensaufgaben, Zusammenfassen, Wissenssuche, Texte nach Vorlage, reicht die Qualität voll aus, mit dem Vorteil kompletter Datenkontrolle.

Jedes Modell hat einen Wissensstichtag und kennt nichts danach. Für tagesaktuelle Fakten ist das ungeeignet; für Ihr Unternehmenswissen spielt das keine Rolle, weil dieses Wissen per RAG aus Ihren aktuellen Dokumenten kommt.

Kostenloser Projekt-Check

Sieben kurze Fragen – und Sie erhalten eine ehrliche Einschätzung, welcher Einstieg zu Ihrem Unternehmen passt. Unverbindlich und kostenlos.