LLM lokal installieren: Die Anleitung in 6 Schritten
Ein LLM lokal zu installieren dauert auf einem einzelnen Rechner weniger als eine Stunde: Werkzeug wählen, Modell laden, starten. Der Unterschied zwischen einem privaten Test und einem belastbaren Unternehmensbetrieb liegt in Absicherung, Dokumentation und Mehrbenutzerfähigkeit. Diese Anleitung führt durch beide Wege, Schritt für Schritt und ohne Fachjargon.
Fakten geprüft, Stand: August 2026
Voraussetzungen: Was Sie vor der Installation brauchen
Für den Einstieg genügt ein handelsüblicher Rechner. Entscheidend ist der Arbeitsspeicher beziehungsweise der Grafikspeicher (VRAM): Ein 8-Milliarden-Parameter-Modell in Q4-Quantisierung benötigt rund 5 bis 8 GB Speicher. Das schafft ein aktueller Laptop mit 16 GB RAM ebenso wie ein Mac mit Apple Silicon.
Für den Unternehmenseinsatz mit mehreren Nutzern und größeren Modellen gilt: Planen Sie Hardware nach der größten Modellklasse, die Sie betreiben wollen, nicht nach dem kleinsten Testfall. Details und Preise liefert unsere Hardware-Übersicht (unten verlinkt).
- Betriebssystem: Windows 11, macOS oder Linux. Ollama und LM Studio laufen plattformübergreifend.
- Speicher: 16 GB RAM für den Einstieg, 32 GB oder mehr für den produktiven Einsatz.
- Datenträger: NVMe-SSD; rechnen Sie mit 50 bis 100 GB freiem Platz, wenn Sie mehrere Modelle testen wollen.
- Internet: nur für den einmaligen Download der Werkzeuge und Modelle. Danach läuft alles offline.
Die 6 Schritte der Installation
Der Ablauf ist für beide gängigen Werkzeuge gleich: LM Studio (grafische Oberfläche, ideal für Einsteiger) und Ollama (Kommandozeile, ideal für Server und Automatisierung). Beide sind kostenlos.
- Schritt 1: Werkzeug wählen. LM Studio für den grafischen Einstieg am Einzelplatz, Ollama für Server, Skripte und API-Anbindungen.
- Schritt 2: Installieren. Installationspaket von der Herstellerseite laden und ausführen. Dauer: wenige Minuten.
- Schritt 3: Modell auswählen. Für den Start ein 7 bis 8B-Modell wie Llama 3.1 8B oder Mistral 7B. Beide beherrschen Deutsch gut und laufen auf Standard-Hardware.
- Schritt 4: Modell laden. Der Download erfolgt direkt aus dem Werkzeug, bei Q4-Quantisierung typischerweise 4 bis 6 GB.
- Schritt 5: Testen. Erste Anfragen stellen, Antwortqualität und Geschwindigkeit in Tokens pro Sekunde prüfen.
- Schritt 6: Absichern. Telemetrie und automatische Updates prüfen, Zugriffe regeln, Installation für den Datenschutzbeauftragten dokumentieren. In Unternehmen ist dieser Schritt Pflicht, kein Extra.
RAM-Bedarf je Modellgröße: die Richtwerte
Die Faustregel für Q4-Quantisierung: rund 0,5 GB Grafikspeicher pro Milliarde Parameter, plus 10 bis 20 Prozent Reserve für Kontext und Zwischenspeicher. Daraus ergeben sich diese Richtwerte:
| Modellgröße | RAM-Bedarf | VRAM-Bedarf (Q4) | Einordnung |
|---|---|---|---|
| 3B | 8 bis 12 GB | 4 bis 6 GB | Einstieg, läuft auf fast jedem Rechner |
| 7 bis 8B | 16 GB | 6 bis 10 GB | Der häufigste Kompromiss aus Qualität und Tempo |
| 13 bis 14B | 24 bis 32 GB | 10 bis 16 GB | Spürbar bessere Textqualität |
| 32B | 48 GB und mehr | 18 bis 24 GB | Workstation-Klasse |
| 70B | 64 GB und mehr | 40 bis 48 GB | Nur mit Profi-Hardware sinnvoll |
Q4-Quantisierung: Was das ist und warum sie zählt
Quantisierung komprimiert die Modellgewichte, bei Q4 auf rund 4 Bit pro Parameter. Der Speicherbedarf sinkt auf etwa ein Drittel der Vollversion, der Qualitätsverlust bleibt bei guten Formaten gering. Für lokale Installationen ist Q4 (als GGUF-Datei) deshalb der Standardkompromiss: Ohne sie passen die meisten Modelle schlicht nicht auf Consumer-Hardware.
Wer ausreichend Speicher hat, kann auf Q5 bis Q8 erhöhen und gewinnt etwas Qualität zurück. Für den Einstieg ist Q4 fast immer richtig.
Offline-Betrieb und Telemetrie: die Datenfrage
Nach dem Download laufen Ollama und LM Studio vollständig offline, auch in abgeschotteten Netzwerken. Damit die Daten wirklich das Haus nicht verlassen, sind zwei Punkte zu prüfen: Telemetrie-Funktionen der Werkzeuge abschalten und Modelle nur aus vertrauenswürdigen Quellen beziehen. Diese Prüfung und ihre Dokumentation ist Teil unserer Unternehmensinstallation.
Eigene KI für zu Hause: Warum Unternehmen mehr brauchen
Für den Privatgebrauch ist die Installation mit LM Studio in 20 Minuten erledigt: Modell laden, chatten, fertig. Genau diese Einfachheit führt in Firmen jedoch zum bekannten Problem des Tool-Wildwuchses: Jeder Mitarbeiter installiert seine eigene, undokumentierte KI.
Ein Unternehmensbetrieb unterscheidet sich an vier Stellen: zentrale Bereitstellung statt Einzelplätze, dokumentierte Datenflüsse (DSGVO, Art. 30 Verarbeitungsverzeichnis), einheitliche Modell- und Qualitätsstandards sowie ein Betreiberkonzept für Updates und Ausfälle.
Abkürzung: der Festpreis-Pilot
Wenn Sie das Ergebnis brauchen, nicht das Bastelprojekt: Wir installieren und dokumentieren ein produktionsreifes lokales LLM in Ihrer Infrastruktur, als Festpreis-Pilot ab 3.500 €, inklusive DSGVO-Unterlagen und Übergabe an Ihre IT. Der kostenlose Projekt-Check klärt vorab, welche Modell- und Hardware-Klasse zu Ihrem Fall passt.
Häufige Fragen
Die Werkzeuge (LM Studio, Ollama) und gängige Modelle sind kostenlos. Kosten entstehen über Hardware und, im Unternehmensbetrieb, über saubere Absicherung, Dokumentation und Betrieb. Unser Festpreis-Pilot für eine vollständige, dokumentierte Unternehmensinstallation startet ab 3.500 €.
Für den Start ein 7 bis 8B-Modell wie Llama 3.1 8B oder Mistral 7B: gute Deutsch-Qualität, läuft auf normaler Hardware, schnelle Antworten. Größere Modelle (70B) bringen mehr Qualität, brauchen aber 40 bis 48 GB Grafikspeicher.
Nein. Internet ist nur für den Download der Werkzeuge und Modelle nötig. Danach laufen Modell und Daten vollständig auf Ihrem Gerät, auch im abgeschotteten Netzwerk.
Für den grafischen Einstieg am Einzelplatz LM Studio, für Server, Skripte und API-Anbindungen Ollama. Beide sind kostenlos und laufen mit denselben Modellen. Sie verlieren mit keiner Wahl etwas, die Unterschiede liegen in Bedienung und Automatisierung.
Bei einer echten lokalen Installation ja, vorausgesetzt, Telemetrie und Cloud-Sync der verwendeten Werkzeuge sind deaktiviert und die Modelle stammen aus vertrauenswürdigen Quellen. Genau diese Prüfung und Dokumentation ist Teil unserer Unternehmensinstallation.
Weiterlesen
Kostenloser Projekt-Check
Sieben kurze Fragen – und Sie erhalten eine ehrliche Einschätzung, welcher Einstieg zu Ihrem Unternehmen passt. Unverbindlich und kostenlos.
