Zum Inhalt springen
Corporate LLM Agentur – Der Prozessmeister
Wissen & Daten

Lokale LLM trainieren: RAG oder Fine-Tuning?

Ein lokales LLM mit eigenen Daten zu nutzen heißt fast nie, das Modell neu zu trainieren. In rund neun von zehn Unternehmensfällen ist RAG, das Nachschlagen in Ihren Dokumenten zur Antwortzeit, der richtige, günstigere und sicherere Weg. Echtes Training (Fine-Tuning) ist die Ausnahme für Spezialfälle. Diese Seite erklärt beide Wege, inklusive VRAM-Bedarf und Zeitaufwand für echtes Training.

Fakten geprüft, Stand: August 2026

RAG statt Training: die wichtigste Entscheidung zuerst

Ein Sprachmodell lernt Ihre Daten nicht automatisch. Es gibt zwei grundsätzliche Wege, Unternehmenswissen verfügbar zu machen: RAG (Retrieval-Augmented Generation) sucht passende Textstellen aus Ihren Dokumenten und legt sie der Anfrage bei, das Modell bleibt unverändert. Fine-Tuning verändert dagegen die Modellgewichte durch echtes Nachtrainieren.

RAG ist aktualisierbar (neues Dokument rein, fertig), nachprüfbar (jede Antwort nennt ihre Quelle) und günstig. Fine-Tuning ist teuer, braucht kuratierte Trainingsdaten und muss bei jeder Datenänderung wiederholt werden.

KriteriumRAG (Nachschlagen)Fine-Tuning (Nachtrainieren)
Typischer AnlassWissen aus Dokumenten beantwortenTon, Format oder Fachsprache ändern
AktualitätSofort nach Dokument-UploadErst nach neuem Trainingslauf
KostenrahmenNiedrig, StandardsoftwareHoch, Datenkuration + GPU-Stunden
NachprüfbarkeitQuellenangabe je AntwortKeine Quellen möglich
DSGVO-AufwandÜberschaubar, dokumentierbarHoch, Löschkonzept nötig

RAG in der Praxis: so kommen Ihre Dokumente ins System

Tiefer in die Technik steigt unser Ratgeber zur RAG-Wissensdatenbank ein (unten verlinkt). Wichtig ist hier: RAG ist kein Forschungsprojekt, sondern bewährte Standardtechnik. Der Aufwand liegt in der Datenaufbereitung, nicht in der KI.

  • Dokumente sammeln und aufräumen: Angebote, Handbücher, Richtlinien, Wissensdatenbanken, veraltete Versionen aussortieren.
  • In Abschnitte zerlegen (Chunking) und als Suchvektoren ablegen, dafür genügt Standardsoftware, lokal betrieben.
  • Anfrage eingeht: Das System findet die passenden Abschnitte und das Modell formuliert die Antwort mit Quellenangabe.
  • Qualität sichern: Testfragen definieren, Antworten gegenprüfen, Freigabe-Regeln festlegen.

Wann echtes Training (Fine-Tuning) sinnvoll ist

Fine-Tuning lohnt sich, wenn es um Verhalten statt Wissen geht: ein festes Antwortformat, Ihre Tonalität, eine sehr spezielle Fachsprache oder eine Aufgabe, die das Basismodell zuverlässig falsch macht. Typisch sind einige hundert bis wenige tausend sorgfältig aufbereitete Beispiele, keine Big Data.

Was Fine-Tuning nicht kann: aktuelles Wissen zuverlässig speichern. Wer dem Modell Ihre Preisliste 2026 beibringen will, ist mit RAG besser und sicherer bedient.

Fine-Tuning lokal: LoRA und QLoRA mit konkreten Werten

Die Standardverfahren heißen LoRA und QLoRA: Statt aller Gewichte werden nur kleine Zusatzmatrizen trainiert, das spart bis zu 90 Prozent Speicher. QLoRA quantisiert zusätzlich das Basismodell und ist damit der praktikabelste Weg auf Consumer-Hardware. Werkzeuge wie Unsloth oder Axolotl optimieren den Ablauf, ändern aber nichts an den VRAM-Untergrenzen.

ModellgrößeQLoRA (4 Bit)LoRAPraxis-Fazit
7 bis 8Bca. 5 bis 10 GBca. 15 bis 20 GBMit 12 bis 16 GB VRAM gut machbar (QLoRA)
13Bca. 9 bis 16 GBca. 28 bis 40 GBMit 24 GB VRAM gut machbar (QLoRA)
70Bca. 40 bis 52 GBca. 140 bis 159 GBErfordert A100/H100-Klasse oder Multi-GPU

Datensätze, Dauer und Kosten

Für einen engen Use-Case genügen oft 1.000 bis 5.000 kuratierte Beispiele, Qualität schlägt Menge. Die Dauer liegt bei einem 7B-Modell mit QLoRA typischerweise im Bereich weniger Stunden auf einer RTX-4090-Klasse, bei 70B bei ein bis zwei Tagen auf starker Hardware. Cloud-GPU-Miete (A100-Klasse) kostet grob 1 bis 2 US-Dollar pro Stunde, ein 7B-Fine-Tune ist damit oft für einen niedrigen zweistelligen Euro-Betrag erledigt.

Was Fine-Tuning in jedem Fall erfordert: konsistente Instruktionsformate, saubere Outputs und einen klaren Testplan. Ohne diese Disziplin trainiert man Müll schneller, nicht besser.

Datenschutz: Ihre Daten bleiben Ihre Daten

Der große Vorteil des lokalen Betriebs: Trainings- und Suchdaten verlassen Ihre Infrastruktur nicht. Trotzdem bleiben Pflichten bestehen: Personenbezogene Daten in Dokumenten fallen unter die DSGVO, das Verarbeitungsverzeichnis (Art. 30) muss das System abbilden, und Betroffenenrechte wie Löschung müssen technisch umsetzbar sein. Bei RAG ist das einfach (Dokument löschen genügt), bei Fine-Tuning aufwendig (das Modell ist neu zu trainieren).

Wir dokumentieren diese Punkte in jedem Projekt revisionssicher, inklusive Verzeichniseintrag und Löschkonzept.

Häufige Fragen

Wenn Sie Antworten aus Ihren Dokumenten wollen: RAG. Wenn Sie das Antwortverhalten (Ton, Format, Fachsprache) ändern wollen: Fine-Tuning. In der Praxis starten Unternehmen mit RAG und ergänzen Fine-Tuning nur bei belegtem Bedarf.

Für RAG genügt Ihre vorhandene Dokumentation, auch einige hundert Seiten reichen für spürbaren Nutzen. Für Fine-Tuning braucht es kuratierte Beispieldatensätze ab etwa 1.000 Beispiele; die Qualität zählt, nicht die Menge.

Ja, bei lokalem Training auf eigener Hardware. Vorsicht bei Cloud-Trainingsdiensten: Dort verlassen Ihre Daten das Haus, dann sind Auftragsverarbeitung und EU-Server-Standorte zu prüfen. Wir trainieren grundsätzlich lokal oder in deutschen Rechenzentren.

Ein RAG-System ist Teil unseres Festpreis-Piloten ab 3.500 €. Fine-Tuning-Projekte kalkulieren wir individuell nach Datenlage, die Potenzialanalyse im Vorfeld ist kostenlos.

Kostenloser Projekt-Check

Sieben kurze Fragen – und Sie erhalten eine ehrliche Einschätzung, welcher Einstieg zu Ihrem Unternehmen passt. Unverbindlich und kostenlos.