Moderne Sprachmodelle entstehen nicht in einem einzigen Trainingslauf, sondern in drei Phasen: Pretraining, Post-Training und Reasoning-Training. Wer diese Reihenfolge versteht, kann Meldungen über neue Modelle einordnen und weiß, wo sich Investitionen für das eigene Unternehmen lohnen. Die kurze Antwort vorweg: Das Vorwissen steckt im Pretraining, die Brauchbarkeit entsteht im Post-Training, und die Fähigkeit, schwierige Aufgaben zu lösen, kommt aus dem Reasoning-Training. Kein Unternehmen muss das selbst nachbauen, aber jede Führungskraft sollte wissen, was die Begriffe bedeuten.
Phase 1: Pretraining, die Grundlage
Im Pretraining lernt das Modell, das nächste Wort vorherzusagen. Es liest Texte, Code, mathematische Formeln und zunehmend Bilder und Tabellen. Früher wurden Modelle auf ein bis fünf Billionen Token trainiert, heute sind 30 bis 50 Billionen üblich. Ein Token entspricht grob einem halben bis zwei Wörtern.
Zwei Dinge haben sich in den letzten Jahren verschoben. Erstens zählt Datenqualität mehr als schiere Menge: Duplikate werden entfernt, minderwertige Quellen gefiltert, synthetische Daten kommen gezielt dazu. Zweitens ist das Pretraining heute kein reines Rechenproblem mehr, sondern vor allem ein Infrastrukturproblem. Ein Modell auf 100.000 Grafikkarten zu trainieren und am Laufen zu halten, wenn einzelne Karten ausfallen, ist die eigentliche Ingenieursleistung. Der Referenzpunkt für die Optimierung von Modellgröße, Datenmenge und Rechenbudget ist weiterhin die Chinchilla-Studie von Hoffmann et al. aus 2022.
Was die Kosten angeht, gilt eine ehrliche Einordnung: Gesamtkosten sind öffentlich nicht verifiziert. DeepSeek hat für V3 etwa 2,8 Millionen GPU-Stunden auf Nvidia-H800-Hardware angegeben, das ist eine veröffentlichte Rechenangabe, keine vollständige Unternehmensrechnung. Schätzungen von Epoch AI helfen für Größenordnungen, nicht für exakte Zahlen. Die meisten seriösen Beobachter gehen davon aus, dass ein Frontier-Modell inklusive Fehlversuchen, Personal und Strom mehrere hundert Millionen kostet.
Phase 2: Post-Training, aus dem Rohmodell wird ein Produkt
Ein Modell nach dem Pretraining kann schon erstaunlich viel, aber es ist ungeschliffen. Im Post-Training wird es brauchbar:
- Supervised Fine-Tuning: Das Modell lernt an kuratierten Anweisungs-Antwort-Paaren, Anweisungen zuverlässig zu befolgen.
- Preference Optimization: Menschen oder KI-Systeme bewerten Antworten, das Modell lernt den gewünschten Stil. Die klassische Pipeline stammt von Ouyang et al. 2022 (InstructGPT), die einfachere Variante DPO von Rafailov et al. 2023.
- Sicherheits- und Domänentraining: Richtlinien, Ablehnungsverhalten, Tool-Aufrufe, Fachwissen.
Für Unternehmen ist das der wichtigste Teil der Antwort: Ein kleineres Modell mit guten Fachdaten und sauberem Post-Training schlägt in einem abgegrenzten Anwendungsfall oft ein größeres Basismodell. Deshalb lohnt es sich für den Mittelstand, auf Open-Weight-Modellen aufzusetzen statt selbst vortrainieren zu wollen. Wie das praktisch geht, erklärt unser Leitfaden LLM mit eigenen Unternehmensdaten trainieren.
Phase 3: Reasoning-Training, Belohnung für richtige Antworten
Reasoning-Modelle lösen Aufgaben in mehreren Schritten. Sie schreiben Zwischenschritte auf, bevor sie antworten. Trainiert wird das mit Reinforcement Learning, bei dem nur das Endergebnis belohnt wird: Eine Matheaufgabe ist gelöst oder nicht, ein Programm besteht die Tests oder nicht. Ob der Lösungsweg elegant war, ist für das Training zunächst egal.
Dieses Verfahren, Reinforcement Learning with Verifiable Rewards, wurde durch DeepSeek-R1 (Guo et al., 2025) prominent. Zwei Erkenntnisse daraus sind für die Praxis relevant:
Erstens braucht es eine Mindestgröße. In kleinen Experimenten funktioniert das Verfahren oft nicht, erst große Basismodelle bringen den Sprung. Zweitens brauchen kleinere Modelle mehr Tokens für dieselbe Aufgabe. Sie denken länger, weil sie mehr Zwischenschritte aufschreiben müssen. Größere Modelle lösen Aufgaben mit weniger Tokens. Wer Token-Kosten kalkuliert, muss das einrechnen: Ein billigeres Modell kann am Ende teurer sein, wenn es doppelt so viele Tokens erzeugt.
Für Unternehmen heißt das: Reasoning lohnt sich für Aufgaben mit klarem Erfolgskriterium, etwa Kalkulationen, Code, strukturierte Auswertungen. Bei offenen Fragen mit subjektivem "gut" bringt es wenig.
Open Weights: Was frei verfügbar wirklich bedeutet
Open Weight heißt: Die trainierten Gewichte sind verfügbar, Sie können das Modell auf eigener Hardware betreiben. Es heißt nicht zwingend Open Source. Trainingsdaten, vollständiger Trainingscode und Abhängigkeiten werden oft nicht veröffentlicht. Die wichtigsten Familien für den Unternehmenseinsatz:
| Modellfamilie | Typische Stärken | Eignung für Unternehmen |
|---|---|---|
| Meta Llama | Breites Ökosystem, viele Größen | Einfacher Einstieg, viel Hosting-Auswahl |
| DeepSeek | Reasoning, Mathematik, Code | Anspruchsvolle Inferenz, eigene Reasoning-Workflows |
| Qwen | Mehrsprachigkeit, viele Varianten | Internationale Anwendungen, verschiedene Hardwarebudgets |
| Mistral | Effiziente Modelle, europäischer Anbieter | Europäische Souveränität, lokale Bereitstellung |
Die Wirtschaftlichkeit ist kein Automatismus. Lokaler Betrieb bedeutet GPU-Investition, Strom, Kühlung, Monitoring und Modellpflege. Eine Faustregel: Kleine quantisierte Modelle laufen auf Workstations, große Mixture-of-Experts-Modelle brauchen erhebliche Ressourcen, auch wenn pro Token nur ein Teil der Parameter aktiv ist. Unsere Übersicht Lokale LLM-Modelle im Überblick hilft bei der Auswahl.
Zwei Themen, die Sie 2026 kennen sollten
Computer Use
Modelle bedienen zunehmend grafische Oberflächen: Maus, Tastatur, Formulare, Webanwendungen. Für Unternehmen mit Altsystemen ohne API ist das ein Weg, Automatisierung zu erreichen, die bisher nicht möglich war. Die Zuverlässigkeit ist aber eine andere als bei Text: Fehler kumulieren, ein falscher Klick blockiert den Prozess. Produktive Einsätze brauchen Sandboxes, Berechtigungsgrenzen, Protokollierung und Bestätigungsschritte. Benchmarks wie OSWorld (Xie et al., 2024) messen das, ersetzen aber keinen Test in Ihrer eigenen Software.
Kontextfenster von einer Million Token
Ein Fenster von einer Million Token bedeutet nur, dass das Modell so viel Eingabe annimmt. Es bedeutet nicht, dass es jede Information darin gleich gut nutzt. Lange Kontexte kosten Geld und Latenz, und die praktisch brauchbare Länge liegt oft unter der beworbenen Maximalgröße. Für sehr lange Dokumente bleiben Chunking, hierarchische Zusammenfassungen und RAG die wirtschaftlich sinnvollen Verfahren. Mehr dazu in RAG einfach erklärt.
Zeitplan: So bauen Sie Grundlagenwissen auf
| Zeitraum | Schritt | Ergebnis |
|---|---|---|
| Woche 1-2 | Transformer-Grundlagen verstehen: Tokens, Aufmerksamkeit, Schichten | Sie können Meldungen über neue Architekturen einordnen |
| Woche 3-4 | Ein Open-Weight-Modell lokal testen, etwa mit LM Studio | Gefühl für Qualität, Geschwindigkeit und Hardwarebedarf |
| Monat 2 | Ein Pilotprojekt mit eigenem Fachwissen definieren | Ein abgegrenzter Anwendungsfall mit messbarem Nutzen |
| Monat 3 | RAG oder Fine-Tuning für den Piloten umsetzen | Erste produktive Antworten aus Ihren Daten |
| Monat 4 | Messen und entscheiden: lokal, API oder Mischbetrieb | Eine begründete Betriebsentscheidung statt Bauchgefühl |
Checkliste für Entscheider
Fazit
Die Technik hinter Sprachmodellen ist verständlicher, als die Flut an Modellmeldungen vermuten lässt. Pretraining liefert das Fundament, Post-Training die Brauchbarkeit, Reasoning die Tiefe bei klar prüfbaren Aufgaben. Für den Mittelstand ist die strategisch klügste Position: Grundlagen verstehen, Open-Weight-Modelle testen, eigene Daten als eigentlichen Hebel begreifen. Wer das tut, kauft keine Hypes, sondern baut einen Wettbewerbsvorteil.
Wie Sie solche Systeme sicher im eigenen Unternehmen betreiben, zeigt unser Leitfaden LLM für Unternehmen.
Quellen
- Hoffmann et al. (2022): "Training Compute-Optimal Large Language Models", Chinchilla.
- Ouyang et al. (2022): "Training Language Models to Follow Instructions with Human Feedback", InstructGPT.
- Rafailov et al. (2023): "Direct Preference Optimization: Your Language Model is Secretly a Reward Model".
- Guo et al. (2025): "DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning".
- Meta AI (2024): "The Llama 3 Herd of Models".
- DeepSeek-AI (2024): "DeepSeek-V3 Technical Report".
- Sevilla et al., Epoch AI (2024): "The Training Costs of Large Language Models".
- Xie et al. (2024): "OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments".
Weiterführend: Open-Source-KI für Unternehmen und Lokale LLMs vs. Cloud-KI.
Stand: September 2026


