Zum Inhalt springen
Corporate LLM Agentur – Der Prozessmeister
Kaufberatung

Lokale LLM Hardware: Was Sie 2026 wirklich brauchen

Die passende Hardware für lokale LLMs bestimmt eine einzige Kennzahl: der Grafikspeicher (VRAM) beziehungsweise der gemeinsame Speicher bei Apple Silicon. Er entscheidet, welche Modellgröße Sie betreiben können. Alles Weitere, Preise, Optionen, Fallstricke, ordnet diese Kaufberatung ein, inklusive konkreter Komplett-Builds und laufender Kosten. Alle Preisangaben stammen aus aktuellen Marktdaten, Stand August 2026.

Fakten geprüft, Stand: August 2026

Die VRAM-Regel: eine Faustformel für alle Modelle

Als Faustregel gilt: Bei Q4-Quantisierung brauchen Sie rund 0,5 GB VRAM pro Milliarde Parameter, plus 10 bis 20 Prozent Reserve für Kontext und Zwischenspeicher. Damit lassen sich alle Anforderungen in Sekunden überschlagen: 8B etwa 5 bis 6 GB, 32B etwa 18 bis 22 GB, 70B etwa 40 bis 48 GB.

ModellklasseVRAM-Bedarf (Q4)Praxis-Einordnung
8Bca. 5 bis 8 GBLäuft komfortabel auf 8 bis 12-GB-Karten und jedem aktuellen Mac
13B bis 14Bca. 8 bis 10 GB12 GB VRAM sind die entspannte Unterkante
27B bis 32Bca. 15 bis 22 GBPasst auf eine RTX 4090 / 5090 (24/32 GB). Die Grenze für Consumer-Karten
70Bca. 40 bis 48 GBErfordert Profi-Hardware mit 48 GB oder mehr
1T+ (MoE, z. B. DeepSeek V4, Kimi K2.6)Server, Multi-GPUNur für dedizierte KI-Server oder Miete

Drei Komplett-Builds für den Einstieg

Die häufigste Frage ist nicht welche GPU, sondern was das Ganze kostet. Drei bewährte Szenarien als Richtwerte (Deutschland, Stand August 2026, Preise schwanken mit der Marktlage):

  • Zum Vergleich die Einzelpreise: Eine RTX 4090 (24 GB) kostet neu grob 2.100 bis 3.400 US-Dollar, die RTX 5090 (32 GB) etwa 2.950 bis 4.500 US-Dollar. Wer nur einzelne Modelle testen will, beginnt oft günstiger: Null Euro, wenn die vorhandenen Rechner 16 GB RAM haben, kleine Modelle laufen darauf bereits.
SzenarioZiel-ModelleAufbauPreisrahmen
Büro-Einstieg8B bis 14B (Qwen3 14B, Qwen2.5-Coder 7B)Mac Studio M4 (Basis) oder PC mit 12-GB-Grafikkarte, 32 GB RAMca. 1.500 bis 2.500 €
Prosumer / Team27B bis 32B (Qwen 3.6-27B, 3.6-35B-A3B)Mac Studio M4 Max (64 GB) oder PC mit RTX 5090 (32 GB), 64 GB RAMca. 3.500 bis 5.500 €
Enterprise70B und mehr, mehrere NutzerServer mit L40S (48 GB) oder H100 (80 GB), oder MieteKauf ab ca. 15.000 €, Miete ab 0,79 Dollar pro GPU-Stunde

Tempo: Tokens pro Sekunde in der Praxis

Qualität ist die eine Kennzahl, Tempo die andere. Gemessene Richtwerte (Q4, Stand August 2026): Llama 3.3 70B schafft auf einer RTX 5090 rund 14 Tokens pro Sekunde, ein Mac Studio M4 Ultra liegt ähnlich, Dual-RTX-4090-Setups erreichen rund 22. Kleinere Modelle sind deutlich schneller: Auf derselben Hardware liefert ein 7- bis 14B-Modell ein Vielfaches dieser Werte und fühlt sich im Betrieb entsprechend direkter an. Wer viele Nutzer gleichzeitig bedient, braucht entweder ein großes System oder Server-Hardware. Tokens pro Sekunde sind dann eine Team-Kennzahl, keine Einzelplatz-Frage.

Option 1: Mac Studio: Der stille Alleskönner

Der Mac Studio mit M4 Max ist die unkomplizierteste Einstiegsoption: leise, kompakt, ohne Treiber-Aufwand. Apple listet das Modell ab 2.499 US-Dollar; in Deutschland liegen die Preise je nach Konfiguration bei etwa 2.900 bis 5.000 Euro. Der gemeinsame Speicher (Unified Memory) reicht von 36 GB in der Basis bis 64 GB beim M4 Max, die Ultra-Variante bietet laut Apple bis zu 96 GB.

Damit eignet sich der Mac Studio hervorragend für Modelle bis etwa 32B und bedingt für 70B. Ideal für: kleine Teams, Büros ohne Serverraum, Dienstleister mit dokumentenlastigen Aufgaben.

Option 2: PC-Workstation mit NVIDIA RTX: Maximale Flexibilität

Eine Workstation mit RTX 4090 (24 GB VRAM) kostet neu grob 2.100 bis 3.400 US-Dollar, die neuere RTX 5090 (32 GB VRAM) etwa 2.950 bis 4.500 US-Dollar, die Straßenpreise schwanken mit der Verfügbarkeit. Damit betreiben Sie Modelle bis 32B flüssig.

Wichtige Grenze: 70B-Modelle in Q4 passen nicht sauber auf eine einzelne 24- oder 32-GB-Karte. Dafür braucht es Multi-GPU-Setups oder Server-Hardware. Ideal für: technikaffine Unternehmen, die aufrüsten und selbst warten wollen.

Option 3: Dedizierter KI-Server: Für 70B und Mehrbenutzerbetrieb

Für große Modelle und viele gleichzeitige Nutzer ist die Serverklasse die richtige Wahl: Eine NVIDIA L40S bietet 48 GB VRAM, eine H100 80 GB. Beim Kauf reden wir über deutlich fünfstellige Beträge. Deshalb ist Miete oft wirtschaftlicher: L40S-Instanzen liegen bei etwa 0,79 bis 2,24 US-Dollar pro GPU-Stunde, H100-Instanzen bei rund 2,70 bis 3,20 US-Dollar (Marktmedian, einzelne Anbieter abweichend). Die neuen offenen Spitzenmodelle (DeepSeek V4, Kimi K2.6) sind mit einer Billion Parametern ausschließlich in dieser Klasse betreibbar.

Achtung bei der Miete: Für DSGVO-sensible Daten kommen nur Anbieter mit Servern in der EU und Auftragsverarbeitungsvertrag infrage, oder eben der eigene Server im Haus. Ideal für: Unternehmen mit vielen Nutzern, hohen Qualitätsanforderungen oder 70B-Pflicht.

Nebenkosten nicht vergessen: Strom, Kühlung, Wartung

Der Anschaffungspreis ist nur die halbe Rechnung. Eine Workstation mit High-End-GPU zieht unter Last 400 bis 600 Watt, bei Dauerbetrieb spürbar in der Stromrechnung: Bei 30 Cent pro Kilowattstunde sind das rund 1.100 bis 1.600 Euro pro Jahr. Ein Mac Studio bleibt typischerweise unter 150 Watt (rund 400 Euro pro Jahr), ein Server liegt deutlich darüber und braucht zudem Kühlung, Platz und Wartung. In die Betriebskosten gehören außerdem Modell-Updates, Backups und Monitoring. Wer das nicht leisten will, fährt mit einem betreuten System langfristig günstiger.

RAM, CPU und SSD: die unterschätzten Bauteile

Der VRAM entscheidet, welches Modell läuft, aber drei weitere Bauteile bestimmen, wie gut es läuft:

  • Arbeitsspeicher (RAM): 32 GB sind die Untergrenze, 64 GB die sichere Wahl. Der RAM puffert Kontext, RAG-Dokumente und mehrere geladene Modelle.
  • CPU: Für RAG-Systeme (Nachschlagen in eigenen Dokumenten) ist die CPU überraschend wichtig: Sie übernimmt Embedding, Suche und Aufbereitung. Aktuelle 8- bis 16-Kerner genügen.
  • SSD (NVMe): Modelle laden von der Platte in den Speicher. Eine schnelle NVMe-SSD spart beim Modellwechsel Minuten und ist für RAG-Indexe Pflicht.
  • Wer nur das Modell kauft, aber diese drei Bauteile vernachlässigt, bekommt einen Flaschenhals, das klassische Fehlkauf-Muster bei LLM-Hardware.

Unsere Empfehlung nach Unternehmensgröße

  • 1 bis 5 Mitarbeitende: Mac Studio M4 Max oder RTX-4090-Build. Modelle bis 32B, Kosten im vierstelligen Bereich.
  • 5 bis 20 Mitarbeitende: Mac Studio M4 Ultra (96 GB) oder Dual-GPU-Build. 70B-Modelle möglich, Mehrbenutzerbetrieb eingeschränkt.
  • Ab 20 Mitarbeitende oder DSGVO-sensible Prozesse: Dedizierter Server oder gemietete GPU-Kapazität in der EU. Planbarer Betrieb, zentrale Verwaltung.

Checkliste vor dem Kauf

  • VRAM-Bedarf für die Zielmodellklasse berechnet? (0,5 GB pro Milliarde Parameter in Q4)
  • Kommerzielle Lizenz der Zielmodelle geprüft?
  • 32 GB RAM (besser 64 GB) und NVMe-SSD eingeplant?
  • Stromkosten und Kühlung im Budget?
  • Miete gegen Kauf gerechnet, inklusive EU-Server und AVV bei sensiblen Daten?
  • Wartung eingeplant oder betreutes System vorgesehen?

Häufige Fragen

Nein. Ein 70B-Modell in Q4-Quantisierung benötigt rund 40 bis 48 GB Grafikspeicher. Die RTX 4090 hat 24 GB, die RTX 5090 hat 32 GB. Für 70B brauchen Sie eine Karte mit 48 GB oder mehr (z. B. L40S) oder einen Mac mit entsprechend viel Unified Memory.

Beides funktioniert. Der Mac Studio ist leiser, einfacher und stromsparender; die PC-Workstation bietet mehr Aufrüstoptionen und bessere Software-Kompatibilität für Spezialfälle. Für die meisten Büros ist der Mac der pragmatischste Einstieg.

Null Euro, wenn Ihre Rechner 16 GB RAM haben. Kleine Modelle laufen darauf bereits. Ein dedizierter Mac Studio beginnt bei rund 2.900 Euro in Deutschland. Die teuerste Option ist selten die richtige: Entscheidend ist die Modellklasse, die Sie tatsächlich brauchen.

Bei Workstations ja, mit Einschränkungen: Gebrauchte RTX-4090-Karten sind deutlich günstiger, aber ohne Garantie und mit unbekannter Laufhistorie. Für den Produktivbetrieb empfehlen wir neue oder gewartete Hardware mit Gewährleistung.

Ein Mac Studio bleibt typischerweise unter 150 Watt, eine RTX-Workstation zieht unter Last 400 bis 600 Watt, ein Server deutlich mehr. Bei einem Strompreis von 30 Cent pro Kilowattstunde macht das im Dauerbetrieb einen spürbaren, aber planbaren Posten.

Kostenloser Projekt-Check

Sieben kurze Fragen – und Sie erhalten eine ehrliche Einschätzung, welcher Einstieg zu Ihrem Unternehmen passt. Unverbindlich und kostenlos.