RackDiff
Alle Guides

Welches LLM läuft auf deinem VPS? Der Hardware-Guide 2026

Gemma 4, Qwen 3 & Co. selbst hosten: RAM-Tabellen, Tokens/s auf CPU, 10 gleichzeitige Nutzer mit vLLM – und warum du keinen 15.000-$-Server kaufen musst.

Dirk Hesse
19. Juli 2026
10 Min. Lesezeit

In r/ollama fragte kürzlich jemand: „Ich will Gemma 4 31B für 10 gleichzeitige Nutzer hosten – welchen Server soll ich für unter 15.000 $ bauen?" Die Antworten: gebrauchte RTX 3090s, Workstation-GPUs, Mac Studios, EPYC-Boards. Alles legitim – aber fast alle überspringen die zwei Fragen, die vor der Hardware kommen:

  1. Brauchst du wirklich das größte Modell? Gemma 4 gibt es auch als MoE-Variante, die einen Bruchteil der Rechenleistung braucht.
  2. Brauchst du überhaupt eigene Hardware? Für 15.000 $ mietest du jahrelang einen GPU-Server – ohne Stromkosten, Defektrisiko und Wertverfall.

Dieser Guide beantwortet beides: welches Modell auf welchem Server läuft (vom 9-€-VPS bis zum GPU-Dedicated), was „10 gleichzeitige Nutzer" wirklich bedeutet, und wann sich Kaufen gegen Mieten rechnet.

Welcher Server für dein Modell?

Unser Ollama-Rechner übersetzt Modellgröße, Context und Nutzerzahl in konkrete Server-Specs.

Zum Ollama VPS-Rechner

Die Kurzantwort

Dein SzenarioEmpfehlungKostenrahmen
Reinschnuppern, privat, 1 Nutzer8-GB-VPS + Kompaktmodell (Gemma 4 E4B, Llama 3.2 3B)unter 10 €/Monat
1 Nutzer, Chat & Automatisierung16-GB-VPS + MoE-Modell (Gemma 4 E4B/12B, Qwen 3 8B)ab ~10 €/Monat
Kleines Team, sporadische Nutzung32-GB-VPS oder Dedicated + Gemma 4 26B-A4B~20–50 €/Monat
10 Nutzer gleichzeitig, 30B-KlasseGPU-Server mieten + vLLM statt Ollamaab ~184 €/Monat zzgl. USt
15.000 $ Hardware kaufenNur bei dauerhafter Vollauslastung über 1,5–2 Jahre13.000 €+ einmalig, plus Strom

Die Details – und warum die MoE-Zeile die interessanteste ist – jetzt der Reihe nach.


Was bestimmt, ob ein Modell auf deinem Server läuft?

Drei Faktoren, in dieser Reihenfolge:

1. RAM: Gewichte + Context + System

Die Faustregel für Q4-quantisierte Modelle: ~0,6–0,7 GB RAM pro Milliarde Parameter, plus 2–4 GB für Context (KV-Cache) und System. Ein 8B-Modell braucht also ~6 GB fürs Modell und läuft komfortabel auf einem 8-GB-VPS – knapp. Mit 16 GB hast du Luft für längere Contexts und Docker daneben.

Wichtig: Bei mehreren gleichzeitigen Nutzern wächst der KV-Cache pro aktiver Anfrage. Wer 10 parallele Sessions mit je 8K Context plant, braucht dafür allein mehrere GB zusätzlich.

2. Speicherbandbreite, nicht Kerne

CPU-Inferenz ist fast immer durch die RAM-Bandbreite limitiert, nicht durch Rechenleistung. Deshalb bringt der Sprung von 4 auf 8 vCPUs mehr als von 8 auf 16, und deshalb sind dedizierte Kerne (Hetzner CCX, Netcup RS) spürbar schneller als geteilte. AVX2-Support ist Pflicht – bei allen aktuellen Anbietern Standard.

3. Quantisierung: Q4 ist der Sweet Spot

Q4_K_M halbiert den RAM-Bedarf gegenüber Q8 bei minimalem Qualitätsverlust. Für Self-Hosting auf CPU gibt es kaum einen Grund, etwas anderes zu nehmen. Details zur Quantisierungswahl stehen in unserem Coding-Assistant-Guide.


Der MoE-Wendepunkt: Warum 2026 mehr auf CPU läuft als je zuvor

Der wichtigste Trend seit unserem Ollama-Setup-Guide: Mixture-of-Experts-Modelle (MoE). Ein MoE-Modell hat viele Parameter, aktiviert pro Token aber nur einen kleinen Teil davon.

Das Paradebeispiel ist genau das Modell aus dem Reddit-Thread – bzw. sein kleinerer Bruder:

Gemma 4 ModellArchitekturRAM (Q4)Geschwindigkeit entspricht
E2BDense~4 GB2B-Modell
E4BDense~6 GB4B-Modell
12BDense~8 GB12B-Modell
26B-A4BMoE, 4B aktiv~16–18 GB~4B-Modell
31BDense~20 GB RAM / ~24 GB VRAM31B-Modell

Gemma 4 26B-A4B hat 26 Milliarden Parameter, rechnet pro Token aber nur mit 4 Milliarden. Ergebnis: Es braucht den RAM eines 26B-Modells, läuft aber fast so schnell wie ein 4B-Modell. Auf einem 32-GB-VPS mit 8 dedizierten vCPUs sind damit zweistellige Tokens/s auf reiner CPU realistisch – ein Leistungsniveau, für das du bei einem dichten 26B-Modell eine GPU bräuchtest.

Dasselbe Prinzip nutzen Qwen 3 30B-A3B (3B aktiv) und gpt-oss-20b (~3,6B aktiv, läuft ab 16 GB). Wer 2026 ein LLM auf CPU-Hardware hostet, sollte zuerst bei den MoE-Modellen suchen.

Das dichte Gemma 4 31B aus dem Reddit-Thread ist stärker – aber der Abstand zum 26B-A4B ist kleiner als der Preisunterschied der Hardware, die beide brauchen. Genau das ist die Frage, die im Thread niemand gestellt hat.


Modell-Matrix: Was läuft auf welchem Server?

ServerRAMModelle (Q4)Erwartung auf CPU
VPS ab ~9 €8 GBLlama 3.2 3B, Gemma 4 E2B/E4B, Mistral 7B5–15 t/s, 1 Nutzer
VPS ab ~12 €16 GBLlama 3.1 8B, Gemma 4 12B, gpt-oss-20b, Qwen 3 14B8–20 t/s, 1–3 Nutzer
VPS/Dedicated ab ~25 €32 GBGemma 4 26B-A4B, Qwen 3 30B-A3B, Mistral Small 24BMoE: 10–25 t/s · Dense 24B: 2–5 t/s
Dedicated ab ~60 €64 GB+Llama 3.3 70B (Q4), Gemma 4 31B1–4 t/s – nur für Batch geduldiger
GPU-Server (z. B. ab ~184 €/Monat zzgl. USt)20–96 GB VRAMGemma 4 31B, 70B-Klasse, alles darunter30–80+ t/s, mehrere Nutzer

Die t/s-Angaben sind Erfahrungswerte für moderne dedizierte Kerne; geteilte vCPUs und langsamer RAM liegen darunter. Zum Vergleich: Flüssiges Lesen entspricht etwa 5–7 t/s – alles darüber fühlt sich „sofort" an.

AnbieterProduktvCPURAMStoragePreis/Mo
IONOS Logo
VPS S+22 GB90 GBNVMe SSD4.00Angebot
Netcup Logo
VPS 500 G1224 GB128 GBSSD5.91Angebot
Hetzner Logo
AX41664 GB37952 GBNVMe SSD70.20Angebot
Contabo Logo
AMD Ryzen 12 Cores1264 GB1000 GBNVMe SSD159.58Angebot

„10 gleichzeitige Nutzer" – der Teil, den fast alle unterschätzen

Ein Modell, das für einen Nutzer flott läuft, kann bei zehn parallelen Anfragen unbenutzbar werden. Der Grund ist weniger die Hardware als die Serving-Software:

Ollama arbeitet Anfragen im Kern sequenziell ab (FIFO-Queue). Zehn gleichzeitige Anfragen heißt: Nutzer 10 wartet, bis 1–9 fertig sind. In Benchmarks bleibt der Gesamtdurchsatz bei ~10 parallelen Anfragen fast auf Einzelnutzer-Niveau (~150 t/s aggregiert auf einer Datacenter-GPU), und die Zeit bis zum ersten Token steigt auf mehrere Sekunden.

vLLM nutzt Continuous Batching: Neue Anfragen werden laufend in den aktuellen Batch eingewoben. Gleiche Hardware, gleiche Modellklasse: ~485 t/s aggregiert bei 10 parallelen Anfragen – rund das Dreifache, bei Time-to-First-Token im Millisekundenbereich.

Die Praxisregel:

  • Bis ~5 gleichzeitige Nutzer: Ollama reicht, die Einfachheit gewinnt.
  • Ab ~5 gleichzeitigen Nutzern: vLLM (oder llama.cpp-Server mit parallelem Decoding) – sonst verschenkst du Hardware.
  • 10 Nutzer auf reiner CPU: nur mit kleinen MoE-Modellen und moderaten Erwartungen realistisch. Der aggregierte Durchsatz eines CPU-VPS verteilt sich auf alle aktiven Anfragen – bei 15 t/s gesamt und 3 gleichzeitig aktiven Chats bekommt jeder ~5 t/s. Für echte 10 parallele Chats in der 30B-Klasse führt kein Weg an einer GPU vorbei.

Wichtig fürs RAM-Budget: Jede aktive Session hält ihren eigenen KV-Cache. 10 Sessions × 8K Context können je nach Modell 5–15 GB zusätzlich belegen. Das ist der Grund, warum „läuft bei mir" auf dem Laptop und „läuft für mein Team" zwei verschiedene Server sind.


Die 15.000-Dollar-Frage: Kaufen oder mieten?

Zurück zum Reddit-Thread. 15.000 $ sind rund 13.000 €. Was bekommt man dafür im Vergleich zur Miete?

Mieten (Beispiel Hetzner, Preise zzgl. USt):

ServerGPUVRAMMonatspreis (netto)
GEX44RTX 4000 SFF Ada20 GB~184 €
GEX130RTX 6000 Ada48 GB~838 €
GEX131RTX PRO 6000 Blackwell96 GB~889 €

Für Gemma 4 31B (Q4, ~24 GB VRAM inkl. Context) plus Batching-Headroom für 10 Nutzer ist die 48-GB-Klasse die richtige. Die nüchterne Rechnung:

  • 13.000 € Kaufbudget ÷ 838 €/Monat ≈ 15 Monate Mietäquivalent.
  • Beim Selbstbetrieb kommen in Deutschland Stromkosten dazu: ein Dual-GPU-Server unter Last zieht schnell 500+ W – bei 24/7-Betrieb und ~0,35 €/kWh über 100 €/Monat. Der reale Break-even rückt damit Richtung 2 Jahre und mehr.
  • Dazu Defektrisiko ohne SLA, Wertverfall (die 15.000-$-Konfiguration von heute ist die Gebrauchtware von 2028) und die Erfahrung, dass der VRAM-Bedarf mit jeder Modellgeneration wächst.

Kaufen lohnt sich, wenn die Hardware dauerhaft ausgelastet ist, Strom günstig ist (oder schon bezahlt wird) und Datenhoheit bis aufs Blech gefordert ist. Für alle anderen ist Mieten die flexiblere Rechnung – kündbar, wenn das nächste MoE-Modell die GPU-Anforderung halbiert.

Und die ehrlichste Antwort auf den Thread: Wer statt des dichten 31B das 26B-A4B nimmt, braucht weder 15.000 $ noch einen GPU-Server – ein Dedicated Server mit viel RAM und vLLM auf CPU trägt kleine Teams, und ein einzelner 20-GB-GPU-Server (ab ~184 €/Monat zzgl. USt) macht daraus ein flottes Multi-User-Setup.


Empfehlungen nach Szenario

Privat reinschnuppern: eigener Chatbot unter 10 €/Monat. Ein 8-GB-VPS mit Ollama und Gemma 4 E4B oder Llama 3.2 3B reicht für persönliche Chats, Textzusammenfassungen und erste n8n-Experimente – und läuft nebenbei auf demselben Server wie Vaultwarden oder ein VPN. Ehrliche Grenze: kompaktere Antworten, kurze Contexts, ein Nutzer. Zum Ausprobieren, ob Self-Hosting zu dir passt, ist das der günstigste Einstieg.

Solo: Chat, n8n-Workflows, Coding-Assistent. 16-GB-VPS mit dedizierten Kernen, Ollama, Gemma 4 12B oder gpt-oss-20b. Setup in 30 Minuten mit unserem Ollama-Guide. Ab ~10–15 €/Monat.

Kleines Team (3–10 Nutzer, nicht alle gleichzeitig). 32-GB-Server (VPS mit dedizierten Kernen oder günstiger Dedicated), vLLM oder llama.cpp-Server, Gemma 4 26B-A4B oder Qwen 3 30B-A3B. Realistisch: kurze Wartezeiten zu Stoßzeiten, dafür ~30–60 €/Monat statt GPU-Preisen.

10+ echte parallele Nutzer, produktiv. GPU-Server mieten, vLLM, Modell nach VRAM: 20 GB reichen für die 12B/26B-A4B-Klasse mit Batching, 48 GB für 31B dense mit Headroom. Erst wenn diese Miete über 1,5–2 Jahre sicher ausgelastet ist, über Kauf nachdenken.

Datenschutz als Hauptmotiv. Jede der drei Stufen hält Prompts und Daten auf deinem Server – relevant für alles DSGVO-Kritische. Details im Guide VPS in Deutschland & DSGVO.


Fazit

Die Reddit-Frage „Welchen 15.000-$-Server soll ich bauen?" hat eine bessere Antwort als jede Hardware-Liste: Erst das Modell wählen (MoE prüfen!), dann die Nutzerlast ehrlich schätzen, dann mieten statt kaufen – bis die Auslastung das Gegenteil beweist. Für die meisten Setups zwischen Hobby und kleinem Team liegt die Antwort nicht bei 15.000 $, sondern zwischen 10 und 60 € im Monat.

Häufig gestellte Fragen

Läuft Gemma 4 31B auf einem CPU-VPS?
Technisch ja – mit 32+ GB RAM startet es in Q4. Praktisch liefert ein dichtes 31B-Modell auf CPU nur 1–4 Tokens/s. Für interaktive Nutzung nimm die MoE-Variante Gemma 4 26B-A4B (fast gleiche Qualität, Vielfaches der Geschwindigkeit) oder eine GPU.
Wie viele gleichzeitige Nutzer schafft ein CPU-VPS?
Mit einem MoE-Modell und vLLM/llama.cpp-Server: 3–5 gelegentliche Nutzer auf 32 GB RAM realistisch. Der Gesamtdurchsatz teilt sich auf aktive Anfragen auf – für 10 echte parallele Chats brauchst du eine GPU.
Ollama oder vLLM?
Bis etwa 5 gleichzeitige Nutzer: Ollama, wegen der Einfachheit. Darüber: vLLM – Continuous Batching liefert bei 10 parallelen Anfragen ein Mehrfaches des Durchsatzes bei drastisch kürzerer Wartezeit aufs erste Token.
Was kostet ein gemieteter GPU-Server für LLMs?
Dedizierte GPU-Server mit 20 GB VRAM starten bei rund 184 €/Monat zzgl. USt (z. B. Hetzner GEX44), 48-GB-Karten liegen bei ~840 €/Monat zzgl. USt. Zum Vergleich: 15.000 $ Kaufbudget entsprechen etwa 15 Monaten Miete der 48-GB-Klasse – ohne Stromkosten gerechnet.
Ist ein selbst gehostetes LLM DSGVO-konform?
Self-Hosting ist die beste Ausgangslage: Prompts und Daten verlassen deinen Server nicht, es gibt keinen US-Cloud-Anbieter als Auftragsverarbeiter. Die DSGVO-Pflichten für deine Anwendung selbst (Rechtsgrundlage, Löschkonzept) bleiben davon unberührt.

Server für dein LLM finden

Vergleiche VPS und Dedicated Server nach RAM, dedizierten Kernen und Preis – sortiert nach Preis, nie nach Provision.

Server mit 16+ GB RAM vergleichen

Passender VPS-Rechner

LocalLLaMA: KI-Modelle selbst hosten

Agentic Coding & Local LLMs auf eigener Hardware – inspiriert von r/LocalLLaMA.

Zum VPS-Rechner

Verwandte Artikel