In r/ollama fragte kürzlich jemand: „Ich will Gemma 4 31B für 10 gleichzeitige Nutzer hosten – welchen Server soll ich für unter 15.000 $ bauen?" Die Antworten: gebrauchte RTX 3090s, Workstation-GPUs, Mac Studios, EPYC-Boards. Alles legitim – aber fast alle überspringen die zwei Fragen, die vor der Hardware kommen:
- Brauchst du wirklich das größte Modell? Gemma 4 gibt es auch als MoE-Variante, die einen Bruchteil der Rechenleistung braucht.
- Brauchst du überhaupt eigene Hardware? Für 15.000 $ mietest du jahrelang einen GPU-Server – ohne Stromkosten, Defektrisiko und Wertverfall.
Dieser Guide beantwortet beides: welches Modell auf welchem Server läuft (vom 9-€-VPS bis zum GPU-Dedicated), was „10 gleichzeitige Nutzer" wirklich bedeutet, und wann sich Kaufen gegen Mieten rechnet.
Welcher Server für dein Modell?
Unser Ollama-Rechner übersetzt Modellgröße, Context und Nutzerzahl in konkrete Server-Specs.
Zum Ollama VPS-RechnerDie Kurzantwort
| Dein Szenario | Empfehlung | Kostenrahmen |
|---|---|---|
| Reinschnuppern, privat, 1 Nutzer | 8-GB-VPS + Kompaktmodell (Gemma 4 E4B, Llama 3.2 3B) | unter 10 €/Monat |
| 1 Nutzer, Chat & Automatisierung | 16-GB-VPS + MoE-Modell (Gemma 4 E4B/12B, Qwen 3 8B) | ab ~10 €/Monat |
| Kleines Team, sporadische Nutzung | 32-GB-VPS oder Dedicated + Gemma 4 26B-A4B | ~20–50 €/Monat |
| 10 Nutzer gleichzeitig, 30B-Klasse | GPU-Server mieten + vLLM statt Ollama | ab ~184 €/Monat zzgl. USt |
| 15.000 $ Hardware kaufen | Nur bei dauerhafter Vollauslastung über 1,5–2 Jahre | 13.000 €+ einmalig, plus Strom |
Die Details – und warum die MoE-Zeile die interessanteste ist – jetzt der Reihe nach.
Was bestimmt, ob ein Modell auf deinem Server läuft?
Drei Faktoren, in dieser Reihenfolge:
1. RAM: Gewichte + Context + System
Die Faustregel für Q4-quantisierte Modelle: ~0,6–0,7 GB RAM pro Milliarde Parameter, plus 2–4 GB für Context (KV-Cache) und System. Ein 8B-Modell braucht also ~6 GB fürs Modell und läuft komfortabel auf einem 8-GB-VPS – knapp. Mit 16 GB hast du Luft für längere Contexts und Docker daneben.
Wichtig: Bei mehreren gleichzeitigen Nutzern wächst der KV-Cache pro aktiver Anfrage. Wer 10 parallele Sessions mit je 8K Context plant, braucht dafür allein mehrere GB zusätzlich.
2. Speicherbandbreite, nicht Kerne
CPU-Inferenz ist fast immer durch die RAM-Bandbreite limitiert, nicht durch Rechenleistung. Deshalb bringt der Sprung von 4 auf 8 vCPUs mehr als von 8 auf 16, und deshalb sind dedizierte Kerne (Hetzner CCX, Netcup RS) spürbar schneller als geteilte. AVX2-Support ist Pflicht – bei allen aktuellen Anbietern Standard.
3. Quantisierung: Q4 ist der Sweet Spot
Q4_K_M halbiert den RAM-Bedarf gegenüber Q8 bei minimalem Qualitätsverlust. Für Self-Hosting auf CPU gibt es kaum einen Grund, etwas anderes zu nehmen. Details zur Quantisierungswahl stehen in unserem Coding-Assistant-Guide.
Der MoE-Wendepunkt: Warum 2026 mehr auf CPU läuft als je zuvor
Der wichtigste Trend seit unserem Ollama-Setup-Guide: Mixture-of-Experts-Modelle (MoE). Ein MoE-Modell hat viele Parameter, aktiviert pro Token aber nur einen kleinen Teil davon.
Das Paradebeispiel ist genau das Modell aus dem Reddit-Thread – bzw. sein kleinerer Bruder:
| Gemma 4 Modell | Architektur | RAM (Q4) | Geschwindigkeit entspricht |
|---|---|---|---|
| E2B | Dense | ~4 GB | 2B-Modell |
| E4B | Dense | ~6 GB | 4B-Modell |
| 12B | Dense | ~8 GB | 12B-Modell |
| 26B-A4B | MoE, 4B aktiv | ~16–18 GB | ~4B-Modell |
| 31B | Dense | ~20 GB RAM / ~24 GB VRAM | 31B-Modell |
Gemma 4 26B-A4B hat 26 Milliarden Parameter, rechnet pro Token aber nur mit 4 Milliarden. Ergebnis: Es braucht den RAM eines 26B-Modells, läuft aber fast so schnell wie ein 4B-Modell. Auf einem 32-GB-VPS mit 8 dedizierten vCPUs sind damit zweistellige Tokens/s auf reiner CPU realistisch – ein Leistungsniveau, für das du bei einem dichten 26B-Modell eine GPU bräuchtest.
Dasselbe Prinzip nutzen Qwen 3 30B-A3B (3B aktiv) und gpt-oss-20b (~3,6B aktiv, läuft ab 16 GB). Wer 2026 ein LLM auf CPU-Hardware hostet, sollte zuerst bei den MoE-Modellen suchen.
Das dichte Gemma 4 31B aus dem Reddit-Thread ist stärker – aber der Abstand zum 26B-A4B ist kleiner als der Preisunterschied der Hardware, die beide brauchen. Genau das ist die Frage, die im Thread niemand gestellt hat.
Modell-Matrix: Was läuft auf welchem Server?
| Server | RAM | Modelle (Q4) | Erwartung auf CPU |
|---|---|---|---|
| VPS ab ~9 € | 8 GB | Llama 3.2 3B, Gemma 4 E2B/E4B, Mistral 7B | 5–15 t/s, 1 Nutzer |
| VPS ab ~12 € | 16 GB | Llama 3.1 8B, Gemma 4 12B, gpt-oss-20b, Qwen 3 14B | 8–20 t/s, 1–3 Nutzer |
| VPS/Dedicated ab ~25 € | 32 GB | Gemma 4 26B-A4B, Qwen 3 30B-A3B, Mistral Small 24B | MoE: 10–25 t/s · Dense 24B: 2–5 t/s |
| Dedicated ab ~60 € | 64 GB+ | Llama 3.3 70B (Q4), Gemma 4 31B | 1–4 t/s – nur für Batch geduldiger |
| GPU-Server (z. B. ab ~184 €/Monat zzgl. USt) | 20–96 GB VRAM | Gemma 4 31B, 70B-Klasse, alles darunter | 30–80+ t/s, mehrere Nutzer |
Die t/s-Angaben sind Erfahrungswerte für moderne dedizierte Kerne; geteilte vCPUs und langsamer RAM liegen darunter. Zum Vergleich: Flüssiges Lesen entspricht etwa 5–7 t/s – alles darüber fühlt sich „sofort" an.
| Anbieter | Produkt | vCPU | RAM | Storage | Preis/Mo | |
|---|---|---|---|---|---|---|
| VPS S+ | 2 | 2 GB | 90 GBNVMe SSD | 4.00 | Angebot | |
| VPS 500 G12 | 2 | 4 GB | 128 GBSSD | 5.91 | Angebot | |
| AX41 | 6 | 64 GB | 37952 GBNVMe SSD | 70.20 | Angebot | |
| AMD Ryzen 12 Cores | 12 | 64 GB | 1000 GBNVMe SSD | 159.58 | Angebot |
„10 gleichzeitige Nutzer" – der Teil, den fast alle unterschätzen
Ein Modell, das für einen Nutzer flott läuft, kann bei zehn parallelen Anfragen unbenutzbar werden. Der Grund ist weniger die Hardware als die Serving-Software:
Ollama arbeitet Anfragen im Kern sequenziell ab (FIFO-Queue). Zehn gleichzeitige Anfragen heißt: Nutzer 10 wartet, bis 1–9 fertig sind. In Benchmarks bleibt der Gesamtdurchsatz bei ~10 parallelen Anfragen fast auf Einzelnutzer-Niveau (~150 t/s aggregiert auf einer Datacenter-GPU), und die Zeit bis zum ersten Token steigt auf mehrere Sekunden.
vLLM nutzt Continuous Batching: Neue Anfragen werden laufend in den aktuellen Batch eingewoben. Gleiche Hardware, gleiche Modellklasse: ~485 t/s aggregiert bei 10 parallelen Anfragen – rund das Dreifache, bei Time-to-First-Token im Millisekundenbereich.
Die Praxisregel:
- Bis ~5 gleichzeitige Nutzer: Ollama reicht, die Einfachheit gewinnt.
- Ab ~5 gleichzeitigen Nutzern: vLLM (oder llama.cpp-Server mit parallelem Decoding) – sonst verschenkst du Hardware.
- 10 Nutzer auf reiner CPU: nur mit kleinen MoE-Modellen und moderaten Erwartungen realistisch. Der aggregierte Durchsatz eines CPU-VPS verteilt sich auf alle aktiven Anfragen – bei 15 t/s gesamt und 3 gleichzeitig aktiven Chats bekommt jeder ~5 t/s. Für echte 10 parallele Chats in der 30B-Klasse führt kein Weg an einer GPU vorbei.
Wichtig fürs RAM-Budget: Jede aktive Session hält ihren eigenen KV-Cache. 10 Sessions × 8K Context können je nach Modell 5–15 GB zusätzlich belegen. Das ist der Grund, warum „läuft bei mir" auf dem Laptop und „läuft für mein Team" zwei verschiedene Server sind.
Die 15.000-Dollar-Frage: Kaufen oder mieten?
Zurück zum Reddit-Thread. 15.000 $ sind rund 13.000 €. Was bekommt man dafür im Vergleich zur Miete?
Mieten (Beispiel Hetzner, Preise zzgl. USt):
| Server | GPU | VRAM | Monatspreis (netto) |
|---|---|---|---|
| GEX44 | RTX 4000 SFF Ada | 20 GB | ~184 € |
| GEX130 | RTX 6000 Ada | 48 GB | ~838 € |
| GEX131 | RTX PRO 6000 Blackwell | 96 GB | ~889 € |
Für Gemma 4 31B (Q4, ~24 GB VRAM inkl. Context) plus Batching-Headroom für 10 Nutzer ist die 48-GB-Klasse die richtige. Die nüchterne Rechnung:
- 13.000 € Kaufbudget ÷ 838 €/Monat ≈ 15 Monate Mietäquivalent.
- Beim Selbstbetrieb kommen in Deutschland Stromkosten dazu: ein Dual-GPU-Server unter Last zieht schnell 500+ W – bei 24/7-Betrieb und ~0,35 €/kWh über 100 €/Monat. Der reale Break-even rückt damit Richtung 2 Jahre und mehr.
- Dazu Defektrisiko ohne SLA, Wertverfall (die 15.000-$-Konfiguration von heute ist die Gebrauchtware von 2028) und die Erfahrung, dass der VRAM-Bedarf mit jeder Modellgeneration wächst.
Kaufen lohnt sich, wenn die Hardware dauerhaft ausgelastet ist, Strom günstig ist (oder schon bezahlt wird) und Datenhoheit bis aufs Blech gefordert ist. Für alle anderen ist Mieten die flexiblere Rechnung – kündbar, wenn das nächste MoE-Modell die GPU-Anforderung halbiert.
Und die ehrlichste Antwort auf den Thread: Wer statt des dichten 31B das 26B-A4B nimmt, braucht weder 15.000 $ noch einen GPU-Server – ein Dedicated Server mit viel RAM und vLLM auf CPU trägt kleine Teams, und ein einzelner 20-GB-GPU-Server (ab ~184 €/Monat zzgl. USt) macht daraus ein flottes Multi-User-Setup.
Empfehlungen nach Szenario
Privat reinschnuppern: eigener Chatbot unter 10 €/Monat. Ein 8-GB-VPS mit Ollama und Gemma 4 E4B oder Llama 3.2 3B reicht für persönliche Chats, Textzusammenfassungen und erste n8n-Experimente – und läuft nebenbei auf demselben Server wie Vaultwarden oder ein VPN. Ehrliche Grenze: kompaktere Antworten, kurze Contexts, ein Nutzer. Zum Ausprobieren, ob Self-Hosting zu dir passt, ist das der günstigste Einstieg.
Solo: Chat, n8n-Workflows, Coding-Assistent. 16-GB-VPS mit dedizierten Kernen, Ollama, Gemma 4 12B oder gpt-oss-20b. Setup in 30 Minuten mit unserem Ollama-Guide. Ab ~10–15 €/Monat.
Kleines Team (3–10 Nutzer, nicht alle gleichzeitig). 32-GB-Server (VPS mit dedizierten Kernen oder günstiger Dedicated), vLLM oder llama.cpp-Server, Gemma 4 26B-A4B oder Qwen 3 30B-A3B. Realistisch: kurze Wartezeiten zu Stoßzeiten, dafür ~30–60 €/Monat statt GPU-Preisen.
10+ echte parallele Nutzer, produktiv. GPU-Server mieten, vLLM, Modell nach VRAM: 20 GB reichen für die 12B/26B-A4B-Klasse mit Batching, 48 GB für 31B dense mit Headroom. Erst wenn diese Miete über 1,5–2 Jahre sicher ausgelastet ist, über Kauf nachdenken.
Datenschutz als Hauptmotiv. Jede der drei Stufen hält Prompts und Daten auf deinem Server – relevant für alles DSGVO-Kritische. Details im Guide VPS in Deutschland & DSGVO.
Fazit
Die Reddit-Frage „Welchen 15.000-$-Server soll ich bauen?" hat eine bessere Antwort als jede Hardware-Liste: Erst das Modell wählen (MoE prüfen!), dann die Nutzerlast ehrlich schätzen, dann mieten statt kaufen – bis die Auslastung das Gegenteil beweist. Für die meisten Setups zwischen Hobby und kleinem Team liegt die Antwort nicht bei 15.000 $, sondern zwischen 10 und 60 € im Monat.
Häufig gestellte Fragen
Läuft Gemma 4 31B auf einem CPU-VPS?
Wie viele gleichzeitige Nutzer schafft ein CPU-VPS?
Ollama oder vLLM?
Was kostet ein gemieteter GPU-Server für LLMs?
Ist ein selbst gehostetes LLM DSGVO-konform?
Weitere LLM- und Self-Hosting-Guides
Server für dein LLM finden
Vergleiche VPS und Dedicated Server nach RAM, dedizierten Kernen und Preis – sortiert nach Preis, nie nach Provision.
Server mit 16+ GB RAM vergleichen


