Warum Ollama statt ChatGPT Plus?
ChatGPT Plus kostet 20€ pro Monat. Claude Pro 18€. GitHub Copilot 10€. Zusammen sind das 48€ monatlich für KI-Tools – und deine Daten landen bei US-Konzernen.
Mit Ollama auf einem eigenen VPS bekommst du: Unbegrenzte Nutzung zum Festpreis (ca. 10€ mtl.), volle DSGVO-Konformität bei deutschem Hosting, und die Möglichkeit, sensible Daten zu verarbeiten, ohne sie an OpenAI oder Anthropic zu schicken.
Der Sweet Spot für die meisten Anwendungen: Llama 3.2 8B oder Qwen 2.5 Coder 7B. Diese Modelle sind für 90% der Alltags-Aufgaben ausreichend und laufen flüssig auf einem 16GB VPS.
Hardware-Anforderungen nach Modell
Der RAM-Bedarf hängt direkt von der Modellgröße und Quantisierung ab. Als Faustregel: 1B Parameter ≈ 1 GB RAM (bei Q4-Quantisierung).
Für CPU-Inferenz sind mehr Kerne besser. AVX2-Support ist Pflicht für akzeptable Performance. GPU ist nice-to-have, aber für die meisten Anwendungen nicht nötig.
| Modell | Parameter | RAM (Q4) | Tokens/Sek (CPU) |
|---|---|---|---|
| Phi-3 / TinyLlama | 1-3B | 4-6 GB | ~50-80 |
| Llama 3.2 / Mistral | 7-8B | 8-10 GB | ~20-40 |
| Qwen 2.5 / CodeLlama | 13-14B | 16-18 GB | ~10-20 |
| Llama 3.1 70B | 70B (quantisiert) | 48+ GB | ~2-5 |
Welches Modell für welche Aufgabe?
Nicht jede Aufgabe braucht das größte Modell. Die richtige Wahl spart RAM und Geld:
| Aufgabe | Empfohlenes Modell | RAM | Geschwindigkeit |
|---|---|---|---|
| Chat & Assistenz | Llama 3.2 8B | 8 GB | 12-18 tok/s |
| Code-Hilfe & Debugging | Qwen 2.5 Coder 7B | 8 GB | 12-18 tok/s |
| Dokumenten-Analyse (RAG) | Llama 3.2 8B + Embedding | 16 GB | 12-18 tok/s |
| Übersetzungen | Llama 3.2 8B | 8 GB | 12-18 tok/s |
| Komplexes Reasoning | Qwen 2.5 32B | 32 GB | 4-8 tok/s |
Unsere Empfehlung
Für den Chat & Assistenz Einsatz mit 7-8B Modellen empfehlen wir IONOS VPS L mit 8 GB RAM für etwa 12€ mtl. oder Contabo Cloud VPS S mit 8 GB für circa 6€ mtl.
Für Coding Assistants oder größere Modelle bietet Contabo Cloud VPS M 16 GB RAM für etwa 10€ mtl. – das beste RAM-pro-Euro-Verhältnis am Markt.
Pro-Tipp: Nutze Continue.dev statt Cline für stabilere Remote-Ollama-Verbindungen. Mehr dazu in unserem Local LLM Coding Guide.



