RackDiff
LocalLLaMA: KI-Modelle selbst hosten

LocalLLaMA: KI-Modelle selbst hosten

Hoste Llama 3, Qwen oder Mistral auf deinem eigenen Server. 100% privat, keine Token-Limits, DSGVO-konform.

Lade passende Angebote...

Warum Ollama statt ChatGPT Plus?

ChatGPT Plus kostet 20€ pro Monat. Claude Pro 18€. GitHub Copilot 10€. Zusammen sind das 48€ monatlich für KI-Tools – und deine Daten landen bei US-Konzernen.

Mit Ollama auf einem eigenen VPS bekommst du: Unbegrenzte Nutzung zum Festpreis (ca. 10€ mtl.), volle DSGVO-Konformität bei deutschem Hosting, und die Möglichkeit, sensible Daten zu verarbeiten, ohne sie an OpenAI oder Anthropic zu schicken.

Der Sweet Spot für die meisten Anwendungen: Llama 3.2 8B oder Qwen 2.5 Coder 7B. Diese Modelle sind für 90% der Alltags-Aufgaben ausreichend und laufen flüssig auf einem 16GB VPS.

Hardware-Anforderungen nach Modell

Der RAM-Bedarf hängt direkt von der Modellgröße und Quantisierung ab. Als Faustregel: 1B Parameter ≈ 1 GB RAM (bei Q4-Quantisierung).

Für CPU-Inferenz sind mehr Kerne besser. AVX2-Support ist Pflicht für akzeptable Performance. GPU ist nice-to-have, aber für die meisten Anwendungen nicht nötig.

ModellParameterRAM (Q4)Tokens/Sek (CPU)
Phi-3 / TinyLlama1-3B4-6 GB~50-80
Llama 3.2 / Mistral7-8B8-10 GB~20-40
Qwen 2.5 / CodeLlama13-14B16-18 GB~10-20
Llama 3.1 70B70B (quantisiert)48+ GB~2-5

Welches Modell für welche Aufgabe?

Nicht jede Aufgabe braucht das größte Modell. Die richtige Wahl spart RAM und Geld:

AufgabeEmpfohlenes ModellRAMGeschwindigkeit
Chat & AssistenzLlama 3.2 8B8 GB12-18 tok/s
Code-Hilfe & DebuggingQwen 2.5 Coder 7B8 GB12-18 tok/s
Dokumenten-Analyse (RAG)Llama 3.2 8B + Embedding16 GB12-18 tok/s
ÜbersetzungenLlama 3.2 8B8 GB12-18 tok/s
Komplexes ReasoningQwen 2.5 32B32 GB4-8 tok/s

Unsere Empfehlung

Für den Chat & Assistenz Einsatz mit 7-8B Modellen empfehlen wir IONOS VPS L mit 8 GB RAM für etwa 12€ mtl. oder Contabo Cloud VPS S mit 8 GB für circa 6€ mtl.

Für Coding Assistants oder größere Modelle bietet Contabo Cloud VPS M 16 GB RAM für etwa 10€ mtl. – das beste RAM-pro-Euro-Verhältnis am Markt.

Pro-Tipp: Nutze Continue.dev statt Cline für stabilere Remote-Ollama-Verbindungen. Mehr dazu in unserem Local LLM Coding Guide.

Welches Modell passt zu welchem VPS?

Diese Matrix gilt unabhängig vom konkreten Modell-Release.

Modelle: Phi-3 (3.8B), Llama 3.2 (3B), TinyLlama
Für: Einfacher Chat, Slack-Bots, Zusammenfassungen
50-80Tokens/Sek
Empfohlen
Modelle: Qwen 2.5 Coder (7B), Mistral (7B), Llama 3.2 (8B)
Für: Coding-Assistent, komplexer Chat (Sweet Spot)
20-40Tokens/Sek
Modelle: Qwen 2.5 (14B), CodeLlama (13B), Command R
Für: RAG, Multi-File Coding, komplexe Agenten
10-20Tokens/Sek
Modelle: Llama 3.1 (70B Q2/Q3), Mixtral 8x7B
Für: High-End Reasoning, Forschung
2-5Tokens/Sek

Tokens/Sek bei CPU-Inference (kein GPU). Modellnamen ändern sich, RAM-Anforderungen bleiben stabil.

Häufig gestellte Fragen

Brauche ich eine GPU für Ollama?
Nein, CPU-only reicht für 7-8B Modelle. Du bekommst 12-18 Tokens/Sekunde auf einem 4-vCPU-Server – ausreichend für Chat und Coding. GPU beschleunigt nur, ist aber bei VPS-Anbietern selten verfügbar.
Wie viel RAM braucht Ollama?
Faustregel: Modellgröße in Milliarden ≈ GB RAM bei Q4-Quantisierung. Llama 3.2 8B braucht ~8 GB, ein 13B-Modell ~16 GB. Dazu 1-2 GB für OS und Docker.
Ist Ollama DSGVO-konform?
Ja, wenn du es auf einem deutschen VPS hostest (IONOS, Contabo, Strato). Alle Daten bleiben auf deinem Server – keine Anfragen an externe APIs.
Welcher VPS-Anbieter ist am besten für Ollama?
Für 8 GB RAM: Contabo Cloud VPS S ab ~6€/Monat. Für 16 GB: IONOS VPS L oder Hetzner CX32. Contabo bietet das beste RAM-pro-Euro-Verhältnis.
Ollama oder ChatGPT API – was ist besser?
Ollama für Festkosten und Datenschutz: Ab 6€/Monat, unbegrenzt, DSGVO-konform. ChatGPT API für höchste Qualität (GPT-4o) und variable Nutzung. Bei täglicher Nutzung ist Ollama ab Tag 1 günstiger.

Verwandte Artikel