
Stable Diffusion auf Server hosten 2026 – GPU-Setup
Stable Diffusion auf Server hosten 2026: GPU-Auswahl, CUDA-Setup, ComfyUI, Docker, Kosten und Performance-Tuning – der komplette Praxis-Guide für Admins.
Der Markt hat sich 2026 in drei Klassen sortiert: Consumer-GPUs für Einsteiger und Inferenz kleiner Modelle, Professional-Karten für Mixed Workloads und Datacenter-Beschleuniger für Training und große Modelle. Die wichtigste Kennzahl ist nicht die FP16-Rechenleistung, sondern der VRAM – denn ein Modell, das nicht in den Speicher passt, läuft gar nicht, egal wie schnell die Karte ist.
| GPU | VRAM | Speichertyp | FP16 (dense) | Leistungsaufnahme | Typischer Mietpreis/h |
|---|---|---|---|---|---|
| RTX 4090 | 24 GB | GDDR6X | ~82 TFLOPS | 450 W | 0,30 – 0,55 € |
| RTX 5090 | 32 GB | GDDR7 | ~105 TFLOPS | 575 W | 0,55 – 0,95 € |
| L40S | 48 GB | GDDR6 ECC | ~91 TFLOPS | 350 W | 0,85 – 1,40 € |
| A100 PCIe | 80 GB | HBM2e | ~78 TFLOPS | 300 W | 1,10 – 1,80 € |
| H100 PCIe | 80 GB | HBM3 | ~200 TFLOPS | 350 W | 1,90 – 2,90 € |
| H100 SXM | 80 GB | HBM3 | ~267 TFLOPS | 700 W | 2,20 – 3,50 € |
| H200 SXM | 141 GB | HBM3e | ~267 TFLOPS | 700 W | 3,20 – 4,60 € |
| B200 SXM | 192 GB | HBM3e | ~450 TFLOPS | 1000 W | 5,20 – 7,50 € |
| AMD MI300X | 192 GB | HBM3 | ~327 TFLOPS | 750 W | 2,00 – 3,20 € |
Für Inferenz ist die Speicherbandbreite entscheidend, nicht die Rechenleistung. Die H200 liegt mit 4,8 TB/s rund 40 Prozent über der H100 und liefert deshalb bei Token-Generierung mit großen Batches spürbar mehr Durchsatz. Die MI300X punktet mit 192 GB VRAM zum Preis einer H100 – ein DeepSeek-V3 in FP8 passt auf eine einzige Karte, während du bei NVIDIA zwei H200 brauchst.
Achte bei der Buchung auf die Angabe „SXM" versus „PCIe". SXM-Karten hängen über NVLink mit 900 GB/s zusammen, PCIe-GPUs kommunizieren über den Host-Bus mit 64 GB/s. Bei Tensor-Parallelismus über zwei GPUs ist NVLink zwei- bis dreimal schneller – bei Multi-Node-Inferenz mit vLLM macht das den Unterschied zwischen 40 und 95 Tokens pro Sekunde.
Der GPU-Cloud-Markt ist 2026 in vier Lager geteilt: europäische Hyperscaler-Nischen, US-Spezialisten mit aggressiven Spot-Preisen, Marktplätze mit Peer-to-Peer-Kapazität und klassische Hoster mit dedizierten GPU-Servern. Die Preisunterschiede für identische Hardware betragen bis zu 400 Prozent.
| Anbieter | Standort | H100 SXM/h | A100 80GB/h | RTX 4090/h | Abrechnung |
|---|---|---|---|---|---|
| Hetzner (GEX-Serie) | DE/FI | – | – | ~0,25 € | monatlich, ~184 – 720 € |
| IONOS AI Model Hub | DE | ~2,90 € | ~1,60 € | – | stündlich |
| Scaleway | FR/PL | ~2,60 € | ~1,50 € | ~0,45 € | stündlich |
| OVHcloud | FR/DE | ~2,75 € | ~1,55 € | ~0,50 € | stündlich |
| Nebius | FI/FR | ~2,10 € | ~1,20 € | – | sekundengenau |
| Lambda Labs | US/EU | ~2,45 € | ~1,25 € | – | stündlich |
| RunPod | US/EU | ~2,30 € | ~1,15 € | ~0,32 € | sekundengenau |
| Vast.ai (Spot) | weltweit | ~1,10 € | ~0,60 € | ~0,18 € | sekundengenau |
| CoreWeave | US/EU | ~2,80 € | ~1,70 € | – | stündlich |
Die günstigsten Angebote kommen fast immer von Marktplätzen wie Vast.ai oder TensorDock, wo Privatpersonen und kleine Rechenzentren überschüssige Kapazität verkaufen. Der Preisvorteil von 50 bis 65 Prozent wird mit drei Risiken erkauft: schwankende Verfügbarkeit, keine SLA-Garantien und gelegentlich langsame Anbindung (1 Gbit/s statt 25 Gbit/s). Für Experimente und Batch-Jobs ist das ideal, für Produktions-Inferenz mit 99,9-Prozent-Ziel nicht.
Europäische Anbieter wie Hetzner, IONOS, Scaleway und Nebius liegen preislich 10 bis 25 Prozent über den US-Marktführern, bieten dafür aber Rechenzentren in Frankfurt, Helsinki, Paris oder Warschau, DSGVO-konforme Auftragsverarbeitungsverträge und keinen US-Cloud-Act-Zugriff. Wenn du personenbezogene Daten verarbeitest oder EU-Kunden bedienst, ist das kein Nice-to-have, sondern Ausschlusskriterium.
Dedicated Bare Metal gibt dir die volle Maschine ohne Virtualisierungs-Overhead. Du bekommst Root-Zugriff, kannst eigene Kernel-Module laden und NVLink zwischen allen Karten nutzen. Typische Konfiguration: 8x H100 SXM, 2 TB RAM, 30 TB NVMe, 2x 100 Gbit – für 18.000 bis 26.000 Euro im Monat. Sinnvoll ab dem Punkt, wo du mehr als 5.000 Stunden pro Monat rechnest.
Instanzen (VM) sind der Standard für die meisten Teams. Du mietest 1, 2, 4 oder 8 GPUs, zahlst stunden- oder sekundengenau und kannst in unter 60 Sekunden hoch- und runterskalieren. Nachteil: Der Hypervisor kostet 3 bis 8 Prozent Leistung, und NVLink steht nur innerhalb einer Instanz zur Verfügung.
Spot / Interruptible kostet 55 bis 75 Prozent weniger, kann aber jederzeit mit 30 bis 120 Sekunden Vorlauf beendet werden. Nutze das nur für Checkpoint-basiertes Training, Batch-Inferenz und Rendering. Mit einem sauberen Checkpointing-Loop alle 15 Minuten verlierst du maximal eine Viertelstunde Rechenzeit.
Serverless GPU rechnet pro Sekunde oder pro Token ab und skaliert auf null. Für sporadische Workloads unter 100 Stunden pro Monat ist das oft die günstigste Variante – der Aufpreis pro Rechensekunde liegt bei 40 bis 120 Prozent gegenüber einer Reserved-Instanz. Colocation bedeutet: Du kaufst die Hardware und stellst sie in ein fremdes Rechenzentrum. Ab 24 Monaten Laufzeit und über 70 Prozent Auslastung meist die günstigste Lösung, aber mit hohem Kapitalbindungsrisiko.
Die Faustregel für Inferenz lautet: Modellgröße in Milliarden Parametern mal Bytes pro Parameter, plus 20 bis 30 Prozent für KV-Cache und Overhead. In FP16 sind das 2 Bytes pro Parameter, in 8-Bit-Quantisierung 1 Byte, in 4-Bit rund 0,55 Byte.
| Modell | FP16 | FP8 / INT8 | 4-Bit (Q4_K_M / AWQ) | Empfohlene GPU |
|---|---|---|---|---|
| Llama 3.1 8B | ~17 GB | ~9 GB | ~5,5 GB | RTX 4090 / RTX 5090 |
| Mistral Small 24B | ~50 GB | ~26 GB | ~15 GB | L40S / RTX 5090 |
| Mixtral 8x7B | ~95 GB | ~50 GB | ~28 GB | 2x L40S / 1x A100 80 |
| Llama 3.1 70B | ~145 GB | ~75 GB | ~42 GB | 1x A100 80 / 2x L40S |
| Qwen 2.5 72B | ~148 GB | ~78 GB | ~44 GB | 2x H100 (TP=2) |
| DeepSeek-V3 671B (MoE) | ~1.350 GB | ~700 GB | ~380 GB | 4x H200 / 2x B200 |
| Flux.1 dev (Bild) | ~24 GB | ~13 GB | ~8 GB | RTX 4090 / L40S |
Der KV-Cache wächst mit Kontextlänge und Batchgröße und ist der unterschätzte Speicherfresser. Bei Llama 3.1 70B mit 32k Kontext belegt ein einzelner Request rund 2,5 GB. Bei Batchgröße 16 sind das schon 40 GB zusätzlich – deshalb reicht eine A100 80 GB für 70B in FP8 nur mit begrenzter Parallelität.
Für Feintuning brauchst du deutlich mehr: Full-Finetuning von 70B in FP16 benötigt rund 1,1 TB VRAM (Modell, Gradienten, AdamW-Optimizer-States). Mit LoRA oder QLoRA sinkt das auf 60 bis 90 GB – ein einzelner H100 mit 80 GB reicht dann für 70B-QLoRA aus. Für 7B-Modelle genügt eine RTX 4090 mit 24 GB.
LLM-Inferenz als API: Der häufigste Grund. Ein vLLM-Cluster mit 2x H100 SXM liefert bei Llama 3.1 70B in FP8 rund 1.800 bis 2.400 Tokens pro Sekunde über alle Batches – das entspricht etwa 60 bis 90 gleichzeitigen Chat-Nutzern bei 25 Tokens/s pro Nutzer. Kosten bei 2,60 Euro pro GPU-Stunde: rund 0,0007 Euro pro 1.000 Output-Tokens.
Feintuning und Alignment: QLoRA-Runs auf 7B bis 13B laufen auf einer RTX 4090 in 3 bis 8 Stunden. Ein 70B-LoRA-Training auf 50.000 Samples dauert auf 4x H100 SXM etwa 14 bis 22 Stunden. Bei 2,40 Euro pro GPU-Stunde sind das 134 bis 211 Euro pro Trainingslauf – deutlich billiger als jede eigene Hardware.
Bild- und Videogenerierung: Stable Diffusion XL oder Flux.1 benötigen pro Bild 2 bis 8 Sekunden auf einer RTX 4090 bei 1024x1024 und 30 Steps. Video-Generierung mit Modellen wie Hunyuan oder Wan 2.1 frisst 40 bis 120 GB VRAM und läuft sinnvoll nur auf H100 oder B200.
Rendering und Simulation: Blender Cycles, Octane und Unreal Path Tracing skalieren fast linear mit GPU-Anzahl. 8x L40S rendern eine 4K-Sequenz etwa 6- bis 7-mal schneller als eine einzelne Karte. Cloud-Gaming braucht 1080p bei 60 fps mit unter 25 ms Latenz – dafür reicht eine RTX 5090 mit 32 GB, sofern der Standort weniger als 300 km entfernt ist.
Nach der Buchung bekommst du per SSH Zugriff. Erster Schritt ist immer die Prüfung der Hardware – bei gemieteten Instanzen ist gelegentlich eine Karte defekt oder der Treiber veraltet.
# GPU-Status, Treiberversion, Speicher
nvidia-smi
nvidia-smi --query-gpu=name,memory.total,driver_version --format=csv
# CUDA-Version prüfen
nvcc --version
# NVLink-Topologie bei Multi-GPU
nvidia-smi topo -m
Für Docker-Workloads brauchst du das NVIDIA Container Toolkit. Ohne das läuft kein GPU-Container, und der Fehler „could not select device driver" ist die häufigste Ursache für einen verlorenen Nachmittag.
# NVIDIA Container Toolkit installieren (Ubuntu 24.04)
curl -fsSL https://nvidia.github.io/libnvidia-container/gpgkey \
| sudo gpg --dearmor -o /usr/share/keyrings/nvidia-container-toolkit-keyring.gpg
curl -s -L https://nvidia.github.io/libnvidia-container/stable/deb/nvidia-container-toolkit.list \
| sed 's#deb https://#deb [signed-by=/usr/share/keyrings/nvidia-container-toolkit-keyring.gpg] https://#g' \
| sudo tee /etc/apt/sources.list.d/nvidia-container-toolkit.list
sudo apt-get update && sudo apt-get install -y nvidia-container-toolkit
sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker
# Test
docker run --rm --gpus all nvidia/cuda:12.6.0-base-ubuntu24.04 nvidia-smi
Für schnelle Tests ist Ollama der kürzeste Weg. Für Produktion nimm vLLM, weil es Continuous Batching, PagedAttention und einen OpenAI-kompatiblen Endpunkt mitbringt.
# Ollama
curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3.1:70b-instruct-q4_K_M
ollama run llama3.1:70b-instruct-q4_K_M
# vLLM auf 2x H100 (Tensor Parallelism = 2)
docker run --gpus all --ipc=host -p 8000:8000 \
-v ~/.cache/huggingface:/root/.cache/huggingface \
vllm/vllm-openai:latest \
--model meta-llama/Llama-3.1-70B-Instruct \
--tensor-parallel-size 2 \
--max-model-len 32768 \
--gpu-memory-utilization 0.92 \
--enable-prefix-caching
# Endpunkt testen
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"meta-llama/Llama-3.1-70B-Instruct","messages":[{"role":"user","content":"Hallo"}]}'
Der Parameter --gpu-memory-utilization 0.92 ist der wichtigste Hebel: vLLM nutzt den restlichen Speicher für den KV-Cache. Zu niedrig gesetzt verschenkst du Durchsatz, zu hoch riskierst du OOM-Fehler unter Last. Miss den Durchsatz anschließend mit vllm bench serve oder einem eigenen Lasttest, bevor du in Produktion gehst.
--enable-prefix-caching in vLLM 30 bis 60 Prozent der Prefill-Rechenzeit.Modell-Downloads sind der unterschätzte Zeitfresser. Ein Llama-3.1-70B-Checkpoint in FP16 wiegt 145 GB. Bei 1 Gbit/s dauert der Download 19 Minuten, bei 10 Gbit/s unter zwei Minuten. Achte deshalb auf mindestens 10 Gbit/s Anbindung pro Node und prüfe, ob der Anbieter einen lokalen HuggingFace-Mirror betreibt.
Als Storage empfehlen sich 1 bis 3 TB NVMe pro Node für Modelle und Checkpoints, plus ein Netzwerk-Dateisystem (NFS, CephFS oder S3-kompatibel) für geteilte Datasets. Rechne mit 0,08 bis 0,15 Euro pro GB und Monat für persistenten Block-Storage. Egress-Traffic ist bei den meisten GPU-Anbietern kostenlos bis 1 TB pro Monat, danach 0,005 bis 0,02 Euro pro GB.
Für Multi-Node-Training brauchst du InfiniBand oder RoCEv2 mit 200 bis 400 Gbit/s. Ohne das sinkt die Skalierungseffizienz bei 8 Nodes schnell auf 40 bis 60 Prozent. Frage vor der Buchung explizit nach der Netzwerk-Topologie – „100 Gbit Ethernet" bedeutet in der Praxis oft 25 Gbit pro GPU.
Seit den Schrems-II-Urteilen und der zunehmenden Regulierung von KI-Systemen durch den EU AI Act ist der Standort kein Nebenaspekt mehr. Rechenzentren in Frankfurt, Helsinki, Amsterdam, Paris und Warschau unterliegen der DSGVO, US-Anbieter mit EU-Regionen können trotzdem dem US Cloud Act unterliegen, wenn die Muttergesellschaft in den USA sitzt.
Für personenbezogene Daten brauchst du einen Auftragsverarbeitungsvertrag nach Art. 28 DSGVO, eine dokumentierte Datenflussanalyse und idealerweise ISO-27001- oder SOC-2-Zertifizierung des Rechenzentrums. Prüfe außerdem, ob der Anbieter Löschfristen für Snapshots garantiert – bei stündlicher Abrechnung bleiben Volume-Snapshots oft 30 Tage erhalten, auch nach Kündigung.
Ein praktischer Tipp: Teste die Latenz zu deinen Nutzern vor der Buchung mit mtr oder ping von einem Test-Endpunkt. Frankfurt zu München liegt bei 8 bis 12 ms, Frankfurt zu Warschau bei 22 bis 28 ms. Für Chat-Anwendungen ist alles unter 40 ms unkritisch, für Cloud-Gaming sind 25 ms bereits grenzwertig.
Eine einzelne RTX 4090 liegt bei 180 bis 400 Euro monatlich, eine A100 80 GB bei 800 bis 1.300 Euro, eine H100 SXM bei 1.500 bis 2.500 Euro. Ein dedizierter 8x-H100-Node kostet 18.000 bis 26.000 Euro im Monat. Bei stundengenauer Abrechnung zahlst du nur die tatsächlich genutzten Stunden – 100 Stunden H100 SXM entsprechen etwa 220 bis 350 Euro.
Für Modelle bis 13B in FP16 und bis 32B in 4-Bit-Quantisierung ja. Llama 3.1 8B läuft in Q4 mit rund 5,5 GB VRAM und liefert 60 bis 110 Tokens pro Sekunde. Für 70B-Modelle brauchst du mindestens 48 GB VRAM, also L40S, A100 oder zwei Karten im Verbund.
Die H100 ist rund 2,5-mal schneller in FP16 und 1,6-mal schneller in der Token-Generierung, kostet aber etwa 70 Prozent mehr pro Stunde. Für Inferenz kleiner und mittlerer Modelle ist die A100 preislich im Vorteil. Ab 70B-Parametern, bei langem Kontext oder beim Training kippt das Verhältnis klar zur H100 oder H200.
Mit einem fertigen Docker-Image und vLLM bist du in 10 bis 20 Minuten online, vorausgesetzt die Instanz hat 10 Gbit/s Anbindung. Der Download eines 145-GB-Checkpoints dauert bei 1 Gbit/s allein 19 Minuten. Rechne für den ersten produktiven Endpunkt mit rund einer Stunde inklusive Test und Reverse Proxy.
Nicht zwingend. Für einen einzelnen Inferenz-Endpunkt reicht Docker Compose plus systemd und ein Nginx als Reverse Proxy. Kubernetes lohnt sich ab etwa drei Workloads, mehreren Teams oder wenn du GPU-Autoscaling mit KEDA und dem NVIDIA Device Plugin brauchst. Der Betriebsaufwand steigt dabei um grob 20 bis 30 Prozent.
Bei den meisten Anbietern ja – RunPod, Vast.ai, Nebius und Lambda Labs rechnen sekunden- oder stundengenau ab, ohne Mindestlaufzeit. Achte aber auf Mindestabrechnungszeiträume von 5 bis 60 Minuten und darauf, dass persistenter Storage auch nach dem Stoppen der Instanz weiterberechnet wird.