Text Generation WebUI (oobabooga) einrichten – Setup-Guide 2026

Was ist die Text Generation WebUI von oobabooga?

Die Text Generation WebUI ist ein Open-Source-Frontend, das ursprünglich von oobabooga entwickelt wurde und mittlerweile von einer aktiven Community gepflegt wird. Sie ermöglicht es, verschiedenste Large Language Models (LLMs) wie Llama, Mistral, Qwen oder Phi lokal über eine komfortable Browser-Oberfläche zu betreiben – ohne Cloud-Abhängigkeit und ohne Daten an externe Server zu senden.

Im Kern basiert die Software auf transformers, llama.cpp und ExLlamaV2 als Backends, wodurch sowohl klassische PyTorch-Modelle als auch quantisierte GGUF- und EXL2-Formate unterstützt werden. Die WebUI bietet dabei nicht nur eine simple Chat-Oberfläche, sondern auch Funktionen für Text-Komplettierung, Instruction-Tuning, Roleplay und API-Endpoints.

Besonders interessant für professionelle Anwender: Die Plattform unterstützt LoRA-Adapter, Custom-Prompts und lässt sich durch Extensions nahezu beliebig erweitern. Damit ist sie 2026 die erste Wahl für alle, die maximale Kontrolle über ihre KI-Inferenz behalten möchten.

Im Gegensatz zu cloudbasierten Lösungen wie ChatGPT oder Claude behalten Sie bei der lokalen Nutzung die volle Datenhoheit. Texte, Code und sensible Informationen verlassen niemals Ihren Rechner – ein entscheidender Vorteil für Unternehmen, Entwickler und datenschutzbewusste Anwender.

Systemanforderungen 2026 im Überblick

Bevor Sie mit der Installation beginnen, sollten Sie prüfen, ob Ihr System die Mindestanforderungen erfüllt. Die Text Generation WebUI selbst ist ressourcenschonend, doch die zu ladenden Modelle bestimmen den tatsächlichen Hardware-Bedarf erheblich. Ein 7B-Modell in voller Präzision benötigt etwa 14 GB VRAM, während quantisierte Varianten mit 6 GB auskommen.

Für ein optimales Erlebnis im Jahr 2026 empfehlen wir folgende Konfiguration als Mindeststandard:

Für fortgeschrittene Anwender, die 70B-Modelle oder Mischmodelle wie Mixtral betreiben möchten, ist eine NVIDIA RTX 4090 (24 GB) oder eine RTX 5090 (32 GB) empfehlenswert. Auch Multi-GPU-Setups werden offiziell unterstützt und können die Inferenzgeschwindigkeit deutlich steigern.

Falls Sie keine dedizierte GPU besitzen, können Sie die WebUI auch im CPU-Modus oder mit Apple Metal betreiben. Die Geschwindigkeit ist zwar geringer, aber für gelegentliche Tests und kleinere Modelle (bis 7B) durchaus ausreichend.

Vorbereitung: Hardware und Software-Check

Eine gründliche Vorbereitung spart später viel Zeit bei der Fehlersuche. Beginnen Sie mit einem System-Update, um sicherzustellen, dass alle Treiber aktuell sind. Für NVIDIA-GPUs laden Sie die neuesten Studio- oder Game-Ready-Treiber von der offiziellen Website herunter und installieren Sie das CUDA-Toolkit 12.4 oder höher.

Installieren Sie als Nächstes Python 3.11 – dies ist 2026 die empfohlene Version für maximale Kompatibilität mit den aktuellen Extensions. Achten Sie darauf, Python nicht aus dem Microsoft Store zu beziehen, sondern den offiziellen Installer von python.org zu verwenden. Aktivieren Sie während der Installation die Option "Add Python to PATH".

Prüfen Sie nach der Installation die korrekte Einrichtung, indem Sie in der Kommandozeile folgende Befehle ausführen:

python --version
pip --version
nvidia-smi

Wenn alle drei Befehle korrekte Ausgaben liefern, ist die Basis bereit. Zusätzlich empfehlen wir die Installation von Git, Visual Studio Build Tools (unter Windows) und ffmpeg für multimediale Erweiterungen. Diese Tools werden für verschiedene Extensions benötigt und sollten vorab eingerichtet werden.

Ein weiterer wichtiger Punkt ist die Speicherplatzverwaltung: Legen Sie ein dediziertes Verzeichnis für Modelle an, idealerweise auf einer schnellen NVMe-SSD. Modelle sind zwischen 4 GB und 200 GB groß, und eine durchdachte Ordnerstruktur erleichtert die spätere Verwaltung erheblich.

Installation unter Windows

Die Installation unter Windows 11 ist dank des mitgelieferten One-Click-Installers besonders einsteigerfreundlich. Öffnen Sie zunächst die offizielle GitHub-Seite des Projekts und laden Sie das aktuelle Release als ZIP-Archiv herunter. Alternativ klonen Sie das Repository mit git clone https://github.com/oobabooga/text-generation-webui.git.

Entpacken Sie das Archiv in ein Verzeichnis Ihrer Wahl – wir empfehlen C:\AI\text-generation-webui zu vermeiden, da Leerzeichen im Pfad zu Problemen führen können. Navigieren Sie anschließend in den entpackten Ordner und führen Sie die Datei start_windows.bat aus. Das Skript erkennt automatisch Ihre GPU und installiert die passenden Abhängigkeiten.

Während der Installation werden Sie möglicherweise gefragt, ob Sie die CUDA-Bibliotheken für NVIDIA oder die ROCm-Bibliotheken für AMD herunterladen möchten. Bestätigen Sie die für Ihre Hardware passende Option. Der Vorgang dauert je nach Internetverbindung zwischen 10 und 30 Minuten, da mehrere Gigabyte an Paketen heruntergeladen werden.

Nach Abschluss der Installation startet automatisch ein Browser-Fenster mit der WebUI unter http://127.0.0.1:7860. Falls dies nicht geschieht, können Sie den Server manuell über die Konsole starten. Speichern Sie das Startskript als Desktop-Verknüpfung, um zukünftige Starts zu vereinfachen.

Für erfahrene Nutzer bietet sich die Portable-Installation an, bei der die gesamte Umgebung in einem einzigen Ordner gekapselt wird. Dies erleichtert Backups und die Nutzung auf mehreren Rechnern erheblich.

Installation unter Linux und macOS

Unter Linux ist die Installation etwas technischer, dafür aber oft stabiler. Klonen Sie zunächst das Repository und navigieren Sie in das Verzeichnis. Führen Sie anschließend start_linux.sh aus, das die erforderlichen Pakete über pip und apt installiert. Ubuntu 24.04 LTS wird 2026 offiziell als Referenzdistribution empfohlen.

Für Distributionen wie Fedora, Arch Linux oder openSUSE müssen Sie möglicherweise die Paketmanager-Befehle im Startskript anpassen. Die Community bietet auf der GitHub-Seite aktualisierte Skripte für alle gängigen Distributionen. Achten Sie besonders auf die korrekte Installation von python3-dev, build-essential und den CUDA-Toolkits.

Besitzer eines Apple Silicon Macs (M2, M3, M4) profitieren von der optimierten Metal-Backend-Unterstützung. Führen Sie start_macos.sh aus, und die WebUI konfiguriert sich automatisch für die Nutzung der Unified Memory Architecture. Modelle bis 70B können auf einem Mac Studio mit 128 GB RAM lokal betrieben werden – eine Konfiguration, die 2026 preislich attraktiver ist als vergleichbare NVIDIA-Workstations.

Ein Vorteil der Linux-Installation ist die Möglichkeit, die WebUI als Systemd-Service einzurichten. So startet die Anwendung automatisch beim Bootvorgang und ist über das Netzwerk erreichbar. Dies ist besonders nützlich für Home-Server oder dedizierte KI-Workstations, die als Familien- oder Team-Ressource dienen.

Beachten Sie, dass die macOS-Variante einige Extensions nicht unterstützt, da diese auf Windows- oder Linux-spezifische Bibliotheken angewiesen sind. Die Kernfunktionalität – Modellladung, Inferenz, API – funktioniert jedoch reibungslos und erreicht auf M3-Max-Chips durchaus vergleichbare Token-Raten wie eine RTX 4090.

Erststart und Grundkonfiguration

Beim ersten Start der WebUI sehen Sie die Standard-Oberfläche mit vier Hauptbereichen: Model, Parameters, Text Generation und Training. Im Bereich Model laden Sie Ihre Sprachmodelle, unter Parameters konfigurieren Sie die Inferenz-Einstellungen, und der Text Generation-Tab ist Ihr primärer Arbeitsbereich für Prompts und Generationen.

Öffnen Sie zunächst die Einstellungen über das Zahnrad-Symbol oben rechts. Hier legen Sie das Standard-Modellverzeichnis fest, definieren die maximale Kontextlänge und passen das Theme an. Wir empfehlen die Aktivierung von dark mode für augenschonendes Arbeiten sowie die Einstellung chat style auf ChatML oder Llama3, je nach verwendetem Modell.

Ein besonders wichtiger Parameter ist die Context Length. Während ältere Modelle auf 2048 Tokens beschränkt waren, unterstützen moderne Modelle 2026 Kontextlängen von 32k bis 128k Tokens. Allerdings steigt mit zunehmender Kontextlänge auch der VRAM-Verbrauch exponentiell, weshalb Sie einen Kompromiss zwischen Funktionalität und Performance finden sollten.

Konfigurieren Sie außerdem den Auto-Launch-Parameter, damit die WebUI direkt nach dem Systemstart verfügbar ist. Falls Sie die Anwendung auf einem Server betreiben, aktivieren Sie zusätzlich die Option "Listen on all interfaces", um den Zugriff aus dem lokalen Netzwerk zu ermöglichen. In Produktionsumgebungen sollten Sie zwingend eine Authentifizierung mit Benutzername und Passwort einrichten.

Speichern Sie alle Änderungen über den Save Settings-Button, der die Konfiguration in der Datei settings.yaml persistiert. Diese Datei können Sie bei Bedarf auch manuell bearbeiten – etwa um erweiterte Parameter wie truncation_length oder stream anzupassen, die nicht in der GUI verfügbar sind.

Modelle herunterladen und laden

Das Herzstück der Text Generation WebUI sind die Sprachmodelle, die Sie lokal betreiben. 2026 stehen hunderte vortrainierte Modelle auf Plattformen wie Hugging Face zur Verfügung. Die Auswahl hängt von Ihrem Use-Case, Ihrer Hardware und Ihren Qualitätsansprüchen ab.

Für Einsteiger empfehlen wir folgende Modelle als solide Basis:

ModellGrößeStärkeRAM-Bedarf
Llama 3.1 8B Instruct8B ParameterAllrounder, Code6 GB (Q4)
Mistral 7B Instruct7B ParameterSchnell, kompakt5 GB (Q4)
Qwen 2.5 14B14B ParameterMehrsprachig, Reasoning10 GB (Q4)
Phi-4 14B14B ParameterWissenschaft, Mathe10 GB (Q4)
Mixtral 8x7B47B (12B aktiv)Hohe Qualität24 GB (Q4)

Um ein Modell herunterzuladen, nutzen Sie am einfachsten den integrierten Model-Download-Tab in der WebUI. Tragen Sie den Hugging-Face-Identifier ein (z.

Docker Compose auf dem VPS: Webserver, Datenbank & Reverse Proxy richtig betreiben
DevOps 02. June 2026 10 Min

Docker Compose auf dem VPS: Webserver, Datenbank & Reverse Proxy richtig betreiben

Praxisnaher Guide für Docker Compose auf dem VPS: Webserver, Datenbank, Reverse Proxy, TLS, Backups, Updates und Sicherheit richtig planen und betreiben.