Wie Sie ein Sprachmodell auf eigener Hardware betreiben, sodass vertrauliche Unterlagen das Haus nicht verlassen: Grafikkarte in einer virtuellen Maschine unter Proxmox VE, darauf Ollama und eine Oberfläche für das Team. Mit Hardware-Beispielen, passenden Modellen und den Stellen, an denen es in der Praxis hakt. Für Betriebe mit etwas eigener IT-Erfahrung oder einem IT-Dienstleister.
Die Spanne reicht vom umgebauten Spielerechner bis zum Rechenzentrumsserver. Zum Vergleich steht bei jedem Rechner der Grafikspeicher — er bestimmt, welche Modelle passen — und die Speicherbandbreite, die vor allem bestimmt, wie schnell eine Antwort entsteht. Die Preise sind Richtwerte inklusive Mehrwertsteuer — und sie steigen gerade: Wegen der Speicherknappheit kosten Arbeitsspeicher und Grafikkarten im Herbst 2026 ein Vielfaches früherer Preise.
Leise genug fürs Büro, genug Speicher für die gängigen mittelgroßen Modelle mit langem Kontext und ein kleines Team.
Die richtige Wahl, wenn viele gleichzeitig arbeiten und Ausfallzeiten teuer sind. Für die meisten kleinen Betriebe überdimensioniert.
Günstig zum Ausprobieren und für kleine Modelle. Ein Cluster verteilt die Nutzer auf mehrere Rechner und fängt Ausfälle ab — ein großes Modell über mehrere PCs zu verteilen, funktioniert über normales Netzwerk dagegen kaum.
Am meisten Grafikspeicher fürs Geld: acht A4000 ergeben 128 GB. Dafür laut, stromhungrig, nur fürs Rack — und ohne Herstellergarantie.
Richtwerte inkl. MwSt., Stand September 2026, nach Preisvergleichen und Händlerangeboten. Die tatsächlichen Preise schwanken, gebraucht besonders stark; ohne Gewähr. Bei mehreren Karten zählt die Bandbreite je Karte, sie addiert sich nicht einfach. Strom: 100 Watt Dauerlast kosten im Gewerbe rund 285 € im Jahr.
Ein lokales Modell ist nicht so stark wie die großen Cloud-Dienste — für viele Büroaufgaben aber stark genug. Der Unterschied liegt beim Betrieb: Die Maschine gehört Ihnen, und damit auch die Verantwortung dafür.
Warum und wann sich eigener Betrieb lohnt, beschreibt die Seite KI im eigenen Haus. Dieser Fahrplan zeigt, wie es technisch geht.
Das Modell muss vollständig in den Speicher der Grafikkarte passen, sonst wird es zäh. Dazu kommt Platz für den Gesprächsverlauf, der mit langen Texten und mehreren gleichzeitigen Nutzern wächst. Faustregel: Bei der üblichen 4-Bit-Kompression braucht ein Modell etwa einen halben Byte pro Parameter, plus Reserve für den Verlauf. Die Spielekarten sind schneller, die Profikarten haben mehr Speicher, Fehlerkorrektur und passen dank schmaler Bauform zu mehreren in einen Server.
Preise: Richtwerte inkl. MwSt., Stand September 2026. Die aktuelle Profi-Generation RTX PRO 6000 mit 96 GB kostet derzeit rund 17.000 €. Technische Daten nach Herstellerangaben.
Zur Modellwahl: Die genannten Modelle — gpt-oss, Gemma 4, Qwen 3.x, Mistral — stehen unter der Apache-2.0-Lizenz und dürfen gewerblich genutzt werden. Vorsicht bei Metas Llama 4: Für die multimodalen Llama-4-Modelle erteilt Meta Unternehmen mit Sitz in der EU keine Nutzungsrechte. Probieren Sie zwei, drei Modelle an Ihren eigenen Texten aus, bevor Sie sich festlegen — gerade bei deutschen Texten unterscheiden sie sich spürbar.
Grundlage ist Proxmox VE 9.2. Die Grafikkarte wird an eine virtuelle Maschine durchgereicht — das hält Treiber und Modell sauber vom Host getrennt, und die Maschine lässt sich wie jede andere sichern.
Schalten Sie im BIOS die Virtualisierung für Ein- und Ausgabegeräte ein — bei Intel heißt sie VT-d, bei AMD IOMMU. Bei aktuellen Proxmox-Kernels ist sie danach auch im System aktiv; prüfen lässt sich das mit dmesg | grep -e DMAR -e IOMMU -e AMD-Vi. Ist Secure Boot an, müssen Treibermodule signiert sein — das ist eine häufige Ursache, wenn später nichts lädt.
Tragen Sie die Module vfio, vfio_iommu_type1 und vfio_pci in /etc/modules-load.d/vfio.conf ein, führen Sie update-initramfs -u -k all aus und starten Sie neu. Die Karte muss in einer eigenen IOMMU-Gruppe liegen; die Übersicht zeigt pvesh get /nodes/<knoten>/hardware/pci --pci-class-blacklist "". Teilt sie sich die Gruppe mit anderen Geräten, hilft oft ein anderer Steckplatz. Mit lspci -nnk prüfen Sie, dass für die Karte vfio-pci als Treiber eingetragen ist.
Legen Sie eine VM mit Maschinentyp q35, UEFI-Firmware (OVMF) und CPU-Typ host an — Letzteres vermeidet ein bekanntes Problem großer Karten, die im Gast sonst ohne Speicher erscheinen. Geben Sie ausreichend Arbeitsspeicher und Plattenplatz für die Modelldateien. Die Karte weisen Sie unter Hardware → PCI-Gerät zu, mit der Option PCI-Express. Eine Bildschirmausgabe braucht es nicht.
Installieren Sie im Gast ein aktuelles Linux und den NVIDIA-Treiber aus den offiziellen Paketen. Aktuelle Karten der Blackwell-Generation — RTX 50 und RTX PRO — laufen nur mit den offenen Kernelmodulen. Halten Sie den Treiberzweig fest, damit ein Systemupdate ihn nicht ungewollt wechselt. nvidia-smi muss die Karte anzeigen, bevor es weitergeht.
Ollama installieren Sie mit dem Installationsskript von ollama.com und laden ein Modell, etwa mit ollama pull gpt-oss:20b. Mit ollama ps prüfen Sie, dass das Modell vollständig auf der Grafikkarte liegt — in der Spalte PROCESSOR muss „100% GPU“ stehen. Steht dort ein Anteil CPU, ist das Modell zu groß oder der Kontext zu lang.
Open WebUI ist eine Chat-Oberfläche im Browser, die mit Ollama spricht, Benutzer und Rollen kennt und Dokumente als Wissen einbinden kann. Sie läuft als Docker-Container in derselben VM. Das erste angelegte Konto wird Administrator; stellen Sie danach ein, dass neue Konten erst freigeschaltet werden müssen.
Ollama hat keine eigene Anmeldung — seine Schnittstelle darf deshalb nie von außen erreichbar sein. Open WebUI ist nach Aussage der Entwickler für vertrauenswürdige Netze gebaut: Stellen Sie es nur hinter einen Reverse Proxy mit Verschlüsselung und Anmeldung oder erreichen Sie es per VPN. Selbstregistrierung schalten Sie ab.
Wie viele Anfragen Ollama gleichzeitig bearbeitet und wie lang der Gesprächsverlauf sein darf, legen Umgebungsvariablen fest. Beides kostet Grafikspeicher: Doppelte Parallelität bei gleichem Kontext braucht auch doppelt so viel Platz für den Verlauf. Standardmäßig bearbeitet Ollama eine Anfrage je Modell, weitere warten. Arbeiten regelmäßig viele gleichzeitig, ist vLLM die bessere Wahl.
Sichern Sie die VM wie jede andere, etwa mit dem Proxmox Backup Server. Eine VM mit durchgereichter Karte lässt sich nicht im laufenden Betrieb auf einen anderen Host verschieben. Planen Sie Updates bewusst: Treiber, Gast-Kernel und Ollama gehören zusammen getestet. Legen Sie fest, wer das übernimmt — hier wird aus Technik Betriebsverantwortung.
Die meisten Probleme zeigen sich in den ersten Stunden der Einrichtung, nicht im Betrieb.
Wie ein Sprachmodell auf eigener Hardware mit Ihren Dokumenten arbeitet, zeigt die Seite Das Firmengedächtnis. Wie Mails damit vorsortiert werden, ohne das Haus zu verlassen, steht im Fahrplan Anfragen vorsortieren.
Stand der Angaben: September 2026 — Proxmox VE 9.2, nach der Dokumentation von Proxmox, NVIDIA, Ollama, Open WebUI und vLLM sowie den Modellkarten der Hersteller. Modelle und Versionen ändern sich schnell.
Ich betreibe selbst Server mit Grafikkarten, auf denen Sprachmodelle laufen. Im kostenlosen Vorgespräch schätzen wir ein, welche Klasse Sie brauchen — bevor irgendetwas angeschafft wird.