Start · Fahrpläne · Lokale KI mit Proxmox

Lokale KI auf der eigenen Grafikkarte — mit Proxmox.

Wie Sie ein Sprachmodell auf eigener Hardware betreiben, sodass vertrauliche Unterlagen das Haus nicht verlassen: Grafikkarte in einer virtuellen Maschine unter Proxmox VE, darauf Ollama und eine Oberfläche für das Team. Mit Hardware-Beispielen, passenden Modellen und den Stellen, an denen es in der Praxis hakt. Für Betriebe mit etwas eigener IT-Erfahrung oder einem IT-Dienstleister.

Vier Wege, vier Preisklassen.

Die Spanne reicht vom umgebauten Spielerechner bis zum Rechenzentrumsserver. Zum Vergleich steht bei jedem Rechner der Grafikspeicher — er bestimmt, welche Modelle passen — und die Speicherbandbreite, die vor allem bestimmt, wie schnell eine Antwort entsteht. Die Preise sind Richtwerte inklusive Mehrwertsteuer — und sie steigen gerade: Wegen der Speicherknappheit kosten Arbeitsspeicher und Grafikkarten im Herbst 2026 ein Vielfaches früherer Preise.

Zeichnung: Workstation im Tower-Gehäuse
Workstation · neu

Tower mit Profi-Grafikkarte

  • AMD Ryzen 9 9950X auf einem Workstation-Mainboard mit Fernwartung
  • 64 GB DDR5 mit Fehlerkorrektur (ECC), 2 TB NVMe, 1000-W-Netzteil
  • NVIDIA RTX A6000 mit 48 GB Grafikspeicher

Leise genug fürs Büro, genug Speicher für die gängigen mittelgroßen Modelle mit langem Kontext und ein kleines Team.

Grafikspeicher
48 GB (1 Karte)
Bandbreite
768 GB/s
Arbeitsspeicher
64 GB DDR5 mit ECC
Rechner 3.500 € + Karte 4.500 €8.000 €
Zeichnung: neuer Markenserver im Rack
Markenserver · neu

Rack-Server vom Hersteller

  • Zum Beispiel Dell PowerEdge R760xa für bis zu vier große Rechenzentrumskarten, Grundgerät rund 36.000 €
  • Herstellergarantie, Vor-Ort-Service, Fernwartung, redundante Netzteile
  • Rechenzentrumskarten wie L40S (48 GB) oder RTX PRO 6000 (96 GB)

Die richtige Wahl, wenn viele gleichzeitig arbeiten und Ausfallzeiten teuer sind. Für die meisten kleinen Betriebe überdimensioniert.

Grafikspeicher
96 GB (2× L40S à 48 GB)
Bandbreite
864 GB/s je Karte
Arbeitsspeicher
z. B. 256 GB DDR5 mit ECC
mit zwei Rechenzentrumskarten60.000 €
Zeichnung: Gaming-PC mit bunter Beleuchtung
Gaming-PC · neu

Spielerechner als Einstieg

  • AMD Ryzen 7 7700X, 32 GB DDR5, 1 TB NVMe
  • NVIDIA GeForce RTX 5070 mit 12 GB Grafikspeicher
  • Mehrere solcher Rechner lassen sich mit Proxmox zu einem Cluster verbinden

Günstig zum Ausprobieren und für kleine Modelle. Ein Cluster verteilt die Nutzer auf mehrere Rechner und fängt Ausfälle ab — ein großes Modell über mehrere PCs zu verteilen, funktioniert über normales Netzwerk dagegen kaum.

Grafikspeicher
12 GB (1 Karte)
Bandbreite
672 GB/s
Arbeitsspeicher
32 GB DDR5
je Rechner, davon Karte 740 €1.850 €
Zeichnung: gebrauchter GPU-Server im Rack
GPU-Server · gebraucht

Aufgearbeiteter Server mit vielen Karten

  • Zum Beispiel Supermicro 4028GR-TRT: acht Steckplätze für doppelt breite Karten, vier Netzteile
  • Ältere Generation mit DDR4 und PCIe 3.0 — für Sprachmodelle meist ausreichend
  • Bestückt mit gebrauchten RTX A4000 (16 GB) oder A5000 (24 GB)

Am meisten Grafikspeicher fürs Geld: acht A4000 ergeben 128 GB. Dafür laut, stromhungrig, nur fürs Rack — und ohne Herstellergarantie.

Grafikspeicher
64 GB (4× A4000 à 16 GB), ausbaubar auf 128 GB
Bandbreite
448 GB/s je Karte
Arbeitsspeicher
z. B. 128 GB DDR4 mit ECC
Server 3.500 € + 4× A4000 gebraucht 3.500 €7.000 €

Richtwerte inkl. MwSt., Stand September 2026, nach Preisvergleichen und Händlerangeboten. Die tatsächlichen Preise schwanken, gebraucht besonders stark; ohne Gewähr. Bei mehreren Karten zählt die Bandbreite je Karte, sie addiert sich nicht einfach. Strom: 100 Watt Dauerlast kosten im Gewerbe rund 285 € im Jahr.

Wann sich eigene Hardware lohnt.

Ein lokales Modell ist nicht so stark wie die großen Cloud-Dienste — für viele Büroaufgaben aber stark genug. Der Unterschied liegt beim Betrieb: Die Maschine gehört Ihnen, und damit auch die Verantwortung dafür.

Gut geeignet

  • Unterlagen, die nicht an einen Cloud-Dienst gehen dürfen: Personalakten, Kalkulationen, Konstruktionsdaten, Kundendaten
  • Zusammenfassen, Umformulieren, Übersetzen, Einordnen von Mails und Anfragen
  • Suchen und Antworten im eigenen Dokumentenbestand
  • Es gibt schon einen Proxmox-Server oder jemanden, der einen betreuen kann

Eher nicht geeignet

  • Anspruchsvolles Programmieren und lange, verschachtelte Aufgaben — da sind die großen Dienste deutlich besser
  • Niemand im Haus oder beim Dienstleister kann Treiber- und Systemupdates übernehmen
  • Sie wollen erst einmal ausprobieren, ob KI überhaupt genutzt wird — dafür ist die Cloud die günstigere Teststrecke

Warum und wann sich eigener Betrieb lohnt, beschreibt die Seite KI im eigenen Haus. Dieser Fahrplan zeigt, wie es technisch geht.

Entscheidend ist der Grafikspeicher.

Das Modell muss vollständig in den Speicher der Grafikkarte passen, sonst wird es zäh. Dazu kommt Platz für den Gesprächsverlauf, der mit langen Texten und mehreren gleichzeitigen Nutzern wächst. Faustregel: Bei der üblichen 4-Bit-Kompression braucht ein Modell etwa einen halben Byte pro Parameter, plus Reserve für den Verlauf. Die Spielekarten sind schneller, die Profikarten haben mehr Speicher, Fehlerkorrektur und passen dank schmaler Bauform zu mehreren in einen Server.

Zeichnung: GeForce RTX 5070
Gaming · 2025

GeForce RTX 5070

Speicher
12 GB
Bandbreite
672 GB/s
Leistung
250 W
Bauform
2–2,5 Slots, Lüfter
Passt für
kleine Modelle bis ~12 Mrd. Parameter
neu740 €
Zeichnung: GeForce RTX 5080
Gaming · 2025

GeForce RTX 5080

Speicher
16 GB
Bandbreite
960 GB/s
Leistung
360 W
Bauform
2,5–3 Slots, Lüfter
Passt für
gpt-oss-20b, Gemma 4 12B
neu1.400 €
Zeichnung: GeForce RTX 5090
Gaming · 2025

GeForce RTX 5090

Speicher
32 GB
Bandbreite
1.792 GB/s
Leistung
575 W
Bauform
2–3,5 Slots, Lüfter
Passt für
Modelle um 27–31 Mrd. mit Kontext; knapp lieferbar
gebraucht; neu derzeit rund 6.000 €3.500 €
Zeichnung: RTX A4000
Profi · 2021

RTX A4000

Speicher
16 GB, ECC
Bandbreite
448 GB/s
Leistung
140 W
Bauform
1 Slot, Radiallüfter
Passt für
viele Karten in einem Server
gebraucht800 €
Zeichnung: RTX A5000
Profi · 2021

RTX A5000

Speicher
24 GB, ECC
Bandbreite
768 GB/s
Leistung
230 W
Bauform
2 Slots, Radiallüfter
Passt für
gpt-oss-20b, Qwen 3.8 27B
gebraucht1.900 €
Zeichnung: RTX A6000
Profi · 2020

RTX A6000

Speicher
48 GB, ECC
Bandbreite
768 GB/s
Leistung
300 W
Bauform
2 Slots, Radiallüfter
Passt für
mittelgroße Modelle, mehrere Nutzer
gebraucht4.000 €

Preise: Richtwerte inkl. MwSt., Stand September 2026. Die aktuelle Profi-Generation RTX PRO 6000 mit 96 GB kostet derzeit rund 17.000 €. Technische Daten nach Herstellerangaben.

Zur Modellwahl: Die genannten Modelle — gpt-oss, Gemma 4, Qwen 3.x, Mistral — stehen unter der Apache-2.0-Lizenz und dürfen gewerblich genutzt werden. Vorsicht bei Metas Llama 4: Für die multimodalen Llama-4-Modelle erteilt Meta Unternehmen mit Sitz in der EU keine Nutzungsrechte. Probieren Sie zwei, drei Modelle an Ihren eigenen Texten aus, bevor Sie sich festlegen — gerade bei deutschen Texten unterscheiden sie sich spürbar.

In neun Halten zum eigenen Sprachmodell.

Grundlage ist Proxmox VE 9.2. Die Grafikkarte wird an eine virtuelle Maschine durchgereicht — das hält Treiber und Modell sauber vom Host getrennt, und die Maschine lässt sich wie jede andere sichern.

Halt 1 · BIOS

IOMMU einschalten

Schalten Sie im BIOS die Virtualisierung für Ein- und Ausgabegeräte ein — bei Intel heißt sie VT-d, bei AMD IOMMU. Bei aktuellen Proxmox-Kernels ist sie danach auch im System aktiv; prüfen lässt sich das mit dmesg | grep -e DMAR -e IOMMU -e AMD-Vi. Ist Secure Boot an, müssen Treibermodule signiert sein — das ist eine häufige Ursache, wenn später nichts lädt.

Halt 2 · Host vorbereiten

Die Karte für die Durchreichung reservieren

Tragen Sie die Module vfio, vfio_iommu_type1 und vfio_pci in /etc/modules-load.d/vfio.conf ein, führen Sie update-initramfs -u -k all aus und starten Sie neu. Die Karte muss in einer eigenen IOMMU-Gruppe liegen; die Übersicht zeigt pvesh get /nodes/<knoten>/hardware/pci --pci-class-blacklist "". Teilt sie sich die Gruppe mit anderen Geräten, hilft oft ein anderer Steckplatz. Mit lspci -nnk prüfen Sie, dass für die Karte vfio-pci als Treiber eingetragen ist.

Halt 3 · Virtuelle Maschine

VM anlegen und die Karte zuweisen

Legen Sie eine VM mit Maschinentyp q35, UEFI-Firmware (OVMF) und CPU-Typ host an — Letzteres vermeidet ein bekanntes Problem großer Karten, die im Gast sonst ohne Speicher erscheinen. Geben Sie ausreichend Arbeitsspeicher und Plattenplatz für die Modelldateien. Die Karte weisen Sie unter Hardware → PCI-Gerät zu, mit der Option PCI-Express. Eine Bildschirmausgabe braucht es nicht.

Halt 4 · Treiber

NVIDIA-Treiber im Gast

Installieren Sie im Gast ein aktuelles Linux und den NVIDIA-Treiber aus den offiziellen Paketen. Aktuelle Karten der Blackwell-Generation — RTX 50 und RTX PRO — laufen nur mit den offenen Kernelmodulen. Halten Sie den Treiberzweig fest, damit ein Systemupdate ihn nicht ungewollt wechselt. nvidia-smi muss die Karte anzeigen, bevor es weitergeht.

Halt 5 · Ollama

Die Server-Software für die Modelle

Ollama installieren Sie mit dem Installationsskript von ollama.com und laden ein Modell, etwa mit ollama pull gpt-oss:20b. Mit ollama ps prüfen Sie, dass das Modell vollständig auf der Grafikkarte liegt — in der Spalte PROCESSOR muss „100% GPU“ stehen. Steht dort ein Anteil CPU, ist das Modell zu groß oder der Kontext zu lang.

Halt 6 · Oberfläche

Open WebUI für das Team

Open WebUI ist eine Chat-Oberfläche im Browser, die mit Ollama spricht, Benutzer und Rollen kennt und Dokumente als Wissen einbinden kann. Sie läuft als Docker-Container in derselben VM. Das erste angelegte Konto wird Administrator; stellen Sie danach ein, dass neue Konten erst freigeschaltet werden müssen.

Halt 7 · Absichern

Nicht offen ins Netz stellen

Ollama hat keine eigene Anmeldung — seine Schnittstelle darf deshalb nie von außen erreichbar sein. Open WebUI ist nach Aussage der Entwickler für vertrauenswürdige Netze gebaut: Stellen Sie es nur hinter einen Reverse Proxy mit Verschlüsselung und Anmeldung oder erreichen Sie es per VPN. Selbstregistrierung schalten Sie ab.

Halt 8 · Einstellen

Kontext und Nutzerzahl abstimmen

Wie viele Anfragen Ollama gleichzeitig bearbeitet und wie lang der Gesprächsverlauf sein darf, legen Umgebungsvariablen fest. Beides kostet Grafikspeicher: Doppelte Parallelität bei gleichem Kontext braucht auch doppelt so viel Platz für den Verlauf. Standardmäßig bearbeitet Ollama eine Anfrage je Modell, weitere warten. Arbeiten regelmäßig viele gleichzeitig, ist vLLM die bessere Wahl.

Halt 9 · Betrieb

Sichern und aktuell halten

Sichern Sie die VM wie jede andere, etwa mit dem Proxmox Backup Server. Eine VM mit durchgereichter Karte lässt sich nicht im laufenden Betrieb auf einen anderen Host verschieben. Planen Sie Updates bewusst: Treiber, Gast-Kernel und Ollama gehören zusammen getestet. Legen Sie fest, wer das übernimmt — hier wird aus Technik Betriebsverantwortung.

Woran es in der Praxis hakt.

Die meisten Probleme zeigen sich in den ersten Stunden der Einrichtung, nicht im Betrieb.

Einrichtung

  • Die Karte teilt sich eine IOMMU-Gruppe mit anderen Geräten — anderer Steckplatz, anderes Mainboard
  • Secure Boot verhindert, dass der Treiber lädt
  • Blackwell-Karten mit dem falschen Treiberpaket — nur die offenen Kernelmodule funktionieren
  • Große Karten ohne Speicher im Gast — CPU-Typ host wählen

Betrieb

  • Langer Kontext und mehrere Nutzer füllen den Grafikspeicher; dann weicht Ollama auf den Prozessor aus und wird sehr langsam
  • Die Alternative, die Karte einem LXC-Container zu geben, spart Aufwand, koppelt aber den Treiber an den Host-Kernel — jedes Proxmox-Update wird zur Treiberfrage
  • Das Aufteilen einer Karte auf mehrere VMs (vGPU) braucht Lizenzen von NVIDIA
  • Open WebUI darf ab einer bestimmten Nutzerzahl nicht ohne Lizenz umgestaltet werden — für kleine Teams unerheblich

Wie ein Sprachmodell auf eigener Hardware mit Ihren Dokumenten arbeitet, zeigt die Seite Das Firmengedächtnis. Wie Mails damit vorsortiert werden, ohne das Haus zu verlassen, steht im Fahrplan Anfragen vorsortieren.

Stand der Angaben: September 2026 — Proxmox VE 9.2, nach der Dokumentation von Proxmox, NVIDIA, Ollama, Open WebUI und vLLM sowie den Modellkarten der Hersteller. Modelle und Versionen ändern sich schnell.

Lieber mit Begleitung?

Ich betreibe selbst Server mit Grafikkarten, auf denen Sprachmodelle laufen. Im kostenlosen Vorgespräch schätzen wir ein, welche Klasse Sie brauchen — bevor irgendetwas angeschafft wird.

Vorgespräch vereinbaren → Alle Fahrpläne