Künstliche Intelligenz

GPU Server mieten: Worauf Sie bei KI und Machine Learning achten

Talha Aslan 19 Minuten Lesezeit 2 Aufrufe

Was bedeutet GPU Server mieten und für wen lohnt es sich?

GPU Server mieten heißt, einen Server oder eine Cloud VM mit einer oder mehreren Grafikkarten stundenweise, monatlich oder mit fester Laufzeit beim Anbieter zu nutzen. Damit trainieren Sie also Modelle, führen Fine Tuning durch, betreiben LLM Inferenz oder erzeugen Bilder, ohne teure Hardware zu kaufen.

Wir sind Talha Aslan und Team, ein Team für digitales Marketing, Webentwicklung und KI Automatisierung. Allerdings sind wir kein Hostinganbieter. Deshalb stützen wir uns in diesem Ratgeber auf die offiziellen Dokumentationen von NVIDIA und Docker. Unser Ziel: Sie sollen ein Angebot zum GPU Server mieten mit den richtigen Fragen prüfen können.

Konkret richtet sich dieser Ratgeber an drei Gruppen. Zunächst an E-Commerce und Content Teams, die ein Modell mit eigenen Daten testen möchten. Dann an Entwicklerteams, die ein Produkt auf Basis großer Sprachmodelle live bringen wollen. Schließlich an Unternehmer, die sich fragen: Brauchen wir überhaupt eine GPU? Falls große Sprachmodelle für Sie neu sind, lesen Sie zuerst unseren Leitfaden zu großen Sprachmodellen.

Worin unterscheidet sich ein GPU Server von einem CPU Server?

Eine CPU besitzt wenige, aber starke Kerne. Sie erledigt sequenzielle Aufgaben und verzweigte Logik daher sehr schnell. Eine GPU arbeitet dagegen mit sehr vielen einfacheren Kernen, die dieselbe Operation gleichzeitig auf große Datenblöcke anwenden. Neuronale Netze bestehen zudem im Kern aus Matrixmultiplikationen, und genau diese Arbeit passt zur parallelen Bauweise.

Der zweite große Unterschied ist der Speicher. Eine GPU hat ihren eigenen Speicher, den VRAM. Modellgewichte, Zwischenergebnisse und der Cache während der Inferenz müssen also dort hineinpassen. Passen sie nicht, startet der Job entweder gar nicht oder weicht auf den Arbeitsspeicher aus und bremst dann stark.

Die Frage nach der Karte allein reicht deshalb nicht. Entscheidend ist vielmehr, wie viel VRAM die Karte bietet und wie schnell dieser Speicher Daten liefert. Trotzdem spielt die CPU weiter eine Rolle. Vorverarbeitung, Tokenisierung und Dateizugriffe laufen nämlich auf der CPU. Eine schwache CPU lässt also eine teure GPU warten.

Ein einfacher Vergleich hilft. Eine CPU gleicht wenigen erfahrenen Handwerkern, die komplexe Entscheidungen sorgfältig treffen. Eine GPU gleicht dagegen einer großen Gruppe, die dieselbe einfache Bewegung im Takt wiederholt. Bei einer kniffligen Entscheidung gewinnen deshalb die Handwerker. Bei Millionen ähnlicher Multiplikationen gewinnt hingegen die Gruppe deutlich. Kurz gesagt ersetzen sich beide nicht; entscheidend ist die passende Zuordnung zur Aufgabe.

Welche Aufgaben brauchen wirklich einen GPU Server?

Eine GPU lohnt sich vor allem dort, wo große Matrixoperationen immer wieder laufen. Unser Team nutzt im Gespräch mit Kunden diese grobe Liste:

  • Modelltraining. Ein Modell von Grund auf zu trainieren ist das schwerste Szenario und braucht oft mehrere GPUs.
  • Fine Tuning. Dagegen ist es deutlich leichter, ein bestehendes Modell an eigene Daten anzupassen. Trotzdem hängt auch das stark vom GPU Speicher ab.
  • LLM Inferenz. Hier beantwortet ein trainiertes Modell Anfragen von Nutzern; das ist die häufigste GPU Nutzung in Live Produkten.
  • Bild und Videoerzeugung. Diffusionsmodelle rechnen in jedem Schritt intensiv und erreichen deshalb auf einer CPU kaum praktikable Geschwindigkeit.
  • 3D Rendering und Videokodierung. Render Engines und hardwarebeschleunigte Encoder ziehen ebenso direkt Nutzen aus der GPU.

Ein Onlineshop, der Produkttexte im eigenen Markenton erzeugen möchte, braucht zum Beispiel meist nur Fine Tuning und Inferenz. Training von Grund auf verlangt dagegen riesige Datenmengen, lange Laufzeiten und ein großes Budget. Den größeren Zusammenhang erklären wir in unserem Einstieg in generative KI.

Außerdem gilt: Eine Aufgabe auf der eigenen GPU zu betreiben, die eine fertige API lösen könnte, ist nicht automatisch ein Vorteil. Ein eigener Server bringt zwar Datenkontrolle und Anpassbarkeit. Im Gegenzug tragen Sie allerdings den gesamten Betriebsaufwand.

Wann ist es Geldverschwendung, einen GPU Server zu mieten?

Viele Unternehmen wollen einen GPU Server mieten, weil gerade alle über KI sprechen. Der Großteil der alltäglichen Webinfrastruktur profitiert allerdings überhaupt nicht von einer GPU. Für die folgenden Aufgaben ist Geld für eine GPU meist verschwendet:

  • Website Hosting. PHP, Node.js oder statische Seiten hängen von CPU, RAM und Festplattentempo ab.
  • Klassische Datenbanken. MySQL und PostgreSQL brauchen ebenso schnelle Festplatten, Arbeitsspeicher und gute Indizes, aber keine GPU.
  • E-Mail, Backups und Dateiablage. Diese Dienste sind vor allem eine Frage von Netzwerk und Speicher.
  • Kleine Aufgaben, die eine API erledigt. Eine eigene GPU dauerhaft zu betreiben, um monatlich ein paar hundert Texte zusammenzufassen, rechnet sich selten.

Für solche Aufgaben passt daher ein normaler VPS, ein Cloud Server oder ein dedizierter Server. Die Unterschiede beschreiben wir in unserem Vergleich von VPS, VDS und Cloud Server; hier wiederholen wir sie nicht.

Und was ist mit Grenzfällen? Angenommen, auf Ihrer Website läuft ein kleines Klassifikationsmodell. Kleine Modelle laufen allerdings oft auch auf einer CPU in akzeptabler Geschwindigkeit. Messen Sie deshalb zuerst auf der CPU. Wechseln Sie erst dann zur GPU, wenn Sie einen echten Engpass sehen. So beruht Ihre Entscheidung auf Messwerten statt auf Annahmen.

Welche Modelle gibt es, um einen GPU Server zu mieten?

Wer einen GPU Server mieten möchte, trifft auf drei Grundmodelle. Jedes bietet allerdings eine andere Mischung aus Kontrolle, Flexibilität und Verantwortung.

Dedizierter GPU Server (Bare Metal). Sie nutzen die gesamte physische Maschine ohne Virtualisierungsschicht. Das bedeutet also vollen Hardwarezugriff, planbare Leistung und stabile Kosten bei langen Jobs. Allerdings liegen Einrichtung, Updates und Überwachung meist bei Ihnen. Das Grundprinzip erklären wir in unserem Ratgeber zum Dedicated Server.

Cloud VM mit GPU. Ein Cloud Anbieter stellt Ihnen eine virtuelle Maschine mit angebundener GPU bereit. Sie starten und stoppen sie zudem innerhalb von Minuten. Daher eignet sie sich für Experimente, kurze Trainingsläufe und schwankende Last.

Abrechnungsart. Die stündliche Abrechnung nach Verbrauch passt zu kurzen und unregelmäßigen Jobs. Eine Monatsmiete vereinfacht dagegen die Kalkulation für Inferenzdienste, die rund um die Uhr laufen. Reservierte Kapazität senkt im Gegenzug für eine längere Bindung oft den Stückpreis. Allerdings zahlen Sie dann auch, wenn Sie die Kapazität nicht nutzen.

Zudem bieten manche Anbieter günstigere Kapazität an, die sie kurzfristig zurückholen dürfen. Die Bezeichnung variiert allerdings je nach Anbieter. Somit eignet sich diese Option nur für Jobs, die an einem gespeicherten Checkpoint weiterlaufen können.

Was unterscheidet Consumer GPUs von Rechenzentrums GPUs?

Das Angebot von NVIDIA lässt sich grob in zwei Familien teilen. Auf der Consumer Seite stehen GeForce Karten für Gaming und persönliche Workstations. Auf der Rechenzentrumsseite stehen dagegen Karten, die NVIDIA für Servergehäuse, Dauerlast und die Skalierung über mehrere GPUs entwickelt. Die aktuellen Produktfamilien finden Sie auf der Rechenzentrumsseite von NVIDIA.

In der Praxis zeigen sich die Unterschiede vor allem hier:

  • Speicherkapazität. Rechenzentrumskarten bieten meist deutlich mehr VRAM; für große Modelle ist das der entscheidende Faktor.
  • Zuverlässigkeit des Speichers. Fehlerkorrigierender Speicher (ECC) ist bei Rechenzentrumskarten verbreitet.
  • Verbindung mehrerer GPUs. Schnelle Verbindungen zwischen GPUs und Funktionen zur Aufteilung stehen auf der Rechenzentrumsseite im Vordergrund.
  • Lizenz und Support. Zudem können Lizenzbedingungen der Treiber und der Umfang des Unternehmenssupports sich zwischen beiden Familien unterscheiden.

Eine Consumer Karte zu mieten kann für Tests mit kleinen Modellen oder für Bilderzeugung günstig sein. Für ein Live Produkt fragen Sie den Anbieter allerdings nach Lizenzkonformität, Kühlung und Austauschzeit bei Defekten. Nennt ein Angebot eine bestimmte Karte, prüfen Sie deren Daten außerdem auf der offiziellen Produktseite von NVIDIA.

Wie viel VRAM braucht Ihr Modell?

Eine exakte Zahl kann niemand nennen, denn der Bedarf hängt vom Modell, von der Kontextlänge und von der Zahl gleichzeitiger Nutzer ab. Die Logik einer groben Schätzung ist trotzdem einfach. Konkret multiplizieren Sie die Zahl der Parameter mit den Bytes pro Parameter.

Die Bytes pro Parameter hängen also von der numerischen Genauigkeit ab. Eine Gleitkommazahl mit 32 Bit belegt 4 Bytes, mit 16 Bit 2 Bytes, mit 8 Bit 1 Byte und mit 4 Bit ein halbes Byte. Quantisierung senkt die Genauigkeit der Gewichte und verkleinert so den Speicherbedarf. Dafür kann allerdings die Ausgabequalität etwas leiden.

Beispielrechnung: Ein hypothetisches Modell mit 7 Milliarden Parametern braucht bei 16 Bit allein für die Gewichte grob 7 × 2 = 14 GB. Quantisieren Sie dasselbe Modell auf 4 Bit, sinkt der Anteil der Gewichte auf etwa 3,5 GB. Diese Werte gelten nur für die Gewichte; der echte Bedarf liegt höher.

Denn während der Inferenz belegen auch der Cache für den Kontext (KV Cache) und der Arbeitsbereich Platz. Zudem lassen lange Kontexte und viele parallele Anfragen diesen Anteil schnell wachsen. Beim Training und beim vollständigen Fine Tuning kommen zudem Gradienten und Optimizer Zustände hinzu; der Bedarf steigt dann auf ein Mehrfaches der Gewichte. Deshalb bieten parametereffiziente Verfahren wie LoRA einen speicherschonenden Mittelweg.

Kurz gesagt: Notieren Sie Modell, Genauigkeit und gewünschte Parallelität, bevor Sie Angebote einholen. Mit diesen drei Angaben führen Sie ein deutlich besseres Gespräch als mit der Bitte nach der größten Karte.

Warum zählen Speicherbandbreite, mehrere GPUs und NVLink?

Die VRAM Größe entscheidet, ob ein Modell hineinpasst. Die Speicherbandbreite entscheidet dagegen, wie schnell es danach läuft. Bei der LLM Inferenz liest die GPU zum Beispiel für jedes neue Token die Gewichte aus dem Speicher. Zwei Karten mit gleichem VRAM können somit sehr unterschiedlich schnell antworten.

Passt ein Modell nicht auf eine Karte, brauchen Sie mehrere GPUs. Dann teilen Sie Modell oder Daten auf mehrere Karten auf, und die Karten tauschen ständig Daten aus. Ist die Verbindung zwischen ihnen langsam, dann verbringt ein Teil der Rechenleistung die Zeit mit Warten.

NVIDIA hat dafür eine direkte Verbindung zwischen GPUs namens NVLink entwickelt. Laut der NVLink Seite von NVIDIA soll sie die Kommunikation mehrerer GPUs innerhalb eines Servers für KI Training und Inferenz beschleunigen. Sprechen die Karten nur über den normalen PCIe Bus miteinander, kann die Effizienz sinken.

Fragen Sie daher bei einem Angebot mit mehreren GPUs: Sind die Karten per NVLink verbunden oder nur über PCIe? Für Inferenzjobs auf einer einzigen Karte ist das weniger wichtig. Beim Training großer Modelle gehört es dagegen zu den wichtigsten Leistungsfaktoren.

Wie bringen Sie CPU, RAM, NVMe und Netzwerk ins Gleichgewicht?

Ist der Rest des Servers schwach, dann wartet die teure Karte. Die Balance ist deshalb genauso wichtig wie die Wahl der Karte.

  • CPU. Sie brauchen genug Kerne für Datenladen, Vorverarbeitung und Tokenisierung. Bei mehreren GPUs fragen Sie zudem, wie viel CPU auf jede Karte entfällt.
  • Arbeitsspeicher (RAM). Datensatz und Modell liegen im RAM, bevor sie die GPU erreichen. Daher erleichtert RAM, der deutlich größer als der gesamte VRAM ist, die Arbeit.
  • NVMe Speicher. Schnelle lokale Laufwerke verringern zudem Engpässe beim Lesen großer Datensätze und Modelldateien.
  • Netzwerk. Downloads von Modellen und Daten, Backups von Checkpoints und Training über mehrere Server brauchen hohe Bandbreite.

Trainieren Sie zum Beispiel mit einem großen Bilddatensatz von einer langsamen Festplatte, sinkt die GPU Auslastung. Beobachten Sie deshalb die Auslastung während des Trainings. Bleibt sie dauerhaft niedrig, liegt der Engpass sehr wahrscheinlich in der Datenpipeline.

Außerdem beeinflusst der Serverstandort die Latenz für Ihre Nutzer. Für einen Live Inferenzdienst prüfen Sie mit unserer IP Abfrage schnell, zu welchem Land und Netz eine Server IP gehört.

Optionen zum GPU Mieten im direkten Vergleich

Die folgende Tabelle fasst die drei Grundoptionen aus Sicht der Entscheidung zusammen. Die Einschätzungen beschreiben allerdings nur allgemeine Tendenzen und können je nach Anbieter abweichen.

KriteriumDedizierte GPU (Bare Metal)Cloud VM mit GPUGehostete KI API
KontrolleVolle Kontrolle über Hardware und BetriebssystemKontrolle über das Betriebssystem, Hardware abstrahiertNur API Parameter
FlexibilitätNiedrig, an Vertrag gebundenHoch, Start und Stopp in MinutenSehr hoch, keine Infrastruktur
Passende AufgabeLanges Training, dauerhafte InferenzExperimente, kurzes Training, schwankende LastPrototypen, geringe Nutzung
BetriebsaufwandHochMittelNiedrig
Kontrolle über den DatenstandortHoch, Sie wählen das RechenzentrumAbhängig von der RegionswahlAbhängig von der Richtlinie des Anbieters
KostenrisikoZahlung auch im LeerlaufRechnung wächst, wenn Sie das Abschalten vergessenWächst schnell mit dem Volumen

Das Ergebnis: Es gibt nicht die eine richtige Lösung. Viele Teams starten im Prototyp mit einer API. Danach wechseln sie beim Wachstum zur Cloud GPU und bei stabiler, planbarer Last schließlich zum dedizierten Server.

Welche Software brauchen Sie auf dem Server?

Steht die Hardware bereit, richten Sie einen Softwarestapel mit drei Schichten ein. Die Reihenfolge ist wichtig, denn jede Schicht baut auf der vorherigen auf.

  1. NVIDIA Treiber. Diese erste Schicht sorgt dafür, dass das Betriebssystem die GPU erkennt. Danach zeigt der Befehl nvidia-smi Ihre Karten, die Treiberversion und die Speicherbelegung.
  2. CUDA. Das ist also die Plattform von NVIDIA für paralleles Rechnen. Frameworks wie PyTorch und TensorFlow greifen etwa über CUDA auf die GPU zu. Prüfen Sie die Versionskompatibilität auf der Installationsseite des jeweiligen Frameworks.
  3. Anwendungsumgebung. Hier liegen Framework, Modellserver und Ihr eigener Code. Halten Sie diese Schicht in einem Container, dann bleibt die Umgebung reproduzierbar.

Viele Anbieter stellen fertige Images mit vorinstalliertem Treiber und CUDA bereit. Solche Images beschleunigen daher die Ersteinrichtung erheblich. Fragen Sie allerdings, welche Versionen enthalten sind und wie der Anbieter Updates handhabt. Versionsnummern nennen wir hier bewusst nicht; prüfen Sie stattdessen immer die aktuelle stabile Version auf der offiziellen Seite.

Richten Sie zum ersten Mal einen Server ein, finden Sie die Grundlagen in unserer Anleitung zur Ersteinrichtung von Ubuntu Server. Benutzer anlegen, Firewall einrichten und Updates einspielen funktioniert auf einem GPU Server genauso.

Wie geben Sie einem Docker Container Zugriff auf die GPU?

Container sind der praktischste Weg, eine Modellumgebung portabel und vom Host getrennt zu halten. Das Grundprinzip erklären wir in unserem Docker Leitfaden. Für die GPU brauchen Sie allerdings zusätzlich das NVIDIA Container Toolkit.

Laut der offiziellen Installationsanleitung von NVIDIA installieren Sie zunächst den NVIDIA Treiber auf dem Host. Danach folgen Sie den Schritten zum Paketquellen Eintrag in der Anleitung und installieren das Paket nvidia-container-toolkit. Anschließend konfigurieren Sie die Docker Laufzeit und starten den Dienst neu:

sudo nvidia-ctk runtime configure --runtime=docker
sudo systemctl restart docker

Zur Kontrolle nutzen Sie das Beispiel aus der Docker Dokumentation zum GPU Zugriff. So geben Sie dem Container alle GPUs oder nur eine bestimmte Karte:

docker run -it --rm --gpus all ubuntu nvidia-smi
docker run -it --rm --gpus device=0 ubuntu nvidia-smi

Zeigt der Befehl Ihre Karten an, sieht der Container die GPU. Danach können Sie mehrere Projekte auf demselben Server auf verschiedene Karten verteilen. Übernehmen Sie den Schritt für die Paketquelle exakt aus der offiziellen Anleitung. Leiten Sie vor allem nie ein beliebiges Installationsskript aus dem Internet direkt in Ihre Shell.

Welche Kosten entstehen, wenn Sie einen GPU Server mieten?

Preise nennen wir hier nicht; aktuelle Zahlen finden Sie immer auf der Preisseite des Anbieters. Die allgemeine Preisbildung bei Servern erklären wir in unserem Beitrag Serverkosten: wovon hängt der Preis ab?. Wenn Sie einen GPU Server mieten, kommen vor allem diese Posten hinzu:

  • Nutzungsdauer. Konkret folgt bei stündlicher Abrechnung die Rechnung direkt der Laufzeit der Maschine.
  • Leerlauf. Ist das Training beendet, läuft die Maschine aber weiter, zählt der GPU Preis trotzdem weiter.
  • Ausgehender Datenverkehr. Viele Cloud Anbieter berechnen ausgehende Daten separat; große Modelle und Datensätze treiben diesen Posten schnell nach oben.
  • Speicher. Zudem können auch bei gestoppter Maschine dauerhafte Laufwerke und Snapshots weiter Kosten verursachen.

Beispielrechnung: Nehmen Sie eine GPU Maschine mit einem Stundenpreis von X an. Trainieren Sie 20 echte Stunden pro Woche, lassen die Maschine aber die ganze Woche laufen, zahlen Sie 168 Stunden. Ihre tatsächliche Auslastung liegt dann bei rund 12 Prozent. Mit automatischem Abschalten sinkt die GPU Rechnung grob auf 20X; Speicher und Datenverkehr kommen noch hinzu.

Daher ist die wirksamste Kostenkontrolle eine Regel, die ungenutzte Maschinen automatisch stoppt. Speichern Sie zudem regelmäßig Checkpoints, dann fahren Sie abends herunter und machen am nächsten Tag weiter. Budgetwarnungen helfen außerdem, böse Überraschungen früh zu erkennen.

Lohnt sich Mieten oder Kaufen mehr?

Die Antwort hängt vor allem von der Auslastung und der Planbarkeit Ihres Bedarfs ab. Für Teams mit dauerhaft hoher Nutzung kann der Kauf eigener Karten langfristig sinnvoll sein. Allerdings bedeutet Kaufen mehr als den Kartenpreis.

Denn beim Kauf liegen Strom, Kühlung, Colocation, Ersatzteile und Hardwaredefekte bei Ihnen. Zudem altert KI Hardware schnell; die Spitzenkarte von heute kann in wenigen Jahren nur noch Mittelklasse sein. Beim Mieten ist der Wechsel auf eine neue Generation dagegen nur eine Vertragsänderung.

Wir empfehlen diese grobe Aufteilung:

  • Mieten. Das passt, wenn Ihr Bedarf unklar ist, das Projekt noch experimentell läuft oder die Last saisonal schwankt.
  • Langfristig mieten oder reservieren. Diese Variante eignet sich vor allem für einen dauerhaft laufenden Inferenzdienst mit planbarer Last.
  • Kauf prüfen. Das lohnt sich eher, wenn die Nutzung rund um die Uhr hoch bleibt, Daten Ihr Haus nicht verlassen dürfen und Sie Personal für den Betrieb haben.

Sammeln Sie vor der Entscheidung einige Monate echte Nutzungsdaten auf einem gemieteten Server. Somit beruht Ihre Rechnung auf gemessenen Stunden statt auf Schätzungen.

Was gilt beim Datenstandort und beim Datenschutz?

Dieser Abschnitt ist keine Rechtsberatung; sprechen Sie für Ihren konkreten Fall mit einer Fachanwältin oder einem Fachanwalt. Trotzdem sollten Sie vor jeder technischen Entscheidung eine Frage klären: Enthalten Ihre Trainings oder Inferenzdaten personenbezogene Daten?

Kundennachrichten, Supporttickets, Sprachaufnahmen und CRM Exporte enthalten sie häufig. Steht Ihr GPU Server in einem anderen Land, kann die Übermittlung dorthin als internationale Datenübermittlung gelten. In der EU setzt die DSGVO konkrete Bedingungen für Übermittlungen außerhalb des Europäischen Wirtschaftsraums. Ebenso hat das türkische Datenschutzgesetz KVKK eigene Regeln für Übermittlungen ins Ausland, die die türkische Datenschutzbehörde in ihrem Leitfaden zur Auslandsübermittlung erläutert.

Technisch können Sie Folgendes tun:

  • Standort schriftlich bestätigen lassen. Fragen Sie außerdem, wo Backups und Snapshots liegen.
  • Daten minimieren. Maskieren oder anonymisieren Sie identifizierende Angaben vor dem Training.
  • Löschung klären. Erfragen Sie zudem, wie der Anbieter Laufwerke nach Vertragsende bereinigt.

Die Seite der Website behandeln wir in unserem Leitfaden für eine datenschutzkonforme Website.

Wie halten Sie einen GPU Server sicher?

GPU Server sind für Angreifer attraktiv, weil sich Rechenleistung leicht missbrauchen lässt. Außerdem sind Modellgewichte und Trainingsdaten wertvolle Unternehmenswerte. Die Grundschritte entsprechen jedem Linux Server, allerdings ist der Preis für Nachlässigkeit höher.

  • SSH absichern. Schalten Sie die Anmeldung per Passwort ab, nutzen Sie Schlüssel und sperren Sie die direkte Anmeldung als root. Die Schritte zeigen wir in unserer Anleitung zur SSH Absicherung.
  • Oberflächen nicht öffentlich machen. Stellen Sie Jupyter, Modellserver oder Dashboards nie über einen offenen Port ins Internet.
  • Isoliertes Netzwerk nutzen. Bietet der Anbieter ein privates Netz oder eine VPC, leiten Sie den Verkehr zwischen Servern darüber.
  • Auslastung beobachten. Unerwartete GPU Last kann zudem auf einen unbefugten Job hinweisen.

Statt einen Port für Jupyter zu öffnen, nutzen Sie zum Beispiel einen SSH Tunnel. Das Beispiel verwendet eine IP Adresse aus dem Dokumentationsbereich:

ssh -L 8888:localhost:8888 benutzer@203.0.113.10

Dieser Befehl leitet Port 8888 des entfernten Servers über einen sicheren Tunnel auf Ihren Rechner. Die Oberfläche erreicht somit nie das offene Internet.

Wann sollten Sie den GPU Server nicht selbst verwalten?

Ehrlich gesagt eignet sich nicht jedes Team für den Betrieb eines eigenen GPU Servers. Selbstverwaltung bedeutet Treiberupdates, Sicherheitspatches, Monitoring, Backups und Störungsbehebung. Kann niemand im Team diese Aufgaben regelmäßig übernehmen, wählen Sie daher einen verwalteten Dienst.

In diesen Fällen empfehlen wir, die Aufgabe an den Anbieter oder eine verwaltete Plattform abzugeben:

  • Ihrem Team fehlt Erfahrung mit Linux. Eine falsch eingestellte SSH Konfiguration oder ein vergessener offener Port schafft ernste Risiken.
  • Der Dienst darf nie ausfallen. Für nächtliche Störungen brauchen Sie dann eine Rufbereitschaft.
  • Sie brauchen nur Inferenz. Verwaltete Inferenzdienste verbergen die Infrastruktur, also konzentrieren Sie sich auf das Modell.
  • Ihr Volumen ist gering. Für wenige Stunden Arbeit im Monat lohnt sich eigener Serverbetrieb kaum.

Andererseits zahlt sich ein eigener Server aus, wenn Sie volle Kontrolle über den Datenstandort oder eine spezielle Modellkonfiguration brauchen. Selbst dann kann es ein guter Mittelweg sein, die Pflege des Betriebssystems an ein verwaltetes Paket abzugeben.

Fragen an den Anbieter, bevor Sie einen GPU Server mieten

Stellen Sie diese Fragen beim Vergleich der Angebote schriftlich. Die Klarheit der Antworten verrät zudem viel über die Reife des Anbieters.

  1. Welches Kartenmodell, wie viel VRAM und wie viele Karten? Vergleichen Sie die Antwort dann mit der offiziellen Seite von NVIDIA.
  2. Gehören die Karten vollständig zu meiner VM, oder teilen sich mehrere Kunden eine Karte?
  3. Sind die Karten bei mehreren GPUs per NVLink verbunden oder nur über PCIe?
  4. Wie viele CPU Kerne, wie viel RAM und wie viel NVMe Speicher sind enthalten?
  5. In welchem Land steht das Rechenzentrum? Wo liegen Backups und Snapshots?
  6. Berechnen Sie ausgehenden Datenverkehr? Falls ja, nach welcher Methode?
  7. Welche Posten laufen weiter, wenn die Maschine gestoppt ist?
  8. Gibt es fertige Images mit Treiber und CUDA? Wer kümmert sich um Updates?
  9. Wie schnell tauschen Sie defekte Hardware aus, und wie schnell reagiert Ihr Support?
  10. Wie löschen Sie die Daten auf den Laufwerken nach Vertragsende?

Nehmen Sie diese Punkte als Spalten in Ihre Vergleichstabelle auf. So vergleichen Sie den Preis zusammen mit dem Leistungsumfang statt isoliert.

Braucht ein KI Agent auf dem eigenen Server eine GPU?

Nicht immer. Ein KI Agent ist eine Software, die Aufgaben Schritt für Schritt plant und Werkzeuge aufruft. Ruft der Agent sein Sprachmodell über eine externe API auf, läuft der Agent selbst problemlos auf einem gewöhnlichen VPS. Eine GPU brauchen Sie erst, wenn Sie auch das Modell selbst hosten möchten.

Diese Unterscheidung wirkt sich deutlich auf das Budget aus. Agentenlogik, Workflows und Integrationen laufen günstig auf einem CPU Server, das Modell dagegen auf einem separaten GPU Dienst. Somit reservieren Sie die GPU nur für die Schicht, die sie wirklich braucht.

Einsatzfälle im Marketing zeigen wir in unserem Beitrag zu KI Agenten; die Einrichtung auf dem eigenen Server behandelt ein weiterer Beitrag dieser Reihe. Für den Einstieg in Python empfehlen wir außerdem unsere Roadmap zu KI mit Python.

Wie treffen Sie beim GPU Server mieten die richtige Entscheidung?

Die richtige Entscheidung beginnt bei der Aufgabe, nicht bei der Hardware. Notieren Sie zunächst Modell, Genauigkeit, Kontextlänge und erwartete Zahl gleichzeitiger Nutzer. Schätzen Sie dann den VRAM Bedarf und wählen Sie die Karte auf dieser Grundlage.

Danach wählen Sie das Mietmodell: stündliche Cloud GPU für Experimente, Monatsmiete oder dedizierter Server für stabile Last. Bei den Kosten denken Sie außerdem an Leerlauf, ausgehenden Datenverkehr und Speicher. Enthalten Ihre Daten personenbezogene Angaben, klären Sie Standort und Übermittlungsregeln vor der technischen Einrichtung.

Schließlich bewerten Sie den Betriebsaufwand ehrlich. Ist Ihr Team nicht bereit, Server zu betreiben, kann ein verwalteter Dienst langfristig günstiger und sicherer sein.

Unser Team verbindet KI mit Marketing und Betriebsabläufen und berät dabei auch zu Infrastrukturfragen. Möchten Sie Ihren GPU Bedarf klären oder eine Automatisierungsidee umsetzen, sehen Sie sich unsere Leistungen zur KI Automatisierung an.

Häufig gestellte Fragen

Was ist der wichtigste Unterschied zwischen einem GPU Server und einem CPU Server?
Der wichtigste Unterschied ist der Beschleuniger: Ein GPU Server trägt eine Karte für parallele Mathematik mit eigenem Speicher, dem VRAM. Modelltraining, Fine Tuning und LLM Inferenz profitieren stark davon. Websites, E-Mail und klassische Datenbanken ziehen dagegen keinen Nutzen aus einer GPU, daher reicht dafür ein normaler CPU Server völlig aus.
Lohnt es sich für ein kleines Unternehmen, einen GPU Server zu mieten?
Für die meisten kleinen Unternehmen lohnt es sich als erster Schritt nicht. Texte in geringem Umfang erzeugen oder zusammenfassen Sie mit einer fertigen KI API günstiger und schneller. Eine stündliche Cloud GPU empfehlen wir erst, wenn Sie Kontrolle über den Datenstandort, ein eigenes Modell oder dauerhaft hohe Nutzung brauchen.
Wie schätze ich den VRAM Bedarf eines Sprachmodells?
Für eine grobe Schätzung multiplizieren Sie die Zahl der Parameter mit den Bytes pro Parameter. Bei 16 Bit sind das 2 Bytes, bei Quantisierung auf 4 Bit ein halbes Byte. Diese Zahl deckt nur die Gewichte ab. Planen Sie also Reserve für Kontextcache, parallele Anfragen und Arbeitsbereich ein; Training braucht ein Mehrfaches.
Was muss ich installieren, um Docker mit einer GPU zu nutzen?
Zunächst installieren Sie den NVIDIA Treiber auf dem Host. Danach folgen Sie der offiziellen Anleitung von NVIDIA, installieren das NVIDIA Container Toolkit, konfigurieren die Docker Laufzeit mit dem dort genannten Befehl und starten Docker neu. Anschließend starten Sie einen Container mit dem Parameter für GPUs und prüfen den Zugriff über das Diagnosewerkzeug von NVIDIA.
Darf ich Kundendaten an einen GPU Server im Ausland senden?
Das hängt von den Daten und vom geltenden Recht ab. Enthalten die Daten personenbezogene Angaben, kann die Übermittlung ins Ausland nach DSGVO, KVKK oder ähnlichen Regeln als internationale Übermittlung gelten. Lassen Sie sich den Standort schriftlich bestätigen, anonymisieren Sie wenn möglich und sprechen Sie mit einer Anwältin. Das ist keine Rechtsberatung.
Warum fällt die Rechnung für einen GPU Server oft höher aus als erwartet?
Der häufigste Grund ist eine Maschine, die nach dem Job einfach weiterläuft. Bei stündlicher Abrechnung zählt der GPU Preis, egal ob Sie die Karte nutzen. Zudem summieren sich ausgehender Datenverkehr, dauerhafte Laufwerke und Snapshots. Eine Regel zum automatischen Abschalten und ein regelmäßiger Blick auf die Preisseite verhindern die meisten Überraschungen.
  • gpu server mieten
  • gpu server
  • ki infrastruktur
  • llm inferenz
  • fine tuning
  • nvidia
  • docker
  • cloud gpu
Teilen:
Talha Aslan

Google Partner und Experte für digitales Marketing. Seit 2012 praktisch in SEO, Google Ads, Webdesign und E-Commerce Projekten; jeder Beitrag hier stammt aus dieser Erfahrung.

Nächstes Projekt

Sprechen wir über Ihr Projekt.

Ihre Anfrage geht direkt an Talha Aslan und Team: Strategie von Talha, Umsetzung durch ein erfahrenes Team. Das Erstgespräch ist kostenlos, wir hören zu und melden uns mit einer klaren Roadmap.