GPU-Server mieten oder Mini-PC kaufen: c'ts Zahlen nachgemessen

28.07.2026 11:27

Die c't hat einen GPU-Server bei Hetzner getestet, den GEX44: 278 Euro im Monat für eine Nvidia RTX 4000 SFF Ada mit 20 GB Grafikspeicher, gedacht für Firmen, die lokale KI ausprobieren wollen. Bei mir steht seit knapp einem Jahr ein Mini-PC, der denselben Zweck erfüllt. Ich habe die beiden Modelle aus dem Test auf ihm nachgemessen.

Warum die Amortisationsrechnung schief steht

Der Test rechnet vor, ab wann Kaufen günstiger wird als Mieten: rund 6.000 Euro Hardwarewert, Strom eingerechnet, Break-even nach etwa 26 Monaten. Diese Rechnung stimmt für die Maschine, die Hetzner zusammengestellt hat. In ihr stecken zwei Datacenter-SSDs für zusammen 3.000 Euro, also fast das Doppelte des GPU-Preises, für ein Szenario, in dem ein paar Modelle von je 20 GB auf der Platte liegen. Die c't hält das selbst für falsch dimensioniert und rechnet die Amortisation trotzdem mit diesem Preis durch.

Meine Maschine ist ein Beelink GTR9 Pro mit Ryzen AI Max+ 395 und 128 GB Speicher, gekauft am 25. August 2025 für 1.785,41 Euro. Günstig war sie, weil sie den bekannten Ethernet-Fehler dieser Serie hat: Der verbaute Intel E610 verabschiedet sich unter GPU-Last und kommt erst nach einem Zug am Stromkabel zurück, ein Software-Neustart reicht nicht. Ich habe einen USB-Netzwerkadapter für 15 Euro davorgehängt, seitdem ist Ruhe. Wer die Kiste kauft, sollte das einkalkulieren.

Von den 128 GB sind 64 GB fest als Grafikspeicher reserviert, weitere 32 GB kann die integrierte GPU bei Bedarf aus dem Arbeitsspeicher dazunehmen. Sie adressiert also bis zu 96 GB, wo die gemietete Karte bei 20 GB endet.

Die Messung

Gemessen habe ich mit Ollama, drei Durchläufe pro Modell bei fester Antwortlänge, Median. Die Streuung lag unter einem Prozent.

Modell Beelink GTR9 Pro GEX44 (c't)
Gemma 4 E4B 54,3 Token/s 65 Token/s
Qwen 3.6 27B Q4_K_M 12,6 Token/s 18 Token/s
Qwen 3.6 35B-A3B Q4_K_M 61,6 Token/s passt nicht in den Speicher

Bei den beiden Modellen, die auf beiden Maschinen laufen, liegt der Mini-PC bei 70 bis 84 Prozent des Tempos. Langsamer, aber nicht in einer anderen Größenordnung. Das deckt sich mit dem, was Peinl und Weber in der iX über diese Geräteklasse geschrieben haben und was ich in Unified-Memory-Workstations zusammengefasst hatte: Der Speicher ist üppig, die Bandbreite ist der Flaschenhals.

Die dritte Zeile ist der Grund, warum ich überhaupt nachgemessen habe. Qwen 3.6 35B-A3B belegt 21,2 GB für die Gewichte plus 5,0 GB für den Kontextspeicher. Schon die Gewichte allein passen nicht in die 20 GB der gemieteten Karte. Auf dem Beelink laufen alle 42 Schichten auf der GPU, und das Modell antwortet mit 61,6 Token pro Sekunde, also gut dreimal so schnell wie der Mietserver mit dem kleineren Qwen.

Bevor jemand daraus schließt, die größere Zahl im Namen bedeute bessere Antworten: Das A3B steht für drei Milliarden aktive Parameter. Es ist ein Mixture-of-Experts-Modell, das pro Token nur einen Bruchteil seiner 35 Milliarden Gewichte durchrechnet. Genau daher kommt das Tempo, und genau deshalb schreibt es nicht zwangsläufig besser als das dichte 27B. Mehr Speicher erlaubt eine andere Architektur. Klüger wird das Modell davon nicht.

Was das kostet

Gegen die 278 Euro Monatsmiete plus 135 Euro Einrichtung amortisiert sich meine Anschaffung nach gut sechs Monaten, nicht nach 26. Der Stromverbrauch ändert daran wenig: Die APU zieht im Leerlauf 4,1 Watt und unter Last 114 Watt, macht bei Dauerbetrieb rund 25 Euro im Monat. Das ist zu klein, um gegen 278 Euro etwas auszurichten.

Für sporadische Nutzung bleibt die Miete rechnerisch attraktiv, Hetzner rechnet stundenweise ab. Nur verhindert die Einrichtungsgebühr genau dieses Modell, weil sie bei jeder Neuanlage erneut fällig wird. Man zahlt also entweder für Leerlauf oder für Wiederanschaffung.

Fazit

Wer selbst gehostete Sprachmodelle im Dauerbetrieb braucht, fährt mit einer Unified-Memory-Kiste für unter 2.000 Euro besser als mit dem Mietserver, und zwar wegen des Speichers, nicht wegen der Geschwindigkeit. Sie kostet ein Sechstel und öffnet eine Modellklasse, die auf 20 GB nicht startet. Wer maximale Token pro Sekunde bei Modellen bis 24 GB will, ist mit einer gebrauchten Grafikkarte weiterhin am besten bedient, siehe RTX 3090 als Preis-Leistungs-König. Und wer nur ausprobieren möchte, wie sich lokale Modelle anfühlen, braucht für den Anfang keine dieser drei Optionen, sondern die Anleitung für den eigenen Rechner.

Quellen

  • Jan Mahn: GPU-Server für KI-Selfhosting: Hetzner GEX44 im Test, c't, 15.07.2026 (Vergleichszahlen GEX44)
  • René Peinl, Thomas Weber: Workstations mit 128 GB Unified Memory, iX 5/2026 (Einordnung der Geräteklasse)
  • Eigene Messungen vom 28.07.2026 auf einem Beelink GTR9 Pro, Ollama 0.32.5, je drei Durchläufe bei 256 Token Antwortlänge

Stichworte

Benchmarks & Evals Hardware Self-Hosting lokale KI

Kommentare

Noch keine Kommentare. Schreib den ersten.

Melde dich an, um zu kommentieren.