Ein interner KI-Assistent durchsucht Verträge, beantwortet Fragen zum Firmenwissen und entwirft Antworten auf Kundenmails. Soll er mit vertraulichen Daten arbeiten, kann ein lokal betriebenes KI-Sprachmodell attraktiv sein: Die Texte müssen dann für die Verarbeitung nicht an einen externen KI-Dienst in der Cloud gehen. Dafür übernimmt das Unternehmen selbst den Betrieb. Welche Hardware sinnvoll ist, hängt weniger vom größten verfügbaren Modell ab als davon, wie viele Menschen (oder Agents) gleichzeitig arbeiten und wie schnell sie eine Antwort brauchen.
Fünf Hardwareprofile kommen dafür infrage: eine professionelle NVIDIA-Grafikkarte im Server, der kompakte DGX Spark, zwei Mac-Studio-Ausführungen und Mini-PCs mit AMD Ryzen AI Max+ 395 beziehungsweise PRO 395. Sie unterscheiden sich vor allem darin, wie viel Speicher ein Modell belegen darf und wie schnell dieser Speicher die Recheneinheit versorgt. Beides zählt; für einen Chat mit einer Person anders als für eine Mail-Automatisierung, die Dutzende Vorgänge nacheinander bearbeitet.
Erst das Modell und den Arbeitsablauf festlegen
Bei der Inferenz erzeugt ein bereits trainiertes Modell Antworten. Die Zahl hinter dem Modellnamen gibt grob seine Parameterzahl an: 12B steht für etwa zwölf Milliarden Parameter. Googles Gemma 4 12B kann etwa für Zusammenfassungen oder die Analyse von Dokumenten erprobt werden; Qwen3.8-27B liegt eine Größenklasse darüber. Ein 70B-Modell wie Llama 3.3 70B dient als bekannte Größenreferenz, ist aber etwas in die Jahre gekommen. Bei rund 120B wird es anspruchsvoller: Qwen3.5-122B-A10B bleibt ein Beispiel dieser Klasse, während die neuere Qwen3.8-Reihe ein aktuelles 27B-Modell bietet. Das 122B-Modell ist ein Mixture of Expert Modell und aktiviert pro Verarbeitungsschritt nur einen Teil seiner Parameter. Trotzdem müssen seine Gewichte im Arbeitsspeicher liegen. Gleiche Parameterzahl bedeutet deshalb weder gleiche Geschwindigkeit noch gleiche Antwortqualität.
Auch der Speicherbedarf lässt sich nicht direkt am Namen ablesen. Bei einer vereinfachten Rechnung benötigen 12B Gewichte mit vier Bit pro Parameter rund sechs Gigabyte, 27B rund 14, 70B rund 35 und 120B rund 60 Gigabyte. Diese Zahlen beschreiben nur die Gewichte; ein betriebsbereites Modell braucht mehr Platz. Quantisierung spart allerdings Speicher, indem sie Modellwerte mit weniger Bits ablegt; außerdem belegen Formatdetails, Verarbeitung und Gesprächsverlauf Speicher. Für ein 70B-Modell sind 96 GB Grafikspeicher deshalb komfortabler als die bloße Gewichtsrechnung vermuten lässt, während eine 120B-Variante je nach Format und Kontext bereits sorgfältige Planung verlangt.
Für eine interne Wissenssuche lohnt sich oft ein kleineres Modell. Bei RAG, bei der vor dem Antworten Firmenbezogene Dokumente mit einbezogen werden, zählt auch, ob die richtigen und aktuellen Textstellen gefunden werden. Wenn ein 12B- oder 27B-Modell diese Belege zuverlässig verarbeitet, bringt seine kürzere Wartezeit im Alltag mehr als ein größeres Modell mit langen Denkpausen. Bei komplexen Rechts- oder Vertragsfragen sollte ohnehin ein Mensch prüfen, was das System aus den Dokumenten ableitet.
Warum 128 GB nicht automatisch schneller sind als 96 GB
Die RTX PRO 6000 Blackwell Workstation Edition hat 96 GB eigenen GDDR7-Grafikspeicher mit 1.792 GB/s nomineller Bandbreite. NVIDIA nennt für die Karte bis zu 600 Watt Leistungsaufnahme; CPU, RAM und übriger Server kommen hinzu. Ihr Vorteil liegt dort, wo ein Modell vollständig in diesen Grafikspeicher passt und viele Anfragen zügig bedient werden sollen. CUDA und darauf aufbauende Server-Software wie vLLM erleichtern den Einsatz verbreiteter NVIDIA-Inferenzverfahren.
Der DGX Spark bringt dagegen 128 GB gemeinsamen Speicher für CPU und GPU in einem kleinen Komplettsystem mit. Seine Speicherbandbreite beträgt 273 GB/s. Ein größeres Modell kann hier Platz finden, obwohl es nicht vollständig in die 96 GB einer RTX PRO 6000 passt. Während der Antwortgenerierung müssen Modellgewichte aber immer wieder aus dem Speicher gelesen werden. Die wesentlich höhere Bandbreite der großen Grafikkarte kann ein passendes Modell daher schneller versorgen. Bandbreite allein ist kein Geschwindigkeitswert: Rechenleistung, Modellarchitektur, Quantisierung und Software entscheiden mit.
ServeTheHome maß beim DGX Spark bei seinen LLM-Aufgaben etwa 60 bis 90 Watt für das gesamte Gerät und verwies zugleich auf die begrenzte Speicherbandbreite. Das sind Messungen eines konkreten Testaufbaus, keine Stromrechnung für jeden Arbeitsalltag. Das mitgelieferte Netzteil ist für 240 Watt ausgelegt; dieser Wert ist ebenso wenig der typische Verbrauch. Spark ist interessant, wenn ein Team große Modelle lokal ausprobieren und dabei im NVIDIA-Ökosystem bleiben will. Als stark ausgelasteter Mehrnutzer-Server sollte er erst nach einem Test mit den eigenen Anfragen eingeplant werden.
Mac Studio: viel shared Memory, anderes Software-Ökosystem
Im Mac Studio mit M5 Max teilen sich CPU und GPU ebenfalls den Arbeitsspeicher. Die hier betrachtete 128-GB-Konfiguration setzt den größeren 40-Core-GPU-Chip voraus; dessen Bandbreite beträgt laut Apple 614 GB/s. Das Basismodell mit 32-Core-GPU hat dagegen 36 GB und 460 GB/s. Wer nur den Einstiegspreis vergleicht, vergleicht also nicht das hier besprochene Gerät. Außerdem stehen von den 128 GB nicht sämtliche Bytes ausschließlich dem Modell zur Verfügung: macOS und andere Programme brauchen ebenfalls Platz.
Auf dem Mac erleichtern Metal als Grafikschnittstelle und Apples MLX-LM den Betrieb passender Modelle. Ein Entwicklerteam, das ohnehin Macs nutzt und Modelle lokal anpasst oder testet, kann damit ohne separaten Linux-GPU-Server beginnen. Für einen zentralen Dienst mit vielen parallelen Nutzern muss es die gewünschte Modellversion und Server-Software aber selbst unter Last prüfen; ein reichhaltiges CUDA-Ökosystem lässt sich nicht eins zu eins auf macOS übertragen.
Wer deutlich größere Modelle möglichst ohne Verteilung auf mehrere Rechner laden will, findet im Mac Studio mit M5 Ultra eine Sonderklasse. Apple nennt 1,2 TB/s Bandbreite und einen Ausbau auf 256 GB gemeinsamen Speicher. Die angekündigte 512-GB-Option soll erst Ende Oktober erhältlich sein; sie erfordert die größere Chipkonfiguration. Das Ultra-Basismodell hat 96 GB. Mehr Kapazität eröffnet Spielraum für sehr große Modelle und längere Chat-Kontexte, rechtfertigt den Aufpreis aber nicht für jeden internen Assistenten. Apples Angabe von maximal 480 Watt für den Mac Studio beschreibt eine Obergrenze des Systems, keinen gemessenen LLM-Verbrauch. Für die gerade erst erschienene M5-Generation sind ältere M3- oder M4-Tests keine belastbaren M5-Geschwindigkeitswerte.
Ryzen AI Max+: günstiger Einstieg nur bei passendem Gesamtpaket
Mini-PCs mit Ryzen AI Max+ 395 oder Max+ PRO 395 können ebenfalls mit 128 GB gemeinsamem Speicher angeboten werden. Die PRO-Ausführung ist für kommerzielle Geräte positioniert; ob ein konkreter Rechner 128 GB hat, entscheidet der Hersteller des Komplettsystems. Typische LPDDR5X-8000-Konfigurationen erreichen rechnerisch bis zu etwa 256 GB/s Bandbreite, deutlich weniger als der M5 Max oder die RTX-Karte. Für lokale Experimente und einzelne größere Modelle ist das interessant, für kurze Antwortzeiten unter starker Last weniger selbstverständlich. Bei 120B-Größe zählt zudem die Aufteilung des gemeinsamen Speichers: In einem AMD-Test mit Ollama lief Qwen3.5-122B-A10B in einer 128-GB-Maschine teils auf der GPU, teils auf der CPU.
Der Kaufpreis kann unter dem der Hochleistungsalternativen liegen, doch Angebote unterscheiden sich bei RAM, SSD, Netzwerk und Support erheblich. ServeTheHome testete einen 128-GB-Beelink mit einem 120B-Modell und maß dabei rund 125 bis 128 Watt für das ganze System. Der Test berichtete auch von vorinstallierter Software und zeitweiligen Treiberproblemen beim Netzwerkadapter. Das betrifft genau diesen Rechner, nicht jeden AMD-PC. Unter Linux müssen IT-Teams vor dem Kauf klären, ob ihre gewünschte ROCm-Version und Inferenzsoftware die konkrete integrierte Radeon-Grafik tatsächlich unterstützen; als niedrigschwelliger Anfang eignet sich gegebenenfalls llama.cpp beziehungsweise eine darauf aufbauende Oberfläche. Die ROCm-Dokumentation für RDNA-3.5-APUs zeigt, dass Speicherkonfiguration und Kernel eine Rolle spielen.
Ein Chat ist noch kein Unternehmensdienst
Wenn mehrere Beschäftigte gleichzeitig das Modell nutzen, reicht es nicht, dass das Modell einmal in den Speicher passt. Jeder laufende Chat hält Teile seines bisherigen Textes als Zwischenergebnis vor, den sogenannten KV-Cache. Lange Dokumente und mehrere Sitzungen füllen diesen Speicher zusätzlich. Außerdem konkurrieren Nutzer um Rechenzeit und Bandbreite. Ein einzelner Chat kann flüssig wirken, während zur gleichen Zeit gestartete Anfragen warten. Server wie llama.cpp und vLLM bieten Verfahren zur parallelen Verarbeitung; sie schaffen aber keinen zusätzlichen physischen Speicher.
Ein sinnvoller Test für einen KMU-Assistenten umfasst deshalb die tatsächlich eingesetzten Dokumente, die übliche Länge der Fragen und mehrere gleichzeitige Nutzer. Gemessen werden sollten die Wartezeit bis zum ersten Antwortzeichen, die Lesegeschwindigkeit der Antwort und die Zahl der erledigten Anfragen pro Minute. Bei Mail-Automatisierung und Agenten, die mehrmals hintereinander ein Modell aufrufen, zählt die Dauer des gesamten Vorgangs. Zugriffsschutz, Protokollierung, gesicherte Dokumentenquellen, Wiederanlauf und ein Supportweg gehören zur Kalkulation. Lokal betrieben heißt nicht automatisch sicher: Auch ein interner Dienst braucht Rechteverwaltung und eine Prüfung, welche Aktionen ein Agent ausführen darf.
Vergleich und Entscheidungshilfe
| Plattform | Speicher und nominelle Bandbreite | Strom und Kosten | Passendes Einsatzprofil |
|---|---|---|---|
| RTX PRO 6000 Blackwell im Server | 96 GB eigener GPU-Speicher; 1.792 GB/s | GPU bis 600 W, dazu Server; hohe Anschaffungskosten | Schnelle Antworten und mehrere Nutzer, sofern das Modell in den GPU-Speicher passt |
| DGX Spark / GB10 | 128 GB gemeinsam; 273 GB/s | Kompaktsystem, 240-W-Netzteil; Preis des Komplettgeräts prüfen | Größere Modelle entwickeln und erproben, NVIDIA-Software nutzen |
| Mac Studio M5 Max, 40-Core-GPU | 128 GB gemeinsam; 614 GB/s | Komplettrechner; 128-GB-Ausbau kostet zusätzlich | Lokale Modelle im Apple-/MLX-Umfeld |
| Ryzen AI Max+ 395 / PRO 395 | Bis 128 GB gemeinsam; etwa 256 GB/s bei LPDDR5X-8000 | Anbieterabhängiger Mini-PC; Leistungsaufnahme und Support variieren | Preisbewusster Einstieg mit großen Modellen bei geringer bis mittlerer Last |
| Mac Studio M5 Ultra | 256 GB gemeinsam; 512 GB angekündigt für Ende Oktober; 1,2 TB/s | Teure Ausbaustufe; Apple nennt maximal 480 W für das System | Sehr große Modelle und großer Speicherbedarf ohne mehrere Rechner |
Aus den Bandbreiten und Speichergrößen lässt sich keine allgemeine Geschwindigkeitsreihenfolge ableiten. Gerade die neuen M5-Macs sollten Unternehmen mit demselben Modell, derselben Quantisierung und der erwarteten Zahl paralleler Anfragen gegen ihre Alternativen testen. Vor einer Bestellung empfiehlt sich ein kleiner Assistent mit echten Aufgaben: Erst wenn Qualität, Antwortzeit und Last bekannt sind, zeigt sich, ob mehr Grafikkartentempo, ein kompakter 128-GB-Rechner oder außergewöhnlich viel Modellspeicher den höheren Preis rechtfertigt.
Quellen
- NVIDIA: RTX PRO 6000 Blackwell Workstation Edition, Spezifikationen; DGX Spark, Produktseite; DGX Spark: Bandbreite und Inferenz.
- Apple: Mac Studio M5 Max/M5 Ultra, technische Daten; Ankündigung mit Verfügbarkeit der 512-GB-Variante; Verkaufsstart im September 2026.
- AMD: Ryzen AI Max+ PRO 395; ROCm-Praxistest mit Qwen3.5; ROCm: RDNA-3.5-Systemoptimierung.
- Hugging Face: Gemma 4 12B, Qwen3.8-27B, Qwen3.5-122B-A10B, Llama 3.3 70B.
- ServeTheHome: DGX-Spark-Praxistest; Ryzen-AI-Max+-Systemtest; Apple MLX-LM; llama.cpp-Server.