Glossar · Modelle und Inferenz
Wissensstufe: FortgeschrittenMulti-Node-Inferenz
Multi-Node-Inferenz bedeutet, dass ein Sprachmodell auf mehrere über ein Netzwerk verbundene Rechner verteilt wird, die gemeinsam jede Antwort berechnen.
Auch: Verteilte Inferenz, Distributed Inference, Network Fabric
Einfach erklärt
Ein Orchester spielt ein Stück gemeinsam, jede Gruppe ihre eigene Stimme. Damit daraus Musik wird, müssen alle nach jedem Takt wieder zusammen sein. Bei Multi-Node-Inferenz sind die Rechner die Instrumentengruppen, und das Netzwerk hält sie im Takt.
Was technisch passiert
Ein Modell lässt sich auf verschiedene Arten zerlegen. Bei Tensor Parallelism erhält jeder Knoten einen Teil der Gewichtsmatrizen jeder Schicht; alle rechnen gleichzeitig an derselben Schicht und tauschen danach ihre Teilergebnisse aus. Bei Pipeline Parallelism bekommt jeder Knoten einen Block aufeinanderfolgender Schichten, und die Daten wandern von einem Knoten zum nächsten. Mixture-of-Experts-Modelle lassen sich außerdem nach Experten aufteilen.
In allen Varianten wird Kommunikation zum Teil der Rechnung. Beim Tensor Parallelism fallen in jeder Schicht Kollektivoperationen wie All-Reduce an, und zwar für jedes einzelne erzeugte Token. Diese Transfers sind klein, aber zahlreich. Ihre Latenz summiert sich und bremst die Ausgabe stärker als eine knappe Bandbreite. Solche Aufbauten setzen deshalb auf RDMA-fähige Netze, im Ethernet also RoCE, statt den Weg über den TCP/IP-Stack des Betriebssystems zu nehmen.
Die Serving-Software koordiniert die Knoten. In SGLang wird das beim Start festgelegt: der Grad der Tensor-Parallelität, die Anzahl der Knoten, der Rang des jeweiligen Knotens und eine Adresse, über die sich alle beim Start finden. Auf jedem Knoten läuft derselbe Serverprozess, nur mit eigenem Rang.
In der Praxis
Der Forschungsverbund von AI SolutionX nutzt Tensor Parallelism über Gerätegrenzen hinweg: TP = 4, ein GB10 je Knoten, zusammen 512 GB Unified Memory. Die Teilergebnisse laufen per RoCE über 200-Gbit-Verbindungen und einen 400-Gbit-Switch. Anwendungen merken davon nichts, sie sprechen einen einzigen Endpunkt an. Offen und Gegenstand der laufenden Arbeit sind unter anderem das Verhalten bei Paketverlust oder dem Ausfall eines Knotens und die Stabilität unter wechselnder Dauerlast. Durchsatzzahlen auf der Projektseite stammen aus der veröffentlichten Referenzimplementierung von MiaAI-Lab; AI SolutionX hat sie nicht selbst gemessen.
Wann ist das sinnvoll?
- Wenn ein Modell zu groß für den Speicher eines einzelnen Systems ist.
- Wenn ein großes Modell aus Datenschutz- oder Kostengründen lokal laufen muss und ein Server mit mehreren GPUs nicht in Frage kommt.
- Nicht, wenn lediglich mehr gleichzeitige Anfragen bedient werden sollen: Dafür genügen mehrere unabhängige Modellinstanzen.
- Nur mit einem Netz, das sehr geringe Latenz liefert; über gewöhnliches Büro-Ethernet würde die Abstimmung zwischen den Knoten die Ausgabe stark ausbremsen.
Nicht verwechseln mit
- Lastverteilung über mehrere Modellkopien (Request-Routing)
- Dort hält jeder Rechner ein vollständiges Modell, und ein Router verteilt ganze Anfragen. Das erhöht die Zahl paralleler Anfragen, macht aber kein Modell ausführbar, das größer ist als ein einzelner Rechner.
- Mehrere GPUs in einem Server
- Im selben Gehäuse sind GPUs über schnelle interne Verbindungen gekoppelt. Bei Multi-Node-Inferenz läuft dieselbe Abstimmung über ein Netzwerk zwischen Geräten, deshalb werden Latenz und Bandbreite des Netzes zur bestimmenden Größe.
- Network Fabric
- Das Fabric ist das Netzwerk, über das die Knoten kommunizieren, nicht das Verfahren der Verteilung selbst. Beide Begriffe tauchen in Dokumentationen meist gemeinsam auf.
Quellen
- SGLang Documentation: Multi-Node Deployment · abgerufen am
- DGX Spark User Guide: ConnectX-7 Networking · abgerufen am
Fachlich geprüft am · Alle Begriffe im Glossar