AI SolutionX

Glossar · Modelle und Inferenz

Wissensstufe: Fortgeschritten

Multi-Node-Inferenz

Multi-Node-Inferenz bedeutet, dass ein Sprachmodell auf mehrere über ein Netzwerk verbundene Rechner verteilt wird, die gemeinsam jede Antwort berechnen.

Auch: Verteilte Inferenz, Distributed Inference, Network Fabric

Einfach erklärt

Ein Orchester spielt ein Stück gemeinsam, jede Gruppe ihre eigene Stimme. Damit daraus Musik wird, müssen alle nach jedem Takt wieder zusammen sein. Bei Multi-Node-Inferenz sind die Rechner die Instrumentengruppen, und das Netzwerk hält sie im Takt.

Was technisch passiert

Ein Modell lässt sich auf verschiedene Arten zerlegen. Bei Tensor Parallelism erhält jeder Knoten einen Teil der Gewichtsmatrizen jeder Schicht; alle rechnen gleichzeitig an derselben Schicht und tauschen danach ihre Teilergebnisse aus. Bei Pipeline Parallelism bekommt jeder Knoten einen Block aufeinanderfolgender Schichten, und die Daten wandern von einem Knoten zum nächsten. Mixture-of-Experts-Modelle lassen sich außerdem nach Experten aufteilen.

In allen Varianten wird Kommunikation zum Teil der Rechnung. Beim Tensor Parallelism fallen in jeder Schicht Kollektivoperationen wie All-Reduce an, und zwar für jedes einzelne erzeugte Token. Diese Transfers sind klein, aber zahlreich. Ihre Latenz summiert sich und bremst die Ausgabe stärker als eine knappe Bandbreite. Solche Aufbauten setzen deshalb auf RDMA-fähige Netze, im Ethernet also RoCE, statt den Weg über den TCP/IP-Stack des Betriebssystems zu nehmen.

Die Serving-Software koordiniert die Knoten. In SGLang wird das beim Start festgelegt: der Grad der Tensor-Parallelität, die Anzahl der Knoten, der Rang des jeweiligen Knotens und eine Adresse, über die sich alle beim Start finden. Auf jedem Knoten läuft derselbe Serverprozess, nur mit eigenem Rang.

In der Praxis

Der Forschungsverbund von AI SolutionX nutzt Tensor Parallelism über Gerätegrenzen hinweg: TP = 4, ein GB10 je Knoten, zusammen 512 GB Unified Memory. Die Teilergebnisse laufen per RoCE über 200-Gbit-Verbindungen und einen 400-Gbit-Switch. Anwendungen merken davon nichts, sie sprechen einen einzigen Endpunkt an. Offen und Gegenstand der laufenden Arbeit sind unter anderem das Verhalten bei Paketverlust oder dem Ausfall eines Knotens und die Stabilität unter wechselnder Dauerlast. Durchsatzzahlen auf der Projektseite stammen aus der veröffentlichten Referenzimplementierung von MiaAI-Lab; AI SolutionX hat sie nicht selbst gemessen.

Wann ist das sinnvoll?

  • Wenn ein Modell zu groß für den Speicher eines einzelnen Systems ist.
  • Wenn ein großes Modell aus Datenschutz- oder Kostengründen lokal laufen muss und ein Server mit mehreren GPUs nicht in Frage kommt.
  • Nicht, wenn lediglich mehr gleichzeitige Anfragen bedient werden sollen: Dafür genügen mehrere unabhängige Modellinstanzen.
  • Nur mit einem Netz, das sehr geringe Latenz liefert; über gewöhnliches Büro-Ethernet würde die Abstimmung zwischen den Knoten die Ausgabe stark ausbremsen.

Nicht verwechseln mit

Lastverteilung über mehrere Modellkopien (Request-Routing)
Dort hält jeder Rechner ein vollständiges Modell, und ein Router verteilt ganze Anfragen. Das erhöht die Zahl paralleler Anfragen, macht aber kein Modell ausführbar, das größer ist als ein einzelner Rechner.
Mehrere GPUs in einem Server
Im selben Gehäuse sind GPUs über schnelle interne Verbindungen gekoppelt. Bei Multi-Node-Inferenz läuft dieselbe Abstimmung über ein Netzwerk zwischen Geräten, deshalb werden Latenz und Bandbreite des Netzes zur bestimmenden Größe.
Network Fabric
Das Fabric ist das Netzwerk, über das die Knoten kommunizieren, nicht das Verfahren der Verteilung selbst. Beide Begriffe tauchen in Dokumentationen meist gemeinsam auf.

Verwandte Begriffe

Multi-Node-Inferenz Tensor Parallelism RoCE NVIDIA DGX Spark SGLang RoCEnante

Quellen

  1. SGLang Documentation: Multi-Node Deployment · abgerufen am
  2. DGX Spark User Guide: ConnectX-7 Networking · abgerufen am

Fachlich geprüft am · Alle Begriffe im Glossar