Glossar · Netzwerk und Multi-Node
Wissensstufe: SpezialwissenRoCEnante
RoCEnante ist der Projektname von AI SolutionX für die experimentelle Multi-Node-KI-Architektur aus vier DGX Spark, verbunden über ein RoCE-fähiges Netzwerk.
Einfach erklärt
Ein Projektname fasst zusammen, was sonst eine lange Aufzählung wäre. Statt jedes Mal „vier DGX Spark, RoCE-Netz, Tensor Parallelism, ein gemeinsamer Endpunkt“ zu sagen, steht RoCEnante für das Vorhaben als Ganzes, so wie ein Bauprojekt einen Namen trägt, bevor das Gebäude fertig ist.
Was technisch passiert
Hinter dem Namen steht keine eigene Technik, sondern das Zusammenspiel bekannter Bausteine. Vier NVIDIA DGX Spark mit je einem GB10 und 128 GB Unified Memory sind über ein RoCE-fähiges Netzwerk verbunden: 200-Gbit-Verbindungen je Pfad, zusammengeführt auf einem 400-Gbit-Switch. Per Tensor Parallelism mit TP = 4 hält jedes System einen Teil der Modellgewichte und berechnet seinen Anteil jedes Layers. Die Teilergebnisse werden mit All-Reduce und All-Gather über RDMA abgeglichen. SGLang bildet die Serving-Schicht und stellt den Verbund als einen OpenAI-kompatiblen Endpunkt bereit.
Das Ziel ist, ein Sprachmodell lokal zu betreiben, dessen Gewichte auf keinem einzelnen System Platz finden; im Verbund stehen 512 GB Unified Memory zur Verfügung.
In der Praxis
RoCEnante ist ein Forschungsaufbau, keine Produktionsfreigabe und kein Standardprodukt. AI SolutionX trennt dabei drei Stufen: veröffentlichte Referenzwerte, eigene Reproduktionsmessungen und produktionsreife Freigaben. Die auf der Projektseite genannten Durchsatzwerte sind veröffentlichte Referenzwerte von MiaAI-Lab, keine eigenen Messungen; deren Reproduktion ist der nächste Laborschritt.
Offen und noch zu belegen sind laut Projektseite:
- Stabilität bei gemischter Langzeitlast
- semantisch korrekte Ergebnisse über alle Ranks
- Verhalten bei Paketverlust und Node-Ausfall
- Vorteil gegenüber dem NCCL-Fallback
- Energie und Kosten pro vollständiger Anfrage
Für Kundenprojekte gilt die hybride Sicht der Projektseite: schnelle Einzelmodelle für Routineaufgaben, ein verteilter Verbund nur dort, wo Modellgröße, Qualität oder Kontext es rechtfertigen.
Wann ist das sinnvoll?
- Wenn Sie verfolgen möchten, ob sehr große Modelle auf kompakter lokaler Hardware praxistauglich werden, ist RoCEnante der Ort, an dem AI SolutionX das prüft.
- Wenn ein Vorhaben ein Modell verlangt, das nicht auf ein einzelnes System passt, und die Daten das Haus nicht verlassen dürfen, lohnt das Gespräch über den Stand der Erkenntnisse.
- Wenn ein produktiver Betrieb mit Verfügbarkeitszusagen gebraucht wird, ist ein Forschungsaufbau nicht die richtige Grundlage, solange die offenen Punkte nicht belegt sind.
Nicht verwechseln mit
- RoCE
- RoCE ist ein Netzwerkprotokoll für direkten Speicherzugriff über Ethernet. RoCEnante ist kein Protokoll und keine Transportoptimierung, sondern der Name eines Forschungsprojekts, das RoCE als eine seiner Komponenten nutzt.
- Referenzimplementierung von MiaAI-Lab
- Die Durchsatzwerte auf der Projektseite stammen aus einer veröffentlichten Implementierung von MiaAI-Lab. RoCEnante ist nicht diese Implementierung und stammt nicht aus ihr, sondern bezeichnet den eigenen Aufbau von AI SolutionX, der die Werte reproduzieren soll.
Quellen
- AI SolutionX: Vier DGX Sparks. Ein Modell. (Projektseite) · abgerufen am
- NVIDIA MLNX_OFED-Dokumentation: RDMA over Converged Ethernet (RoCE) · abgerufen am
- SGLang-Dokumentation: Multi-Node Deployment · abgerufen am
Fachlich geprüft am · Alle Begriffe im Glossar