AI SolutionX

Forschung & Entwicklung · Local AI Lab

Vier DGX Sparks. Ein Modell.

AI SolutionX erforscht verteilte lokale KI-Inferenz auf vier NVIDIA DGX Spark. 512 GB Unified Memory, 200-Gbit-Verbindungen und ein 400-Gbit-Switch – für Modelle, die auf keinem einzelnen System Platz finden.

  • Daten bleiben lokal
  • OpenAI-kompatible API
  • Kein Cloud Lock-in

Kurz zusammengefasst

AI SolutionX betreibt in Leonberg einen Forschungsaufbau aus vier NVIDIA DGX Spark, die über ein 400-Gbit-RoCE-Fabric zu einem Inferenzsystem verbunden sind. Per Tensor Parallelism (TP = 4) verteilt SGLang ein einzelnes Sprachmodell auf alle vier Systeme mit zusammen 512 GB Unified Memory; nach außen erscheint der Verbund als ein OpenAI-kompatibler Endpunkt. Ziel ist lokale Inferenz für Modelle, die auf keinem einzelnen System Platz finden. Die auf dieser Seite genannten Durchsatzwerte sind veröffentlichte Referenzwerte der Implementierung von MiaAI-Lab; eigene Reproduktionsmessungen stehen aus.

Stand: · Status: Forschungsaufbau

Nicht vier Server. Ein Rechensystem.

Große Modelle werden verteilt – Token für Token synchronisiert.

Tensor Parallelism zerlegt ein Modell über alle vier GB10-Systeme. RoCE transportiert die Zwischenergebnisse mit sehr geringer Latenz. Bei AI SolutionX läuft dieser Aufbau unter dem Projektnamen RoCEnante.

NVIDIA DGX Spark mit GB10
4 ×
Unified Memory im Verbund
512 GB
Netzwerkverbindung je Pfad
200 G
Switching-Kapazität im AI-Lab
400 G
TP = 4

Das Modell liegt auf vier Systemen

Vier Shards teilen sich die Gewichte. Jeder Knoten besitzt genau den Teil, den er für seine Berechnung benötigt.

Was die Referenzimplementierung zeigt

Aus „passt in den Speicher“ wird interaktive Inferenz.

Die folgenden Werte stammen aus der veröffentlichten DeepSeek-V4.1-Flash-TP4-Referenz auf vier DGX Sparks über ein geschaltetes RoCE-Fabric. Sie sind keine AISX-eigenen Abnahmemessungen – genau deren Reproduktion ist der nächste Laborschritt. Veröffentlicht als Open-Source-Dokumentation; abgerufen am 2. Oktober 2026.

Tokens/s · Prosa · 1 Stream Referenzwert TP4
87,7
Tokens/s · Code · 1 Stream Referenzwert TP4
124,8
Tokens/s aggregiert · 16 Streams Referenzwert TP4
342,7
Tokens Kontext im Needle-Test Referenzwert TP4
1 M

Quelle und technische Details: MiaAI-Lab · DeepSeek-V4.1-Flash auf 3×/4× DGX Spark

Konkrete Möglichkeiten

Lokale KI für Aufgaben, die bisher die Cloud verlangten.

Private RAG

Große vertrauliche Wissensräume

Verträge, technische Dokumentationen und interne Archive lokal analysieren – kombiniert mit Qdrant und hybrider Suche.

Software Engineering

Codebasen im großen Kontext

Architekturen, Abhängigkeiten und Migrationen über umfangreiche Repositories hinweg verstehen, ohne Quellcode nach außen zu übertragen.

Agentic Workloads

Mehrstufige Analyseketten

Recherche, Bewertung, Synthese und Qualitätskontrolle durch spezialisierte Agenten – über einen zentralen lokalen Modellendpunkt.

Sovereign AI

Kontrolle über Daten und Betrieb

Modelle, Logs, Prompts und Zugriffsregeln bleiben in der eigenen Infrastruktur. Planbare Kosten statt tokenbasierter Abhängigkeit.

Nicht jeder Auftrag braucht vier Sparks

Die stärkste Architektur ist hybrid.

Schnelle Einzelmodelle bearbeiten Routineaufgaben. Der Vier-Spark-Verbund übernimmt nur dann, wenn Modellgröße, Qualität oder Kontext es rechtfertigen.

Fast Lane

Einzelner Spark oder RTX 5090

Für Dialog, Klassifikation, Extraktion und viele parallele Standardanfragen.

  • Niedrige Antwortzeit
  • Unabhängig skalierbare Instanzen
  • Ollama, vLLM oder SGLang

Technisch ehrlich

Ein Forschungsaufbau – kein fertiges Standardprodukt.

Serving-Software und GB10-optimierte Kernel bewegen sich schnell. Deshalb trennt AI SolutionX veröffentlichte Referenzwerte, eigene Reproduktionsmessungen und produktionsreife Freigaben klar voneinander.

Häufige Fragen zum DGX-Spark-Verbund

Was ist ein DGX-Spark-Cluster?

Mehrere NVIDIA DGX Spark (GB10, je 128 GB Unified Memory), die über ein schnelles Netzwerk so verbunden sind, dass sie ein Sprachmodell gemeinsam ausführen. In unserem Aufbau sind es vier Systeme mit 200-Gbit-Verbindungen je Pfad und einem 400-Gbit-Switch, zusammen 512 GB Unified Memory.

Warum reicht ein einzelner DGX Spark nicht?

Ein einzelner DGX Spark hat 128 GB Unified Memory. Modelle, deren Gewichte darüber liegen, passen nicht in den Speicher eines Systems. Tensor Parallelism verteilt die Gewichte auf mehrere Systeme und macht solche Modelle lokal ausführbar.

Was bedeutet Tensor Parallelism mit TP = 4?

Jeder der vier Knoten hält einen Teil der Gewichte jedes Transformer-Layers und berechnet seinen Anteil parallel zu den anderen. All-reduce und All-gather führen die Teilergebnisse nach jedem Schritt über das Netzwerk zusammen. Das Modell bleibt dabei logisch eine Einheit.

Was ist RoCE, und was bedeutet RoCEnante?

RoCE steht für RDMA over Converged Ethernet: Systeme schreiben direkt in den Speicher des jeweils anderen, über Ethernet und mit sehr geringer Latenz. RoCEnante ist der von AI SolutionX geprägte Projektname für diese experimentelle Multi-Node-Architektur: vier DGX-Spark-Systeme, verbunden über ein RoCE-fähiges 200-/400-Gbit-Netzwerk.

Wie schnell ist der Verbund?

Die Referenzimplementierung von MiaAI-Lab nennt für vier DGX Spark mit TP = 4 rund 87,7 Tokens pro Sekunde für Prosa und 124,8 für Code in einem einzelnen Stream, 342,7 Tokens pro Sekunde aggregiert über 16 Streams sowie einen bestandenen Needle-Test mit einer Million Tokens Kontext. Das sind veröffentlichte Werte, keine eigenen Messungen von AI SolutionX; deren Reproduktion ist der nächste Schritt.

Können Unternehmen einen solchen Aufbau einsetzen?

Der Vier-Spark-Verbund ist ein Forschungsaufbau und kein Standardprodukt. Was wir für Unternehmen bauen, sind On-Premise-KI-Systeme, RAG-Architekturen und individuelle Anwendungen vom einzelnen GPU-Server bis zum verteilten Verbund — in der Regel hybrid: schnelle Einzelmodelle für Routineaufgaben, der Verbund nur dort, wo Modellgröße, Qualität oder Kontext es rechtfertigen.

Bleiben die Daten dabei lokal?

Ja. Modelle, Logs, Prompts und Zugriffsregeln bleiben in der eigenen Infrastruktur; Anwendungen sprechen einen OpenAI-kompatiblen Endpunkt im eigenen Netz an. Es gibt keine Cloud-API und keine nutzungsabhängige Abrechnung pro Anfrage.

Begriffe dieser Seite erklärt das Glossar.

Tobias Plehn, Geschäftsführer von AI SolutionX

Verantwortlich

Tobias Plehn, Dipl.-Inf. (FH), Geschäftsführer AI SolutionX, Sachverständiger für Datenschutz, Datensicherheit und Cyber-Security. Verantwortlich für Aufbau und Betrieb der lokalen KI-Plattform.

Local AI. Made in Leonberg.

Welche KI muss bei Ihnen lokal bleiben?

Wir entwickeln sichere On-Premise-KI-Systeme, RAG-Architekturen und individuelle Anwendungen – vom einzelnen GPU-Server bis zum verteilten Inferenzverbund.

Erstgespräch vereinbaren