Lokale KI
Wissensstufe: GrundlageLokale KI bezeichnet KI-Modelle, die auf eigener oder selbst kontrollierter Hardware rechnen, statt über die Schnittstelle eines externen Cloud-Anbieters.
auch: Local AI, Lokale Sprachmodelle
Glossar
Fachbegriffe zu lokaler KI, verteilter Inferenz, GPU-Systemen, RAG und souveräner KI — erklärt anhand unseres eigenen Forschungsaufbaus.
Wo es passt, zeigen wir, wo ein Begriff in unserem Aufbau aus vier NVIDIA DGX Spark konkret vorkommt. Mehr dazu im Bereich Forschung & Entwicklung.
KI-Verarbeitung auf eigener oder kontrollierter Infrastruktur
Lokale KI bezeichnet KI-Modelle, die auf eigener oder selbst kontrollierter Hardware rechnen, statt über die Schnittstelle eines externen Cloud-Anbieters.
auch: Local AI, Lokale Sprachmodelle
Wie ein Sprachmodell Antworten erzeugt und verteilt gerechnet wird
Durchsatz ist die Menge an Tokens, die ein Inferenzsystem pro Sekunde über alle gleichzeitig laufenden Anfragen hinweg erzeugt.
auch: Throughput, Tokens pro Sekunde aggregiert
Kollektivoperationen sind Kommunikationsschritte, an denen alle Prozesse einer Gruppe gleichzeitig teilnehmen, etwa um Teilergebnisse zu summieren oder zu verteilen.
auch: All-Reduce, All-Gather, Collectives
Verwandt
Das Kontextfenster ist die größte Zahl an Tokens, die ein Sprachmodell in einer Anfrage zugleich berücksichtigen kann, Eingabe und Antwort zusammen.
auch: Context Window, Kontextlänge
Latenz ist die Wartezeit zwischen Anfrage und Reaktion; bei Sprachmodellen meist die Zeit bis zum ersten Token und der Abstand zwischen den folgenden Tokens.
auch: Antwortzeit, Time to First Token, TTFT
Verwandt
Modellgewichte sind die im Training gelernten Zahlenwerte eines neuronalen Netzes; sie bestimmen sein Verhalten und belegen beim Betrieb den Großteil des Speichers.
auch: Weights, Parameter
Verwandt
Multi-Node-Inferenz bedeutet, dass ein Sprachmodell auf mehrere über ein Netzwerk verbundene Rechner verteilt wird, die gemeinsam jede Antwort berechnen.
auch: Verteilte Inferenz, Distributed Inference, Network Fabric
Prefill und Decode sind die zwei Phasen der Inferenz: Erst wird die gesamte Eingabe auf einmal verarbeitet, danach entsteht die Antwort Token für Token.
auch: Prefill-Phase, Decode-Phase
Verwandt
Ein Rank ist die laufende Nummer eines Prozesses in einer verteilten Berechnung, meist genau einer GPU zugeordnet, über die sich die Beteiligten ansprechen.
auch: Worker, Prozessrang
Verwandt
SGLang ist ein Open-Source-Framework, das Sprachmodelle als Dienst bereitstellt: Es lädt das Modell, verwaltet Anfragen und bietet eine OpenAI-kompatible API.
auch: Serving Engine, OpenAI-kompatible API
Ein Shard ist ein abgegrenzter Teil eines größeren Datenbestands, etwa der Anteil der Modellgewichte, den ein einzelnes System bei verteilter Inferenz speichert.
auch: Modell-Shard, Partition
Verwandt
Tensor Parallelism teilt die Gewichtsmatrizen jeder Schicht eines Modells auf mehrere GPUs auf, die ihren Anteil derselben Rechnung gleichzeitig ausführen.
auch: Tensorparallelismus, TP, TP = 4
Ein Token ist die kleinste Texteinheit, mit der ein Sprachmodell rechnet, meist ein Wortteil, ein kurzes Wort oder ein Satzzeichen.
auch: Tokens, Tokens pro Sekunde
Verwandt
Hardware, auf der Modelle liegen und rechnen
Der KV-Cache speichert Zwischenwerte (Keys und Values) bereits verarbeiteter Tokens, damit das Modell sie für jedes neue Token nicht erneut berechnen muss.
auch: Key-Value-Cache
NVIDIA DGX Spark ist ein kompakter KI-Rechner für den Schreibtisch, in dessen Chip GB10 sich CPU und GPU 128 GB Unified Memory teilen.
auch: GB10, Grace Blackwell GB10
Unified Memory ist ein Speicher, den CPU und GPU gemeinsam adressieren, sodass beide mit denselben Daten arbeiten, ohne sie zwischen zwei Speichern zu kopieren.
auch: Gemeinsamer Speicher, Shared Memory (CPU/GPU)
Was mehrere Rechner zu einem Inferenzsystem verbindet
NCCL (NVIDIA Collective Communications Library) ist eine Softwarebibliothek, die den Datenaustausch zwischen GPUs in einem oder mehreren Rechnern organisiert.
auch: NVIDIA Collective Communications Library
Verwandt
RDMA (Remote Direct Memory Access) lässt einen Rechner über das Netzwerk direkt im Speicher eines anderen Rechners lesen und schreiben, ohne dessen CPU zu belasten.
auch: Remote Direct Memory Access
Verwandt
RoCE (RDMA over Converged Ethernet) ist ein Netzwerkprotokoll, mit dem Rechner über Ethernet direkt auf den Arbeitsspeicher anderer Rechner zugreifen.
auch: RDMA over Converged Ethernet
RoCEnante ist der Projektname von AI SolutionX für die experimentelle Multi-Node-KI-Architektur aus vier DGX Spark, verbunden über ein RoCE-fähiges Netzwerk.
Eigene Dokumente als Wissensquelle für Sprachmodelle
Ein Embedding ist ein Zahlenvektor, den ein Modell aus einem Text berechnet, sodass inhaltlich ähnliche Texte ähnliche Vektoren erhalten.
auch: Einbettung, Vektorrepräsentation
Retrieval-Augmented Generation ist ein Verfahren, bei dem ein Sprachmodell vor der Antwort passende Textstellen aus einem Dokumentenbestand erhält und sie nutzt.
auch: RAG
Vektorsuche findet Texte nach inhaltlicher Ähnlichkeit, indem sie Anfrage und Dokumente als Zahlenvektoren vergleicht, statt nach gleichen Wörtern zu suchen.
auch: Hybridsuche, Semantische Suche, Vektordatenbank
Wo Daten liegen und wer über Modelle und Betrieb entscheidet
Datenresidenz bezeichnet den geografischen Ort, an dem Daten gespeichert und verarbeitet werden, sagt aber allein nichts darüber, wer auf sie zugreifen kann.
auch: Data Residency, Datenstandort
Verwandt
On-Premise-KI läuft auf Hardware im eigenen Haus; souveräne KI meint darüber hinaus die Kontrolle über Daten, Modelle, Betrieb und die Wahl des Anbieters.
auch: On-Premise AI, Sovereign AI, Souveräne KI
Welche Begriffe in Ihrem Projekt eine Rolle spielen, klären wir im Erstgespräch.
Erstgespräch vereinbaren