Produkt / Technologie

Enterprise-KI auf Ihrer Hardware

Eine lokale KI, die mit Ihrer Organisation wächst: vom kompakten Einstiegsserver bis zum hochverfügbaren Cluster. Zwei KI-Modell-Tiers, vollständig on-premises — vergleichbar mit kommerziellen Cloud-KI-Diensten, aber unter Ihrer Kontrolle.

Cluster-Architektur

Jede Schicht optimiert für ihren Zweck

Die Hardware skaliert mit Ihrer Nutzerzahl — von einem einzelnen GPU-Server (Einstieg) über den kompakten DGX-Spark-Cluster bis zum hochverfügbaren Rack-Setup. Die folgende Tabelle zeigt die logischen Schichten; die Compute-Schicht wächst dabei mit der gewählten Konfiguration (siehe unten).

Schicht Komponente Spezifikation Rolle
Compute 2× NVIDIA L40S → 4× DGX Spark 96 GB → 512 GB LLM Inference
Interconnect InfiniBand / Load-Balancer 200 Gbps (Cluster / HA) Node Fabric
Modell (Qualität) Qwen3.5-35B-A3B (MoE) 3,3B aktiv / 35B total, FP8 Sonnet-Tier Tasks
Modell (Durchsatz) Qwen3.5-4B FP8, Mamba+MoE Haiku-Tier Tasks
Inference Stack SGLang / vLLM CUDA, TRT-LLM, NCCL Request Routing
API Layer OpenAI-kompatible REST-API HTTPS, mTLS, JWT Auth Atlas-Integration
Applikation contboxx Atlas On-Premises Installation Wissensmanagement

Hardware-Konfigurationen

Drei Konfigurationen — skaliert mit Ihrer Größe

Die lokale KI läuft auf Ihrer eigenen Hardware — einmalige Anschaffung, keine laufenden Cloud-Kosten. Die passende Größe richtet sich nach Nutzerzahl und Nutzungsintensität: vom einzelnen GPU-Server für den Einstieg bis zum hochverfügbaren Cluster. Hardware ist nicht Teil der Lizenz und kann auch kundenseitig gestellt werden.

Einstieg · Baseline

Kompakter GPU-Server

bis ~250 Mitarbeiter

  • 2× NVIDIA L40S 48 GB (96 GB gesamt) — 864 GB/s je Karte
  • Je ein Modell-Tier pro Karte
  • 2U-Standardserver — kein Spezial-Rack, keine Wasserkühlung
  • Inkl. Next-Business-Day-Support, Redundanz optional
Cluster

4× NVIDIA DGX Spark

bis ~500 Mitarbeiter

  • 512 GB Unified Memory (4× 128 GB)
  • 200 Gbps InfiniBand RDMA-Fabric
  • Höhere Parallelität & Durchsatzreserve
  • Desktop-Formfaktor, ~1.000 W, Luftkühlung
Hochverfügbar · Mit Redundanz

2× Rack-Server, redundant

500+ Mitarbeiter

  • 2× redundante GPU-Server mit Load-Balancer
  • N+1-Ausfallsicherheit, SLA-fähig
  • GPU-Klasse skalierbar: L40S bis H100/H200
  • Für unternehmenskritischen Dauerbetrieb
NVIDIA DGX Spark Cluster — die Cluster-Konfiguration von contboxx Vault

Abgebildet: die Cluster-Konfiguration (4× NVIDIA DGX Spark).

Richtwerte zur Orientierung; die finale Auslegung erfolgt nach Lastprofil. Preise und Konfigurationsdetails finden Sie auf der Preisseite.

Zwei-Tier-Modellarchitektur

Der Cluster betreibt zwei LLM-Tiers gleichzeitig, abgestimmt auf die unterschiedlichen Verarbeitungsanforderungen von contboxx Atlas.

Sonnet-Tier — Tiefenverarbeitung

Qwen3.5-35B-A3B

Mixture-of-Experts mit nur 3,3 Mrd. aktiven von 35 Mrd. Parametern, FP8-quantisiert — läuft effizient auf einer einzelnen GPU. Für Aufgaben, bei denen Qualität, Nuance und Reasoning-Tiefe zählen:

  • Komplexe RAG-Anfragen
  • Langform-Zusammenfassungen
  • Dokumentübergreifende Synthese
  • Suchintent-Erkennung
  • Compliance-Analyse
  • Entwurfsgenerierung
  • Onboarding-Assistenz
Durchsatz: ~30–75 Tokens/s Parameter: 35B (3,3B aktiv) VRAM: ~30 GB (FP8)
Haiku-Tier — Schnellverarbeitung

Qwen3.5-4B

Kompaktes, FP8-quantisiertes Mamba+MoE-Modell mit großer Parallelitätsreserve. Für Routine-Operationen, die Geschwindigkeit statt tiefes Reasoning erfordern:

  • Volltextindexierung
  • Embedding-Generierung
  • Auto-Tagging & Klassifikation
  • Kurz-Q&A
  • Duplikaterkennung
  • Automatische Zusammenfassungen
Durchsatz: ~30–40 Tokens/s Erfolgsrate: 98,8 % VRAM: ~8 GB (FP8)

Performance & Kapazität

Durchsatz auf Enterprise-Niveau

Gemessen im mehrwöchigen Dauertest auf NVIDIA DGX Spark (GB10) unter realer Pipeline-Last:

Modell Tier Architektur Decode (Tok/s) Erfolgsrate
Qwen3.5-4B Speed-Tier Mamba+MoE · 4B 27–42 98,8 %
Qwen3.5-35B-A3B Quality-Tier MoE · 3,3B aktiv 28–77 95–100 %

Modellspeicher (FP8)

~40 GB

Gewichte beider Modell-Tiers (FP8)

Streaming

Echtzeit

Progressive Ausgabe nach erstem Token

Speculative Decoding

1,5–2× Speedup

EAGLE3, minimaler Genauigkeitsverlust

Software-Stack

Inference SGLang / vLLM — optimiert für kontinuierliches Batching und hohen Durchsatz, CUDA, TRT-LLM, NCCL
API OpenAI-kompatible REST-API (POST /v1/chat/completions) — Drop-in Replacement für bestehende Cloud-Integrationen
RAG Retrieval-Augmented Generation mit Vektordatenbank für semantische Suche, lokale Embedding-Generierung
Sicherheit mTLS, JWT-basierte Autorisierung, verschlüsselter Speicher, Audit-Logging, Netzwerkisolation
Netzwerk Vollständig Air-Gapped möglich — Internet nur für initialen Modell-Download erforderlich
Betriebssystem NVIDIA DGX OS (Ubuntu-basiert) mit definiertem Sicherheits-Patch-Zyklus

Verfügbarkeit & Zuverlässigkeit

Ausfallsicher durch Design

SGLang Inference Server läuft als systemd-Service mit automatischem Neustart bei Fehler
Graceful Model Failover: Bei Fehler im Sonnet-Tier fällt Atlas auf das Haiku-Tier zurück — eingeschränkt, aber funktionsfähig
DGX Spark Nodes laufen unabhängig; Ausfall eines Nodes degradiert den Service, eliminiert ihn aber nicht
Optionaler redundanter QM8700-Switch für vollständige Hochverfügbarkeit
NAS-Backup-System sichert Modellgewichte, Konfiguration und Indizes für Recovery bei Node-Ausfall

Technische Fragen? Wir haben Antworten.

Vereinbaren Sie ein technisches Gespräch mit unserem Architektur-Team.

Technisches Gespräch vereinbaren