Produkt / Technologie
Enterprise-KI auf Ihrer Hardware
Eine lokale KI, die mit Ihrer Organisation wächst: vom kompakten Einstiegsserver bis zum hochverfügbaren Cluster. Zwei KI-Modell-Tiers, vollständig on-premises — vergleichbar mit kommerziellen Cloud-KI-Diensten, aber unter Ihrer Kontrolle.
Cluster-Architektur
Jede Schicht optimiert für ihren Zweck
Die Hardware skaliert mit Ihrer Nutzerzahl — von einem einzelnen GPU-Server (Einstieg) über den kompakten DGX-Spark-Cluster bis zum hochverfügbaren Rack-Setup. Die folgende Tabelle zeigt die logischen Schichten; die Compute-Schicht wächst dabei mit der gewählten Konfiguration (siehe unten).
| Schicht | Komponente | Spezifikation | Rolle |
|---|---|---|---|
| Compute | 2× NVIDIA L40S → 4× DGX Spark | 96 GB → 512 GB | LLM Inference |
| Interconnect | InfiniBand / Load-Balancer | 200 Gbps (Cluster / HA) | Node Fabric |
| Modell (Qualität) | Qwen3.5-35B-A3B (MoE) | 3,3B aktiv / 35B total, FP8 | Sonnet-Tier Tasks |
| Modell (Durchsatz) | Qwen3.5-4B | FP8, Mamba+MoE | Haiku-Tier Tasks |
| Inference Stack | SGLang / vLLM | CUDA, TRT-LLM, NCCL | Request Routing |
| API Layer | OpenAI-kompatible REST-API | HTTPS, mTLS, JWT Auth | Atlas-Integration |
| Applikation | contboxx Atlas | On-Premises Installation | Wissensmanagement |
Hardware-Konfigurationen
Drei Konfigurationen — skaliert mit Ihrer Größe
Die lokale KI läuft auf Ihrer eigenen Hardware — einmalige Anschaffung, keine laufenden Cloud-Kosten. Die passende Größe richtet sich nach Nutzerzahl und Nutzungsintensität: vom einzelnen GPU-Server für den Einstieg bis zum hochverfügbaren Cluster. Hardware ist nicht Teil der Lizenz und kann auch kundenseitig gestellt werden.
Kompakter GPU-Server
bis ~250 Mitarbeiter
- 2× NVIDIA L40S 48 GB (96 GB gesamt) — 864 GB/s je Karte
- Je ein Modell-Tier pro Karte
- 2U-Standardserver — kein Spezial-Rack, keine Wasserkühlung
- Inkl. Next-Business-Day-Support, Redundanz optional
4× NVIDIA DGX Spark
bis ~500 Mitarbeiter
- 512 GB Unified Memory (4× 128 GB)
- 200 Gbps InfiniBand RDMA-Fabric
- Höhere Parallelität & Durchsatzreserve
- Desktop-Formfaktor, ~1.000 W, Luftkühlung
2× Rack-Server, redundant
500+ Mitarbeiter
- 2× redundante GPU-Server mit Load-Balancer
- N+1-Ausfallsicherheit, SLA-fähig
- GPU-Klasse skalierbar: L40S bis H100/H200
- Für unternehmenskritischen Dauerbetrieb
Abgebildet: die Cluster-Konfiguration (4× NVIDIA DGX Spark).
Richtwerte zur Orientierung; die finale Auslegung erfolgt nach Lastprofil. Preise und Konfigurationsdetails finden Sie auf der Preisseite.
Zwei-Tier-Modellarchitektur
Der Cluster betreibt zwei LLM-Tiers gleichzeitig, abgestimmt auf die unterschiedlichen Verarbeitungsanforderungen von contboxx Atlas.
Qwen3.5-35B-A3B
Mixture-of-Experts mit nur 3,3 Mrd. aktiven von 35 Mrd. Parametern, FP8-quantisiert — läuft effizient auf einer einzelnen GPU. Für Aufgaben, bei denen Qualität, Nuance und Reasoning-Tiefe zählen:
- Komplexe RAG-Anfragen
- Langform-Zusammenfassungen
- Dokumentübergreifende Synthese
- Suchintent-Erkennung
- Compliance-Analyse
- Entwurfsgenerierung
- Onboarding-Assistenz
Qwen3.5-4B
Kompaktes, FP8-quantisiertes Mamba+MoE-Modell mit großer Parallelitätsreserve. Für Routine-Operationen, die Geschwindigkeit statt tiefes Reasoning erfordern:
- Volltextindexierung
- Embedding-Generierung
- Auto-Tagging & Klassifikation
- Kurz-Q&A
- Duplikaterkennung
- Automatische Zusammenfassungen
Performance & Kapazität
Durchsatz auf Enterprise-Niveau
Gemessen im mehrwöchigen Dauertest auf NVIDIA DGX Spark (GB10) unter realer Pipeline-Last:
| Modell | Tier | Architektur | Decode (Tok/s) | Erfolgsrate |
|---|---|---|---|---|
| Qwen3.5-4B | Speed-Tier | Mamba+MoE · 4B | 27–42 | 98,8 % |
| Qwen3.5-35B-A3B | Quality-Tier | MoE · 3,3B aktiv | 28–77 | 95–100 % |
Modellspeicher (FP8)
~40 GB
Gewichte beider Modell-Tiers (FP8)
Streaming
Echtzeit
Progressive Ausgabe nach erstem Token
Speculative Decoding
1,5–2× Speedup
EAGLE3, minimaler Genauigkeitsverlust
Software-Stack
Verfügbarkeit & Zuverlässigkeit
Ausfallsicher durch Design
Technische Fragen? Wir haben Antworten.
Vereinbaren Sie ein technisches Gespräch mit unserem Architektur-Team.
Technisches Gespräch vereinbaren