Private KI-Infrastruktur

Managed AI Runtime

Eine private KI-Umgebung aufzubauen ist das eine — sie sicher, aktuell und wirtschaftlich zu betreiben das andere. Die Managed AI Runtime ist unser Betriebsangebot: eine containerisierte, private KI-Umgebung mit Ihren Modellen und Ihren Daten, von uns betrieben — zu einer planbaren monatlichen Pauschale zzgl. transparent durchgereichter Compute-Kosten.

Weitere Leistungen

Managed AI Runtime im Überblick

Der Leistungsumfang gliedert sich in vier Bereiche. Betrieb: containerisierte Runtime, private Model-Endpoints auf modernen Inference-Servern (z. B. vLLM), Updates, Patches und Backups. Sicherheit: Single Sign-on über Entra ID/OIDC, rollenbasierte Berechtigungen, Secrets-Management und private Netzwerke. Compliance: AVV, technische und organisatorische Maßnahmen, Subprozessorliste, Logging- und Löschkonzept sowie ein Dokumentationspaket, das Sie bei den Pflichten aus DSGVO und AI Act unterstützt. Kostenkontrolle: laufendes Monitoring von Token- und GPU-Verbrauch mit monatlichem Reporting.

Beim Thema Compute gehen wir einen ungewöhnlichen Weg: GPU- und Infrastrukturkosten reichen wir transparent zu Selbstkosten an Sie durch. Wir verdienen am Betrieb — nicht daran, Ihnen Rechenzeit teurer weiterzuverkaufen. Das macht Ihre Kosten planbar und unsere Empfehlungen unabhängig: Wenn ein günstigerer Provider für Ihren Workload besser passt, wechseln wir ihn.

Auch beim Betrieb gilt unser Portabilitätsversprechen: Ihre KI kann uns verlassen. Deployments sind containerisiert, Konfiguration und Datenpfade sind dokumentiert, die Exit-Dokumentation gehört zum Leistungsumfang. Auf Wunsch testen wir einmal jährlich im AI Exit Drill, ob sich Ihr Stack tatsächlich auf alternativer Infrastruktur wiederherstellen lässt — digitale Souveränität wird bei uns nicht behauptet, sondern getestet. Unsere Support-Zusagen sind ehrlich kalkuliert: Wir vereinbaren Reaktionszeiten, die wir organisatorisch halten können, statt Enterprise-Versprechen abzugeben, die auf dem Papier stehen bleiben.

Managed AI Runtime: konkrete Leistungen

Containerisierte Runtime und private Model-Endpoints (z. B. vLLM)
SSO über Entra ID/OIDC, RBAC und private Netzwerke
Monitoring, Logging, Backup und Patch-Management
Compliance-Paket: AVV, TOMs, Subprozessorliste, AI-Act-Dokumentation
Token- und GPU-Kostenkontrolle mit monatlichem Reporting
Exit-Dokumentation und optionaler jährlicher AI Exit Drill
Anwendungsfälle

Managed AI Runtime in der Praxis

// 01

Privates LLM für sensible Dokumente

Verträge, Personaldokumente oder Konstruktionsdaten werden mit einer privaten Modellinstanz verarbeitet — ohne dass Inhalte an externe Modellanbieter gehen.

// 02

Wissenssuche über Unternehmensdaten

RAG über technische Dokumentation, Wissensdatenbank und Ablagen: Mitarbeitende finden Antworten statt Dokumente — betrieben in Ihrer kontrollierten Umgebung.

// 03

Interne KI-APIs für Fachanwendungen

Ihre Anwendungen nutzen private Inference-Endpoints für Klassifikation, Extraktion oder Textgenerierung — mit stabilen Kosten pro Monat statt überraschender API-Rechnungen.

So gehen wir vor

Managed AI Runtime: Schritt für Schritt

1

Übernahme oder Aufbau der Umgebung nach Ziel-Architektur

2

Härtung und Anbindung: SSO, Netzwerk, Berechtigungen

3

Betriebsstart mit Monitoring, Backup und Runbooks

4

Regelbetrieb mit monatlichem Kosten- und Statusreport

Support- und Reaktionszeiten werden individuell vereinbart und so kalkuliert, dass sie organisatorisch verlässlich einzuhalten sind. Alle Preisangaben sind Nettopreise; verbindlich ist das individuelle Angebot.

FAQ

Häufige Fragen zu Managed AI Runtime

Noch offene Punkte? Wir klären sie gern im Erstgespräch.

Was kostet der Managed-Betrieb?
Die monatliche Betriebs-Pauschale richtet sich nach Umfang und Support-Level; den konkreten Preis erhalten Sie nach dem Erstgespräch als transparentes Angebot. Compute-, Storage- und Traffic-Kosten kommen hinzu — transparent zu Selbstkosten durchgereicht, ohne versteckten Aufschlag.
Brauchen wir dafür eigene GPUs?
Nein. Wir betreiben Ihre Umgebung auf passender gemieteter Infrastruktur bei deutschen und europäischen Providern — von kleineren Inference-Systemen bis zu High-End-GPUs. Eigene Hardware lohnt sich erst bei dauerhaft hoher Auslastung; genau das rechnen wir Ihnen ehrlich vor.
Läuft das in unserer Azure-Umgebung oder bei Ihnen?
Beides ist möglich. Wir verfolgen einen hybriden Ansatz: Microsoft 365, Entra ID und Business Central bleiben, wo sie sind — die private KI-Umgebung läuft dort, wo Kontrolle, Kosten und Datenschutz es erfordern. Die Ziel-Architektur legt das pro Workload fest.
Wie kommen wir wieder raus?
Geordnet und dokumentiert: Deployments sind containerisiert, Konfiguration und Datenpfade liegen als Exit-Dokumentation vor. Ihr Stack lässt sich zu einem anderen Betreiber oder zu Ihrem eigenen Team migrieren — auf Wunsch testen wir das jährlich im AI Exit Drill.

Lassen Sie uns Ihr Projekt besprechen.

Kostenloses Erstgespräch, 30–45 Minuten, remote. Eine ehrliche Einschätzung — auch wenn die Antwort lautet, dass Sie das eigentlich gar nicht brauchen.