Das Wichtigste in Kürze
- KI On-Premise oder Cloud ist heute keine Entweder-oder-Frage. In der Praxis stehen fünf Betriebsmodelle zur Wahl: geteiltes SaaS, eine dedizierte Instanz beim Anbieter, eine Private Cloud, der eigene Cloud-Tenant und das eigene Rechenzentrum. Das eigene Rechenzentrum ist der Sonderfall, nicht der Normalfall.
- Zwei Entscheidungen, nicht eine: Wo läuft die Plattform, und wo laufen die Modelle? Die proprietären Spitzenmodelle nutzen Unternehmen in aller Regel als Dienst, ihre Gewichte stehen nicht zum Download bereit. Wer Modelle vollständig im eigenen Haus betreiben will, setzt auf offene Modelle.
- Datenhoheit entsteht nicht durch den Serverstandort allein, sondern über Anbindung, Berechtigungen, Protokollierung und Verträge. Auch im Hybrid-Betrieb geht der für die Antwort nötige Datenausschnitt an das Modell.
- Die Kostenlogik unterscheidet sich strukturell: Anbieterbetrieb bedeutet laufende Kosten, eigener Betrieb bedeutet Hardware, GPU-Kapazität und dauerhafte Personalbindung. Wer eigene Modelle betreibt, plant Betriebskapazität dafür fest ein.
- Marktbild Deutschland: 90 Prozent der Unternehmen ab 20 Beschäftigten nutzen Cloud-Anwendungen, 74 Prozent Private Cloud, 59 Prozent Public Cloud, 29 Prozent kombinieren beides (Bitkom Cloud Report 2025, 604 Unternehmen). Stand: September 2026.
Die Frage „KI On-Premise oder Cloud" fällt in fast jedem Projektstart, und dahinter stehen drei Sorgen: Datenzugriff, Betriebskosten über Jahre und Tempo bis zur Arbeitsfähigkeit. Die Antwort hängt weniger am Bauchgefühl als an vier nüchternen Kriterien: Datenklassen, regulatorische Anforderungen, vorhandene Betriebskapazität und die Frage, welche Modelle Sie überhaupt einsetzen wollen.
Dieser Artikel sortiert die Betriebsmodelle, die 2026 real verfügbar sind, trennt den Betrieb der Plattform vom Betrieb der Modelle und zeigt, welche Kostenarten in welchem Modell tatsächlich anfallen. Ohne Pauschalzahlen, die in Ihrem Haus ohnehin anders aussehen.
Welche Betriebsmodelle gibt es für eine KI-Plattform?
Für eine KI-Plattform gibt es fünf Betriebsmodelle: geteiltes SaaS, eine dedizierte Instanz beim Anbieter, eine Private Cloud, den eigenen Cloud-Tenant und das eigene Rechenzentrum. Sie unterscheiden sich darin, wem die Umgebung gehört und wer sie betreibt.
Ein geteiltes SaaS-Angebot ist der schnellste, aber unflexibelste Weg. Eine dedizierte Instanz bedeutet, dass Ihr Unternehmen eine eigene Umgebung samt eigener Datenbank bekommt, die der Anbieter betreibt. Private Cloud und eigener Tenant verschieben den Betriebsort in Ihre Verantwortungssphäre. Der Betrieb im eigenen Rechenzentrum gibt die volle Kontrolle und verlangt die volle Betriebsleistung.
Fünf Betriebsmodelle im Vergleich
| Betriebsmodell | Wer betreibt | Wo läuft es | Wann sinnvoll |
|---|---|---|---|
| Geteiltes SaaS | Anbieter | Gemeinsame Umgebung für viele Kunden | Erste Erfahrungen, unkritische Inhalte, kleine Teams |
| Dedizierte Instanz beim Anbieter | Anbieter | Eigene Instanz je Kunde, EU-Rechenzentrum | Normalfall im Mittelstand: eigene Daten, eigene Konfiguration, ohne eigenen Betrieb |
| Private Cloud | Anbieter oder gemeinsam | Cloud-Umgebung exklusiv für Ihr Unternehmen | Strengere interne Vorgaben, eigene Netzsegmente, besondere Vertragslagen |
| Eigener Cloud-Tenant | Ihre IT, unterstützt vom Anbieter | Ihre Cloud-Subscription, zum Beispiel in Azure | Vorhandener Cloud-Standard im Haus, eigene Schlüssel- und Netzwerkregeln |
| Eigenes Rechenzentrum | Ihre IT | Eigene Hardware, auf Wunsch ohne Internetanbindung | Geheimschutz, abgeschottete Produktionsnetze, harte Air-Gap-Vorgaben |
Für die meisten Mittelständler ist die dedizierte Instanz der pragmatische Mittelweg: eigene Umgebung, eigene Zugangskontrolle, eigene Datenbank, aber kein eigener Betriebsaufwand. Wer bereits einen Cloud-Standard im Haus hat, verlegt die Instanz in den eigenen Tenant und bleibt damit in den eigenen Sicherheits- und Netzwerkregeln.
Wo läuft eigentlich das Modell?
Plattformbetrieb und Modellbetrieb sind zwei getrennte Entscheidungen. Selbst wenn die Plattform im eigenen Tenant läuft, rechnet das Modell meist woanders, denn die Gewichte der proprietären Spitzenmodelle von OpenAI, Anthropic oder Google stehen nicht zum Download bereit.
Damit ergeben sich drei Wege, die sich kombinieren lassen:
- Modell-API in einer EU-Region. Die großen Cloud-Anbieter steuern den Verarbeitungsort über den Bereitstellungstyp. Bei Microsoft Foundry beispielsweise verarbeiten „Data Zone"-Bereitstellungen Anfragen ausschließlich innerhalb der EU-Datengrenze, globale Bereitstellungen dagegen in jeder Region. Wer EU-Verarbeitung braucht, muss den Bereitstellungstyp aktiv wählen.
- Offene Modelle bei einem europäischen Anbieter. IONOS, OVHcloud oder STACKIT betreiben offene Modelle als API in europäischen Rechenzentren, mit Zusagen zur Datenspeicherung. STACKIT etwa nennt dafür die Region Germany South und sagt zu, dass Daten und Abfragen weder gespeichert noch zum Training verwendet werden.
- Offene Modelle selbst betreiben. Auf eigener GPU-Infrastruktur, im eigenen Tenant oder im eigenen Rechenzentrum. Das ist der einzige Weg zu echter Air-Gap-Fähigkeit und gleichzeitig der aufwendigste. Welche offenen Modelle dafür lizenzrechtlich infrage kommen, steht im Leitfaden zu Open-Source-LLMs und Self-Hosting.
Praktische Konsequenz: Die Frage „läuft alles bei uns?" beantwortet sich nur dann mit Ja, wenn Sie auch die Modelle selbst betreiben. Alles andere ist eine Kombination aus eigenem Plattformbetrieb und fremder Modellverarbeitung, die vertraglich und technisch sauber geregelt sein will.
Was kostet welcher KI-Betrieb wirklich?
Was ein KI-Betrieb kostet, hängt vor allem von Nutzerzahl, Token-Verbrauch und vorhandener Infrastruktur ab, eine seriöse Pauschalzahl gibt es deshalb nicht. Vergleichbar sind die Kostenarten, und an ihnen zeigt sich, wo der eigene Betrieb teurer wird als erwartet.
Kostenarten je Betriebsmodell
| Kostenart | Dedizierte Instanz beim Anbieter | Eigener Cloud-Tenant | Eigenes Rechenzentrum |
|---|---|---|---|
| Plattform und Wartung | Im Betrieb enthalten | Anteilig, je nach Vereinbarung | Vollständig bei Ihnen |
| Infrastruktur | Beim Anbieter | Ihre Cloud-Rechnung | Hardware, Strom, Fläche, Ersatz |
| Modellnutzung | Nach Verbrauch, pro Team steuerbar | Nach Verbrauch | GPU-Kapazität rund um die Uhr, auch bei Leerlauf |
| Personal | Gering: Administration und Use-Case-Arbeit | Cloud-Betrieb und Berechtigungen | Betrieb, Bereitschaft, Modellpflege, Updates |
| Sicherheit und Audit | Anbieterseitig, vertraglich geregelt | Geteilt | Vollständig bei Ihnen |
| Skalierung | Kurzfristig | Kurzfristig | Beschaffungsvorlauf für Hardware |
Die beiden Posten, die in Eigenbetriebs-Rechnungen am häufigsten fehlen, sind Personal und Leerlauf. Eine GPU-Instanz kostet auch dann, wenn niemand fragt, und ein produktiver Modellbetrieb braucht dauerhaft Menschen, die Aktualisierungen prüfen, Qualität messen und Störungen beheben. Eine vollständige Kostenaufstellung inklusive Einführung, Schulung und Betrieb finden Sie im Artikel zu den Gesamtkosten einer KI-Plattform.
Wann lohnt sich der Betrieb im eigenen Rechenzentrum?
Der eigene Betrieb lohnt sich, wenn eine Anforderung ihn erzwingt, nicht weil er günstiger wäre. Drei Konstellationen rechtfertigen ihn regelmäßig:
- Abgeschottete Umgebungen. Produktionsnetze, Geheimschutz oder Verteidigungsprojekte, in denen kein Verkehr nach außen zulässig ist.
- Besonders schutzwürdiges geistiges Eigentum. Konstruktionsdaten, Rezepturen oder Quelltexte aus Auftragsentwicklung, bei denen die Risikoabwägung gegen jede externe Verarbeitung ausfällt.
- Sehr hohe, gleichmäßige Last. Wenn dauerhaft große Mengen an Anfragen anfallen, kann eigene Inferenz wirtschaftlich werden. Der Preisverfall bei der Inferenz spricht allerdings gegen frühe Festlegungen: Die a16z-Analyse „LLMflation" misst für vergleichbare Modellqualität einen Preisrückgang um etwa den Faktor zehn pro Jahr.
Was in stark regulierten Branchen zusätzlich zu beachten ist, etwa Auslagerungsanzeigen und Prüfrechte, behandelt der Artikel zu KI im Finanzwesen.
Gegen den Eigenbetrieb spricht selten die Technik, sondern fast immer die Dauerverpflichtung: Modellwechsel, Sicherheitsupdates, Qualitätsmessung und Bereitschaft enden nie. Wer diese Kapazität nicht fest einplant, betreibt nach einem Jahr ein veraltetes Modell auf teurer Hardware.
Wie bleiben sensible Daten im Haus?
Sensible Daten bleiben im Haus, wenn die Quellsysteme lokal bleiben und nur der für eine Antwort nötige Ausschnitt an das Modell geht. Welche Daten das sind, steuern Berechtigungen, Filter und Protokollierung.
Der verbreitete Hybrid-Gedanke „Plattform in der Cloud, Daten bleiben lokal" funktioniert also, aber anders, als es oft verkauft wird: Aggregiert oder anonymisiert ist der übergebene Ausschnitt nur, wenn die Anbindung genau so gebaut wurde.
Was den Unterschied macht, sind vier Stellschrauben:
- Zugriffsrechte an der Quelle. Die Anbindung sieht nur, was das technische Konto sehen darf, und idealerweise nur, was die fragende Person sehen darf.
- Filter und Feldauswahl. Nicht die ganze Tabelle, sondern die benötigten Felder. Personenbezug wird entfernt, wo er für die Aufgabe nicht gebraucht wird.
- Protokollierung. Nachvollziehbar, welche Abfrage welche Daten berührt hat, mit Aufbewahrung nach Ihren Vorgaben.
- Modellfreigabe je Team. Für den sensiblen Bereich nur Modelle mit geprüfter Verarbeitung, für den Rest die volle Auswahl.
Technisch führt der Weg über Konnektoren zu ERP, Fileserver, Ticket-System oder älteren Datenbanken. Wie so eine Anbindung in gewachsenen Landschaften aussieht, beschreibt der Leitfaden zur Integration bestehender Systeme. Welche rechtlichen Anforderungen daran hängen, steht im Artikel zu KI und DSGVO.
In fünf Schritten zur Betriebsentscheidung
Die Betriebsentscheidung folgt aus Datenklassen, Regulierung und Betriebskapazität, nicht aus Grundsatzpositionen. Diese fünf Schritte führen zu einer begründeten Wahl.
-
1
Daten klassifizieren
Öffentlich, intern, vertraulich, streng vertraulich. Ohne diese Einteilung ist jede Betriebsdiskussion eine Meinungsdiskussion.
-
2
Use Cases gegen Datenklassen legen
Die meisten Anwendungsfälle arbeiten mit internen Daten. Nur wenige berühren die oberste Klasse, und nur diese treiben die Anforderungen.
-
3
Regulatorische Vorgaben prüfen
Branchenaufsicht, Kundenverträge, Betriebsvereinbarungen und Zertifizierungen setzen harte Grenzen. Diese Prüfung gehört vor die Anbieterauswahl.
-
4
Betriebskapazität ehrlich bewerten
Wer keine feste Kapazität für Betrieb und Modellpflege hat, entscheidet sich damit faktisch gegen den Eigenbetrieb der Modelle.
-
5
Portabilität vertraglich sichern
Datenexport, Kündigungsfolgen, Unterauftragsverarbeiter und der Wechsel des Betriebsmodells gehören in den Vertrag, nicht in die Hoffnung.
Wie Plotdesk den Betrieb löst
Plotdesk verbindet eine KI-Plattform mit einem Umsetzungsteam für den Mittelstand und betreibt jede Kundeninstanz dediziert: als Plotdesk Cloud, von Plotdesk betrieben und in der EU gehostet, als Private Cloud oder direkt im eigenen Tenant, zum Beispiel in Azure. Die Betriebsentscheidung ist damit keine Produktentscheidung mehr, sondern eine Frage der Anforderungen.
Lokale Systeme bleiben, wo sie sind. ERP, Fileserver, Ticket-System oder alte Datenbanken werden über Plotdesk Connect angebunden, statt Daten in eine neue Umgebung zu kopieren. Für die Modellseite stehen mehr als 100 Modellvarianten aus zehn Provider-Typen zur Verfügung, steuerbar pro Team, Gruppe und Anwendung, einschließlich offener Modelle über EU-Inferenz.
Governance bringt die Plattform mit: Anmeldung über Single Sign-On, Rollen und mehr als 40 Berechtigungen, verschlüsselte Zugangsdaten, Audit-Logs sowie Nutzungs- und Kostenanalysen je Bereich. Vertraglich gehören ein DSGVO-konformer Auftragsverarbeitungsvertrag und EU-Datenresidenz dazu.
Der Weg dorthin läuft in vier Schritten: KI-Potenzialanalyse, Proof of Value, produktive Lösung, systematischer Ausbau. Das Betriebsmodell wird dabei früh festgelegt, weil es Anbindung, Berechtigungen und Modellfreigaben bestimmt.
Häufige Fragen zum KI-Betrieb
Ist der Betrieb in der Cloud datenschutzrechtlich zulässig?
Was ist der Unterschied zwischen Private Cloud und eigenem Tenant?
Brauche ich eigene GPUs für KI im Unternehmen?
Kann ich das Betriebsmodell später wechseln?
Bleiben unsere Daten wirklich im Haus, wenn wir hybrid arbeiten?
Was bedeutet der US CLOUD Act für die Modellwahl?
Fazit: erst die Anforderungen, dann das Blech
Die ehrliche Antwort auf „On-Premise oder Cloud" lautet für die meisten Mittelständler: eine dedizierte Instanz in der EU oder im eigenen Tenant, kombiniert mit Modellen, die je Team freigegeben werden, und lokalen Systemen, die angebunden statt kopiert werden. Der Betrieb im eigenen Rechenzentrum bleibt die richtige Antwort für abgeschottete Umgebungen und besonders schutzwürdige Daten.
Wer die Entscheidung entlang von Datenklassen, Regulierung, Betriebskapazität und Portabilität trifft, kommt zu einem Setup, das auch in drei Jahren noch trägt. Wer sie entlang von Grundsatzpositionen trifft, zahlt entweder mit Tempo oder mit Risiko.