Das Wichtigste in Kürze
- Eine KI-Datenstrategie legt fest, welche Daten ein Unternehmen für KI nutzt, wem sie gehören, wie sie aufbereitet und geschützt werden und wie KI-Anwendungen darauf zugreifen. Sie entscheidet stärker über den Erfolg eines Projekts als die Modellwahl.
- Datenarbeit ist ein großer Kostenblock: 50 % der KI-nutzenden Unternehmen nennen die Aufbereitung von Daten als großen Kostenpunkt, 41 % die Integration in bestehende Systeme, nur 21 % Softwarelizenzen (Bitkom-KI-Studie, September 2026, 603 Unternehmen).
- Gartner erwartet, dass Unternehmen bis Ende 2026 rund 60 % der KI-Projekte aufgeben, denen KI-fähige Daten fehlen. 63 % der befragten Organisationen haben keine oder unsichere Datenmanagement-Praktiken für KI (Gartner, Februar 2025).
- Art. 10 der KI-Verordnung gilt nur für Hochrisiko-KI-Systeme, und zwar ab 2. Dezember 2027 (Anhang III) bzw. 2. August 2028 (Anhang I). Stand: September 2026, nach dem Digital Omnibus.
- Der Einstieg gelingt mit einem Use Case: Daten-Inventar, klare Datenverantwortung und eine kleine, dokumentierte Datenbasis in rund 90 Tagen statt eines Großprogramms.
Eine KI-Datenstrategie beantwortet die Frage, an der viele KI-Projekte scheitern: Welche Daten braucht der Anwendungsfall, wo liegen sie, wem gehören sie und wie gelangen sie sicher in das KI-System? KI selbst ist in deutschen Unternehmen inzwischen Alltag. Laut Bitkom-KI-Studie vom September 2026 setzen 57 % der Unternehmen ab 20 Beschäftigten KI ein, 2025 waren es 36 %.
Die Wirkung hält damit nicht Schritt. Kein befragtes Unternehmen schöpft das Potenzial von KI nach eigener Einschätzung vollständig aus, 59 % schöpfen es überhaupt nicht aus. Bei den Unternehmen ohne KI nennen 40 % fehlende Daten als Hürde. Bei den Nutzern taucht dieselbe Lücke als Kostenpunkt auf: Datenaufbereitung und Integration.
Dieser Leitfaden zeigt, was KI-fähige Daten ausmacht, welche sechs Dimensionen eine KI-Datenstrategie abdeckt, welche Architektur- und Vektordatenbank-Optionen es gibt, was Art. 10 der KI-Verordnung für Hochrisiko-Systeme verlangt und wie Sie in 90 Tagen den ersten produktiven Use Case auf eine saubere Datenbasis stellen.
Was ist eine KI-Datenstrategie?
Eine KI-Datenstrategie ist der verbindliche Plan, wie ein Unternehmen seine Daten für KI-Anwendungen auswählt, aufbereitet, schützt und bereitstellt. Sie ergänzt die klassische Datenstrategie um das, was erst mit KI wichtig wird: unstrukturierte Inhalte, Zugriff zur Laufzeit und die laufende Prüfung gegen den Anwendungsfall.
Der zentrale Begriff dahinter heißt KI-fähige Daten (englisch AI-Ready Data). Gartner beschreibt Daten als KI-fähig, wenn sie den konkreten Anwendungsfall repräsentieren, einschließlich der Muster, Fehler und Ausreißer, die ein Modell für genau diese Aufgabe kennen muss. Daraus folgen drei Verschiebungen gegenüber klassischer Datenqualität:
- Vom einmaligen Check zur laufenden Eignungsprüfung. Daten werden fortlaufend gegen den Use Case geprüft: Stimmt die Verteilung noch, wandern die Eingabedaten ab, arbeitet die Anwendung unter heutigen Bedingungen noch so wie beim Test?
- Von „sauber“ zu „repräsentativ“. Für Berichte werden Ausreißer bereinigt. Für KI können sie wichtig sein, weil das System sonst ein zu glattes Bild der Wirklichkeit bekommt.
- Von der IT zur Fachdomäne. Vertrieb, Einkauf, Produktion oder Service verantworten Definitionen, Qualitätsansprüche und Risiken ihrer Daten. Die IT betreibt die Plattform.
Laut Gartner-Analystin Roxane Edjlali ist KI-fähige Datenqualität immer vom Anwendungsfall abhängig; einmalige Qualitätsprüfungen reichen deshalb nicht (Gartner Data & Analytics Summit 2026, zusammengefasst von Atlan).
| Dimension | Klassische Datenqualität | KI-fähige Daten |
|---|---|---|
| Prüfrhythmus | Quartalsweise oder projektbezogen | Laufend, gekoppelt an die Bewertung der KI-Anwendung |
| Ausreißer | Entfernen oder bereinigen | Behalten, wenn sie für den Anwendungsfall typisch sind |
| Datenherkunft | Meist nicht dokumentiert | Herkunft dokumentiert (bei Hochrisiko-Systemen Pflicht nach Art. 10) |
| Prüfung auf Verzerrungen | Kein Standardprozess | Standardprozess, bei Hochrisiko-Systemen Pflicht |
| Verantwortung | Zentrale IT oder Data-Warehouse-Team | Fachdomäne als Datenverantwortliche |
| Datenarten | Strukturiert (ERP, BI) | Strukturiert und unstrukturiert (Texte, PDFs, Bilder, Audio) |
| Zugriff | Berichte auf Anfrage | Schnittstellen und Suchschicht mit Rechteprüfung zur Laufzeit |
Warum scheitern KI-Projekte an Daten?
KI-Projekte scheitern an Daten, wenn Quellen verstreut, Verantwortlichkeiten ungeklärt und Qualitätsmaßstäbe nicht am Anwendungsfall ausgerichtet sind. Die Folge sind Piloten, die mit ausgewählten Testdaten überzeugen und im Betrieb nicht tragen.
Mehrere Studien zeigen dieses Muster. Gartner hat im Februar 2025 eine Umfrage unter 1.203 Data-Management-Verantwortlichen veröffentlicht: 63 % der Organisationen haben keine oder unsichere Datenmanagement-Praktiken für KI, und Gartner erwartet, dass bis Ende 2026 rund 60 % der KI-Projekte ohne KI-fähige Daten aufgegeben werden (Pressemitteilung).
Für die DACH-Region nennt die Studie „AI-ready Data Platforms 2026“ von Computerwoche und Lufthansa Industry Solutions als häufigste Bremsen mangelnde Datenqualität (30 %), fragmentierte Datenlandschaften (28 %) und träge IT-Prozesse (25 %). Das Modell steht nicht auf der Liste.
Auch die Wirkung hängt an den Daten. Laut der Precisely-Studie zu Datenintegrität und KI 2026 erzielen nur 34 % der deutschen Unternehmen einen positiven KI-ROI oder erwarten ihn in den nächsten sechs Monaten; in Großbritannien sind es mehr als 45 %.
Die sechs Dimensionen einer KI-Datenstrategie
Eine belastbare KI-Datenstrategie deckt sechs Dimensionen ab: Inventar, Verantwortung, Plattform, Zugriff, Herkunft und Verzerrungen sowie Kompetenz. Die Übersicht eignet sich als Raster für eine ehrliche Standortbestimmung mit IT und Fachbereichen.
| Dimension | Schlüsselfrage | Typische Lage im Mittelstand |
|---|---|---|
| 1. Daten-Inventar | Wissen wir, welche Daten wir wo haben? | SharePoint, ERP, CRM, PIM, Netzlaufwerke, Confluence; meist ohne vollständigen Katalog |
| 2. Datenverantwortung | Wer verantwortet Qualität und Definitionen? | Pauschal „die IT“ statt der Fachdomäne; niemand fühlt sich zuständig |
| 3. Datenplattform | Auf welchem Fundament laufen Analysen und KI? | Klassische Data Warehouses, zunehmend Lakehouse-Plattformen oder Microsoft Fabric |
| 4. Datenzugriff | Greifen KI-Anwendungen rechte- und rollenkonform auf Daten zu? | SSO und Rollen oft solide; Zeilenrechte, Maskierung und Erkennung personenbezogener Daten häufig lückenhaft |
| 5. Herkunft und Verzerrungen | Können wir Herkunft, Veränderungen und Verzerrungen dokumentieren? | Häufig nicht; für Hochrisiko-Systeme ab Dezember 2027 Pflicht nach Art. 10 |
| 6. Sponsor und Kompetenz | Wer treibt die Strategie, und kann das Team sie umsetzen? | Verantwortung verteilt auf CIO, CDO und Fachbereiche; KI-Kompetenz nach Art. 4 oft nur auf dem Papier |
Wer auf zwei oder mehr Dimensionen deutliche Lücken sieht, sollte sie vor dem breiten Rollout schließen. Sonst läuft jede neue KI-Initiative gegen dieselbe Wand. Für Dimension 4 lohnt der Blick auf die Anbindung der Kernsysteme, etwa ERP-Systeme mit KI verbinden. Für Dimension 6 hilft eine klare Organisationsform wie ein AI Center of Excellence, das Datenverantwortung und KI-Verantwortung zusammenführt.
Welche Datenarchitektur braucht KI: Warehouse, Lakehouse oder Hybrid?
Für den ersten Use Case brauchen die meisten Mittelständler keine neue Datenplattform, sondern eine saubere, berechtigte Anbindung der vorhandenen Systeme. Eine Lakehouse- oder Warehouse-Plattform lohnt sich, sobald mehrere Anwendungsfälle dieselben aufbereiteten Daten brauchen.
Ein Lakehouse verbindet die günstige Speicherung großer, auch unstrukturierter Datenmengen (Data Lake) mit der Struktur und Verwaltung eines Data Warehouse. Vier Plattformfamilien prägen die Entscheidung. Keine ist objektiv die richtige; es kommt auf Datenmenge, vorhandene Werkzeuge und das Profil der Use Cases an.
| Plattform | Ansatz | Passt besonders, wenn … |
|---|---|---|
| Databricks | Lakehouse mit offenen Tabellenformaten und Katalog, starke Werkzeuge für Machine Learning | eigene Modelle und Datenpipelines entstehen und ein engineering-starkes Team vorhanden ist |
| Snowflake | Cloud-Data-Warehouse mit KI-Funktionen, die sich direkt aus SQL aufrufen lassen (Cortex) | eine SQL- und BI-Organisation KI schrittweise ergänzen will |
| Microsoft Fabric | SaaS-Plattform mit OneLake, Spiegelung von Quelldatenbanken (Mirroring) und Power-BI-Integration; Microsoft hat Mirroring auch für SAP-Quellen angekündigt | Microsoft 365 und Power BI bereits gesetzt sind |
| SAP Business Data Cloud | SAP-Datenprodukte mit Geschäftskontext; eine Zero-Copy-Anbindung an Microsoft Fabric (SAP BDC Connect) ist angekündigt | S/4HANA oder RISE with SAP den Kern der Systemlandschaft bilden |
Stand: September 2026, laut Anbieterangaben. Prüfen Sie Verfügbarkeit und Lizenzbedingungen angekündigter Funktionen für Ihre Umgebung, bevor Sie Architekturentscheidungen daran knüpfen.
Zwei Entwicklungen erleichtern die Wahl. Snowflake und Databricks unterstützen beide das offene Tabellenformat Apache Iceberg, was Wechsel und Mischbetrieb vereinfacht. Und die Plattformen bringen KI-Funktionen näher an die Daten, statt Daten in eine getrennte KI-Umgebung zu kopieren. Für viele Mittelständler heißt der pragmatische Weg deshalb ergänzen statt ersetzen: Das Data Warehouse bleibt für Berichte, daneben entsteht eine Schicht für Dokumente, Suche und KI-Anwendungen.
Braucht jede KI-Anwendung eine Vektordatenbank?
Nein. Eine Vektordatenbank braucht, wer große Mengen unstrukturierter Inhalte für eine KI-Suche aufbereiten will; für strukturierte Abfragen reichen oft die vorhandenen Datenbanken. Wer bereits PostgreSQL betreibt, kann mit der Erweiterung pgvector starten, ohne eine weitere Datenbank einzuführen.
Eine Vektordatenbank speichert Texte, Dokumentteile oder Bilder als Embeddings, also als Zahlenreihen, die Bedeutung abbilden. So findet eine KI-Anwendung zu einer Frage die inhaltlich passenden Stellen und nutzt sie für ihre Antwort. Dieses Prinzip heißt Retrieval-Augmented Generation (RAG). Vier Optionen sind im Mittelstand verbreitet:
| Lösung | Betriebsmodell | Stärke | Kostenlogik |
|---|---|---|---|
| pgvector | Open-Source-Erweiterung für PostgreSQL | Vektorsuche und SQL-Filter in derselben, transaktionssicheren Datenbank | Keine Zusatzlizenz, wenn PostgreSQL bereits läuft |
| Qdrant | Open Source; selbst betrieben oder als Managed Cloud | Schnelle gefilterte Suche, Selbstbetrieb in eigener Infrastruktur möglich | Selbstbetrieb ohne Lizenz; Cloud nach Ressourcen |
| Weaviate | Open Source; selbst betrieben oder als Managed Cloud | Hybride Suche aus Vektor- und Stichwortsuche, Mandantenfähigkeit | Selbstbetrieb ohne Lizenz; Cloud in Paketen |
| Pinecone | Vollständig gemanagter Cloud-Dienst | Kein eigener Betrieb, skaliert auf große Datenmengen | Nutzungsbasiert nach Speicher und Abfragen |
Stand: September 2026; aktuelle Preise stehen auf den verlinkten Anbieterseiten. Pinecone ist vollständig gemanagt und skaliert gut, bindet aber an einen US-Clouddienst ohne Selbstbetrieb. Wer bereits PostgreSQL betreibt, startet mit pgvector oft günstiger; Qdrant und Weaviate kommen infrage, wenn Volumen, Filterlogik oder Selbstbetrieb es verlangen.
Die Reihenfolge bleibt dieselbe: erst Daten ordnen und Rechte klären, dann die einfachste passende Suchschicht wählen und erst bei nachgewiesenem Bedarf auf eine Spezialdatenbank wechseln. Ob die Antworten gut genug sind, zeigt nicht die Datenbank, sondern eine laufende Evaluation der KI-Anwendung.
Was verlangt Art. 10 der KI-Verordnung von Ihren Daten?
Art. 10 verlangt dokumentierte Daten-Governance für Trainings-, Validierungs- und Testdaten, gilt aber nur für Hochrisiko-KI-Systeme. Nach dem Digital Omnibus (Verordnung (EU) 2026/1744, in Kraft seit 27. Juli 2026) greifen diese Pflichten für eigenständige Systeme nach Anhang III ab dem 2. Dezember 2027 und für Hochrisiko-KI in regulierten Produkten nach Anhang I ab dem 2. August 2028.
Hochrisiko-Systeme nach Anhang III sind etwa KI in der Personalauswahl, bei der Kreditwürdigkeitsprüfung, in der Bildung oder in kritischer Infrastruktur. Für sie nennt Art. 10 Anforderungen an die Daten-Governance, die sich in acht Punkten zusammenfassen lassen:
Art. 10 KI-Verordnung: acht Anforderungen an die Daten-Governance
- Konzeptionsentscheidungen. Die Auswahl und der Aufbau der Datensätze sind begründet.
- Erhebung und Herkunft. Es ist nachvollziehbar, wie die Daten erhoben wurden und woher sie stammen; bei personenbezogenen Daten auch der ursprüngliche Zweck.
- Aufbereitung. Schritte wie Annotation, Kennzeichnung, Bereinigung, Aktualisierung, Anreicherung und Aggregation sind dokumentiert.
- Annahmen. Es ist festgehalten, was die Daten messen und abbilden sollen.
- Verfügbarkeit, Menge und Eignung. Die benötigten Datensätze wurden auf ausreichenden Umfang und Eignung für den Zweck geprüft.
- Prüfung auf Verzerrungen. Die Daten wurden auf Verzerrungen untersucht, die Gesundheit, Sicherheit oder Grundrechte beeinträchtigen oder zu verbotener Diskriminierung führen können.
- Gegenmaßnahmen. Erkannte Verzerrungen werden mit geeigneten Maßnahmen erkannt, verhindert und abgeschwächt.
- Datenlücken. Relevante Lücken oder Mängel in den Daten sind benannt, ebenso der Weg, sie zu beheben.
Drei praktische Folgen für die KI-Datenstrategie:
- Herkunft von Anfang an mitschreiben. Datenherkunft und Prüfungen lassen sich rückwirkend kaum herstellen. Wer Hochrisiko-Anwendungen plant, dokumentiert ab dem ersten Pipeline-Lauf, auch wenn die Pflicht erst Ende 2027 greift.
- Fachbereiche prüfen mit. Ob Daten verzerrt sind, kann die IT allein nicht beurteilen. Die Fachdomäne, deren Daten genutzt werden, gehört in die Prüfung.
- Auch ohne Hochrisiko lohnt die Dokumentation. Sie beschleunigt Audits, Kundenanfragen zur KI-Governance und eine mögliche Zertifizierung nach ISO/IEC 42001, der Norm für KI-Managementsysteme.
Ob ein konkretes System als hochriskant gilt, hängt vom Einsatzzweck ab. Die Einordnung in diesem Artikel ersetzt keine Rechtsberatung.
Sieben Fehler, an denen KI-Datenstrategien scheitern
Die meisten Datenstrategien scheitern nicht an der Technik, sondern an Reihenfolge und Zuständigkeit. Diese sieben Muster treten besonders häufig auf:
- „Erst Use Cases, dann Daten.“ Schnelle Piloten auf handverlesenen Daten überzeugen in der Präsentation und brechen beim ersten echten Volumen. Daten und Use Cases müssen parallel wachsen.
- „Wir kippen erst einmal alles in einen Data Lake.“ Ohne Verantwortliche, Schemaabsprachen und Qualitätsziele entsteht ein Datensumpf statt eines nutzbaren Datenbestands.
- „Die IT macht das.“ Wer Definitionen an die zentrale IT delegiert, bekommt technisch saubere, fachlich unklare Daten. Die Fachdomäne liefert Definitionen und Abnahmekriterien, die IT betreibt die Plattform.
- Eine Spezialdatenbank als Standard, weil sie bekannt ist. Die Suchschicht sollte zu Volumen, Filterbedarf und Betriebsmodell passen. Oft reicht zu Beginn die vorhandene Datenbank.
- „Eine Plattform für alles.“ Warehouse, Lakehouse, Vektorsuche, Katalog und KI aus einer Hand vereinfachen den Einkauf, erhöhen aber die Abhängigkeit. Offene Formate und austauschbare Bausteine halten Wege offen.
- „Um Art. 10 kümmern wir uns, wenn es so weit ist.“ Herkunft und Prüfungen lassen sich nicht nachträglich rekonstruieren. Wer Hochrisiko-Anwendungen plant, dokumentiert von Beginn an.
- „Wir verbieten private KI-Tools.“ Verbote allein verlagern die Nutzung in die Schatten-KI. Tragfähig ist ein offizielles, leicht zugängliches KI-Angebot mit geregelter Datenanbindung.
90-Tage-Plan: vom Datensilo zum ersten produktiven Use Case
In 90 Tagen lässt sich keine vollständige Datenstrategie umsetzen, wohl aber ein erster produktiver Use Case mit einer kleinen, sauber dokumentierten Datenbasis. Er wird zur Vorlage für alle weiteren Anwendungsfälle. Eine unternehmensweite Datenstrategie braucht realistisch eher 12 bis 18 Monate; der folgende Plan sorgt dafür, dass sie auf echten Ergebnissen aufbaut.
-
1
Daten-Inventar und Use-Case-Liste
Woche 1 bis 2Mit den zwei bis drei wichtigsten Fachbereichen klären: Welche Datenquellen liegen wo, welche Use Cases sind realistisch? Ergebnis ist eine priorisierte Liste (Nutzen, Datenverfügbarkeit, Umsetzbarkeit) und ein klar abgegrenzter erster Use Case mit benannter Datenverantwortung.
-
2
Architekturentscheidung für den ersten Use Case
Woche 3 bis 4Keine monatelange Zielarchitektur, sondern eine Entscheidung, die den ersten Use Case trägt: Welche Quelle wird angebunden, welche Plattform oder Suchschicht genügt, welche Rollen und Rechte gelten, welche Anforderungen an Hosting und Datenschutz sind zu dokumentieren?
-
3
Datenstrecke und Suchschicht aufbauen
Woche 5 bis 8Mit echten Daten statt Testdaten: Quelle anbinden, bereinigen, für die Suche aufbereiten und die Herkunft von Anfang an protokollieren. Parallel entsteht ein Satz geprüfter Beispielfragen mit erwarteten Antworten, gegen den die Anwendung laufend getestet wird.
-
4
Go-live mit ersten Nutzern und Wirkungsmessung
Woche 9 bis 10Fünf bis zehn Beschäftigte aus dem Fachbereich arbeiten produktiv mit der Anwendung. Gemessen werden Antwortqualität, Trefferquote und Zeitaufwand gegenüber dem Ausgangswert; Hindernisse bei der Nutzung werden gesammelt.
-
5
Bilanz und Fahrplan für Use Case zwei und drei
Woche 11 bis 12Ein kurzes Entscheidungsdokument für Geschäftsführung und IT: Was läuft, welche Wirkung ist gemessen, wie ist die Datenbasis dokumentiert, welche Use Cases bauen als Nächstes auf demselben Fundament auf.
Was kostet eine KI-Datenstrategie?
Die Kosten entstehen weniger bei Lizenzen als bei Datenaufbereitung, Integration und den Menschen, die Daten verantworten. Die Bitkom-KI-Studie 2026 bestätigt das: Als großen Kostenpunkt nennen KI-nutzende Unternehmen die Infrastruktur (51 %), die Aufbereitung von Daten (50 %) und die Integration in bestehende Systeme (41 %), Softwarelizenzen dagegen nur 21 % und den Tokenverbrauch 8 %.
Drei Kostenblöcke bestimmen die Rechnung:
- Plattform. In Microsoft- oder SAP-geprägten Häusern ist ein Teil oft schon lizenziert; neu hinzu kommen Kapazitäten für zusätzliche Datenmengen und KI-Funktionen. Für einen ersten Use Case genügt meist die vorhandene Infrastruktur.
- Suchschicht. pgvector auf vorhandenem PostgreSQL verursacht kaum Zusatzkosten; gemanagte Vektordatenbanken rechnen nach Ressourcen oder Nutzung ab.
- Engineering und Governance. Der größte Posten: Anbindung, Aufbereitung, Katalog und Rechtekonzept sowie Zeit der Datenverantwortlichen in den Fachbereichen.
Die Studie von Computerwoche und LHIND zeigt, welche Ziele Unternehmen mit diesen Investitionen verfolgen: Effizienz (55 %) und Kostensenkung (49 %) stehen vorn, Umsatzwachstum nennen nur 23 %.
Beispielrechnung mit offenen Annahmen
Angenommen, acht Beschäftigte sparen durch einen KI-Assistenten auf sauber angebundenen Daten je vier Stunden pro Woche. Bei 46 Arbeitswochen und einem Vollkostensatz von 70 € je Stunde ergibt das 8 × 4 × 46 × 70 € = rund 103.000 € im Jahr. Die Zahlen sind eine Annahme, keine Zusage. Setzen Sie Ihre eigenen Werte ein und stellen Sie sie den Kosten für Anbindung, Aufbereitung und Betrieb gegenüber. Messen Sie dazu vor dem Start einen Ausgangswert, sonst lässt sich die Wirkung später nicht belegen.
Wie Plotdesk Unternehmensdaten für KI nutzbar macht
Plotdesk verbindet eine KI-Plattform mit einem Umsetzungsteam für den Mittelstand und setzt dort an, wo Ihre Daten heute liegen. Statt Daten zuerst in ein weiteres System zu kopieren, werden vorhandene Quellen mit Rechten und Protokollierung angebunden.
Technisch stehen dafür mehrere Bausteine bereit:
- Dokumente: Dateien werden mit Texterkennung (OCR) lesbar und in Wissensspeichern abgelegt, die an Teams und Rollen gebunden sind.
- Strukturierte Daten: Externe Datenbanken wie SQL Server, PostgreSQL, MySQL oder Snowflake werden direkt abgefragt; Tables halten strukturierte Daten in der Plattform.
- Lokale Systeme: Plotdesk Connect bindet ERP, Fileserver, Ticket-Systeme und ältere Datenbanken bis hin zur AS/400 an, ohne sie ins Internet zu öffnen.
- Automatisierung: Workflows und zeit- oder ereignisgesteuerte Abläufe halten Daten aktuell und übergeben Ergebnisse an Folgesysteme.
- Eigene Anwendungen: Mit Canvas entstehen Anwendungen direkt auf Ihren Daten, im Chat erzeugt.
- Governance: SSO, Rollen, mehr als 40 Berechtigungen, Audit-Logs sowie Modell- und Kostensteuerung je Team. Betrieben wird eine dedizierte Instanz in der EU oder im eigenen Tenant, mit Zugriff auf mehr als 100 Modellvarianten aus zehn Provider-Typen.
Die Zusammenarbeit folgt vier Schritten: In der KI-Potenzialanalyse prüfen wir Prozesse, Datenquellen und Systeme und formulieren eine Hypothese, wo KI wirtschaftlich wirkt. Im Proof of Value wird ein klarer Use Case auf Ihren Daten umgesetzt und gegen gemeinsam definierte Erfolgskriterien geprüft. Die Produktive Lösung integriert ihn in Prozesse, Berechtigungen und Infrastruktur. Im Systematischen Ausbau bauen neue Use Cases auf demselben Datenfundament auf. Die Erfahrung dafür stammt aus mehr als 1.200 Use Cases in 15 Branchen.
Häufige Fragen zur KI-Datenstrategie
Brauchen wir ein Lakehouse, oder reicht unser Data Warehouse?
Wir nutzen SAP. Welche Rolle spielen Microsoft Fabric und SAP Business Data Cloud?
Sollten wir pgvector, Qdrant oder Pinecone nehmen?
Gilt Art. 10 der KI-Verordnung für unser Unternehmen?
Wer sollte die KI-Datenstrategie verantworten?
Wir haben Microsoft 365 Copilot. Brauchen wir trotzdem eine Datenstrategie?
Fazit: Daten entscheiden über den Nutzen von KI
KI ist in der Mehrheit der Unternehmen angekommen, ihre Wirkung noch nicht. Der Engpass liegt selten im Modell, sondern in Daten ohne Verantwortliche, ohne Katalog und ohne Zugriffskonzept. Eine KI-Datenstrategie schließt diese Lücke, wenn sie am konkreten Anwendungsfall ansetzt.
Beginnen Sie mit einem Use Case, dokumentieren Sie Herkunft und Rechte von Anfang an und wählen Sie die einfachste Architektur, die trägt. Wer zusätzlich verstehen will, in welchen Prozessen KI den größten Hebel hat, findet im Beitrag zu Process Intelligence die passende Ergänzung. Der zweite und dritte Use Case entstehen dann schneller, weil sie auf demselben Fundament aufbauen.