Führungskräfte in Unternehmen stehen unter zunehmendem Druck, Experimente mit KI in messbare Geschäftsergebnisse umzusetzen. Mit dem Fokus darauf, wie die Technologie die Produktivität steigern, Prozesse automatisieren oder neue Einnahmequellen erschließen kann, haben viele bereits Pilotprojekte und Proof-of-Concepts gestartet.
Viele dieser Initiativen haben jedoch Schwierigkeiten, in die Produktionsphase überzugehen. Ein immer wiederkehrendes Hindernis ist der Mangel an Daten, die ausreichend zuverlässig, zugänglich und geregelt sind, um KI in großem Maßstab zu unterstützen. Gartner geht davon aus, dass Unternehmen im Jahr 2026 60 % der KI-Projekte aufgeben werden, die nicht durch KI-taugliche Daten gestützt werden.
Bevor ein KI-Modell zuverlässige Ergebnisse liefern kann, benötigt es Zugriff auf vertrauenswürdige Daten.
Warum Datenplattformen plötzlich wieder an Bedeutung gewinnen
Kundendaten befinden sich im CRM, Finanzdaten in einem separaten Hauptbuch und Betriebsdaten im ERP. Jeder erstellt auf seinem Laptop neue Berichte auf der Grundlage der dortigen Daten, und dank der Cloud ist es ein Leichtes, zum „Citizen Data Engineer“ zu werden – noch nie war es einfacher, ein neues Silo zu schaffen.
Das Hinzufügen von KI verstärkt dieses Szenario nur noch. „Garbage In/Garbage Out“ gilt nach wie vor – mit dem Unterschied, dass ungezügelte KI diesen „Müll“ in großem Maßstab in überzeugende, aber falsche Antworten verwandeln kann.
Jahrelang wurden Datenplattformen weitgehend als Migrationsprojekte betrachtet: Systeme, die verlagert und modernisiert werden mussten und dann bis zum nächsten Migrationszyklus sich selbst überlassen blieben. Heute bilden sie den Kern jedes KI-Anwendungsfalls in Unternehmen. Data Engineering, Analytik, Governance und KI sind allesamt Teil desselben Ökosystems. Der Schwerpunkt verlagert sich von isolierten Plattformen für Data Warehousing, Analytik und maschinelles Lernen hin zu einer einheitlicheren Datenbasis, bei der Governance in die Architektur integriert ist.
Data Lakes, die eigentlich starre Data Warehouses ersetzen sollten, wurden oft zu „Data Swamps“, während Kunden ihre alten Integrationen parallel dazu weiter nutzten. Als Antwort darauf sind moderne Lakehouse-Architekturen entstanden, die Unternehmen eine gemeinsame Grundlage für Analytik, Data Engineering, Governance und KI bieten.
Dies ist ein Grund, warum Plattformen wie Databricks so viel Aufmerksamkeit auf sich gezogen haben. Offene Tabellenformate wie Delta Lake unterstützen transaktionale Konsistenz und versionierte Daten und helfen Unternehmen dabei, zuverlässige Tabellenhistorien zu pflegen und robustere Grundlagen für kontrollierte Datenprozesse zu schaffen.
Governance rückt in den Mittelpunkt
Eine gemeinsame Datenbasis löst nur einen Teil des Problems. Die nächste Frage ist, ob die Daten vertrauenswürdig, rückverfolgbar und kontrollierbar sind.
Bis vor wenigen Jahren waren Datenherkunft, Zugriffskontrollen und Kataloge in erster Linie Anliegen von Governance-Teams und wurden erst nachträglich implementiert. Heute wirkt sich Governance auf Unternehmensziele und KI-Ergebnisse aus. Wenn ein Unternehmen nicht erklären kann, woher die Daten stammen, wer sie geändert hat, wie sie transformiert wurden und wer Zugriff darauf hat, kann es den darauf aufbauenden KI-Ergebnissen nicht vertrauen.
Unity Catalog bietet ein einheitliches Framework für die Verwaltung von Zugriff, Datenherkunft und Audits im gesamten Lakehouse. Diese Funktionen können Unternehmen dabei helfen, die Daten-Governance und Rückverfolgbarkeit zu stärken, die zur Erfüllung geltender regulatorischer Verpflichtungen erforderlich sind, einschließlich derer, die sich aus dem EU-KI-Gesetz ergeben.
Skalierung in Industrieunternehmen
Industrieunternehmen müssen heute zunehmend traditionelle IT-Daten mit Eingaben von Maschinen, Sensoren, Produktionsanlagen und Betriebssystemen kombinieren. Die Datenmengen sind dabei enorm – ein Werk mit 5.000 Sensoren, die einmal pro Sekunde Messwerte erfassen, erzeugt täglich über 400 Millionen Messwerte.
Bislang waren diese Informationen oft vor Ort im Werk isoliert – sei es in Bangalore oder Johannesburg –, während die Unternehmenszentrale Berichte auf der Grundlage von Excel-Dateien erstellte, die per E-Mail ausgetauscht wurden. Die nahtlose Übertragung der Daten aus dem Werk stellt jedoch weiterhin eine Herausforderung dar.
Erfassungstechnologien wie Auto Loader und Zerobus können dabei helfen, Daten auf Werksebene in eine geregelte Datenumgebung zu überführen und so eine Grundlage für Anwendungen wie vorausschauende Instandhaltung, Produktionsoptimierung, Transparenz in der Lieferkette, Anlagenleistungsmanagement und Energieoptimierung zu schaffen. Und obwohl diese Ergebnisse oft als KI-Projekte beschrieben werden, handelt es sich in erster Linie um klare Dateninitiativen.
KI ist ein Ergebnis, keine Strategie
Einer der größten Fehler, den Unternehmen begehen, ist es, KI als Ausgangspunkt zu betrachten.
Meiner Erfahrung nach lassen sich die besten Ergebnisse jedoch erzielen, wenn man sich zunächst auf die Schaffung vertrauenswürdiger Datengrundlagen konzentriert – einschließlich einer Modernisierung der Architektur, einer Verbesserung der Governance sowie Investitionen in Data Engineering und Observability. Auch wenn dies vielleicht nicht so spannend klingt wie die Diskussion über autonome Agenten und intelligente Assistenten, ist es doch in der Regel genau das, was erfolgreiche Transformationen von endlosen Proof-of-Concepts (POCs) unterscheidet.
Das bedeutet nicht, dass zunächst jeder Datensatz korrigiert werden muss. Wir müssen die geregelte Grundlage Schritt für Schritt anhand einzelner hochwertiger Anwendungsfälle aufbauen und jeden Anwendungsfall diese Grundlage erweitern lassen.
In diesem Zusammenhang darf nicht vergessen werden, dass KI aus Daten Wert schafft. Und wenn die Daten nicht vertrauenswürdig, geregelt und zugänglich sind, kann keine noch so ausgefeilte KI dies kompensieren.
Stellen Sie also vor Ihrer nächsten Sitzung des KI-Lenkungsausschusses eine Frage: „Wenn dieses Modell morgen eine falsche Antwort liefern würde, könnten wir dann nachvollziehen, warum?“
Wenn nicht, haben Sie ein Datenproblem.
Einschlägige Blogs
KI-gestützte vorausschauende Instandhaltung im Schienenverkehr: Für sicherere und zuverlässigere Verkehrsnetze
KI-gestützte vorausschauende Instandhaltung im Schienenverkehr: Für sicherere und zuverlässigere Verkehrsnetze