企業のリーダーたちは、AIの実験を測定可能なビジネス成果へと結びつけるよう、ますます強いプレッシャーにさらされています。この技術が生産性の向上、プロセスの自動化、あるいは新たな収益源の開拓にどのように貢献できるかに焦点が当てられる中、多くの企業がすでにパイロットプロジェクトや概念実証(PoC)を開始しています。
しかし、こうした取り組みの多くは、本番環境への移行に苦戦しています。繰り返し見られる障害の一つは、大規模なAI導入を支えるために必要な、十分に信頼性が高く、アクセス可能で、ガバナンスが確立されたデータが不足していることです。ガートナーは、2026年までに、AI対応データに支えられていないAIプロジェクトの60%が中止されると予測しています。
AIモデルが信頼できる結果を生み出すには、信頼できるデータへのアクセスが必要です。
データプラットフォームが再び重要視される理由
顧客データはCRMに、財務データは別の元帳に、業務データはERPに格納されている。誰もが自分のノートPC上のデータに基づいて新しいレポートを作成しており、クラウドの普及により、誰でも簡単に「市民データエンジニア」になれるようになった――新たなサイロを作り出すことが、かつてないほど容易になっているのだ。
そこにAIが加わると、この状況はさらに悪化する。「ゴミを入れればゴミが出る(Garbage In/Garbage Out)」という原則は依然として当てはまるが、制御の効かないAIは、その「ゴミ」を大規模かつ自信満々の誤った答えに変えてしまう可能性がある。
長年にわたり、データプラットフォームは主に移行プロジェクトとして扱われてきました。つまり、システムを移行し、最新化して、次の移行サイクルまでそのまま放置されるものでした。しかし今や、データプラットフォームはあらゆるエンタープライズAIユースケースの中核となっています。 データエンジニアリング、アナリティクス、ガバナンス、そしてAIはすべて、同じエコシステムの一部です。優先順位は、データウェアハウス、アナリティクス、機械学習のためのばらばらのプラットフォームから、アーキテクチャにガバナンスが組み込まれた、より統合されたデータ基盤へと移行しつつあります。
堅苦しいデータウェアハウスの問題を解決するために導入されたデータレイクは、しばしば「データスワンプ」と化してしまいましたが、顧客はそれとは別にレガシーな統合システムを稼働させ続けていました。これに対応して、アナリティクス、データエンジニアリング、ガバナンス、AI のための共通基盤を組織に提供する、現代的なレイクハウスアーキテクチャが登場しました。
これが、Databricksのようなプラットフォームがこれほど注目を集めている理由の一つです。Delta Lakeなどのオープンなテーブル形式は、トランザクションの一貫性とバージョン管理されたデータをサポートし、組織が信頼性の高いテーブル履歴を維持し、ガバナンスの効いたデータ運用に向けたより堅牢な基盤を構築するのを支援します。
ガバナンスが中心に浮上
共通のデータ基盤は、問題の一部しか解決しません。次の課題は、そのデータが信頼でき、追跡可能であり、ガバナンスが適用できるかどうかです。
数年前までは、データリネージ、アクセス制御、カタログは主にガバナンスチームの関心事であり、後付けで実装されることが一般的でした。今日では、ガバナンスは企業の目標やAIの成果に直接影響を及ぼします。 組織が、データの出所、変更者、変換方法、アクセス権限者を説明できない場合、そのデータに基づいて構築されたAIの成果を信頼することはできません。
Unity Catalogは、レイクハウス全体にわたるアクセス、リネージ、監査を管理するための統一されたフレームワークを提供します。これらの機能により、組織は、EU AI法に基づくものを含め、適用される規制上の義務を遵守するために必要なデータガバナンスとトレーサビリティを強化することができます。
産業企業におけるスケーリング
今日の製造業では、従来のITデータと、機械、センサー、生産資産、運用システムからの入力を組み合わせる必要性がますます高まっています。そのデータ量は膨大です。1秒に1回サンプリングを行う5,000個のセンサーを備えた工場では、1日あたり4億件以上の測定値が生成されます。
これまで、こうした情報はバンガロールであれヨハネスブルグであれ、工場内にサイロ化されていることが多く、本社ではメールで共有されたExcelファイルに基づいてレポートを作成していました。しかし、工場現場からデータをシームレスに外部へ移行させることは、依然として課題となっています。
Auto LoaderやZerobusといったデータ取り込み技術は、プラントレベルのデータをガバナンスの行き届いたデータ環境に取り込むのに役立ち、予知保全、生産最適化、サプライチェーンの可視化、資産パフォーマンス管理、エネルギー最適化といったアプリケーションの基盤を構築します。そして、こうした成果はしばしばAIの活用として説明されますが、それらはまず第一に明確なデータイニシアチブなのです。
AIは成果であり、戦略ではない
組織が犯しがちな最大の過ちの一つは、AIを出発点として扱うことです。
しかし、私の経験上、最も優れた成果は、まず信頼できるデータ基盤の構築に焦点を当てることから得られます。これには、アーキテクチャの近代化、ガバナンスの改善、そしてデータエンジニアリングや可観測性への投資が含まれます。これは、自律型エージェントやインテリジェントアシスタントについて語るほど刺激的に聞こえないかもしれませんが、通常、成功した変革と終わりのないPOC(概念実証)を分ける要因となっています。
これは、まずすべてのデータセットを修正しなければならないという意味ではありません。ガバナンスの効いた基盤を、価値の高いユースケースを一つずつ構築し、それぞれのユースケースによってその基盤を拡張していく必要があります。
この文脈で忘れてはならないのは、AIがデータから価値を生み出すということです。そして、データが信頼できず、ガバナンスが効いておらず、アクセスできない状態であれば、どんなに洗練されたAIであってもそれを補うことはできません。
ですから、次回のAI運営委員会を開く前に、一つだけ質問をしてみてください。「もし明日、このモデルが間違った答えを出した場合、その原因を特定できるでしょうか?」
もし答えられないなら、データに問題があるということです。