POSデータや顧客データなど、小売企業には日々膨大なデータが蓄積されています。これらをいかに利活用し、需要予測や販促施策、店舗運営の意思決定に活かせるかは、企業の競争力を左右する重要な経営戦略の要です。データドリブンな意思決定の実現には、大量のデータをリアルタイムかつ正確に処理できるデータ基盤の開発が不可欠となります。
しかし、いざデータ基盤の開発に着手すると、小売業界ならではの落とし穴に直面することが多々あります。本記事では、Matillion、Snowflake、Tableauを組み合わせた基盤構築の事例をもとに、膨大なPOSデータを扱う際に陥りやすい技術的な落とし穴と、コスト最適化のベストプラクティスを解説します。
既存BIツールのパフォーマンス課題と新データ基盤のアーキテクチャ
例となる大手小売り企業の既存環境では、とあるBIツールを使用していましたが、レポート表示の著しい遅延が課題となっていました。複数人がアクセスするとさらにパフォーマンスが低下するため、ユーザーはデータをダウンロードして手元で集計せざるを得ず、属人化と業務非効率が常態化していました。
モダンデータスタックを採用したELT環境の構築
この課題を解決するために、新しいデータ基盤にはクラウドネイティブなモダンデータスタックを採用することで、新たなELT環境を構築しました。
モダンデータスタックとは、データの「取り込み」「保管・処理」「分析・可視化」といった役割ごとに、それぞれ得意なクラウドサービスを組み合わせて構築するデータ基盤の考え方です。従来は自社サーバー上で1つのシステムがすべての処理を担うケースが多くありましたが、モダンデータスタックでは、各役割に特化したサービスをパーツのように組み合わせることで、必要な機能を柔軟に選び、効率よく基盤を構築することができます。
また、まずはデータをそのまま保管場所(データウェアハウス※DWH)に取り込んでから、その中で必要な形に加工・整形するという順番を取るのも特徴的なポイントです。これにより、データを取り込む段階での作業負荷を抑えつつ、保管場所側の高い処理能力を活かし、効率的にデータを整形することができます。
一方で、サービスごとに料金体系が異なるため、組み合わせ方によってはコストが想定以上に膨らんでしまうこともあり、コスト管理の重要性が増す点には注意が必要です。
全国に多数の店舗を展開する小売企業の場合、1店舗・1日あたりの取引データだけでも相当な件数にのぼり、それが全店舗・毎日蓄積されていくため、データ基盤には大量データを安定して処理できる性能が求められます。今回のプロジェクトでも十数億行を超えるデータ処理が必須となっており、こうした要件を満たす基盤として、モダンデータスタックの採用は理にかなった選択でした。
データ取り込みにMatillion、データの保管・処理にSnowflake、分析・可視化にTableauを選定し、アーキテクチャを構築しました。
構築プロセスで直面した2つの落とし穴
膨大なデータを処理する中で、初期段階で取り込んだファイル群の中に、いくつかのイレギュラーなファイルが発見されました。
これらの例外パターンは、当初想定していなかったものであり、発見が後工程になってからだったため、発覚するたびに、その形式に対応した処理を追加で作成する必要が生じ、結果として大きな手戻りが発生しました。
また、コスト面でも課題がありました。初期構築時のジョブ実行やクエリ実行において、想定外の処理時間がかかり、クラウドリソースの課金額が跳ね上がる事態が発生したのです。
これはまさに、モダンデータスタック導入時に注意すべきとされる、サービスごとの料金体系の違いによるコスト増加が、実際のプロジェクトでも表面化した形といえます。
大規模基盤開発でコストとパフォーマンスを両立する3つのポイント
モダンデータスタックを活用した大規模基盤開発を行っていく上で、以下の3つのポイントが非常に重要になります。
1. イレギュラーデータの早期特定とレギュラー処理の確立
ファイル数やデータ量が膨大であるからこそ、イレギュラーなパターンの早期発見が不可欠です。
まずはレギュラーパターンの処理をいち早く完成させ、ベースラインを確立することが必須となります。その上で、例外パターンの有無を事前にシステム提供元や業務担当者からヒアリングし、手戻りのリスクを最小限に抑えることが重要です。
2. 一時的なファイル処理における代替手段(AWS CLI等)の活用
本番のデータパイプラインに含まれない一時的な処理(過去データの解凍やファイル整理など)には、クラウドツールのコンポーネントを安易に使用しない工夫が必要です。
AWS CLIなどの代替手段を活用し、ELTツールやDWHのコンピュートリソースを消費せずに処理を行うことで、開発初期段階の不要な課金を大幅に抑えることができます。
3. BIツール接続時におけるデータ量とパフォーマンスの意識
TableauなどのBIツールからDWHに接続する際は、常に本番環境のデータ量を意識した設計が求められます。
初期構築時の小規模データ(1ヶ月分など)で問題なく動作しても、全データ(2年分など)を投入した途端にパフォーマンスが劣化し、クエリコストが増大するケースは少なくありません。構築初期からフルボリュームのデータを想定したパフォーマンスチューニングを心がける必要があります。
初期段階からのコスト意識と例外対応がプロジェクトを成功に導く
本記事では、大規模POSデータのDWH構築を例に、コストとパフォーマンスを最適化するためのポイントを解説してきました。
こうしたプロジェクトを成功に導くのは、とりあえず動かすことだけを目指すのではなく、初期段階から発生しうる例外事象やコスト増加の要因を予測し、適切に対処する視点です。
弊社では、こうした最新技術やこれまでのプロジェクトで培った知見・経験を活かし、小売業界に向けたソリューションをご提供しています。
データ基盤の開発や、データ活用にお悩みのある方は、ぜひお気軽にお問い合わせください。



