フィーチャーストア

Feature Store

フィーチャーストアとは

フィーチャーストア(Feature Store)とは、機械学習で使用する特徴量(フィーチャー)を一元的に管理・提供するためのデータ管理プラットフォームです。特徴量の作成、保管、共有、再利用、サービングを効率化し、学習時と推論時で一貫した特徴量を提供することでデータの品質と再現性を保証します。

表:フィーチャーストアの要点まとめ
ひとことで言うと機械学習で使う特徴量を、一元管理して再利用できるようにする仕組み。
何がうれしいか同じ特徴量を各所で作り直す無駄がなくなり、学習時と本番での食い違いも防げる。
注意点導入コストが高い。モデルが数個なら過剰投資になりやすい。

フィーチャーストアの構成

フィーチャーストアは通常、オフラインストア(学習用の大量データを保持するデータウェアハウス)とオンラインストア(推論時に低レイテンシで特徴量を提供するキャッシュ/KVストア)の2層構成です。特徴量パイプラインがデータソースから特徴量を計算し、両ストアに書き込みます。

図:フィーチャーストアの役割
1特徴量を定義一度作れば使い回せる
▶
2計算して保存バッチとリアルタイム
▶
3学習時に取得過去時点の値を再現
▶
4推論時も同じ定義食い違いを防ぐ
▶
5チームで共有重複開発をなくす

代表的なフィーチャーストア

Feast(Feature Store)はオープンソースのフィーチャーストアで、Google Cloudとの親和性が高いです。Tecton は商用フィーチャーストアの代表格で、リアルタイム特徴量計算もサポートします。Amazon SageMaker Feature Store、Databricks Feature Storeなどのマネージドサービスもあります。

フィーチャーストアの価値

フィーチャーストアの導入により、チーム間での特徴量の再利用が促進され、同じ特徴量を複数回計算する無駄がなくなります。学習と推論での特徴量の不一致(Training-Serving Skew)を防ぎ、データの系譜管理やガバナンスにも貢献します。