← TOPへ戻る

Tableauの予測機能とクラスター分析の仕組み
— 指数平滑法とK-meansを理解する

「予測線は数クリックで描けるのに、何を計算しているのか説明できない」「クラスター数Kをどう決めればいいのか分からない」―― Tableauの予測機能(指数平滑法)とクラスター分析(K-means)の仕組みを、信頼区間の読み方や決定論的な性質まで整理します。

Tableauの予測機能とクラスター分析が抱える共通の悩み

Tableauには「予測」と「クラスター」という、ほぼノーコードで高度な統計分析を実行できる機能が用意されています。グラフを右クリックして「予測」を選べば将来の数値が線で描かれ、分析ペインから「クラスター」をドラッグすればデータが自動でグループに分かれます。

しかし便利さの一方で、「この予測線はどの計算結果なのか」「クラスター数を変えたら結果が変わったが、どちらが正しいのか」と問われると、説明に詰まる方は少なくありません。

予測機能は指数平滑法(ETS法)、クラスター分析はK-means法という、いずれも統計学・機械学習の世界では標準的なアルゴリズムを採用しています。仕組みを理解しておくと、結果を正しく解釈できるだけでなく、Tableau Certified Data Analyst試験の「データの探索と分析」ドメインで問われるアルゴリズム関連の設問にも自信を持って答えられるようになります。

予測機能の裏側 — 指数平滑法(ETS法)の仕組み

指数平滑法とは何か

Tableauの予測機能が採用しているのは指数平滑法(ETS法、Exponential Smoothing)と呼ばれる時系列分析の手法です。指数平滑法とは、直近のデータほど重みを大きく、古いデータの重みを指数的に減衰させて将来の値を推定する方法を指します。

たとえば「過去12か月の売上」を使って来月の売上を推定する場面を考えます。単純な算術平均では12か月分の値を均等に扱いますが、指数平滑法では先月の値の影響が最も大きく、半年前の値はやや小さく、1年前の値はさらに小さく重みづけされます。重みは指数関数的に減るため、最近のトレンド変化への反応が早いことが特徴です。

似た手法に移動平均やARIMAがありますが、Tableauが採用しているのは指数平滑法であり、これは試験でも頻出の出題ポイントです。

レベル・トレンド・季節性の3要素モデル

Tableauの指数平滑法は、時系列データを3つの要素に分解して扱います。

  • レベル(Level): その時点での基準値、つまり「今このくらいの水準」を表す成分
  • トレンド(Trend): 上昇しているか下降しているかという中長期的な方向
  • 季節性(Seasonality): 毎年・毎月など周期的に繰り返されるパターン

たとえば小売店の売上は、ベースとなる売上水準(レベル)に、年々増加するトレンドが乗り、12月のクリスマス商戦で跳ね上がる季節性が重なって成り立っています。Tableauはこの3成分を自動で識別し、データに最も適合するモデルを選んで予測を生成します。

季節性の周期はデータの粒度によって自動判定されます。月次データなら12か月、日次データなら7日(曜日効果)といった具合に、Tableauが時系列の性質を読み取って組み込みます。この粒度は背後の集計方法(SUM・COUNT・COUNTDなど)によっても変わるため、基本となる仕組みは「Tableau集計の仕組み|COUNT・COUNTDの違いと粒度の変化」で確認しておくと理解がスムーズです。

信頼区間の正しい読み方

予測グラフには中央の予測線(点推定)に加え、その上下に帯状の領域が表示されます。これが信頼区間です。デフォルトは95%信頼区間ですが、Tableauの予測オプションから90%・99%・カスタム値に変更することもできます。

信頼区間とは、「将来の実測値がこの範囲に収まるであろう確率」を示す帯のことです。95%信頼区間であれば、「実際の値が帯の内側に入る確率がおよそ95%」と解釈します。

ここで初心者が陥りやすい誤解があります。「帯が広い=予測の精度が高い」と読んでしまうケースです。実際は逆で、帯が広いほど不確実性が高く、実測値がぶれる可能性が大きいことを意味しています。帯が狭いほど、データのばらつきが小さく、予測の信頼度が高い状態です。

信頼区間は「予測値そのもの」ではなく「予測がどれくらい当たりそうか」を示す指標である、と覚えておきましょう。指数平滑法の基本と信頼区間の読み方は学習単元「予測機能の使い方」で復習できます。

クラスター分析の裏側 — K-means法の仕組み

K-meansは「重心への距離」で分類するアルゴリズム

Tableauのクラスター分析が採用しているのはK-means法(Kクラスタリング)です。K-meansとは、データ点を「あらかじめ指定したK個のグループ」に分類する手法で、機械学習の教科書にも必ず登場する代表的なクラスタリングアルゴリズムです。

Tableauの実装では、距離を計算する前に各変数をmin-maxスケーリングで0〜1の範囲に正規化します。「購入金額(円)」と「購入回数(回)」のように単位やスケールが大きく異なる変数をそのまま使うと、数値の大きい変数だけがクラスタリング結果を支配してしまうため、この正規化が重要な前処理になります。

K-meansの計算手順は次のようになります。

  1. クラスター数Kを分析者が指定する(または自動推薦に従う)
  2. 各変数をmin-maxスケーリングで0〜1に正規化する
  3. 変数の平均値を閾値にデータを再帰的に2分割する決定論的な手順で初期の重心を決める(ランダムな初期値ではない)
  4. 各データ点を、二乗ユークリッド距離がもっとも近い重心のクラスターに割り当てる
  5. 重心の位置が動かなくなるまで4を繰り返す

シンプルに言えば「正規化したうえで、データ点と重心の二乗ユークリッド距離を計算し、最も近い重心のグループに割り当てる作業を繰り返す」アルゴリズムです。Tableauでは分析ペインから「クラスター」をビューにドラッグするだけでこの処理が実行されます。

クラスター数Kを決める判断軸(Calinski-Harabasz基準)

K-meansを使ううえで最大の難所は「Kをいくつに設定するか」です。Kを変えると分類結果はまったく変わるため、適切な値を選ぶ必要があります。

統計学で一般的によく知られる手法の一つがエルボー法です。エルボー法とは、Kを1、2、3……と増やしながら「クラスター内のデータ点が重心からどれだけ離れているか」(クラスター内平方和、SSE)を計算し、グラフにプロットする方法を指します。Kを増やすとSSEは減りますが、ある時点から減り方が緩やかになります。グラフが「肘(エルボー)」のように曲がる地点が、最適なKの目安とされる手法です。

ただし、Tableauが自動的に推薦するKの値はエルボー法ではなく、Calinski-Harabasz基準(指数が最初に局所的な最大値を取る地点を採用する基準)に基づいて決定されます。Tableauはデフォルトで最大25クラスターまでを探索し、設定を変更すれば最大50クラスターまで探索範囲を広げられます。エルボー法は一般的な統計手法として知っておく価値がありますが、「Tableauの自動推薦=エルボー法」と覚えると試験で誤答するおそれがあるため、両者を区別しておきましょう。

Tableauの自動推薦に加えて、ビジネス目的に合わせた手動設定も重要です。たとえば「顧客を上位・中位・下位の3セグメントに分けたい」という要件があれば、自動推薦の結果が4を示していてもK=3で運用するのが現実的な判断になります。

決定論的な初期化と再現性

一般的なK-meansの教科書的な説明では「ランダムな初期値→局所最適解に陥る可能性がある→実行ごとに結果が変わりうる」という性質が強調されます。しかしTableauのクラスター分析はこの一般的な実装とは異なり、変数の平均値を閾値に再帰的に2分割する決定論的な初期化手順を採用しています。

そのため、同じデータ・同じK値であれば、何度再実行しても常に同じクラスタリング結果が得られます(Tableau公式ヘルプが明記している性質です)。「クラスター分析は実行するたびに結果が変わる」という理解は誤りであり、試験でもこの決定論的な性質を問う設問に注意が必要です。K-meansの基本手順は学習単元「クラスター分析」で確認してください。

実務での活用例 — 売上予測と顧客セグメンテーション

理論を押さえたうえで、実際のビジネス現場での活用例を見ていきます。

予測機能の代表的な活用例は売上の季節予測です。月次の売上推移グラフに予測機能を適用すれば、過去のレベル・トレンド・季節性を踏まえた将来3〜6か月の予測線が描かれます。クリスマス前に売上が伸びるEC事業や、夏に需要が集中するアパレル事業など、季節パターンが明確な業種ほど指数平滑法の効果は発揮されます。信頼区間の幅を見れば「予測がどれだけぶれそうか」も伝えられるため、経営層への報告で説得力が増します。

クラスター分析の代表例は顧客セグメンテーションです。「購入頻度」と「客単価」を2軸にした散布図にK-meansを適用すれば、ヘビーユーザー層・ライトユーザー層・高単価少頻度層などが自動的に分類されます。各グループにカラーが付与されるため違いが視覚的に伝わり、施策の優先順位を議論する材料になります。

クラスタリング結果はディメンションとして保存できるため、フィルターや別ビューのカラーとして再利用が可能です。これにより「上得意客のみに絞ったダッシュボード」「中位顧客向けキャンペーン対象リスト」を一気通貫で組み立てられます。

結果を誤読しないための注意点

便利な機能ほど、結果の誤読が大きな意思決定ミスにつながります。代表的な落とし穴を整理します。

第一は信頼区間と予測値を混同しないことです。経営会議で予測値を見せるとき、「この帯の上限値で計画を立てよう」「下限値で在庫を絞ろう」といった判断をする場面があります。信頼区間はあくまで「ぶれ幅」を示すものであり、上限・下限のどちらかを決定値として採用する根拠にはなりません。「予測値はあくまで点推定、帯は不確実性の表現」という区別を徹底しましょう。

第二はクラスター分析の機械的判断を鵜呑みにしないことです。K-meansは「数値の近さ」だけでグループ化するため、ビジネス的な意味づけは人間が行う必要があります。「このクラスターは価格に敏感な層だ」「ここは品質重視の層だ」といった解釈は、ドメイン知識のある分析者が判断するものであり、自動分類の出力をそのまま施策に落とし込むのは危険です。

第三は十分なデータ量を確保することです。予測機能は時系列データの量とパターンが不足すると結果を表示できません。日付ディメンションと連続メジャーが揃っていても、データ点が少なすぎる場合や時系列パターンが不明瞭な場合、Tableauは「予測を計算できない」と判断します。クラスター分析でも、データ点が極端に少ない場合は意味のある分類になりません。予測に使う時系列データの粒度設計はLOD式の理解とも関わります。詳細は「Tableau LOD式(FIXED/INCLUDE/EXCLUDE)完全解説」で解説しています。

第四はKの設定をビジネス上の意味と照らし合わせて見直すことです。Tableauのクラスター分析は決定論的なため、同じK値であれば再実行しても結果は変わりません。一方でCalinski-Harabasz基準による自動推薦はデフォルトで最大25クラスターまでしか探索しない統計的な目安にすぎないため、自動推薦の値とビジネス上意味のあるセグメント数の両方を照らし合わせて、最終的なKを決定することが大切です。

Tableau Certified Data Analyst試験で問われる典型パターン

Tableau Certified Data Analyst試験では、予測機能とクラスター分析について次の3類型の出題パターンがあります。

パターン1: アルゴリズムの特定
「Tableauの予測機能で採用されているのは何か」「クラスター分析で使われるのは何か」という直球の問いです。指数平滑法(ETS法)とK-means法の名前を確実に紐づけられるかが問われます。移動平均、ARIMA、決定木、階層クラスタリングなど類似手法が誤答選択肢として並ぶため、「Tableauが採用しているのはこれ」という正解を即答できる状態にしておきます。

パターン2: 機能の挙動・条件
「予測機能を使うために必要なフィールドは」「クラスター数Kは変更できるか」といった、操作上の前提条件を問う問題です。予測には日付ディメンションと連続メジャーが必要で、クラスター数Kは自動推薦されるが手動変更も可能、という基礎を押さえておけば対応できます。

パターン3: 結果の解釈
「信頼区間の帯が広いとき何を意味するか」「クラスター結果はそのまま意思決定に使えるか」という結果読解力を問う問題です。信頼区間は不確実性の表現、クラスター結果は人間による意味づけが必要、という2点が頻出ポイントです。「帯が広い=精度が高い」「機械が分類すれば人間の解釈は不要」といった逆方向の選択肢が誘導として用意されているため、本記事の説明を踏まえて落ち着いて選びましょう。

「データの探索と分析」ドメイン全体の配点や出題範囲はTableau Certified Data Analyst試験の配点とロードマップで整理しています。

PassDojoで実力を確認しよう

予測機能とクラスター分析の挙動は、頭で理解しただけでなく演習で確認すると定着します。PassDojoでは試験形式の模擬問題を提供しています。

Tableau Certified Data Analyst 模擬試験を解くTableau実技力を試す(Skill Check 初段)Tableau Certified Data Analyst 入門学習へ

※ 本記事はTableau Certified Data Analyst試験の学習を支援する目的で作成しています。 予測機能・クラスター分析の仕様や試験の最新情報はSalesforce(Tableau)の公式ドキュメントをご確認ください。 Tableau・Salesforceは各社の商標または登録商標です。

この記事の内容を、問題を解いて定着させる

模擬試験で現在地を測り、入門学習で不足している知識を埋められます。

Tableau Certified Data Analyst 模擬試験に挑戦Tableau Certified Data Analyst 入門学習へ

無料会員登録で学習履歴を保存

模擬試験の結果や入門学習の進捗を保存し、苦手分野を継続して把握できます。

無料会員登録(30秒)ログイン