← TOPへ戻る

Tableauのトレンドライン5モデルを使い分ける
— 線形・多項式・指数・対数・累乗とR2

「トレンドラインは自動で引けるのに、線形と多項式のどちらを選ぶべきか、R2の見方が分からない」―― Tableauが用意する5つの統計モデルの数式と適用シーン、R2の読み方と落とし穴、多項式の過学習リスクを実例とともに整理します。

トレンドラインで「モデル選択」が分析の信頼性を決める理由

モデル選択を誤ると結論まで歪む

Tableau Desktopで散布図を作り、ビューにトレンドラインをドラッグするだけで、Tableauは自動的に統計モデルでデータを近似してくれます。操作自体はわずか数秒で完了するため、「とりあえず線形を引いておく」「自動で出たモデルをそのまま使う」という運用になりがちです。

しかし、トレンドラインのモデル選択は分析の結論そのものを左右します。たとえば季節性のある月次売上データに線形モデルを当てると、「右肩上がりに伸びている」という結論しか得られません。実際には「夏と年末にピークがある」という重要なパターンを見落とすことになり、需要予測の精度が大きく下がります。

逆に、本来一定の伸び率しか持たない売上データに多項式の3次モデルを当てると、データの細かいノイズに合わせて曲線が踊り、「来期は急減速する」という根拠の薄い予測を生み出してしまいます。これがいわゆる過学習(オーバーフィッティング)の典型例です。

つまりモデル選択は、表現力(フィットの良さ)と汎化性能(新しいデータへの適用力)のバランスを取る判断であり、Tableau Certified Data Analyst試験でも繰り返し問われる中核論点です。

Tableauで選べる5つの統計モデル

Tableau Desktopのトレンドラインで選択できるモデルは、線形・多項式・指数・対数・累乗(Power)の5種類です。それぞれが想定するデータの形が異なり、選び方には根拠が必要です。

モデル想定するデータ形状代表的な実例
線形一定の傾きで増減月次売上の安定成長、固定費
多項式曲線的な山・谷季節性のある売上、二次関数的な現象
指数加速度的な急成長・急減少市場立ち上がり期、感染症の初期拡大
対数初期は急、後半は頭打ち学習効果、市場浸透の飽和
累乗比率一定のべき乗関係(両対数で線形)規模の経済、物理法則的なスケーリング

このあと、それぞれの数式と適用シーンを順に整理します。散布図のもとになるデータ設計の基本はデータモデル設計で解説しています。

5モデルの数式と適用シーンを整理する

線形モデル — 一定の傾きを表す最もシンプルな式

線形モデルは Y = a + bX という式で表され、傾き b と切片 a の2つのパラメーターでデータを近似します。Xが1単位増えるごとにYが b ずつ変化するという、もっとも素直な関係です。

このモデルが適しているのは、増減の幅が時間や数量によらず一定とみなせるケースです。月次売上が毎月およそ同じ金額ずつ伸びている、あるいは広告費を1万円増やすたびにコンバージョンが約20件増えているといった、定数的な関係に向いています。

線形モデルの強みは結果の解釈のしやすさです。傾きの値そのものがビジネス上の意味を持ちます(「広告費1万円あたり20件のCV」など)。意思決定者への説明しやすさを優先する場面でも有力候補になります。

一方で、本来曲線的なデータに線形を当てると、フィットが甘くなりR2が低下します。後述する季節性のある売上データなどには不向きです。

多項式モデル — 曲線の山と谷を捉える

多項式モデルは Y = a + b₁X + b₂X² + ... + bₙXⁿ という形で、次数(degree)に応じて項が増えます。Tableau Desktopでは2次〜8次の範囲で次数を指定できます。

2次多項式(Y = a + bX + cX²)は1つの山または谷を持つ放物線になり、季節性のある売上や、上限に近づくと頭打ちになる現象を表現できます。3次多項式は変曲点を1つ持つS字曲線を扱えます。

多項式モデルの強みは、線形では取りこぼす曲線を素直に再現できる点です。一方で次数を上げすぎると、データのノイズまで拾ってしまい、訓練データには高いR2を示すのに新しいデータでは外れる過学習に陥ります。実務では2次か3次までで収めることが多く、4次以上を使う場合は十分な根拠が必要です。5モデルの選択基準を短時間で復習したい方は学習単元「トレンドラインの統計モデル」も参照してください。

指数モデル — 加速度的な増減を表現する

指数モデルは Y = a × b^X という形で、Xが増えるほどYが加速度的に増減します。Tableauは内部的に対数変換を行って線形回帰として近似するため、Y > 0 のデータに限られる点に注意してください。

このモデルが適しているのは、複利的な成長や急成長フェーズの市場データです。サブスクリプションサービスの初期ユーザー数、感染症の初期拡大局面、複利運用の資産推移など、増加率そのものが時間とともに増えていくケースです。

ただし、指数モデルは「永遠に加速し続ける」前提のため、現実には市場の飽和や物理的な上限を無視するリスクがあります。長期予測には不向きで、立ち上がり期の傾向把握に向きます。

対数モデル — 初期は急増して後半に頭打ちになる関係

対数モデルは Y = a + b × ln(X) という形で、Xが小さいうちはYが急激に変化し、Xが大きくなるにつれて変化が緩やかになります。Tableauでは X > 0 の領域でのみ計算されます。

このモデルが適しているのは、学習曲線・市場浸透・スキル習熟など、初期の伸びが大きく後半に飽和する現象です。新サービスの登録ユーザー数が初月に急増して、半年後にはほぼ横ばいに落ち着くようなパターンが典型です。

指数モデルとは対照的な形であり、両者の違いは「加速するか減速するか」と覚えておくと混乱しにくくなります。

累乗モデル — 比率が一定のべき乗関係を表現する

累乗(Power)モデルは Y = b0 × Xb1 という形で、XとYの比率が一定のべき乗関係にあるデータを近似します。両対数(log-log)スケールに変換すると直線になるため、Tableauは内部的に対数変換をかけて線形回帰として計算します。指数モデルと同様にX、Yともに正の値である必要があります。

このモデルが適しているのは、規模の経済(生産量が2倍になるとコストが1.8倍で済む、といった規模効果)や、物理法則的な比例関係(面積と周囲長、売場面積と来店数など)です。指数モデルの「時間とともに加速する」関係とは異なり、累乗モデルは「何かの量が何倍になると、もう一方が一定の指数倍になる」という静的な比例関係を表します。

指数・対数・累乗の3つはいずれも対数変換を使う点で似ていますが、指数は時間軸に対する成長、対数はXの大きさに対する頭打ち、累乗はXとYの比率関係というように、着目する軸が異なります。混同しやすいため、「時間で加速・減速するなら指数か対数、量と量の比例関係なら累乗」と覚えておくと区別しやすくなります。

R2(決定係数)の読み方と限界

R2は0〜1で「説明できた割合」を示す

R2(決定係数、R-squared)はモデルがデータの変動をどれだけ説明できたかを示す指標で、0から1の値を取ります。1に近いほどモデルがデータを良く説明できており、0に近いほど説明できていない状態を意味します。

直感的には「データの散らばり全体のうち、何割をモデルで説明できたか」を示す比率です。R2 = 0.85 ならば、データの変動の85%がモデルで説明されており、残り15%は誤差や未観測の要因によるものと解釈できます。

Tableau Desktopではトレンドラインを右クリックして「統計情報の記述」を選ぶと、R2・p値・各係数の値を確認できます。試験でもこのメニュー操作と読み取り方は問われやすいポイントです。

R2だけで判断できない3つの落とし穴

R2は分かりやすい指標ですが、これだけを根拠にモデルを選ぶと誤判断につながります。

第一に、多項式の次数を上げると見かけのR2はほぼ必ず上昇します。データ点の数だけ次数を上げれば理論上はR2 = 1に到達できますが、それは過学習の極限であり予測には使えません。

第二に、R2はモデルの形状の妥当性は判断してくれません。本来曲線的な関係を線形で近似すると、R2がそれなりに高く出ても残差(実測値とモデル値の差)に明確なパターンが残ります。残差プロットを併せて確認する習慣が大切です。

第三に、p値はR2と別物です。p値は「観測されたトレンドが偶然生じた確率」を示し、一般に0.05未満であれば統計的に有意と判断されます。R2はあてはまりの良さ、p値はトレンドの有意性であり、両者は独立に解釈する必要があります。

多項式の次数と過学習リスク

多項式モデルは表現力が高い反面、過学習に陥りやすい性質を持ちます。次数を上げるほどモデルはデータの細部に追従するようになり、訓練データでのR2は上昇する一方で、新しいデータに対する予測精度は下がっていきます。

イメージとしては、12個のデータ点に対して11次の多項式を当てると、すべての点を完全に通る曲線が描けます。しかしその曲線は点と点の間で激しく振動しており、新しい入力が来たときの予測値は信頼できません。これが過学習の極端な姿です。

実務での対応指針は明快です。まず2次多項式から始めて、ビジネス的に説明できる山・谷の数が増えるならば次数を1つずつ上げる。R2が頭打ちになったり、残差プロットに改善が見られなくなったら、それ以上次数を上げないという判断が必要です。Tableau Certified Data Analyst試験でも「次数を高くするほど良い」という選択肢は誤答として頻出します。

実例で覚える5モデルの使い分け

一度だけ山・谷がある業績変化 → 多項式(次数2〜3)

多項式モデルが向くのは、周期的に繰り返す季節性ではなく、ある期間だけ上がって下がる、あるいは上昇→停滞→再上昇のように変曲点を1つだけ持つ変化です。たとえば期間限定プロモーション中だけ売上が跳ね上がり、終了後に元の水準へ戻るようなケースは2次多項式(上に凸の放物線)でよく近似できます。新機能のリリース直後に利用が伸び、しばらく停滞してから口コミで再び伸び始めるような、変曲点を1つ持つS字的な変化は3次多項式で捉えられます。

一方、夏と年末に繰り返しピークを迎えるような季節性(周期的に繰り返す山と谷)は、多項式トレンドラインでは正しく表現できません。3次多項式が作れる極値(山・谷)は最大2つまでで、年に複数回繰り返すピークを多項式で無理に当てはめようとすると、次数を上げて過学習を招くか、パターンを取りこぼすかのどちらかになります。繰り返す季節性を扱いたい場合は、多項式トレンドラインではなくTableauの予測機能(指数平滑法)や季節成分の分解を使うのが適切です。予測機能の仕組みは「Tableauの予測機能とクラスター分析の仕組み」で解説しています。月次売上をどう集計してトレンドラインの元データにするかは「Tableau集計の仕組み|COUNT・COUNTDの違いと粒度の変化」で解説しています。

市場成長の初期フェーズ → 指数

新しいSaaS製品をリリースして最初の半年、ユーザー数が口コミで加速度的に伸びているフェーズを考えます。初月100人、2ヶ月目250人、3ヶ月目600人、4ヶ月目1,500人というように、増加率自体が増えていく場合は指数モデルが最適です。

ただし、指数モデルが適切なのはあくまで「加速フェーズ」の間だけです。市場が飽和に近づくにつれて伸び率は鈍化し、いずれは対数モデルやS字カーブの方が当てはまるようになります。指数モデルでの予測は短期に限定する判断が重要です。

飽和現象(学習効果・市場浸透) → 対数

新入社員のタイピング速度が、入社から3ヶ月で大きく向上し、その後は伸びが緩やかになるような学習曲線データには対数モデルが当てはまります。市場浸透率(普及率)の推移、特定スキルの習熟度なども同じ形状を描きます。

対数モデルは「最初に大きく伸びる→後半は飽和に向かう」という非対称な現象を素直に表現できる点が強みです。指数モデルが「いつまでも加速する」前提なのとは対照的で、両者は形状的に逆の関係にあります。

安定成長の月次トレンド → 線形

成熟市場における主力商品の月次売上が、毎月およそ50万円ずつ伸びているような安定成長データには線形モデルが適しています。傾きの値(月50万円)がそのまま「翌月の追加売上見込み」として解釈でき、経営報告でも説明しやすくなります。

季節性が小さく、市場フェーズも安定しているデータでは、無理に多項式や指数を当てる必要はありません。シンプルな線形でR2が0.9前後に届くなら、それ以上モデルを複雑にしても得るものは少ないという判断が現実的です。

規模の経済・物理的な比例関係 → 累乗

店舗の売場面積と年間来店者数のように、「ある量が2倍になると、別の量がおおよそ一定の指数倍になる」関係には累乗モデルが向きます。売場面積を2倍にすると来店者数が1.5倍になるといった規模効果は、両対数グラフで直線になるため、Tableauの累乗モデルでうまく近似できます。

指数モデルと混同しないよう注意してください。指数モデルはXが時間軸で「時間が経つほど加速・減速する」関係を扱うのに対し、累乗モデルはXも量の指標で「量と量の比率関係」を扱います。どちらも対数変換を使う点は共通していますが、X軸が時間かどうかで使い分けを判断すると区別しやすくなります。

Tableau Certified Data Analyst試験で問われる典型パターン

Tableau Certified Data Analyst試験では、トレンドラインに関する設問が「データの探索と分析」ドメインで繰り返し出題されます。問われる型はおおむね3つに整理できます。

第一の型はモデル選択を問う問題です。データの特徴(急成長・周期変動・緩やかな増加・飽和・比率関係など)を文章で示し、線形・多項式・指数・対数・累乗のなかから最適なモデルを選ばせます。「指数関数的な加速→指数」「変曲点を1つ持つ山・谷の変化→多項式」「初期に急増して後に頭打ち→対数」「量と量の比率が一定のべき乗関係→累乗」というキーワード対応を押さえておくと答えやすくなります。

第二の型は統計指標の意味を問う問題です。「R2は1に近いほど良い」「p値は0.05未満で有意」を選ばせる定番問題で、R2とp値を逆に説明している選択肢、向きを反転させた選択肢(R2は0に近いほど良い)が誤答として並びます。

第三の型は過学習を問う問題です。多項式モデルで次数を上げすぎるとどうなるかを問い、「訓練データにはよく合うが新しいデータで外れる」「複雑になりすぎて予測精度が下がる」という選択肢を選ばせます。「次数は高いほど良い」は典型的な誤答です。

「データの探索と分析」ドメイン全体の配点や学習順序はTableau Certified Data Analyst試験の配点とロードマップで整理しています。

これら3パターンは関連学習単元「トレンドラインと統計モデル」でも整理されており、確認問題で記憶を定着させると本番で迷いにくくなります。

PassDojoで実力を確認しよう

Tableauのトレンドライン・統計モデルは、Tableau Certified Data Analyst試験の「データの探索と分析」ドメインで安定して出題される論点です。記事の理解度をPassDojoの模擬試験でぜひ確認してみてください。

Tableau Certified Data Analyst 模擬試験を解くTableau実技力を試す(Skill Check 初段)関連学習単元「トレンドラインと統計モデル」へ

※ 本記事はTableau Certified Data Analyst試験の学習を支援する目的で作成しています。 トレンドラインの統計モデルや試験の最新情報はSalesforce(Tableau)の公式ドキュメントをご確認ください。 Tableau・Salesforceは各社の商標または登録商標です。

この記事の内容を、問題を解いて定着させる

模擬試験で現在地を測り、入門学習で不足している知識を埋められます。

Tableau Certified Data Analyst 模擬試験に挑戦Tableau Certified Data Analyst 入門学習へ

無料会員登録で学習履歴を保存

模擬試験の結果や入門学習の進捗を保存し、苦手分野を継続して把握できます。

無料会員登録(30秒)ログイン