ピアソン

目次
ピアソン
ピアソン
@ creator • Click to Play Video Inline
🎵 ピアソン
ピアソンとスピアマンはどう使い分ける?相関係数の決定基準と実践手順

データ分析の現場で2つの変数の関係性を探る際、誰もが最初に手にする指標が「相関係数」です。しかし、手元にあるデータに対してピアソンの積率相関係数を使うべきか、それともスピアマンの順位相関係数を選ぶべきか、判断に迷う場面は少なくありません。分析手法の選択を誤ると、データの背後にある本質的な相関を見落としたり、誤った意思決定を招いたりするリスクを伴います。

統計解析における適切な指標選びは、データの信頼性を担保する生命線です。本稿では、データの尺度、正規性の有無、外れ値への耐性といった客観的基準をもとに、迷わず最適な手法を選び抜くための判断軸を整理してお伝えします。

📌 【この記事の重要ポイントまとめ】
  • 要点1:量的データで正規分布に従い、直線的な関係を調べる場合は「ピアソンの積率相関係数」を選択する。
  • 要点2:データが順位尺度である場合や、外れ値が存在する非線形(単調増加・減少)の関係には「スピアマンの順位相関係数」が適している。
  • 要点3:散布図による事前の視覚的確認と正規性の検定を組み合わせることで、分析の失敗を未然に防ぐことができる。

【基本概念】ピアソンの積率相関係数とスピアマンの順位相関係数の根本的な違い

2つの相関係数は、どちらも「2変数間の関連の強さ」を-1から+1の範囲で表す指標ですが、前提とする計算ロジックと検定の性質が根本から異なります。

ピアソンの積率相関係数は、母集団が正規分布に従っていることを前提とするパラメトリック検定の手法です。2つの変数の実数値そのもの(間隔尺度や比率尺度)を用いて、両者の間に「どれだけきれいな直線関係があるか」を計測します。値が1に近ければ正の線形相関、-1に近ければ負の線形相関を示し、0であれば直線的な関連がないと解釈されます。

一方のスピアマンの順位相関係数は、母集団の分布を限定しないノンパラメトリック検定に分類される手法です。各変数の実数値をそのまま使うのではなく、数値を昇順や降順に並べ替えた「順位データ」に変換してから相関を算出します。そのため、数値そのものの間隔が等しくないデータや、直線的ではなくても「一方が増えればもう一方も増える」という単調関係を正確に捉えられます。

【決定的な3つの基準】データの尺度・正規性の有無・外れ値の影響で見極める

ピアソンとスピアマンの使い分けにおいて、直感や推測で選ぶのは危険です。実務では以下の3つの明確な基準に沿って判断を下します。

第1の基準は「順序尺度と間隔尺度(または比率尺度)の区別」です。テストの点数、身長、売上金額、気温のように目盛りの間隔に意味がある量的データ(間隔・比率尺度)であればピアソンが候補に入ります。一方で、「満足度5段階評価」「アンケートの順位」「社内評価のランク」といった順序尺度の場合は、スピアマンを選択するのが鉄則です。

第2の基準は「正規性の検定の結果」です。量的データであっても、データが正規分布から著しく歪んでいる場合、ピアソンの適用は適切ではありません。シャピロ・ウィルク検定(Shapiro-Wilk test)やコルモゴロフ・スミルノフ検定(Kolmogorov-Smirnov test)を実施し、正規性が棄却された場合には、安全にスピアマンへ切り替える必要があります。

第3の基準は「外れ値の影響度合い」です。ピアソンは実数値の偏差平方和を用いるため、わずか1〜2個の極端な外れ値によって相関係数が大きく歪んでしまいます。スピアマンは数値を順位に置き換えるため、外れ値が存在しても極端に順位が狂うことがなく、ロバスト(頑健)な結果を維持できる強みがあります。

【迷った時の即決チャート】相関分析の判断フローと実践ステップ

分析実務をスムーズに進めるために、迷った際に辿るべき相関分析の判断フローを整理しました。

1. ステップ1:データの尺度を確認する
・順序データ(アンケートの段階評価など) ➔ スピアマンを選択
・連続的な量的データ(売上、温度、身長など) ➔ ステップ2へ進む

2. ステップ2:散布図を描画し、外れ値と関係性を視覚化する
・明らかな外れ値があり除外できない ➔ スピアマンを選択
・曲線的な単調関係(U字型ではなく一方向の増減) ➔ スピアマンを選択
・概ね直線状の分布をしている ➔ ステップ3へ進む

3. ステップ3:正規性の検定を実施する
・正規性が認められる(p > 0.05) ➔ ピアソンの積率相関係数を選択
・正規性が認められない(p ≦ 0.05) ➔ スピアマンの順位相関係数を選択

この手順を踏むだけで、手法の選択ミスによる誤った結論を論理的に回避できます。

【もう一つの選択肢】ケンドールの順位相関係数との違いと使い所

順位に基づくノンパラメトリックな相関係数には、スピアマンのほかにケンドールの順位相関係数(ケンドールのタウ:$\tau$)が存在します。こちらも知っておくべき重要な選択肢です。

スピアマンが「順位差の二乗」をベースに計算するのに対し、ケンドールはデータ対の「順位の逆転(不一致)」の数に着目して算出します。理論的には、ケンドールの方がサンプルサイズが小さいデータにおいて標本誤差が少なく、同順位(タイデータ)が多い場合にも安定した推定値を示す特徴があります。

サンプルサイズが十分に大きい一般的なビジネスデータではスピアマンが広く使われますが、心理学や医学研究、あるいは標本数が20〜30件未満と少ない調査では、ケンドールの採用が推奨される場面も目立ちます。

【ツール別実装】Python相関係数算出とExcel相関係数の求め方

理論を押さえた上で、代表的なツールを使った具体的な計算方法を確認します。

Python相関係数算出を行う場合、主要ライブラリであるPandasやSciPyを活用すれば極めてシンプルに実装できます。

# Pandasを用いたデータフレームからの算出
import pandas as pd
df = pd.DataFrame({'x': [10, 20, 30, 40, 100], 'y': [15, 25, 35, 45, 50]})

pearson_corr = df['x'].corr(df['y'], method='pearson')

# スピアマン
spearman_corr = df['x'].corr(df['y'], method='spearman')

# SciPyを用いた無相関検定(p値の算出)
from scipy import stats
stat, p_val = stats.spearmanr(df['x'], df['y'])

Excel相関係数の求め方については、ピアソンを求める際は「=CORREL(配列1, 配列2)」または「=PEARSON(配列1, 配列2)」関数を使用します。スピアマンを計算したい場合は、まず「RANK.AVG関数」などで各変数を順位列に変換した上で、その順位列同士に対して「=CORREL(順位配列1, 順位配列2)」を適用すれば即座に算出可能です。

【失敗しないための盲点】線形関係と単調関係の罠・散布図確認の重要性

相関分析で最も犯しやすい過ちは、数値を計算しただけで満足し、グラフによる視覚的確認を怠ることです。

相関係数は「関係の強さ」を示しますが、線形関係と単調関係の区別には注意が要ります。例えば、片方の変数が指数関数的に急上昇する場合、両者には強い関係(単調増加)があるにもかかわらず、直線を想定するピアソン相関係数は低めに出る傾向があります。この場合、スピアマンを用いれば1.0に近い高い相関として適切に検出されます。

さらに警戒すべきは「U字型」や「逆U字型」の非線形関係です。ストレスと作業効率の関係(ヤーキーズ・ドットソンの法則)のように、一定ラインまでは正の相関を示し、それを超えると負の相関になるケースでは、ピアソンもスピアマンも相関係数は0付近になってしまいます。散布図を見ずに「相関なし」と切り捨ててしまう重大な見落としを防ぐためにも、事前の散布図チェックは分析の絶対条件です。

【ピアソン スピアマン 使い分け】に関するよくある質問(FAQ)

Q1:サンプル数が非常に大きい場合、どちらを選んでも結果は同じになりますか?
A1:データがきれいな正規分布かつ直線的な関係であれば、ピアソンとスピアマンの数値はほぼ同等になります。ただし、巨大なビッグデータであっても外れ値が含まれていたり、裾野が広い歪んだ分布(ロングテール)をしていたりする場合は、両者の算出値に大きな乖離が生じます。サンプルサイズに関わらず、分布の形状と外れ値の有無を確認してください。

Q2:リッカート尺度(5件法アンケート)にはピアソンを使ってはいけませんか?
A2:厳密な統計理論上は順序尺度であるためスピアマン(またはケンドール)が適しています。実務や一部の社会科学分野では「等間隔性がある」と仮定してピアソンを適用するケースも見られますが、査読付き論文や厳格なエビデンスが求められるビジネス分析では、順位相関係数を用いる方が批判を受けにくく安全です。

Q3:ピアソンとスピアマンで相関係数の値が大きく異なるときは、どう解釈すればよいですか?
A3:例えば「ピアソンが0.3、スピアマンが0.8」のようなケースでは、データが直線ではなく「曲線的な単調関係」を描いているか、あるいは「一部の外れ値がピアソンの数値を引き下げている」可能性が極めて高い状態です。散布図を描画して外れ値の特定や非線形パターンの確認を行ってください。

まとめ:適切な相関係数の選択がデータ分析の信頼性を左右する

ピアソンとスピアマンの使い分けは、単なる計算式の違いにとどまらず、データが持つ特性(尺度・分布・外れ値)をどれだけ深く理解しているかの試金石です。直線的な関係性と正規性を前提とするピアソンに対し、順位に基づくスピアマンは歪んだ分布や外れ値に対しても柔軟に対応できる強みを持ちます。

ツールを使えば一瞬で相関係数が算出できる現代だからこそ、前提条件の確認を怠らない丁寧なデータハンドリングが求められます。分析の第一歩として必ず散布図を描き、データの性質を見極めた上で最適な指標を選択してください。 (出典: ピアソン スピアマン 使い分け(Yahoo!ニュース))

ピアソン スピアマン 使い分け
ピアソン スピアマン 使い分け
ピアソン スピアマン 使い分け