スピアマンの順位相関係数とは?ピアソンとの違いやエクセル計算方法
無事にエクセルや統計ソフトでスピアマンの順位相関係数 $r_s$ が算出できたら、次はその数値が持つ意味を正しく読み解くフェーズに移ります。統計学の基礎詳細まとめとして、現場で統一的に用いられている相関係数の強さと解釈の基準(ギルフォードの基準に準拠)、およびその数値が「偶然の産物ではない」ことを証明する無相関検定とp値の目安を押さえておきましょう。
- $|r_s| = 0.7 \sim 1.0$:かなり強い相関がある(2つの変数の順位がほぼ連動して動いている状態)
- $|r_s| = 0.4 \sim 0.7$:中程度の相関がある(実務のアンケート分析や行動データでは、$0.4$ を超えれば十分に意味のある関連性として重視される)
- $|r_s| = 0.2 \sim 0.4$:弱い相関がある(サンプルサイズが大きい医療統計や社会調査では、$0.25$ 程度でも重要な示唆となるケースがある)
- $|r_s| = 0.0 \sim 0.2$:ほとんど相関がない(無相関とみなす)
「相関係数 0.8 なのに意味がない?」無相関検定とp値の決定的な役割
ここで初心者が必ず陥る罠が、「$r_s = 0.80$ が出たから強い相関があると断定してレポートに書いてしまう」ことです。もし調査対象がたった4人($n = 4$)しかいなかった場合、まったく無関係なサイコロを振っても、偶然に順位が揃って $r_s = 0.80$ になる確率は20%(5回に1回)も存在します。
そこで不可欠となるのが無相関検定(母集団の本当の順位相関係数 $\rho_s$ が $0$ であるという帰無仮説を棄却するための検定)です。サンプルサイズ $n$ が10以上(より厳密には $n \ge 20$)であれば、以下の検定統計量 $t$ が自由度 $n - 2$ の $t$ 分布に近似的に従う性質を利用します。
$$t = \frac{r_s \sqrt{n - 2}}{\sqrt{1 - r_s^2}}$$
エクセルでこのp値(有意確率)まで一気に出したい場合は、算出された $t$ 値(の絶対値)を使って =T.DIST.2T(ABS(t値), n-2) という関数を入力します。算出されたp値が $p < 0.05$(5%水準)、あるいはより厳格な $p < 0.01$(1%水準) を下回って初めて、「この順位相関係数は偶然ではなく、統計的に有意な相関である」と胸を張って発表できるのです。たとえば同じ $r_s = 0.45$ という中程度の相関係数であっても、$n = 10$ なら $p = 0.19$(有意ではない・偶然の可能性大)と棄却されないのに対し、$n = 30$ あれば $p = 0.012$($p < 0.05$ で統計的に有意!)と判定が一変します。
【プロの結論】数値への「共依存」を断ち切る心理的バウンダリーと、向いている人・おすすめできない人の判断基準
なぜビジネスの現場や組織の評価制度において、不適切な相関係数の乱用が繰り返されるのでしょうか。社会心理学および組織社会学の観点から分析すると、そこには現代日本組織に根深く存在する「数値への共依存関係(データ絶対視という呪縛)」と、主観と客観を切り分けられない「分析上のバウンダリー(境界線)の崩壊」という構造的課題が浮かび上がります。
人間が誰かを5段階で評価する人事考課や顧客満足度調査において、「評価4」と「評価5」の間隔は、「評価1」と「評価2」の間隔と心理的に決して等間隔ではありません。それにもかかわらず、管理職や分析者が「数字になっているのだから平均もピアソン相関も出せるはずだ」と過剰に数値へ依存(共依存)し、データが持つ本来の限界(順序尺度という境界線)を踏み越えてしまうことで、見かけ上の『偽の相関』に振り回される悲劇が起きています。健全なデータ意思決定を行うためには、「ここまでは実測値の距離として扱えるが、ここからは順序(ランク)としてしか扱えない」という冷徹な統計的バウンダリー(境界線)を引くリテラシーこそが最大の防御策となります。
以上の構造的分析を踏まえ、スピアマンの順位相関係数を「積極的に選ぶべき人(向いているケース)」と「使用を避けるべき人(おすすめできないケース)」の判断基準を明確に提示します。
- ⭕ スピアマンの順位相関係数が向いている人・選ぶべきケース:
- 顧客満足度(1〜5点)、重症度ステージ、成績ランキングなど順序尺度のデータ分析を行う人。
- 年収、資産額、Webページの滞在時間、購買金額など、一部のヘビーユーザーによる極端な外れ値が含まれるデータを、恣意的なデータ削除なしで誠実に分析したい人。
- 2つの変数が直線ではなく、曲線的(単調増加・単調減少)に連動しているかを検証したい人。
- ❌ スピアマンの順位相関係数をおすすめできない人・避けるべきケース:
- 身長と体重、気温と電力消費量のように、データがきれいな正規分布に従う比例・間隔尺度であり、「Xが1単位増えたときにYが何単位増えるか」という厳密な線形回帰モデルを作りたい人(→この場合は迷わずピアソンの積率相関係数を使用すべきです)。
- サンプルサイズが極端に少なく($n < 10$)、かつ3段階評価(松・竹・梅など)のように同順位(タイ)がデータ全体の半分以上を占めるような粗いカテゴリデータを扱う人(→この場合はペアの逆転率を直接数え上げるケンドールの順位相関係数 $\tau_b$ を使う方が統計的検出力と精度が圧倒的に高くなります)。
- U字型や逆U字型(二次関数的)の関係性、たとえば「ストレスが低すぎても高すぎてもパフォーマンスが落ち、適度な時に最大化する」といった非単調な関係を探している人(→順位相関でもピアソンでも相関係数は $0$ 付近になるため、必ず散布図の目視確認を併用してください)。