什麼是變異數分析?為什麼要做變異數分析?

  • 之前的章節,我們描述隨機變數與本身的隨機性質的關係與工具
  • 當隨機變數與某些已知的獨立變數相關時,我們該如何做分析?
    • 獨立變數是類別型變數:變異數分析
    • 獨立變數是數值型變數:迴歸分析

變異數分析

  • 「變異數分析」(ANOVA)中,我們假設樣本來自不同的群體
    • 群體代表「已知的變數」
  • 我們假設不同的群體代表不同參數的常態分佈
  • 我們透過分析,不同群體的變異數,推論不同群體之間的平均是否相等

變異數分析的假設

  • 假設我們收集到的\(N\)筆數據可分成\(k\)組:
    • 第1組:\(Y_{1,1}, Y_{1, 2}, ..., Y_{1, n_1}\)共有\(n_1\)筆資料
    • 第2組:\(Y_{2,1}, Y_{2, 2}, ..., Y_{2, n_2}\)共有\(n_2\)筆資料
    • 第k組:\(Y_{k,1}, Y_{k, 2}, ..., Y_{k, n_k}\)共有\(n_k\)筆資料
  • 我們更近一步假設:

\[Y_{i,j} \sim \mathcal{N}(\theta_i, \sigma^2)\]

傳統的變異數分析

  • \(H_0: \theta_1 = \theta_2 = ... = \theta_k\)

挑戰

  • 我們不一定對\(H_0\)並不感興趣,我們想知道的可能是:哪一個\(\theta_i\)最大或最小

變異數分析的方法

根據機率論,我們可以知道:

  • \(\bar{Y_i} = \frac{1}{n_i} \sum_{j=1}^{n_i}Y_{i,j} \sim \mathcal{N}(\theta_i, \frac{\sigma^2}{n_i})\)
  • \(S^2_i = \frac{1}{n_i - 1} \sum_{j = 1}^{n_i} \left(Y_{i,j} -\bar{Y_i}\right)^2\)
    • \((n_i - 1)S^2_i / \sigma^2 \sim \chi^2_{n_i - 1}\)
  • 因為\(\sigma\)是一致的,統計學家用所有的資料來估計\(\sigma\):\(S^2_p = \frac{1}{N - k} \sum_{i=1}^k \sum_{j = 1}^{n_i} \left(Y_{i,j} -\bar{Y_i}\right)^2 \sim \chi^2_{N - k}\)
    • \((N - k)S^2_p / \sigma^2 \sim \chi^2_{N - k}\)
  • \(\chi^2_p\) 代表自由度\(p\)的卡方分佈,也代表\(Gamma(\frac{p}{2}, 2)\)

變異數分析的方法

根據機率論,我們可以知道:

  • 給定任意的\(a_1, a_2, ..., a_k \in \mathbb{R}\),我們知道:
    • \(E\left( \sum_{i=1}^k a_i \bar{Y_i} \right) = \sum_{i=1}^k a_i \theta_i\)
    • \(Var\left( \sum_{i=1}^k a_i \bar{Y_i} \right) = \sigma^2 \sum_{i=1}^k \frac{a^2_i}{n_i}\)

\[\frac{\sum_{i=1}^k a_i \bar{Y_i} - \sum_{i=1}^k a_i \theta_i}{\sqrt{S^2_p \sum_{i=1}^k \frac{a^2_i}{n_i}}} \sim t_{N - k}\]

  • \(t_{N - k}\) 代表自由度\(N-k\)的Student’s t分佈

變異數分析的方法:t 檢定

  • 要檢定 \(H_0: \sum_{i=1}^k a_i \theta_i = C\),只要當以下條件發生時拒絕\(H_0\)

\[\left| \frac{\sum_{i=1}^k a_i \bar{Y_i} - C}{\sqrt{S^2_p \sum_{i=1}^k \frac{a^2_i}{n_i}}} \right| > t_{N - k, \frac{\alpha}{2}}\]

  • 或是計算\(\sum_{i=1}^k a_i \theta_i\)的信賴區間:

\[\left[\sum_{i=1}^k a_i \bar{Y_i} - t_{N-k,\frac{\alpha}{2}} \sqrt{S^2_p \sum_{i=1}^k \frac{a^2_i}{n_i}},\sum_{i=1}^k a_i \bar{Y_i} + t_{N-k,\frac{\alpha}{2}} \sqrt{S^2_p \sum_{i=1}^k \frac{a^2_i}{n_i}}\right]\]

  • \(t_{N - k, \frac{\alpha}{2}}\) 代表自由度\(N-k\)的t-分佈的\(\frac{\alpha}{2}\)的百分位數:當\(X \sim t_{N-k}\)時\(P(X > t_{N - k, \frac{\alpha}{2}}) = \frac{\alpha}{2}\)

範例

  • 檢定\(H_0: \theta_1 = \theta_2\)
  • 比較\(\theta_1, \theta_2, \theta_3\)的大小順序
    • 檢定\(\theta_1 - \theta_2\)、\(\theta_2 - \theta_3\)與\(\theta_1 - \theta_3\)

變異數分析的方法:F 檢定

  • 當以下條件發生時,拒絕\(H_0: \theta_1 = \theta_2 = ... = \theta_k\):

\[\frac{\sum_{i=1}^k n_i \left( \bar{Y_i} - \bar{Y} \right)^2}{S^2_p} > (k - 1) F_{k-1, N- k, \alpha}\]

  • \(\bar{Y} = \frac{1}{N}\sum_{i,j} Y_{i,j}\)
  • \(F_{k-1, N-k}\)代表自由度\(k-1\)、\(N-k\)的F分佈。\(F_{k-1, N- k, \alpha}\)代表百分位數。

變異數分析的名稱由來

\[\sum_{i=1}^k\sum_{j=1}^{n_i} \left(Y_{i,j} - \bar{Y}\right)^2 = \sum_{i=1}^k n_i(\bar{Y_i} - \bar{Y})^2 + \sum_{i=1}^k \sum_{j=1}^{n_i} \left( Y_{i,j} - \bar{Y_i}\right)^2\]

  • \(SST = \sum_{i=1}^k\sum_{j=1}^{n_i} \left(Y_{i,j} - \bar{Y}\right)^2\) 代表數據的變化
  • \(SSB = \sum_{i=1}^k n_i(\bar{Y_i} - \bar{Y})^2\) 代表各組之間的變化,被獨立變數解釋的變化,是我們感興趣的部分
  • \(SSW = \sum_{j=1}^{n_i} \left( Y_{i,j} - \bar{Y_i}\right)^2\) 代表隨機的變化,無法被獨立變數解釋的變化,是我們的參考
  • 變異數分析比較兩者來判斷,「各組之間的變化與隨機的變化相比,是否明顯」
    • F檢定:\(\frac{SSB / (k - 1)}{SSW / (N - k)}\)

變異數分析的衍生

  • 更多的相依變數
  • \(\sigma\)不再假設一致

核心概念仍然一致

  • 我們的獨立變數解釋了多少的變化?
  • 獨立變數解釋的變化,與隨機的變化相比,明不明顯?

總結

  • 我們介紹了變異數分析的問題定義、解釋與方法
    • t 檢定處理各組平均數的線性組合
    • F 檢定處理各組平均數是否一致
    • 當相依變數是離散型時的統計分析基礎
  • 我們介紹了「變異數分析」這個名稱的核心理念