什麼是迴歸分析?為什麼要做迴歸分析?

  • 當隨機變數與某些已知的獨立變數相關時,我們該如何做分析?
    • 獨立變數是類別型變數:變異數分析
    • 獨立變數是數值型變數:迴歸分析

迴歸分析的原理

  • \(E(Y_i) = \alpha + \beta x_i\)
  • \(Var(Y_i) = \sigma^2\)

迴歸分析的原理

最小平方法(數學的觀點)

  • 給定資料點\((y_1, x_1), (y_2, x_2), ..., (y_n, x_n)\)
  • 模型的誤差為:\(r_i = y_i - (\alpha + \beta x_i)\)
  • 我們要讓誤差的平方和最小,則:
    • \(\hat{\beta}_{LS} = \frac{S_{xy}}{S_xx}\), \(S_{xx} = \sum_{i=1}^n(x_i - \bar{x})^2, S_{xy} = \sum_{i=1}^n(x_i-\bar{x})(y_i - \bar{y})\)
    • \(\hat{\alpha}_{LS} = \bar{y} - \hat{\beta}_{LS} \bar{x}\)

迴歸分析的原理

最佳線性估計法(統計的觀點)

  • 給定資料點\((y_1, x_1), (y_2, x_2), ..., (y_n, x_n)\)
  • 假設\(Y_i = \alpha + \beta x_i + \varepsilon_i\)
    • \(E(\varepsilon_i) = 0, Var(\varepsilon_i) = \sigma^2\)
  • 我們只考慮可以寫成\(\sum_{i=1}^n d_i y_i\)的估計
    • 若是\(\beta\)的不偏估計:\(\beta = E(\sum_{i=1}^n d_i y_i) = \alpha (\sum_{i=1}^n d_i) + \beta (\sum_{i=1}^n d_i x_i)\)
    • \(Var(\sum_{i=1}^n d_i y_i) = \sigma^2 \sum_{i=1}^n d_i^2\)
  • 從統計的觀點,我們希望不偏的同時,\(Var(\sum_{i=1}^n d_i y_i)\)越小越好

迴歸分析的原理

最佳線性估計法(統計的觀點)

3\[\left\{\begin{array}{l} \sum_{i=1}^n d_i = 0 \\ \sum_{i=1}^n d_i x_i = 1 \\ \sum_{i=1}^n d_i^2 \text{ 最小} \end{array}\right.\]

  • 可以證明,\(d_i = \frac{x_i - \bar{x}}{S_{xx}}\)符合條件,而答案則會與最小平方法相同

迴歸分析的原理

  • 再假設\(Y_i | x_i \sim \mathcal{N}(\alpha + \beta x_i, \sigma^2)\)
  • 有分佈,我們就可以計算最大概似估計:
    • \(\hat{\alpha}_{MLE}\) 與 \(\hat{\beta}_{MLE}\) 仍然與最小平方法一樣
  • \(\sigma^2\)的最大概似估計,與常態分佈的狀況一樣,是有偏差的。所以人們更常用不偏的:

\[S^2 = \frac{1}{n-2} \sum_{i=1}^n(y_i - \hat{\alpha} - \hat{\beta} x_i)^2\]

回歸分析的方法

\[\left\{\begin{array}{l} \hat{\alpha} \sim \mathcal{N}(\alpha, \frac{\sigma^2}{n S_{xx}} \sum_{i=1}^n x_i^2) \\ \hat{\beta} \sim \mathcal{N}(\beta, \frac{\sigma^2}{S_{xx}}) \\ \frac{(n-2)S^2}{\sigma^2} \sim \chi^2_{n-1} \end{array}\right. \Rightarrow \left\{\begin{array}{l} \frac{\hat{\alpha} - \alpha}{S\sqrt{\frac{\sum_{i=1}^n x_i^2}{(n S_{xx})}}} \sim t_{n-2} \\ \frac{\hat{\beta} - \beta}{S/\sqrt{S_{xx}}} \sim t_{n-2} \end{array}\right.\]

迴歸分析的方法

t 檢定

  • 當以下狀況發生時,\(H_0: \beta = 0\)會被拒絕:

\[\left|\frac{\hat{\beta}}{S / \sqrt{S_{xx}}}\right| > t_{n-2,\frac{\alpha}{2}}\]

  • 或是\(\beta\)的信賴區間為:

\[\left[\hat{\beta} - t_{n-2, \alpha/2} \frac{S}{\sqrt{S_{xx}}}, \hat{\beta} + t_{n-2, \alpha/2} \frac{S}{\sqrt{S_{xx}}}\right]\]

迴歸分析的方法

F 檢定

  • 或是當以下狀況發生時,\(H_0: \beta = 0\)會被拒絕:

\[\frac{\hat{\beta}^2}{S^2 / S_{xx}} > F_{1,n-2,\alpha}\]

迴歸分析的方法

與變異數分析的比較

\[\sum_{i=1}^n (y_i - \bar{y})^2 = \sum_{i=1} (\hat{y_i} - \bar{y})^2 + \sum_{i=1}^n (y_i - \hat{y})^2\]

  • 如果迴歸模型有效,我們希望\(\sum_{i=1} (\hat{y_i} - \bar{y})^2\) 越大越好,這代表用迴歸模型解釋的變化
  • \(\sum_{i=1}^n (y_i - \hat{y})^2\)代表模型無法解釋的變化,也就是隨機的變化

迴歸分析的方法

與變異數分析的比較

  • 可以證明F檢定的算式等價:

\[\frac{\sum_{i=1} (\hat{y_i} - \bar{y})^2}{\sum_{i=1}^n (y_i - \hat{y})^2 / (n - 2)}\]

  • 也是在比較兩者的變化

總結

  • 當獨立變數是數值型態時,我們可以用迴歸分析。這裡介紹了迴歸分析的方法
  • 無論是變異數分析還是迴歸分析,F檢定,最終都等價於比較「模型解釋的變化」與「隨機的變化」

預測

  • 給定\(x = x_0\)時,根據\(\hat{\alpha}, \hat{\beta}\)我們可以預測\(\hat{y}_0 = \alpha + \beta x_0\)
  • 如果\(Y_i | x_i \sim \mathcal{N}(\alpha + \beta x_i, \sigma^2)\)則:

\[\hat{y}_0 \sim \mathcal{N} \left(\alpha + \beta x_0 , \sigma^2\left(\frac{1}{n} + \frac{(x_0 - \bar{x})^2}{S_{xx}} \right)\right)\]

\[\frac{(\hat{\alpha} + \hat{\beta} x_0) - (\alpha + \beta x_0)}{S \sqrt{\frac{1}{n} + \frac{(x_0 - \bar{x})^2}{S_{xx}}}} \sim t_{n-2}\]

  • \(\hat{y} | x_0\) 的信賴區間為:

\[\left[\hat{\alpha} + \hat{\beta} x_0 - t_{n-2, \alpha/2} S \sqrt{\frac{1}{n} + \frac{(x_0 - \bar{x})^2}{S_{xx}}} , \hat{\alpha} + \hat{\beta} x_0 + t_{n-2, \alpha/2} S \sqrt{\frac{1}{n} + \frac{(x_0 - \bar{x})^2}{S_{xx}}} \right]\]

預測