什麼是參數估計?為什麼要參數估計?

George E. P. Box:

All models are wrong, but some are useful

  • 我們會使用機率分佈來描述資料的變化
  • 我們會留下一些不確定的參數來讓模型更符合資料

範例:德國坦克問題

  • \(X\)代表我們抓到的坦克車之中,零件編號的分佈
  • 我們假設\(X\)是均勻離散分佈,而我們不知道最大值\(N\)
  • 我們希望知道最大值,才能推估坦克的總數

什麼是參數估計?為什麼要參數估計?

  • 假設\(X \sim \mathcal{F}(\theta)\),\(\mathcal{F}\)是一個有參數的分佈、\(\theta\)是參數
  • \(x_1, x_2, ..., x_n\)是從\(X\)中取得的樣本
  • 任何統計上估計\(\theta\)的方法,都是\(x_1, x_2, ..., x_n\)的函數:所以估計方法都是隨機變數
    • 記做\(\hat{\theta}\)
  • 基於假設,我們可以利用\(\theta\)對我們感興趣的資訊做推測

範例:德國坦克問題

  • 我們已經觀測到五個樣本:\(\{2, 3, 7, 16, 22\}\)。請問我們要如何估計\(N\)?
  • 我們可以用最大的樣本,\(22\),來估計\(N\)
    • 這個策略可以視為用樣本中的最大值來做估計。而樣本中的最大值是一個隨機變數

動差估計法

  • \(X\)的\(n\)次動差\(E(X^n)\)可以透過樣本來簡單估計:
    • \(E(X^n) = \frac{1}{n} x_i^n\)
  • 舉例來說,在上述的德國坦克問題範例中,已經觀測到五個樣本:\(\{2, 3, 7, 16, 22\}\)。我們可以估計\(X\)的1、2與3次動差分別為:
    • \(E(X) \approx \bar{x} = \frac{1}{n}\sum_{i=1}^n x_i = 10\)
    • \(E(X^2) \approx \bar{x^2} = \frac{1}{n}\sum_{i=1}^n x_i^2 = 160.4\)
    • \(E(X^3) \approx \bar{x^3} = \frac{1}{n}\sum_{i=1}^n x_i^3 = 3024.4\)

動差估計法

  • 如果\(X\)是離散均勻分佈(Discrete Uniform Distribution),且介於\(1\)與\(N\)之間,則機率論告訴我們:
    • \(E(X) = \frac{N+1}{2}\)
    • \(E(X^2) = \frac{(N+1)(2N+1)}{6}\)
    • \(E(X^3) = \frac{N(N+1)^2}{4}\)
  • 我們可以把樣本估計的代入上面的式子中解N
    • \(\bar{x} = \frac{\hat{N}_1 + 1}{2} \Rightarrow \hat{N}_1 = 19\)
    • \(\bar{x^2} = \frac{(\hat{N}_2 + 1)(2 \hat{N}_2)+ 1}{6} \Rightarrow \hat{N}_2 = 21.1877229\)
    • \(\bar{x^3} = \frac{\hat{N}_3(\hat{N}_3 + 1)^2}{4} \Rightarrow \hat{N}_3 = 22.2944116\)

動差估計法的缺點

  • 解出來的答案不一定在參數的合理範圍之中
    • \(N \geq 22\),所以\(\hat{N}_1, \hat{N}_2 < 22\) 都是不合理的估計
    • \(N \in \mathbb{N}\) 但是會解出非正整數解

第二個例子

  • 在播放1000次廣告之中,獲得了34次點擊
  • 如果點擊的次數是二項式分佈(Binomial Distribution),\(n = 1000\)、\(p\)要怎麼估計呢?

二項式分佈(Binomial Distribution)的動差估計法

  • \(E(X) = np \Rightarrow \hat{p}_1 = 0.034\)
  • \(E(X^2) = np(1 - p + np) \Rightarrow \hat{p}_2 = 0.0335183\)
  • \(E(X^3) = np(1 - 3p + 3np + 2p^2 - 3Np^2 + N^2 p^2) \Rightarrow \hat{p}_3 = 0.0330702\)

第三個例子:多參數

  • 假設\(X\)是二項式分佈(Binomial Distribution),但是我們不知道\(n\)與\(p\)的值
  • 我們觀測到5個樣本:\(8, 7, 6, 7, 9\)

用一階和二階動差估計\(n\)與\(p\)

\[\begin{eqnarray} & & \left\{\begin{array}{c} \bar{x} = np \\ \bar{x^2} = np(1 - p + np) \end{array}\right. \\ & \Leftrightarrow & \left\{\begin{array}{c} n = \frac{\bar{x}^2}{\bar{x} - \frac{1}{n}\sum_i(x_i - \bar{x})^2} \\ p = \frac{\bar{x}}{n} \end{array}\right. \\ & \Leftrightarrow & \left\{\begin{array}{c} n = 8.6100629 \\ p = 0.8594595 \end{array}\right. \end{eqnarray}\]

最大概似估計(Maximal Likelihood Estimation)

  • 什麼是「概似」
  • 最大概似原理

概似(Likelihood)

  • 如果\(x_1, x_2, ..., x_n\) 都是獨立的從\(X \sim \mathcal{F}\)中抽取出來的樣本,則他們的分佈會是:

\[\prod_{i=1}^n f_X(x_1)\]

  • 為什麼?
    • \(X\) 與 \(Y\) 獨立 \(\Leftrightarrow P(X \leq a \cup Y \leq b) = P(X \leq a) P(Y \leq b) \Leftrightarrow f_{X,Y}(a,b) = f_X(a) f_Y(b)\)

最大概似原理(Maximal Likelihood Principle)

  • 如果\(x_1, x_2, ..., x_n\) 都是獨立的從\(X \sim \mathcal{F(\theta)}\)中抽取出來的樣本
  • 定義\(\mathcal{L}(\theta) = \prod_{i=1}^n f_X(x_i)\)
    • \(x_i\) 已知,\(\theta\)是參數
  • 讓\(\mathcal{L}\)最大的\(\theta\),就是好的\(\theta\)(為什麼?)
  • 最大概似估計(Maximal Likelihood Estimation)就是:

\[\hat{\theta}_{MLE} = \arg\min_{\theta} \mathcal{L}(\theta)\]

  • \(\hat{\theta}_{MLE}\) 一定會落在原本\(\theta\)的空間\(\Theta\)中

為什麼最大概似原理有用?

先來個實際問題演練

  • 我有兩個銅板ABA正面的機率是0.8,B正面的機率是0.2
  • 我挑一個銅板來丟三次,你不知道我拿的是哪一個銅板
  • 三次的結果都是正面,請問你會猜我拿的是A還是B

把上述的問題「數學」化

  • A丟出三次正面的機率是\(0.8^3 = 0.512\),先稱為\(p_A\)
  • B丟出三次正面的機率是\(0.2^3 = 0.008\),先稱為\(p_B\)
  • 因為\(p_A > p_B\),所以我會猜A

這就是最大概似原理

用最大概似估計的語言再看一次

  • 丟銅板三次,正面的次數\(X\)是二項次分佈,\(n = 3, p \in \{0.2, 0.8\}\)。這個例子中,\(\theta = p\),\(\Theta = \{0.2, 0.8\}\)
  • 我們觀測到\(x = 3\),所以
    • \(\mathcal{L}(p) = p^3\)
  • 因為\(\mathcal{L}(0.2) = 0.008\)、\(\mathcal{L}(0.8) = 0.512\),所以\(\arg \max_p \mathcal{L}(p) = 0.8\)
  • 因此\(\hat{p}_{MLE} = 0.8\)
  • 如果把\(\Theta\)放到\([0,1]\)上,則\(\arg \max_p \mathcal{L} = 1\)
  • 所以使用最大概似估計,我們會猜A

範例:常態分佈的參數

  • 如果\(x_1, x_2, ..., x_n\)是獨立的常態分佈樣本,且參數\(\mu\)是未知的,但是我們知道\(\sigma^2\)
    • \(\theta = \mu, \mu \in \mathbb{R}\)
  • \(\mathcal{L}(\mu) = \prod_{i=1}^n \frac{1}{\sqrt{2 \pi} 2}e^{\frac{-(x_i - \mu)^2}{8}} \propto e^{- \frac{\sum_{i=1}^n (x_i - \mu)^2}{8}} \equiv - \sum_{i=1}^n (x_i - \mu)^2\)
    • \(\hat{\mu}_{MLE} = \arg \max_{\mu} \mathcal{L} = \bar{x}\)
  • 我們用最大概似估計重新推導了最小平方法、平均數

範例:常態分佈的參數

  • 如果\(x_1, x_2, ..., x_n\)是獨立的常態分佈樣本,且參數\(\mu\)與\(\sigma^2\)都是未知的
    • \(\theta = \{\mu, \sigma\}, \mu \in \mathbb{R}, \sigma > 0\)
  • \(\mathcal{L}(\mu, \sigma) = \prod_{i=1}^n \frac{1}{\sqrt{2 \pi} \sigma}e^{\frac{-(x_i - \mu)^2}{2\sigma^2}} \propto \sigma^{-n} e^{- \frac{\sum_{i=1}^n (x_i - \mu)^2}{2\sigma^2}}\)
    • \(\hat{\mu}_{MLE} = \arg \max_\mu L(\mu, \sigma) \equiv \arg \max_\mu - \sum_{i=1}^n (x_i - \mu)^2 = \bar{x}\)
  • 即使在\(\sigma\)未知的狀況下,最小平方法仍然可用
  • \(\hat{\sigma}_{MLE} = \arg \max_{\sigma} \sigma^{-n} e^{\frac{-\sum_{i=1}^n(x_i - \bar{x})^2}{2\sigma^2}}\)

德國坦克問題的MLE

  • 如果\(x_1, x_2, ..., x_n\)是獨立的離散均勻分佈的樣本,\(N\)未知
    • \(N \in \mathbb{N}, N \geq x_{(n)}\)
  • \(\mathcal{L}(N) = \prod_{i=1}^n \frac{1}{N} = \frac{1}{N^n}\)
    • \(N\)越小,\(\mathcal{L}(N)\)越大,所以\(\hat{N}_{MLE} = x_{(n)}\)

貝氏統計與貝式估計

貝式定理

\[P(A | B) = \frac{P(A \cap B)}{P(B)} = \frac{ P(B | A) P(A) }{ P(B)}\]

貝式統計

  • 參數\(\theta\)不是一個未知的固定值,而是一個隨機變數。它的PDF記做\(\pi(\theta)\)
  • 我們過去介紹的各種統計分部、統計模型都是\(f(x | \theta)\)或\(P(X = x|\theta)\)
  • 根據觀察到的資料,\(x\),我們反過來對參數做推論:
    • \(f(\theta | x) = \frac{f(x | \theta) \pi(\theta)}{f(x)} \propto f(x | \theta) \pi(\theta)\)

範例

投擲硬幣的正面次數

  • \(X\)代表丟擲硬幣五次,會出現的正面次數
  • \(X\)是二項式分佈:\(P(X = x) = \left(\begin{array}{c}n \\ x\end{array}\right)p^x(1-p)^{n-x}\)
  • 參數是\(n\)與\(p\),\(n = 5\)而\(p\)未知
  • \(x\)是我們收集的資料,是已知
  • 貝式統計認為,\(p\)也是隨機變數
  • 如果\(p\)是變數,而且的分佈是\(\pi(p)\)的話,根據貝式定理,我們可以得到基於觀測到的\(x\),對\(p\)做統計推論

範例

投擲硬幣的正面次數

  • \(\pi\)是給定的。有各種方法可以設計\(\pi\),或是直接主動定一個。我們這裡定\(\theta\)是貝塔分佈,且\(\alpha = 2, \beta = 1\)
    • \(\pi(p) \propto p\)
  • 我看到了四次正面:\(x = 4\),我們可以做什麼統計推論呢?
    • 首先,計算\(f(p | x) \propto p^{x+1}(1-p)^{n-x} = p^5(1-p)\) 所以\(p | x \sim Beta(\alpha = 6, \beta = 2)\)
    • \(p | x\)的期望值是多少?\(0.75\)
    • \(p | x\)有分散?或是\(p | x\)的變異數有多大?\(0.0208333\)
    • 可以預測下一次正面的機率嗎?\(0.75\)

估計方法的比較

  • 偏差(Bias)
  • 變動(Variance)

均方差(Mean Squared Error)

  • 若\(\hat{\theta}\)是\(\theta\)的估計量,則均方差(Mean Squared Error)的定義為:

\[E\left((\hat{\theta} - \theta)^2\right)\]

  • \(x_1, x_2, ..., x_n \sim \mathcal{F}(\theta)\)
  • \(\hat{\theta}(x_1, x_2, x_3, ..., x_n)\)也是隨機變數
  • 因為\(\hat{\theta}\)是\(x_1, x_2, x_3, ..., x_n\)的函數,所以它的分佈會與\(\theta\)有關
  • 因為\(\hat{\theta}\)的分佈與\(\theta\)有關,所以\(E(\hat{\theta})\)、\(E(\hat{\theta}^2)\)等都是\(\theta\)的函數。
  • 所以\(E\left((\hat{\theta} - \theta)^2\right)\)也是\(\theta\)的函數。

為什麼是均方差(Mean Squared Error)?

  • 偏差(Bias):\(E(\hat{\theta}) - \theta\)
  • 變動(Variance):\(Var(\hat{\theta})\)

\[\begin{eqnarray} E\left((\hat{\theta} - \theta)^2\right) & = & E\left((\hat{\theta} - E(\hat{\theta}) + E(\hat{\theta}) - \theta)^2\right) \\ & = & Var(\hat{\theta}) + (\hat{\theta} - \theta)^2 \\ & = & \text{Variance} + \text{Bias}^2 \end{eqnarray}\]

範例:常態分佈

  • 若\(x_1, x_2, ..., x_n\)是獨立且常態分佈\(\mathcal{N}(\mu, \sigma^2)\)的樣本。
  • 平均數\(\bar{x} = \frac{1}{n} x_i\)是\(\mu\)的估計

\[E(\bar{x}) = E\left(\frac{1}{n}\sum_{i=1}^n x_i\right) = \frac{1}{n}\sum_{i=1}^n E(x_i) = \mu\]

  • 因為\(E(\bar{x}) = \mu\),所以\(\bar{x}\)被稱為\(\mu\)的無偏估計

  • 平均數的均方差為:

\[E((\bar{x} - \mu)^2) = Var(\bar{x}) = \frac{\sigma^2}{n}\]

  • \(\tiny{Var(\frac{1}{n}\sum_{i=1}^n x_i) = \frac{1}{n^2}\left(\sum_{i=1}^n Var(x_i)\right) = \frac{\sigma^2}{n}}\)

範例:常態分佈

  • 已知\(E\left((x_i - \bar{x})^2\right) = (n-1)\sigma^2\),所以常用的樣本標準差\(S^2 = \frac{1}{n-1} \sum_{i=1}^n (x_i - \bar{x})^2\)是\(\sigma^2\)的不偏估計
  • 已知\(E\left((S^2 - \sigma^2)^2\right) = \frac{2\sigma^4}{n - 1}\)
  • 所以\(S^2\)的均方差為:\(\frac{2\sigma^4}{n - 1}\)
  • \(\frac{n-1}{n}S^2\)是\(\sigma^2\)的最大概似估計\(\hat{\sigma^2}_{MLE}\),而它的均方差為:

\[E\left((\frac{n-1}{n}S^2 - \sigma^2)^2\right) = \frac{(n-1)^2}{n^2} \frac{2\sigma^4}{n - 1} + \frac{1}{n^2}\sigma^4 = \frac{2n-1}{n^2}\sigma^4\]

  • 如果\(n = 100\),\(\frac{199}{10000} \approx 0.0199 < 0.0202 \approx \frac{2}{99}\),也就是\(\hat{\sigma^2}_{MLE}\)得均方差比較好
  • 但是\(S^2\)是無偏估計,\(\hat{\sigma^2}_{MLE}\)不是。這是偏差與變異的交換的範例。

最佳無偏估計

  • 有時候,人們更喜歡無偏估計。例如常態分佈的\(\sigma^2\)的估計中,樣本標準差\(S^2\)比最大概似估計更普遍。
    • 即使在剛剛我們才提到,最大概似估計的均方差更好
  • 在所有的無偏估計中,變異數最小的就是最好的估計,稱之為最佳無偏估計
  • 統計學家有推導出一些尋找最佳無偏估計的方法,例如Cramér–Rao不等式。
  • 但是要證明或反證出一個實際有用的估計是不是最佳無偏估計,仍然是困難的問題

Stein’s Paradox (1955)

  • 想像下列情境:
    • 老闆根據過去產品的表現(但是只有一筆),要我們估計未來的產品的售量
    • 老闆根據過去的進貨成本(但是只有一筆),要我們估計未來的進貨的成本
    • 我們個人對某檔基金的表現有興趣(但是只有一筆),收集了基金的歷史數據
  • Stein’s Paradox 說,如果你已經有了對這三個問題的各自的估計,那你可以把他們混在一起,以均方差的觀點來看,平均來說混在一起的估計會更好!

Stein’s Paradox (1955)

  • \(X_1 \sim \mathcal{N}(\mu_1, 1)\),有一個樣本\(x_1\)
    • 如果用\(X_1\)估計\(\mu_1\),均方差會是1
  • \(X_2 \sim \mathcal{N}(\mu_2, 1)\),有一個樣本\(x_2\)
    • 如果用\(X_2\)估計\(\mu_2\),均方差會是1
  • \(X_3 \sim \mathcal{N}(\mu_3, 1)\),有一個樣本\(x_3\)
    • 如果用\(X_3\)估計\(\mu_3\),均方差會是1
  • 所以同時考慮用\((x_1, x_2, x_3)\)估計\((\mu_1, \mu_2, \mu_3)\)的均方差為3
  • Stein提出一個新的估計:\(\hat{\mu}^{JS} = \left(1 - \frac{1}{X_1^2 + X_2^2 + X_3^2}\right)X_i\)
    • 它技巧的「收縮」了\(x_1, x_2, x_3\)
  • 可以證明\(\hat{\mu}^{JS}\)的均方差為\(3 - E(\frac{1}{X_1^2 + X_2^2 + X_3^2}) < 3\)

Stein’s Paradox 的啟示

  • 請小心任何平均指標
    • 平均比較好的,對於個別來看不一定會比較好!
  • 收縮,或是後續被稱作Regularization的技術,在近代機器學習應用中被廣泛使用
    • 統計學家很早就知道「收縮」對於整體優化具有改善的能力
    • 也許Stein’s Paradox稍微說服你相信收縮對於改善複雜的估計有神奇的效果

大樣本下的參數估計救星:最大概似估計

  • 在大多數的狀況下,我們不知道最佳估計是什麼
  • 但是在大部分的狀況下,統計學家證明最大概似估計在資料很大的時候,和最佳估計差不多好

大樣本下我們要關心的估計問題

  • 當資料越來越多的時候,估計會不會越來越準?(Consistency)

範例

  • \(x_1, x_2, ..., x_n\)是彼此獨立且來自相同的常態分佈\(\mathcal{N}(\mu, \sigma^2)\)的樣本
  • 不論有多少筆資料,我們只用第一筆來估計\(x_1\)
  • 這種估計方法不會因為資料變多而越來越準確

大樣本下我們要關心的估計問題

  • 當資料越來越多的時候,估計的誤差會不會和理論上的最佳誤差差不多好?(Efficiency)

範例

  • 統計學家證明了,在大部分的狀況下,最大概似估計在資料夠大的狀況下的是無偏的
  • 統計學家也證明了,最大概似估計的變異數和理論上的最佳下界會隨著資料量變大而縮小

什麼是大部分的狀況?

  • 基本上應用問題會遇到的狀況都算是這裡的大部分的狀況,除了
    • 隨機變數的有效範圍和參數有關的狀況,例如:德國坦克問題