George E. P. Box:
All models are wrong, but some are useful
- 我們會使用機率分佈來描述資料的變化
- 我們會留下一些不確定的參數來讓模型更符合資料
範例:德國坦克問題
- \(X\)代表我們抓到的坦克車之中,零件編號的分佈
- 我們假設\(X\)是均勻離散分佈,而我們不知道最大值\(N\)
- 我們希望知道最大值,才能推估坦克的總數
George E. P. Box:
All models are wrong, but some are useful
\[\begin{eqnarray} & & \left\{\begin{array}{c} \bar{x} = np \\ \bar{x^2} = np(1 - p + np) \end{array}\right. \\ & \Leftrightarrow & \left\{\begin{array}{c} n = \frac{\bar{x}^2}{\bar{x} - \frac{1}{n}\sum_i(x_i - \bar{x})^2} \\ p = \frac{\bar{x}}{n} \end{array}\right. \\ & \Leftrightarrow & \left\{\begin{array}{c} n = 8.6100629 \\ p = 0.8594595 \end{array}\right. \end{eqnarray}\]
\[\prod_{i=1}^n f_X(x_1)\]
\[\hat{\theta}_{MLE} = \arg\min_{\theta} \mathcal{L}(\theta)\]
A與B。A正面的機率是0.8,B正面的機率是0.2A還是B?A丟出三次正面的機率是\(0.8^3 = 0.512\),先稱為\(p_A\)B丟出三次正面的機率是\(0.2^3 = 0.008\),先稱為\(p_B\)A這就是最大概似原理
A\[P(A | B) = \frac{P(A \cap B)}{P(B)} = \frac{ P(B | A) P(A) }{ P(B)}\]
\[E\left((\hat{\theta} - \theta)^2\right)\]
\[\begin{eqnarray} E\left((\hat{\theta} - \theta)^2\right) & = & E\left((\hat{\theta} - E(\hat{\theta}) + E(\hat{\theta}) - \theta)^2\right) \\ & = & Var(\hat{\theta}) + (\hat{\theta} - \theta)^2 \\ & = & \text{Variance} + \text{Bias}^2 \end{eqnarray}\]
\[E(\bar{x}) = E\left(\frac{1}{n}\sum_{i=1}^n x_i\right) = \frac{1}{n}\sum_{i=1}^n E(x_i) = \mu\]
因為\(E(\bar{x}) = \mu\),所以\(\bar{x}\)被稱為\(\mu\)的無偏估計
平均數的均方差為:
\[E((\bar{x} - \mu)^2) = Var(\bar{x}) = \frac{\sigma^2}{n}\]
\[E\left((\frac{n-1}{n}S^2 - \sigma^2)^2\right) = \frac{(n-1)^2}{n^2} \frac{2\sigma^4}{n - 1} + \frac{1}{n^2}\sigma^4 = \frac{2n-1}{n^2}\sigma^4\]