常見的連續分佈

  • 均勻分佈(Uniform Distribution)
  • 指數分佈(Exponential Distribution)
  • 伽瑪分佈(Gamma Distribution)
  • 常態分佈(Normal Distribution)
  • 貝塔分佈(Beta Distribution)

均勻分佈(Uniform Distribution)

\[f(x | a, b) = \left\{\begin{array}{lc} \frac{1}{b-a} & \text{ if } x \in [a,b] \\ 0 & \text{ otherwise }\end{array}\right.\]

  • \(E(X) = \frac{a + b}{2}\)
  • \(Var(X) = \frac{(b - a)^2}{12}\)

均勻分佈(Uniform Distribution)

為什麼指數分佈(Exponential Distribution)?

  • 指數分佈常常被用來描述「到下一個事件需要的時間長度」
    • 到下一次顧客買東西的時間
    • 到下一次電腦壞掉的時間
    • 到下一班公車進站的時間

指數分佈(Exponential Distribution)

\[f(x | \beta) = \frac{1}{\beta} e^{\frac{-x}{\beta}}\]

  • \(\beta\)是什麼?
  • 為什麼這個算式可以描述時間?

\(\beta\)的意義

  • \(\beta\)代表事件發生的機會(rate)的倒數
    • 類似卜瓦松分佈(Poisson Distribution)的\(\lambda\)
    • 一個小時有30個顧客
    • 每年有30台電腦損壞
    • 每小時有3班公車
  • 是一個可以隨著時間長度而伸縮成機率的參數
    • 一個小時有30個顧客 ==> 十個小時有300個顧客

為什麼指數分佈(Exponential Distribution)的PDF是這樣?

  • 我們用Poisson 分佈來描述「平均」一個小時有30個顧客的這個現象
    • 十個小時有300個顧客
    • 一分鐘有0.5個顧客
  • 請問顧客之間的時間間隔要怎麼描述?
    • 間隔就代表那一段時間沒有顧客
  • 如果我們把時間切成\(t\)個單位,每個單位的事件次數是\(Y \sim Poisson(\lambda)\),那總共\(t\)個時間都沒有發生事件的機率是:
    • \(e^{-\lambda} \times e^{-\lambda} \times ... \times e^{-\lambda} = e^{-\lambda t}\)
    • \(P(X > t) = e^{-\lambda t} \Rightarrow P(X \leq t) = 1 - e^{-\lambda t} \Rightarrow f(x|\lambda) = \lambda e^{- \lambda t}\)
    • \(\beta = \frac{1}{\lambda}\)

指數分佈(Exponential Distribution)的特性:無記憶性

  • 如\(s > t\),且\(X\)是指數分佈(Exponential Distribution),則:

\[P(X > s | X > t) = P(X > s - t)\]

  • 推導類似幾何分佈(Geometric Distribution)的方法
  • 幾何分佈(Geometric Distribution)是唯一有無記憶性的離散機率分佈
  • 指數分佈(Exponential Distribution)是唯一有無記憶性的連續機率分佈

指數分佈(Exponential Distribution)的特性:期望值

  • \(E(X) = \beta\)
  • \(Var(X) = \beta^2\)

伽瑪分佈(Gamma Distribution)

\[f(x | \alpha, \beta) = \frac{1}{\Gamma(\alpha) \beta^{\alpha}}x^{\alpha - 1}e^{-\frac{x}{\beta}}\]

  • 其中伽瑪函數的定義為:

\[\Gamma(\alpha) = \int_0^{\infty} t^{\alpha - 1} e^{-t} dt\]

  • 伽瑪函數的性質:
    • 若\(\alpha > 0\),則\(\Gamma(\alpha + 1) = \alpha \Gamma(\alpha)\)
    • 若\(n \in \mathbb{N}\)是正整數,\(\Gamma(n) = (n-1)!\)

為什麼要有伽瑪函數?

  • 其實我們比較想要的是伽瑪函數的性質,這代表伽瑪函數是\(n!\)的推廣
    • 若\(\alpha > 0\),則\(\Gamma(\alpha + 1) = \alpha \Gamma(\alpha)\)
    • 若\(n \in \mathbb{N}\)是正整數,\(\Gamma(n) = (n-1)!\)

數學家在18世紀時發現伽瑪函數

  • 數學家在研究\(n!\)的推廣
  • Euler 在 1729 年寫下了:

\[n! = \prod_{k=1}^{\infty} \frac{(1 + \frac{1}{k})^n}{1 + \frac{n}{k}}\]

  • 在1730年寫出了:

\[n! = \int_0^1 (- log(s))^n ds\]

  • 19世紀,數學家 Gauss 、 Weierstrass 把伽瑪函數推廣到複數平面…

為什麼要有伽瑪分佈(Gamma Distribution)?

  • 為了估計第\(k\)個事件發生的時間
    • 指數分佈(Exponential Distribution)是為了估計下一個事件發生的時間
  • 伽瑪分佈(Gamma Distribution)是指數分佈(Exponential Distribution)的推廣

為什麼伽瑪分佈(Gamma Distribution)的PDF是這樣?

  • 類似解釋指數分佈(Exponential Distribution)一樣,我們假設事件的發生次數\(Y\)是卜瓦松分佈,
    • 而\(E(Y)\)是\(\lambda t\) 與時間長度成正比
  • 第\(k\)個事件發生的時間超過\(t\)個單位的機率是?
    • 在時間之中發生少於\(k\)次事件:

\[P(X > t) = \sum_{x = 0}^{k-1} P(Y = x | \lambda t) = \sum_{x = 0}^{k-1} \frac{(\lambda t)^x e^{-\lambda t}}{x!}\]

為什麼伽瑪分佈(Gamma Distribution)的PDF是這樣?

  • 伽瑪分佈(Gamma Distribution)的PDF是對CDF做微分:

\[f(t) = \frac{d}{dt}P(X \leq t) = \frac{d}{dt}\left(1 - \sum_{x = 0}^{k-1} \frac{(\lambda t)^x e^{-\lambda t}}{x!}\right) = \frac{\lambda^k t^{k-1}}{(k-1)!} e^{-\lambda t}\]

  • 令 \(\alpha = k\)、\(\beta = \frac{1}{\lambda}\) 代入就是伽瑪分佈(Gamma Distribution)的PDF

\(\alpha\)與\(\beta\)是什麼意思?

  • 估計第\(k\)個事件發生的時間
    • \(\alpha\)就是\(k\)
    • \(\frac{1}{\beta}\)就是事件發生率,會和時間長度一起算出實際的機率

伽瑪分佈(Gamma Distribution)的期望值與變異數

  • \(E(X) = \alpha \beta\)
  • \(Var(X) = \alpha^2 \beta\)
  • 同學要推導的話,要用到伽瑪函數的性質:

\[\int_0^{\infty} x ^{\alpha - 1} e^{-\frac{x}{\beta}} dx = \Gamma(\alpha) \beta^\alpha\]

伽瑪分佈(Gamma Distribution)的形狀

伽瑪分佈(Gamma Distribution)的衍生

  • \(\alpha = 1\) 就是指數分佈(Exponential Distribution)
  • \(\alpha = \frac{p}{2}\) 且 \(\beta = 2\),就是自由度\(p\)的卡方分佈(chi squared distribution)

常態分佈(Normal Distribution)

  • 最重要的分佈之一
  • 被研究的最透徹、最好分析的分佈
  • 鐘形、對稱、易用
    • 其他鐘形、對稱的機率分佈都不像常態分佈有這麼好的分析性質
  • 中央極限定理,使得許多機率分佈可以用常態分佈來近似

\[f(x | \mu, \sigma^2) = \frac{1}{\sqrt{2 \pi} \sigma} e^{\frac{-(x-\mu)^2}{2\sigma^2}}\]

  • \(x \in \mathbb{R}\)
  • \(E(X) = \mu\)、\(Var(X) = \sigma^2\)
  • 我們用\(X \sim \mathcal{N}(\mu, \sigma^2)\)代表\(X\)是一個期望值為\(\mu\)、變異數為\(\sigma^2\)的常態分佈

標準化的常態分佈

  • 當\(\mu = 0\)、\(\sigma^2 = 1\)時,我們稱為標準常態分佈
  • 如果\(X \sim \mathcal{N}(\mu, \sigma^2)\),那\(Z = \frac{X - \mu}{\sigma}\)會是標準常態分佈

\[f_Z(x) = \frac{1}{\sqrt{2\pi}} e^{\frac{-(x-\mu)^2}{2}}\]

  • \(E(Z) = 0\)、\(Var(Z) = 1\)

Location-Scale

  • 常態分佈只需要\(\mu\)與\(\sigma^2\)兩個參數就可以確定所有分佈的資訊
    • \(\mu\)是位置的資訊
    • \(\sigma^2\)是形狀的資訊

六個\(\sigma\)

  • \(P(X - \mu| \leq \sigma) = P(|Z| \leq 1) = 0.6826895\)
  • \(P(X - \mu| \leq 2\sigma) = P(|Z| \leq 2) = 0.9544997\)
  • \(P(X - \mu| \leq 3\sigma) = P(|Z| \leq 3) = 0.9973002\)

貝塔分佈(Beta Distribution)

\[f(x | \alpha, \beta) = \frac{1}{B(\alpha, \beta)} x^{\alpha - 1} (1 - x)^{\beta - 1}\]

  • \(0 < x < 1\)
  • \(\alpha > 0, \beta > 0\)
  • \(B(\alpha, \beta) = \frac{\Gamma(\alpha)\Gamma(\beta)}{\Gamma(\alpha + \beta)}\)是貝塔函數
    • 是一個讓 \(\int_0^1 f(x) = 1\) 的常數

貝塔分佈(Beta Distribution)的用途

  • 貝塔分佈(Beta Distribution)常常被拿來描述「機率」的分佈

範例

  • 在播放廣告時,假設點擊率是\(p\),也就是每個閱聽人看到廣告後有\(p\)的機率點擊廣告。
  • 播放\(n\)次廣告後,廣告的點擊數\(X \sim Binomial(n, p)\)是二項式分佈
  • 如果我們把\(p\)當隨機變數呢?
  • 貝塔分佈(Beta Distribution)可以是描述\(p\)的變化的機率分佈
  • \(0 < x < 1\)

為什麼貝塔分佈(Beta Distribution)的PDF是這樣?

  • 貝式統計
  • 均勻分佈的順序統計量

貝塔分佈(Beta Distribution)是許多機率的共軛先驗概率 Conjugate priors

  • 在貝式統計裡面,共軛先驗概率 Conjugate priors可以大幅簡化計算量
  • 貝塔分佈(Beta Distribution)是以下機率分佈的共軛先驗概率 Conjugate priors:
    • 伯努利試驗
    • 二項式分佈
    • 幾何分佈
    • 負二項式分佈

均勻分佈的順序統計量

  • 如果\(X_1, X_2, .., X_n\)是\(n\)個分佈都是\(F_X\)、\(f_X\),且彼此獨立的隨機變數
  • 我們把\(X_1, X_2, .., X_n\)中最小的數記做\(X_{(1)}\)、第二小的數記做\(X_{(2)}\),以此類推
    • 最大的數會是\(X_{(n)}\)
  • \(X_{(k)}\)的分佈會是:

\[f_{(k)}(x) = n \left(\begin{array}{c}n - 1 \\ k - 1\end{array}\right) f_X(x) F_X(x)^{k - 1} (1 - F_X(x))^{n-k}\]

  • 如果\(X_1, X_2, .., X_n\)是均勻分佈於\(0, 1\)之間的呢?

\[f_{(k)}(x) = n \left(\begin{array}{c}n - 1 \\ k - 1\end{array}\right) x^{k-1}(1 - x)^{n-k}\]

另一個直觀但不嚴謹的看法

\[f(x | \alpha, \beta) \propto x^{\alpha - 1} (1 - x)^{\beta - 1}\]

  • 可以視為「已經知道」成功\(\alpha - 1\)次、失敗\(\beta - 1\)次

另一個直觀但不嚴謹的看法

\[f(x | \alpha, \beta) \propto x^{\alpha - 1} (1 - x)^{\beta - 1}\]

  • 可以視為「已經知道」成功\(\alpha - 1\)次、失敗\(\beta - 1\)次

另一個直觀但不嚴謹的看法

\[f(x | \alpha, \beta) \propto x^{\alpha - 1} (1 - x)^{\beta - 1}\]

  • 可以視為「已經知道」成功\(\alpha - 1\)次、失敗\(\beta - 1\)次

另一個直觀但不嚴謹的看法

\[f(x | \alpha, \beta) \propto x^{\alpha - 1} (1 - x)^{\beta - 1}\]

  • 可以視為「已經知道」成功\(\alpha - 1\)次、失敗\(\beta - 1\)次

貝塔分佈(Beta Distribution)的期望值與變異數

  • \(E(X) = \frac{\alpha}{\alpha + \beta}\)
  • \(Var(X) = \frac{\alpha \beta}{(\alpha + \beta)^2 (\alpha + \beta + 1)}\)