什麼是假設檢定?為什麼要做假設檢定?
- 在依照資料做決策時,我們需要判斷觀察到的現象「是不是」隨機性所導致的
- 假設檢定提供一種「描述」與「控制」隨機性對判斷影響的方法
範例
- 公司的新入口網站即將上線,老闆想要先知道新的網站是不是改善了使用者的體驗
- A/B分流實驗:
- 90%的使用者會繼續看到舊的網站
- 10%的使用者會看到新的網站
- 我們想比較使用者留存率有沒有改善
假設檢定的原理
- 建立模型:用機率描述參數與資料的關係
- 根據收集到的資料,我們需要判斷參數是不是違反虛無假設\(H_0\)
- 計算機率:在隨機的狀態下,根據「虛無假設」來計算發生觀測到的資料或更壞狀況的最大機率
- 根據機率來判斷虛無假設是否合理
範例
- 我們建立留存率與實際留存人數的機率關係(二項式分佈)
- 虛無假設:新的網站的留存率\(p_1\)與舊的網站的留存率\(p_0\)相比,沒有改善!(\(p_1 \leq p_0\))
- 收集一段時間的資料,舊的網站900人留下了300人,新的網站100人留下了40人
- 根據「虛無假設」(\(p_1 \leq p_0\)),計算相關結果的機率
- 設計檢定統計量,例如比率的變化
- 計算檢定統計量在虛無假設下發生(更差狀況)的機率,稱為p-value
假設檢定的解釋
- 如果p-value很高,則認為差異是來自隨機性,沒有證據證明虛無假設錯誤
- 如果p-value很低,則認為差異可能不只是來自隨機性,有證據證明虛無假設錯誤
- 一般來說,會設定5%顯著水準或95%信心水準,拒絕p-value小於0.05的虛無假設
假設檢定的侷限
- 檢定是基於「機率」的證據,不是絕對的證據
- 檢定不會告訴我們「造成差異」的真正原因
- 檢定不建議被單獨用於做決策的依據。應該只是決策的過程之一。
比較假設檢定
範例
- \(H_0:\) 這個人沒有懷孕
- 認為一個男生懷孕了 \(\Rightarrow\) 型一錯誤
- 一個有懷孕的女生,沒有驗出懷孕 \(\Rightarrow\) 型二錯誤
統計的假設檢定都會控制型一錯誤
- 會比較不同檢定的型二錯誤,或是統計檢定力(power)
- 統計檢定力代表檢定能成功拒絕虛無假設(避免型二錯誤)的機率
總結
- 了解什麼是統計檢定
- 了解統計檢定的解釋與限制
- 了解如何比較統計檢定