什麼是假設檢定?為什麼要做假設檢定?

  • 在依照資料做決策時,我們需要判斷觀察到的現象「是不是」隨機性所導致的
  • 假設檢定提供一種「描述」與「控制」隨機性對判斷影響的方法

範例

  • 公司的新入口網站即將上線,老闆想要先知道新的網站是不是改善了使用者的體驗
  • A/B分流實驗:
    • 90%的使用者會繼續看到舊的網站
    • 10%的使用者會看到新的網站
  • 我們想比較使用者留存率有沒有改善

假設檢定的原理

  • 建立模型:用機率描述參數與資料的關係
  • 根據收集到的資料,我們需要判斷參數是不是違反虛無假設\(H_0\)
  • 計算機率:在隨機的狀態下,根據「虛無假設」來計算發生觀測到的資料或更壞狀況的最大機率
  • 根據機率來判斷虛無假設是否合理

範例

  • 我們建立留存率與實際留存人數的機率關係(二項式分佈)
  • 虛無假設:新的網站的留存率\(p_1\)與舊的網站的留存率\(p_0\)相比,沒有改善!(\(p_1 \leq p_0\))
  • 收集一段時間的資料,舊的網站900人留下了300人,新的網站100人留下了40人
  • 根據「虛無假設」(\(p_1 \leq p_0\)),計算相關結果的機率
    • 設計檢定統計量,例如比率的變化
    • 計算檢定統計量在虛無假設下發生(更差狀況)的機率,稱為p-value

假設檢定的解釋

  • 如果p-value很高,則認為差異是來自隨機性,沒有證據證明虛無假設錯誤
  • 如果p-value很低,則認為差異可能不只是來自隨機性,有證據證明虛無假設錯誤
    • 一般來說,會設定5%顯著水準或95%信心水準,拒絕p-value小於0.05的虛無假設

假設檢定的侷限

  • 檢定是基於「機率」的證據,不是絕對的證據
  • 檢定不會告訴我們「造成差異」的真正原因
  • 檢定不建議被單獨用於做決策的依據。應該只是決策的過程之一。

比較假設檢定

  • 型一錯誤:
    • 錯誤的拒絕虛無假設
  • 型二錯誤:
    • 錯誤的接受虛無假設

範例

  • \(H_0:\) 這個人沒有懷孕
    • 認為一個男生懷孕了 \(\Rightarrow\) 型一錯誤
    • 一個有懷孕的女生,沒有驗出懷孕 \(\Rightarrow\) 型二錯誤

統計的假設檢定都會控制型一錯誤

  • 會比較不同檢定的型二錯誤,或是統計檢定力(power)
  • 統計檢定力代表檢定能成功拒絕虛無假設(避免型二錯誤)的機率

總結

  • 了解什麼是統計檢定
  • 了解統計檢定的解釋與限制
  • 了解如何比較統計檢定