術語

多重比較

檢定做得夠多,光靠雜訊也會冒出「顯著」。不校正,門檻就名存實亡。

又稱:multiple comparisons、multiple testing、多重檢定、校正

本頁目次

它在說什麼

一個檢定在 α=.05\alpha = .05 下,虛無為真時有 5% 的機會誤報。做 20 個獨立檢定,至少誤報一次的機率是

1(10.05)200.641 - (1 - 0.05)^{20} \approx 0.64

檢定做得夠多,光靠雜訊也會冒出「顯著」。多重比較校正就是把這件事算進去:要麼壓低族系錯誤率(如 Bonferroni,把門檻除以檢定數),要麼控制

一個具體例子

2009 年,Bennett 等人把一條大西洋鮭放進 fMRI 機器,請牠判讀照片中人物的情緒。。在未校正的門檻(t(131)>3.15t(131) > 3.15p<0.001p < 0.001)下,8,064 個 voxel 裡有 16 個「顯著」,還漂亮地群聚在魚的腦腔內。做完錯誤發現率或族系錯誤率校正,顯著的 voxel 一個都不剩,連把門檻放寬到 p=0.25p = 0.25 都沒有。

這篇海報拿了 2012 年的搞笑諾貝爾獎,但它的對象不是那條魚,是當年大量不做校正的 fMRI 論文。

它與 p-hacking 的差別

選擇性報告:做了很多,只報好看的。多重比較是數量問題:全部誠實報告,但檢定太多,門檻就失去了它原本承諾的錯誤率。兩者常常同時發生,而且第一種會讓第二種變得無法校正,因為沒人知道實際上做了幾個檢定。

資料來源

  1. 1.Yoav Benjamini and Yosef Hochberg(1995)。Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing,Journal of the Royal Statistical Society, Series B (Methodological), 57(1), pp.289-300。全文(錯誤發現率 FDR 的原始提出:改控制「被拒絕的假設裡有多少比例是錯拒」的期望值,取代族系錯誤率)。DOI 10.1111/j.2517-6161.1995.tb02031.x。原文
  2. 2.Craig M. Bennett, Abigail A. Baird, Michael B. Miller and George L. Wolford(2010)。Neural Correlates of Interspecies Perspective Taking in the Post-Mortem Atlantic Salmon: An Argument For Proper Multiple Comparisons Correction,Journal of Serendipitous and Unexpected Results, 1(1), pp.1-5(2009 年以海報形式發表於 Human Brain Mapping 年會)。Methods 與 Results 欄:受試者為一條約 18 吋、3.8 磅的大西洋鮭,掃描時已死亡;未校正門檻 t(131) > 3.15、p < 0.001 下,8,064 個 voxel 中有 16 個「顯著」,且群聚在鮭魚的腦腔內;改用 FDR 或族系錯誤率校正後,顯著 voxel 歸零,連放寬到 p = 0.25 都沒有。原文

相鄰術語

  • p-hacking——一邊看結果一邊調分析:多收幾個樣本、換個共變量、換個結果變數,直到 p 掉到門檻底下。
  • 顯著水準——事前選定的門檻:長期而言,你願意讓多少比例的真虛無被錯判為顯著。
  • 陽性預測值——在所有「顯著」的結果裡,真的有效果的佔幾成。它取決於這個領域有多少假說本來就是對的。

出現在