多重比較
檢定做得夠多,光靠雜訊也會冒出「顯著」。不校正,門檻就名存實亡。
又稱:multiple comparisons、multiple testing、多重檢定、校正
本頁目次
它在說什麼
一個檢定在 下,虛無為真時有 5% 的機會誤報。做 20 個獨立檢定,至少誤報一次的機率是
檢定做得夠多,光靠雜訊也會冒出「顯著」。多重比較校正就是把這件事算進去:要麼壓低族系錯誤率(如 Bonferroni,把門檻除以檢定數),要麼控制錯誤發現率——Benjamini 與 Hochberg 在 1995 年提出的做法,管的是「被宣告顯著的那些結果裡,錯的佔幾成」。
一個具體例子
2009 年,Bennett 等人把一條大西洋鮭放進 fMRI 機器,請牠判讀照片中人物的情緒。這條魚長約 18 吋、重 3.8 磅,而且掃描時已經死亡。在未校正的門檻(,)下,8,064 個 voxel 裡有 16 個「顯著」,還漂亮地群聚在魚的腦腔內。做完錯誤發現率或族系錯誤率校正,顯著的 voxel 一個都不剩,連把門檻放寬到 都沒有。
這篇海報拿了 2012 年的搞笑諾貝爾獎,但它的對象不是那條魚,是當年大量不做校正的 fMRI 論文。
它與 p-hacking 的差別
p-hacking 是選擇性報告:做了很多,只報好看的。多重比較是數量問題:全部誠實報告,但檢定太多,門檻就失去了它原本承諾的錯誤率。兩者常常同時發生,而且第一種會讓第二種變得無法校正,因為沒人知道實際上做了幾個檢定。
資料來源
- 1.Yoav Benjamini and Yosef Hochberg(1995)。Controlling the False Discovery Rate: A Practical and Powerful Approach to Multiple Testing,Journal of the Royal Statistical Society, Series B (Methodological), 57(1), pp.289-300。全文(錯誤發現率 FDR 的原始提出:改控制「被拒絕的假設裡有多少比例是錯拒」的期望值,取代族系錯誤率)。DOI 10.1111/j.2517-6161.1995.tb02031.x。原文
- 2.Craig M. Bennett, Abigail A. Baird, Michael B. Miller and George L. Wolford(2010)。Neural Correlates of Interspecies Perspective Taking in the Post-Mortem Atlantic Salmon: An Argument For Proper Multiple Comparisons Correction,Journal of Serendipitous and Unexpected Results, 1(1), pp.1-5(2009 年以海報形式發表於 Human Brain Mapping 年會)。Methods 與 Results 欄:受試者為一條約 18 吋、3.8 磅的大西洋鮭,掃描時已死亡;未校正門檻 t(131) > 3.15、p < 0.001 下,8,064 個 voxel 中有 16 個「顯著」,且群聚在鮭魚的腦腔內;改用 FDR 或族系錯誤率校正後,顯著 voxel 歸零,連放寬到 p = 0.25 都沒有。原文