效果量
效果有多大,用一把不隨樣本數伸縮的尺量出來。
又稱:effect size、Cohen d、效應量
本頁目次
它在說什麼
效果量量的是「差多少」,而且用的尺度不隨樣本數伸縮。最常見的一把尺是 Cohen 的 :兩組平均數的差,除以共同的標準差。
p 值會隨樣本數變小,效果量不會。這就是為什麼一篇論文只報 p 值、不報效果量,等於只告訴你「這個差距不太可能是巧合」,卻不告訴你「這個差距值不值得在意」。
一個具體例子
Cohen 把 、、 分別叫作小、中、大,而且每一個都掛了真實的對照物:小效果約當雙胞胎與非雙胞胎的平均智商差距;中效果約當 14 歲與 18 歲女孩的平均身高差距——「大到肉眼看得出來」;大效果約當博士學位持有者與大一新生的平均智商差距。
同一節裡,Cohen 自己說這組對應是任意的。這句自白值得記住:小中大是溝通用的粗刻度,不是自然界的分界線。
常見誤讀
「 很小所以效果很大」是最貴的一條。1988 年的阿斯匹靈試驗:22,071 位醫師,服藥組 104 人心肌梗塞,安慰劑組 189 人,。效果量換算成相關係數卻只有 0.03 左右。用同一批數字算出來的兩個數,一個看起來像鐵證,一個小到幾乎看不見。(順帶一提,這個小效果救了很多人命;效果小不等於不重要,要看代價與規模。)
資料來源
- 1.Jacob Cohen(1988)。Statistical Power Analysis for the Behavioral Sciences,Hillsdale, NJ: Lawrence Erlbaum (2nd ed.)。§2.2「The Effect Size Index: d」,pp.24-27(小 d=.2、中 d=.5、大 d=.8 的約定,以及各自的真實對照物:雙胞胎與非雙胞胎的平均智商差距約當小效果,14 歲與 18 歲女孩的平均身高差距約當中效果,博士學位持有者與大一新生的平均智商差距約當大效果)。Cohen 在同節自承這組對應是任意的。原文
- 2.Steering Committee of the Physicians' Health Study Research Group(1988)。Preliminary Report: Findings from the Aspirin Component of the Ongoing Physicians' Health Study,New England Journal of Medicine, vol. 318, no. 4, pp.262–264。22,071 名男性醫師隨機分派服用阿斯匹靈(11,037 人)或安慰劑(11,034 人);追蹤期間阿斯匹靈組 104 人、安慰劑組 189 人發生心肌梗塞,相對風險約 0.56(降低 44%),因效果極端顯著而提前終止試驗。原文
- 3.Robert Rosenthal(1990)。How Are We Doing in Soft Psychology?,American Psychologist, vol. 45, no. 6, pp.775–777。以二元效果量顯示法(Binomial Effect Size Display, BESD)重新詮釋阿斯匹靈與心肌梗塞試驗的效果量:相關係數 r 僅約 .03,量級很小,但換算成「每若干人中避免幾次心肌梗塞」的實際人數後,效果並不能說是無足輕重。原文