術語

效果量

效果有多大,用一把不隨樣本數伸縮的尺量出來。

又稱:effect size、Cohen d、效應量

本頁目次

它在說什麼

效果量量的是「差多少」,而且用的尺度不隨樣本數伸縮。最常見的一把尺是 Cohen 的 dd:兩組平均數的差,除以共同的標準差。

d=xˉ1xˉ2sd = \frac{\bar{x}_1 - \bar{x}_2}{s}

p 值會隨樣本數變小,效果量不會。這就是為什麼一篇論文只報 p 值、不報效果量,等於只告訴你「這個差距不太可能是巧合」,卻不告訴你「這個差距值不值得在意」。

一個具體例子

,而且每一個都掛了真實的對照物:小效果約當雙胞胎與非雙胞胎的平均智商差距;中效果約當 14 歲與 18 歲女孩的平均身高差距——「大到肉眼看得出來」;大效果約當博士學位持有者與大一新生的平均智商差距。

同一節裡,Cohen 自己說這組對應是任意的。這句自白值得記住:小中大是溝通用的粗刻度,不是自然界的分界線。

常見誤讀

pp 很小所以效果很大」是最貴的一條。。用同一批數字算出來的兩個數,一個看起來像鐵證,一個小到幾乎看不見。(順帶一提,這個小效果救了很多人命;效果小不等於不重要,要看代價與規模。)

資料來源

  1. 1.Jacob Cohen(1988)。Statistical Power Analysis for the Behavioral Sciences,Hillsdale, NJ: Lawrence Erlbaum (2nd ed.)。§2.2「The Effect Size Index: d」,pp.24-27(小 d=.2、中 d=.5、大 d=.8 的約定,以及各自的真實對照物:雙胞胎與非雙胞胎的平均智商差距約當小效果,14 歲與 18 歲女孩的平均身高差距約當中效果,博士學位持有者與大一新生的平均智商差距約當大效果)。Cohen 在同節自承這組對應是任意的。原文
  2. 2.Steering Committee of the Physicians' Health Study Research Group(1988)。Preliminary Report: Findings from the Aspirin Component of the Ongoing Physicians' Health Study,New England Journal of Medicine, vol. 318, no. 4, pp.262–264。22,071 名男性醫師隨機分派服用阿斯匹靈(11,037 人)或安慰劑(11,034 人);追蹤期間阿斯匹靈組 104 人、安慰劑組 189 人發生心肌梗塞,相對風險約 0.56(降低 44%),因效果極端顯著而提前終止試驗。原文
  3. 3.Robert Rosenthal(1990)。How Are We Doing in Soft Psychology?,American Psychologist, vol. 45, no. 6, pp.775–777。以二元效果量顯示法(Binomial Effect Size Display, BESD)重新詮釋阿斯匹靈與心肌梗塞試驗的效果量:相關係數 r 僅約 .03,量級很小,但換算成「每若干人中避免幾次心肌梗塞」的實際人數後,效果並不能說是無足輕重。原文

相鄰術語

  • p 值——假設虛無為真,得到「像這樣或更極端」的結果的機率。
  • 檢定力——效果真的存在時,這個研究抓得到它的機率。
  • 信賴區間——一套會生出區間的規則。95% 是這套規則的長期命中率,不是眼前這一個區間的機率。

出現在