術語

p 值

假設虛無為真,得到「像這樣或更極端」的結果的機率。

又稱:p-value、顯著性機率、P value

本頁目次

它在說什麼

p 值回答一個很窄的問題:假設虛無假設為真,我看到「像這樣或更極端」的資料的機率有多大。它是一個條件機率,條件在「虛無為真」這一側。

它不回答「虛無為真的機率」。這兩者的方向相反,而且相反得很徹底:從「如果她在猜,全對的機率是 1.4%」推不出「她在猜的機率是 1.4%」。

一個具體例子

八杯茶裡挑出四杯先倒奶的,一共有 70 種挑法。純靠猜,四杯全對只有 1 種挑法,所以

p=1700.014p = \frac{1}{70} \approx 0.014

這個 0.014 就是 p 值。要算它,你得先把「純靠猜會發生什麼」的完整分佈列出來,那就是

常見誤讀

,最頑固的三條是:p 值是虛無為真的機率(不是);p = 0.05 表示這個結果只有 5% 的機會是僥倖(不是);p 大代表虛無成立(不是,只代表沒推翻)。

p 的大小也不等於效果的大小。。樣本夠大,任何微小的差距都會把 p 壓到很小。

資料來源

  1. 1.Sander Greenland, Stephen J. Senn, Kenneth J. Rothman, John B. Carlin, Charles Poole, Steven N. Goodman, and Douglas G. Altman(2016)。Statistical Tests, P Values, Confidence Intervals, and Power: A Guide to Misinterpretations,European Journal of Epidemiology, vol. 31, no. 4, pp.337–350。§2「常見誤讀清單」,列舉 25 條——正文標題即為 "Twenty-five misinterpretations" 對應段落原文
  2. 2.Steering Committee of the Physicians' Health Study Research Group(1988)。Preliminary Report: Findings from the Aspirin Component of the Ongoing Physicians' Health Study,New England Journal of Medicine, vol. 318, no. 4, pp.262–264。22,071 名男性醫師隨機分派服用阿斯匹靈(11,037 人)或安慰劑(11,034 人);追蹤期間阿斯匹靈組 104 人、安慰劑組 189 人發生心肌梗塞,相對風險約 0.56(降低 44%),因效果極端顯著而提前終止試驗。原文
  3. 3.Robert Rosenthal(1990)。How Are We Doing in Soft Psychology?,American Psychologist, vol. 45, no. 6, pp.775–777。以二元效果量顯示法(Binomial Effect Size Display, BESD)重新詮釋阿斯匹靈與心肌梗塞試驗的效果量:相關係數 r 僅約 .03,量級很小,但換算成「每若干人中避免幾次心肌梗塞」的實際人數後,效果並不能說是無足輕重。原文

相鄰術語

  • 虛無假設——被設計來承受攻擊的那個假設:設下它,是為了讓資料有機會推翻它。
  • 顯著水準——事前選定的門檻:長期而言,你願意讓多少比例的真虛無被錯判為顯著。
  • 抽樣分佈——同一個統計量在反覆抽樣下會長成的樣子。p 值與信賴區間都是從它身上量出來的。
  • p-hacking——一邊看結果一邊調分析:多收幾個樣本、換個共變量、換個結果變數,直到 p 掉到門檻底下。

出現在