顯著水準
事前選定的門檻:長期而言,你願意讓多少比例的真虛無被錯判為顯著。
又稱:significance level、alpha、顯著水平、門檻
本頁目次
它在說什麼
顯著水準是事前決定的門檻:長期而言,我願意讓多少比例的「虛無其實為真」的情況被我判成顯著。它是一個錯誤率的預算,不是一個證據的刻度。
關鍵在「事前」。門檻先訂、資料後看,這個比例才守得住。看完 p 再回頭挑門檻,等於沒有門檻。
來歷
Fisher 在 1925 年寫下那句被引用到爛的話:P = 0.05 大約是 1.96 個標準差,「取這一點為界線判斷偏離是否顯著,很方便」。方便,0.05 的理論地位僅止於此。它在當年還有一個很實際的理由:查表方便。
Neyman 與 Pearson 則把門檻放進一套決策框架:先固定第一類錯誤的上限,再在這個限制下把檢定力做到最大。門檻在他們那裡有明確的功能,代價是你不能再把 p 當證據強度看。
常見誤讀
「p = 0.049 顯著、p = 0.051 不顯著」讀成「前者有效、後者無效」,是把一條行政界線讀成了自然界線。美國統計學會 2016 年的聲明講得直白:科學結論與政策決定,不該只看 p 值有沒有越過某個門檻。
資料來源
- 1.Ronald A. Fisher(1925)。Statistical Methods for Research Workers,Edinburgh: Oliver and Boyd。13th ed.(1958 印次系列),p.44(部分版本標為 p.47,因版本/刷次不同)。原文
- 2.Jerzy Neyman and Egon S. Pearson(1933)。On the Problem of the Most Efficient Tests of Statistical Hypotheses,Philosophical Transactions of the Royal Society of London, Series A, vol. 231, pp.289–337。p.291(「rule of behaviour」段落,決策式邏輯的原始表述);pp.296–297(H0 記號、「errors of the first kind」與第二類錯誤用語首次系統性提出之處)。「power」一詞本身在這篇論文中尚未以此固定術語出現。原文
- 3.Ronald L. Wasserstein and Nicole A. Lazar(2016)。The ASA Statement on p-Values: Context, Process, and Purpose,The American Statistician, vol. 70, no. 2, pp.129–133。六條原則列表,正文 p.131("Principle 1" 起)原文
相鄰術語
- p 值——假設虛無為真,得到「像這樣或更極端」的結果的機率。
- 第一類與第二類錯誤——兩種錯法:虛無為真卻拒絕它(誤報),虛無為假卻沒拒絕(漏抓)。
- null ritual——把 Fisher 的證據邏輯和 Neyman-Pearson 的決策邏輯焊成一套固定動作,兩邊的代價都不付。