術語

置換檢定

把標籤重新洗牌,看看純屬巧合能做到多好,再看真實資料排在哪裡。

又稱:permutation test、randomization test、重排檢定

本頁目次

它在說什麼

置換檢定的動作只有一個:把標籤重新洗牌。實驗組與對照組的標籤如果本來就沒意義(虛無假設就是這個意思),那麼把標籤隨便打亂再算一次統計量,得到的結果應該和真實資料差不多。洗個幾萬次,你就得到一整個「純屬巧合能做到多好」的,再看真實資料排在第幾。

一個具體例子

:把「先倒奶」這四個標籤,在八個杯子上重排,共 70 種排法。這 70 種全部列出來、數一遍,不需要洗牌,也不需要模擬,這種做法叫窮舉。杯子多幾個,窮舉就跑不動了,這時才改用隨機洗牌來逼近同一個分佈。

它的好處與代價

好處是不必假設常態分佈,分佈直接由手上這批資料的結構決定。代價是它換掉的假設沒有消失,只是換了位置:置換檢定要求「在虛無假設下,觀測值是可交換的」。時間序列、群聚資料、重複量測都常常不滿足這個要求,硬洗牌會得到一個看起來很嚴謹的錯誤答案。

資料來源

  1. 1.Ronald A. Fisher(1935)。The Design of Experiments,Edinburgh: Oliver and Boyd (1st ed.)。Ch. II, §5 'The Statement of Experiment', p.13(茶品實驗設定:8 杯,4 杯先加奶);§8 'The Null Hypothesis',p.18(1935 初版;部分刷次標為 p.19)。原文

相鄰術語

  • 抽樣分佈——同一個統計量在反覆抽樣下會長成的樣子。p 值與信賴區間都是從它身上量出來的。
  • p 值——假設虛無為真,得到「像這樣或更極端」的結果的機率。
  • 虛無假設——被設計來承受攻擊的那個假設:設下它,是為了讓資料有機會推翻它。

出現在