統計學實驗室

到底什麼是信賴區間

民調說某人的支持度是 45%、誤差 ±4 個百分點,於是報紙寫「真實支持度有 95% 的機率落在 41% 到 49% 之間」。這句話幾乎每個人都會講,而它是錯的。這篇從一個平均數把信賴區間親手推一遍,看那句 95% 是怎麼在「代入手上的數字」那一步失去立足點的;再用潛艇、比值區間、六句自測,指出連專家都栽在同一個地方。頻率派的工具正確回答了一個定義清楚的問題,只是那個問題不是你想問的那個。

2026-07-18發表2026-08-13更新約 12 分鐘信賴區間誤差幅度頻率派推論Neyman可信區間誤讀
本頁目次

2024 年 10 月,蓋洛普(Gallup)訪了 1,023 位美國成年人,報出賀錦麗的施政滿意度是 45%,。隔天的報導把它翻成一句人人都懂的話:她的真實支持度,有 95% 的機率落在 41% 到 49% 之間。

41%49%點估計 45%誤差 ±4 個百分點020406080100支持度(%)
蓋洛普 2024 年 10 月電訪、隨機抽樣 1023 位美國成年人:施政滿意度點估計 45%,抽樣誤差 ±4 個百分點(95% 信心水準)。實心點是點估計,橫帶是 41% 到 49% 的 95% 信賴區間——報紙緊接著那句「真實支持度有 95% 機率落在裡面」,正是本文要拆的誤讀。

這句話我從前也講,講得很順。它只有一個問題:是錯的。而且不是小地方講錯,是把整個的意思讀反了。那條 41% 到 49% 的帶子,一旦算出來就是死的,它要麼含著真值、要麼不含,沒有「95% 機率」這回事。95% 這個數字,說的根本不是這一段區間。

先講清楚我沒有要為難誰。「我就是想知道真值在不在這段裡的機率」,這個願望非常合理,每個看到民調的人心裡想問的就是這一句,而手上這個工具算的並不是這件事。要看清楚差在哪,得把區間親手造一次。

先把區間造出來

假設你在估一個平均數。母體平均是 μ\mu,你不知道它;你有一組 nn 筆資料,樣本平均 Xˉ\bar X、樣本標準差 ss。有一個量,它把「你不知道的 μ\mu」和「你算得出的 Xˉ\bar X」綁在一起:

T=Xˉμs/nT = \frac{\bar X - \mu}{s / \sqrt{n}}

這個 TT 有個好性質——不管 μ\mu 到底是多少,只要資料近似常態,TT 就服從自由度 n1n-1tt 分佈。它的分佈形狀跟未知的 μ\mu 無關。這種「裡面帶著未知參數,分佈卻固定」的量,叫做樞紐量(pivotal quantity),是整個構造的樞紐。

因為 TT 的分佈是固定的,我可以在它身上寫一句穩穩成立的機率話。令 t=t0.975,n1t^* = t_{0.975,\,n-1}tt 分佈中間夾住 95% 的那個臨界值):

P ⁣(tXˉμs/nt)=0.95P\!\left( -t^* \le \frac{\bar X - \mu}{s / \sqrt{n}} \le t^* \right) = 0.95

到這裡都還沒出事。接著做一步純代數:把中間那串不等式解開,讓 μ\mu 單獨站到中間去。兩邊乘 s/ns/\sqrt n、移項、變號,得到

P ⁣(Xˉtsn    μ    Xˉ+tsn)=0.95P\!\left( \bar X - t^* \frac{s}{\sqrt n} \;\le\; \mu \;\le\; \bar X + t^* \frac{s}{\sqrt n} \right) = 0.95

那個 Xˉ±ts/n\bar X \pm t^*\, s/\sqrt n,就是信賴區間。民調那條 ±4 個百分點的帶子,是同一件事的比例版本:把每個受訪者答「滿意」記成 1、答「不滿意」記成 0,45% 就是這串 0 與 1 的平均,它的標準誤是 p(1p)/n\sqrt{p(1-p)/n}。代進 p=0.45p=0.45n=1023n=10231.961.96 個標準誤大約是 3 個百分點;蓋洛普報 ±4,是因為,比課本公式的裸值大一點。骨架則完全一樣。

現在看那句機率話的主詞。P()=0.95P(\dots) = 0.95 這一行,寫下來的時候 μ\mu 是固定的常數,會動的是 Xˉ\bar X,它還沒觀測,還是個隨機變數。95% 講的是:在還沒抽樣、Xˉ\bar X 還會這裡那裡亂跳的時候,「Xˉ\bar X 落得夠近、使得算出來的區間剛好罩住 μ\mu」這件事,發生的機率是 95%。 機率是掛在飄動的 Xˉ\bar X 身上的。

然後你抽了樣,Xˉ=45%\bar X = 45\%ss 也定了,區間算出來是 41% 到 49%。這一步把 Xˉ\bar X 從隨機變數換成了一個手上的數字。Xˉ\bar X 不再動,μ\mu 本來就不動,區間的兩個端點也定死了。剛才那 95% 是描述「Xˉ\bar X 亂跳時罩不罩得住」的,現在什麼都不跳了,它就沒有地方可站。41% 到 49% 這段,要麼含 μ\mu、要麼不含,是非零即一的事實,不是機率。誤讀就生在「代入數字」這一步:把一句講程序長期行為的話,硬讀成講眼前這一段的話。

那句 95% 是覆蓋率

把上面那句話畫出來就一目了然。母體平均 μ\mu 是一條固定的直線;每抽一次樣,就得到一段區間。抽一次、畫一條,疊上去:

信心水準

覆蓋率:2000 段裡有 1901 段罩住真值=95.0%

依長度排序後,最窄的 1000 段只罩住 921(92.1%),最寬的 1000 段罩住 980(98.0%)——窄區間常沒蓋,這就是相關子集。

真值4042444648505254565860
直線是固定不動的母體平均;每一橫條是一次抽樣算出的信賴區間(畫面顯示前 60 段)。罩住真值的畫成細淡線,沒罩到的畫成深色。撥信心水準與 n,看罩住的比例怎麼變;勾「依長度排序」,短區間會集中在上方、而且更常沒罩到。覆蓋率統計跑滿 2000 段。

疊到夠多,你會看到大約 95% 的區間罩住那條線,大約 5% 沒罩到。95% 是這一整疊區間的性質,也就是「照這個程序做,長期而言罩得住的比例」,這叫覆蓋率。它描述的是製造區間的那台機器,不是機器某一次吐出來的那一段。你手上的 41% 到 49% 是這疊裡的某一條,它自己不帶機率;帶 95% 的是整個程序。

順手也把一個更土的誤讀清掉:這段區間畫的不是資料的鋪開。它是平均數的不確定範圍,會隨著 nn 變大而收窄;資料本身的散佈是 ss,不會因為你多收了樣本就變小。把信賴區間當成「大部分個體落在這裡」來讀,連問的對象都弄錯了。

把滑桿撥到 90% 或 99%,看區間跟著變窄、變寬。再撥動 nn。無論怎麼撥,那個百分比講的都是「這一疊裡罩得住的比例」,從來不是「你選中的那一條有多少機率是對的」。

造出它的人,當場就否決了那個讀法

Jerzy Neyman 1937 年那篇奠定信賴區間的論文,在提出構造的同一頁,就自己把那個誘人的讀法擋掉了。他先說:長期照這套規則做陳述,大約有 100a%100a\% 會是對的。然後他自問自答——

信賴區間從出生那一刻起,就不是為了回答「這一段罩住真值的機率」而造的。它回答的是一個關於程序的問題,Neyman 講得再清楚不過。

頻率派內部的裂縫

到這裡也許你想說:好吧,那就把 95% 記成「長期罩得住的比例」,別套在單一區間上,不就沒事了?問題是,就算你嚴守這條紀律,頻率派自己內部還有兩道裂縫,不必請貝氏出場就看得到。

第一道,來自一個看起來很無害的問題:兩個平均數的比值。這種估計在現實裡到處都是:劑量反應的半數效應、兩組成本的比、迴歸斜率。它的 95% 信賴集由 Fieller 的方法給出,而

95% 信賴集:一段有限區間

點估計 比值 = 1.00-10-8-6-4-20246810兩平均數的比值
拉滑桿把分母的訊噪比(分母平均相對於它的標準誤)壓低。信賴集先是一段有限區間,接著中間被挖空、剩兩端無限(箭頭表示延伸到無限),最後脹成整條實數線。這不是算錯,是這個合法程序為了守住 95% 覆蓋率、在分母可能為零時必須付的代價。

拉滑桿把分母的訊噪比壓低,分母的平均相對於它的誤差越來越小、越來越可能跨過零。信賴集先是一段有限區間,接著中間被挖空、剩兩端無限,最後脹成整條實數線。整條實數線的意思是「任何值都相容」,資訊量是零。這不是誰算錯了,是這個守規矩的程序,在分母可能為零時,為了維持 95% 覆蓋率必須付出的代價。一個合法的 95% 信賴程序,有正機率交給你一個什麼都沒說的答案。

第二道裂縫更狠,它直接打在「這一段區間有多可信」上。Morey 等人 2016 年用一個潛艇的故事講它——先說清楚,這幾位是貝氏立場,文章結論主張推論時;我這裡只借他們的示範,不接那個判決。

故事是這樣:一艘 10 公尺長的潛艇沉在海底,救援艙門在船身正中央,位置未知。艙門會放出氣泡,氣泡沿著船身、在艙門左右各 5 公尺的範圍內均勻地冒上來。你只有一次下潛救援的機會。頭兩個氣泡浮出來,位置是 x1x_1x2x_2。頻率派用它們造一段 50% 信賴區間:兩泡之間那一段(xˉ±x1x2/2\bar x \pm |x_1 - x_2|/2)。它是貨真價實的 50% 程序,兩泡落在艙門異側的機率剛好一半。

兩泡間距 |x1 - x2| = 2.40 公尺 CP1 這一段含住了艙門。

救援艙門(真值,未知)CP1:頻率派 50% 信賴區間平坦先驗 50% 可信區間氣泡 1氣泡 2-6-4-20246距艙門的位置(公尺)
拖動兩個氣泡。深色橫條是頻率派用頭兩個氣泡造的 50% 信賴區間 CP1,淡色橫條是平坦先驗下的 50% 可信區間。兩泡靠近時 CP1 很窄卻幾乎沒資訊;把兩泡拉到相距超過 5 公尺,CP1 必然夾住艙門。同一個合法的 50% 程序,這一段可以確定對、也可以幾乎確定錯。

拖動兩個氣泡看看。兩泡靠得很近時,這段區間很窄,統計學家會說「很精確」,但兩個離得那麼近的氣泡,其實對艙門在哪裡幾乎沒提供資訊,窄得毫無道理。反過來,把兩泡拉到相距超過 5 公尺:由於氣泡最遠只能落在艙門外 5 公尺,兩泡一旦相距超過 5 公尺,艙門必然被夾在中間,這時 50% 區間保證 100% 含艙門。同一個合法的 50% 程序,手上這一段可以確定是對的,也可以幾乎確定是錯的,全看兩泡的間距。

Morey 把常見的誤讀拆成三個有名字的迷思。精確度誤:以為窄區間等於精確;潛艇裡最窄的區間反而最沒資訊。似真誤:以為區間內的值比區間外的值更可能為真;兩泡相距近 10 公尺時,區間內幾乎全是不可能的位置。根本信賴謬誤:把「隨機程序長期覆蓋 50%」讀成「這一段觀測到的區間有 50% 機率含真值」,也就是報紙對民調犯的那個錯。

這三個迷思背後是同一件事,Fisher 1959 年就講過,叫相關子集:你觀測到的資料,往往落在一個「區間罩不罩得住真值的機率,跟整體平均很不一樣」的子集裡;氣泡的間距就標出了這種子集。回頭看覆蓋率那張圖:把兩千條區間依長度排序後,最窄的一半只罩住 92%,最寬的一半罩住 98%。它們全都是「95% 區間」,覆蓋率卻分別在 95% 的下面和上面。你手上那一條到底比較像哪一半,區間的長度早就漏了口風。

連專家都答錯

如果你到這裡覺得「這些是刁鑽的邊角案例,日常研究裡不至於」,Hoekstra 等人 2014 年的一個調查會讓人不太好受。他們給受試者一句虛構情境:某教授報告一個平均數的 95% 信賴區間是 0.1 到 0.4;接著六句關於這個區間的陳述,請你逐句判對錯。

,而那六句沒有一句成立。1986 年也做過一次,

自己做做看,六句都在下面。做完再看正解:

已作答 0 / 6
  1. 1

    情境:某教授報告一個平均數的 95% 信賴區間是 0.1 到 0.4。這句話對嗎——「真實平均大於 0 的機率,至少有 95%。」

  2. 2

    同一情境(95% 信賴區間 0.1 到 0.4)。這句話對嗎——「真實平均等於 0 的機率,小於 5%。」

  3. 3

    同一情境。這句話對嗎——「『真實平均等於 0』這個虛無假設,很可能是錯的。」

  4. 4

    同一情境。這句話對嗎——「真實平均有 95% 的機率,落在 0.1 到 0.4 之間。」

  5. 5

    同一情境。這句話對嗎——「我們可以有 95% 的信心,說真實平均落在 0.1 到 0.4 之間。」

  6. 6

    同一情境。這句話對嗎——「如果我們一再重複這個實驗,95% 的時候真實平均會落在 0.1 到 0.4 之間。」

六句錯在同一個地方。。每一句誤讀,都是想從一段程序性的陳述裡,擠出一句關於這個參數、這一次的話。擠不出來。

這樣說對,那樣說錯

把整篇的分寸收攏成一張對照表:同一個信賴區間,哪些說法守得住,哪些是最常撞見的誤讀。每條誤讀都配一句該怎麼改。

這樣說是對的

95% 掛在「程序」上,不掛在你手上這一段。Neyman 1937 年那篇奠基論文就是先講這句長期覆蓋率,才接著擋掉對單一區間的機率讀法。

代入數字那一步,把會亂跳的樣本平均換成一個定死的數;能承載機率的隨機性沒了。真值是未知的常數,對它的值不能再做機率陳述,這是 Neyman 自己的結論。

六句經典誤讀都栽在同一處:想從一句程序性的陳述裡,擠出一句關於這個參數、這一次的話。這句話(Hoekstra 等人的原話)把界線劃在對的地方。

這個名字(Greenland 等人提議)把注意力從「有沒有跨過某條界線」,挪回「整段區間裡每個值各有多相容」,正好堵住「界線內為真、界線外為假」的二分誤讀。

這樣說是錯的

把「隨機程序長期覆蓋 95%」讀成「這一段觀測到的區間有 95% 機率含真值」,Morey 等人稱為根本信賴謬誤,報紙寫民調時犯的就是這一個。區間一算出來就定死了,真值也是定死的常數,兩者之間沒有機率可言。

95% 是整套程序的長期覆蓋率;要談「這一次真值在不在裡面的機率」,得換到貝氏框架、配一個先驗,那叫可信區間。

潛艇故事裡最窄的區間反而最沒資訊:兩個氣泡靠得很近時區間很窄,但這兩泡對艙門在哪幾乎沒提供訊息。窄不等於精確。

寬度本身不是精確度;先問你手上的資料是不是落在一個「覆蓋率跟整體很不一樣」的相關子集裡;區間長度本身常常就是判斷的線索。

兩個氣泡相距近 10 公尺時,那段 50% 區間裡幾乎全是不可能的位置,而區間內外誰更「可能」,區間本身答不了。Morey 等人叫它似真誤。

區間內的值是更相容於資料,不是更可能為真;要談「更可能」需要一個先驗,那是另一套工具。

信賴區間畫的是平均數的不確定範圍,會隨樣本數變大而收窄;資料本身的散佈是標準差,不會因為多收樣本就縮小。把區間讀成「個體落點」,連問的對象都弄錯了。

要描述個體的鋪開,看資料的標準差或預測區間;信賴區間講的是平均數,不是個體。

把願望正名

繞了一圈,回到最前面那個合理的願望:我就是想知道,真值落在這段裡的機率。這個問題有答案,只是它屬於另一套框架。你要的那個東西叫可信區間(credible interval):給定模型與一個先驗,參數有 95% 的事後機率落在這一段裡;這一次說的就是這一段本身,而且真的是機率。它跟信賴區間長得像,回答的卻正好是你原本想問的那句。民調那條帶子,如果配上一個先驗、用貝氏的算法重畫,才會變成報紙以為它已經是的那個東西。(先驗怎麼進來、可信區間怎麼隨它移動,留給續篇。)

95% 信賴區間

[41.0, 49.0]

製造它的程序,長期會蓋到真值 95% 的時候。

95% 可信區間(平坦先驗)

[41.0, 49.0]

在這個模型與先驗下,參數有 95% 的事後機率就落在這一段。

95% 信賴區間41.049.095% 可信區間(平坦先驗)41.049.03840424446485052平均數
左邊是頻率派的 95% 信賴區間,右邊是平坦先驗下的 95% 可信區間。示範用的例子裡兩段數值重合,但左邊那句話講的是程序長期的覆蓋率,右邊才真的是「參數這一次落在這段的機率」。你原本想問的是右邊那句。(先驗怎麼進來、可信區間怎麼隨它移動,留給續篇。)

同一筆資料,兩段區間並排。數字上它們幾乎重合,讀法卻是兩回事:左邊說的是製造它的程序長期罩得住真值 95% 的時候,右邊才真的說參數有 95% 的事後機率在裡面。

該怎麼收?不是宣布「所以你該改當貝氏派」。頻率派這個工具精準地回答了一個定義清楚的問題:這套程序長期的覆蓋率是多少。壞的是把兩個框架的問題當成同一個,拿頻率派的區間去回答貝氏的問句。

近年有人連工具的名字都想改。2019 年,。同一個誤讀在科學文獻裡就是這個樣子。同一群人裡,Greenland 更進一步主張把它。這個名字把注意力從「有沒有跨過某條界線」,挪回到「整段區間裡的每個值,各有多相容」。

回到蓋洛普那句 45%、±4 個百分點。那條帶子把「這個估計有多少抽樣層面的搖晃」如實標了出來。被讀壞的是緊跟其後那句「有 95% 機率落在裡面」:95% 是製造區間那套程序長期的覆蓋率,講的不是眼前這一段。

資料來源

  1. 1.Gallup(2024)。At 45%, Harris' Approval Rating Is Higher Than Biden's,Gallup News。2024 年 10 月 1 至 12 日的電訪,隨機抽樣 1,023 位美國成年人;賀錦麗(Kamala Harris)施政滿意度 45%。方法欄註明抽樣誤差為 ±4 個百分點、信心水準 95%。開場那條 41% 到 49% 的「誤差帶」就是一個 95% 信賴區間。原文
  2. 2.Pew Research Center(2016)。Understanding the margin of error in election polls,Pew Research Center, Decoded / Short Reads。以一個候選人得票 48%、誤差 ±3 個百分點(95% 信心水準)的例子解釋抽樣誤差描述的是「結果離母體真值有多近」,並提醒「領先幅度大於個別候選人的誤差幅度」不足以斷定領先在統計上為真——即報導端最常見的誤讀。原文
  3. 3.Jerzy Neyman(1937)。Outline of a Theory of Statistical Estimation Based on the Classical Theory of Probability,Philosophical Transactions of the Royal Society of London, Series A, vol. 231, pp.333-380。p.349(信賴區間的頻率解釋:長期而言,照這套規則做的陳述有 100a% 是對的;緊接著自問「對這一個已經算出來的區間,能不能說參數落在裡面的機率是 a」,並自答不能)。原文
  4. 4.George Casella and Roger L. Berger(2002)。Statistical Inference (2nd edition),Duxbury / Thomson Learning, Section 9.5.3 (Miscellanea)。兩個常態平均數的比值的 1-alpha 信賴集(Fieller)依分母訊噪比而定,可以是一段區間、一段區間的補集、或整條實數線;而且為了維持 1-alpha 的覆蓋率,它必然以正機率成為無限。這是頻率派內部、不靠貝氏就能指出的病態:一個合法的信賴程序,有正機率吐出「整條實數線」這種資訊量為零的答案。
  5. 5.Richard D. Morey, Rink Hoekstra, Jeffrey N. Rouder, Michael D. Lee and Eric-Jan Wagenmakers(2016)。The fallacy of placing confidence in confidence intervals,Psychonomic Bulletin & Review, 23(1), pp.103-123。沉沒潛艇的思想實驗(救援艙門位置未知,氣泡在艙門左右各 5 公尺內均勻冒出)用來拆穿三個具名迷思:精確度誤(窄區間即精確)、似真誤(區間內的值比較可能)、根本信賴謬誤(隨機程序的 X% 覆蓋率被讀成這一段觀測區間也有 X%)。兩泡相距超過 5 公尺時,其 50% 程序算出的區間必定百分之百含艙門;相距極近時同寬區間幾乎不含——同一合法程序,手上這段可以確定對、也可以幾乎確定錯(相關子集,Fisher 1959)。圖 1 畫 200 條 N=2 的隨機 50% 區間,107 條(53.5%)含真值,依長度排序即見短區間幾乎不含、長區間幾乎都含。原文
  6. 6.Rink Hoekstra, Richard D. Morey, Jeffrey N. Rouder and Eric-Jan Wagenmakers(2014)。Robust misinterpretation of confidence intervals,Psychonomic Bulletin & Review, 21(5), pp.1157-1164。受測者拿到一句虛構情境:某教授報告一個平均數的 95% 信賴區間為 0.1 到 0.4,隨後六句對這個區間的陳述,逐句判真假。六句全錯。樣本=442 位尚未修過推論統計的大學一年級生、34 位碩士生、120 位研究者(博士生與教職)。三組平均都認可三句以上;統計訓練與表現無關,研究者幾乎沒贏過學生。原文 ↑1↑2
  7. 7.Michael Oakes(1986)。Statistical Inference: A Commentary for the Social and Behavioural Sciences,Wiley, Chichester。更早的同型結果:70 位學術心理學家判讀一個顯著 p 值的六句陳述,平均認可約 2.5 句、完全正確者僅約 11%。是 Hoekstra 2014 信賴區間版自測的直接前身。原文
  8. 8.Valentin Amrhein, Sander Greenland and Blake McShane(2019)。Scientists rise up against statistical significance (Retire statistical significance),Nature, 567, pp.305-307。由三位作者主筆、超過八百位科學家連署的評論。主張顯著性被二分化地誤用,並直說:不能只因為 p 值大於門檻、或信賴區間含零,就下結論說「沒有差別」。這正是本文開場民調誤讀在科學文獻裡的成年版。作者聲明不是要禁用 p 值。原文
  9. 9.Zad Rafi and Sander Greenland(2020)。Semantic and cognitive tools to aid statistical science: replace confidence and significance by compatibility and surprise,arXiv:1909.08579 [stat.ME], v7 (1 Oct 2020); also in BMC Medical Research Methodology, 20:244。把信賴區間正名為「相容區間」(compatibility interval):區間內的參數值,是在背景假設下比區間外的值更「相容於資料」的那些;縮寫仍作 CI。這一步把注意力從「有沒有跨過某條界線」移到「整段區間裡的值各有多相容」,正是本文收尾要落到的地方。原文