統計學實驗室

大法官站在哪裡:從投票估計理想點

把一位大法官放到一條「傾向」的軸上,這條軸從哪裡來?本文以憲法法庭 2022 年後官方逐項立場表為真投票,用 Samejima 分級反應模型的貝氏估計逐法官的違憲宣告傾向,再用置換檢定看它沿不沿提名總統排列。四個維度都測不到效果,而這個 null 帶檢定力、等價與規格曲線的紀律;逐法官可信區間普遍很寬、相鄰全部重疊,這屆在稀疏異議下多半彼此不可區分。另一層用 1949 年以來的意見書共同具名網絡、階層二項模型,測到同提名人中等而穩健的正效果。投票層測不到、協作層測得到,兩層各說各的。台灣既有實證研究沒有一篇用過官方逐項真投票——本文補上這個缺口,並對一篇問題意識高度重疊、迄今未取得全文的研究,在新穎性上保留。

本頁目次

高共識的憲法法院能不能從投票估出大法官的意識形態位置,是比較司法量化長年的難題。本研究以台灣憲法法庭 2022 年憲法訴訟法施行後的官方逐主文項立場表為資料,把每位大法官在每個主文項的反應編為相對多數的違憲宣告方向,以貝氏分級反應模型估計逐法官的違憲宣告傾向 θ\theta,再以置換檢定檢驗這條軸是否沿提名總統、任命批次、職業背景、留學背景結構化。四個維度都測不到效果(提名總統 p0.34p \approx 0.34)。這種「測不到差異、虛無假設推翻不了」的結果,統計上稱為 null;而這個 null 帶檢定力、等價與規格曲線的紀律:效果若存在,量級以同意率差計被關在約 ±0.1\pm 0.1 內。逐法官的可信區間普遍很寬、相鄰全部重疊,顯示這屆在稀疏異議下多半彼此不可區分。另一層以 1949 年以來意見書的共同具名網絡、用帶法官隨機效果的階層二項模型估計,同提名人對共同具名有中等且穩健的正效果,換八種設定都排除零。投票層測不到、協作層測得到,兩層各說各的。台灣既有的憲法法庭實證研究沒有一篇用過官方逐項真投票;本研究補上這個缺口,並對一篇問題意識高度重疊、迄今未能取得全文的研究,在新穎性上保留宣稱。

1 導論

整屆十九位大法官,參與的爭議主文項數從蔡彩貞的三十七個到呂太郎的一百三十三個,差到近四倍;異議次數也懸殊,許宗力四次、黃昭元四十三次。把「多常不同意」直接當成積極或保守的量尺,分母最小的人容易落在名次表的兩端,而這多半是資訊量不足,不是立場真的極端。

比這更根本的問題是:「同意率」是描述量,數的是已發生的事,可是「站在哪裡」講的是一條軸上的位置。這條軸沒有被直接觀測到,統計上叫它潛在特質,我們手上只有一格一格的投票。要從投票估出位置,光靠更好的平均不夠,得有一個把位置寫進去的測量模型。

這個測量問題連著一個政治學問題。若大法官的位置沿「提名總統」這條線結成陣營,那是任命政治化的訊號。審議專業化與任命政治化常被擺成一組對比,但本研究能直接檢的只有後者,也就是位置有沒有沿提名人結構化;專業化沒有被操作成一個可測的量,因此測不到政治化並不等於證成專業化,只是把天平從政治化那頭挪開。本研究分兩層檢驗這個政治化訊號。投票層用官方逐項立場表量真投票,估計違憲宣告傾向並檢驗它的分組結構;協作層用意見書的共同具名量另一種行為,也就是誰願意跟誰署在一起,把一屆真投票給不了的跨屆變異補上。本研究的資料與方法在後續各節依序交代:第 2 節定位既有文獻,第 3 節說明兩層資料,第 4 節說明測量與推論模型,第 5 節報告結果,第 6、7 節討論與限度。

2 文獻回顧與定位

2.1 理想點測量與高共識庭的難題

從投票估計位置的模型,源頭在空間投票理論。司法場域的標竿把這條線接了過來。

這套工具能不能移到共識高、異議稀的法院,是一個沒有保證的問題。方向看似與本研究相反,讀法卻要小心。Hanretty 之所以挑西葡,正因這兩院在西歐裡相對「政治」、異議夠多到估得動,而他明白警告:案件政治性低、異議稀疏的法院,可能沒有足夠的異議讓理想點估得出來。台灣憲法法庭共識更高、異議更稀,這使本研究的 null 有兩個相容解讀,一是結構真的弱,二是異議太稀、樣本太小,即使潛在結構存在也估不出。Hanretty 這條警告是本研究的 null 必須先擋下的對立假設,第 4.2、5.1 節的檢定力與分析就是為此而做。

2.2 台灣憲法法庭的實證前行研究

台灣憲法法庭的量化實證有一條清楚的脈絡,也有一個共同的資料限制。結論是態度模型不成立,交互項幾乎全不顯著。但這個 null 有兩處硬傷:整個研究期間大法官投票都不公開,個人票靠已公開的個別意見反推、未署名者一律計為多數方,而填補誤差與撰寫意見書的傾向相關,屬系統性偏誤,不是隨機噪音;同時提名總統與時代、案件組成完全共線,作者自承變數相關卻仍對交互項作偏好解讀。這是一個低檢定力、且帶假陽性殘跡的 null。

理想點與提名總統無相關,法院整體不極化。方法上有兩個更深的問題。其一,理想點的訊號幾乎全來自三分之一有署名不同意見的案件,其餘依建構即為一致決,模型實際量的是「願不願意寫署名意見」的傾向;馬提名者僅出現在四件解釋、模型直接不收斂。其二,把二十二年非重疊的法官當成單一大法庭估在同一條尺上,作者自承許多法官從未同案,跨屆比較在此資料下不可識別。這個 null 的檢定力接近零,作者卻寫成「absolutely clear evidence of no relationship」,措辭遠超證據能給的。

另外三篇放棄了個人層次,各自從不同角度描出同一張「高共識」的圖。此文強調「歧異日增」,指的是分別意見書的撰寫量,與本研究量的「逐項立場是否沿提名人結成聯盟」不是同一件事;個別意見產出高,與投票聯盟結構弱,可以並存。此文明文把個別意見書排除在測量之外,與本研究鄰接而不重疊,它對「意見書文本到底在量什麼」的效度警示,正是本研究量化立場時要守的紀律。此文處理的是受理前的議程設定、且明言《大審法》時期司法院不公布個別票決、無法做個人層次分析,與本研究的受理後合議結構鄰接;它獨立發現的高共識圖像,可作本研究結論的旁證。

2.3 研究缺口與本研究定位

這六篇有一個共同的資料天花板:沒有一篇使用官方逐項記載的個別真投票。兩篇理想點研究被迫從署名意見反推個人票,其餘三篇完全放棄個人層次。2022 年憲法訴訟法施行後,官方逐主文項立場表逐項記載每位大法官的同意、不同意與分向票,這個資料本身就取代了「未署名即計多數」的重建法。本研究的第一個貢獻落在這裡:用真投票、非反推、非跨屆強壓,重新檢定同一個任命政治化假說,並把 null 配上檢定力、等價與規格曲線,讓「測不到」變成可量化的效果上界,而不是停在不顯著三個字。第二個貢獻是補上前行研究都未觸及的協作層——共同具名網絡——並把它與投票層分開估計;兩篇理想點研究「書寫行為不等於投票偏好」的自承,正是這個分層的正當性依據。

新穎性須保留一句。與本研究問題意識幾乎完全重疊的一篇是 Lee、Lin 與 Ho(2018),檢驗大法官學術背景是否影響撰寫個別意見;該文自 2018 年會議發表後查無正式發表版,其資料規模、方法與實質發現皆不可知。在無法取得全文之前,誠實的定位語言只能是「查無同題已發表研究」,而不是「首次」。

3 資料

投票層用 2022 年憲法訴訟法施行後的官方逐主文項立場表,涵蓋 60 件裁判、233 個表決項,其中爭議項 133 個、一致項 100 個,另含 45 筆分向票(同一主文項同時列部分同意與部分不同意)。這批立場表逐項記載每位大法官的態度,是真投票而非反推。協作層用 1949 年以來全部行憲後解釋與判決的共同具名紀錄,涵蓋一百多位出庭者、上千對曾共事者,跨屆連任者提供了一屆真投票給不了的識別。

投票的編碼要先解決一個方向問題。把投票記成「同意」或「不同意」,會安靜地丟掉一樣東西。對一件宣告違憲的判決投不同意,意思是「應該維持合憲」;對一件宣告合憲的判決投不同意,意思是「應該違憲」。方向相反的兩個立場,二元編碼記成同一個「不同意」,由二元投票估出的軸抓到的往往是異議的強弱,抓不到反對的方向。台灣的官方立場表逐項記載「部分同意」「部分不同意」及其範圍註,使方向可以還原。做法是先逐項查證每個主文項的宣告方向(違憲、合憲、部分違憲,或不受理、救濟諭知這類非合憲性宣告),再把每位大法官的反應改記為相對多數主文的偏離方向:

yij{2,1,0,+1,+2}.y_{ij} \in \{-2,\,-1,\,0,\,+1,\,+2\}.

00 是完全同意主文;+2+2 是完全不同意、方向要比多數多宣告違憲;2-2 是完全不同意、方向要少宣告違憲;±1\pm 1 是偏某一側的分向票。這條尺有序、題內可比,潛在特質也有了實質定義:違憲宣告傾向,一端是司法積極、一端是司法自制。

4 方法

4.1 測量模型:從項目反應理論到分級反應模型

先看最簡單的二元情形。令第 jj 位大法官的位置為 θj\theta_j,第 ii 件案子有兩個參數:鑑別力 αi\alpha_i 與難度 δi\delta_i。他在該案投「同意」的機率寫成

Pr(yij=同意)=logistic ⁣(αiθjδi).\Pr(y_{ij} = \text{同意}) = \operatorname{logistic}\!\big(\alpha_i\,\theta_j - \delta_i\big).

這是雙參數項目反應模型(2PL)。αi\alpha_i 大,這題對位置敏感,立場稍有不同投票就分開;αi\alpha_i 接近零的題,人人投得差不多,對定位幾乎沒有貢獻。位置 θj\theta_j 要同時解釋一位大法官在每一題的行為,是一個跨案共用的量。逐案比例沒有這一層資訊。在政治學裡,θj\theta_j 的名字是(ideal point)。統計骨架就是上面那條曲線。

有序的違憲宣告方向要用對應的模型。yij{2,,+2}y_{ij} \in \{-2,\dots,+2\} 是有序類別,Samejima 的分級反應模型不直接寫「落在某一級」的機率,寫的是「達到某一級以上」的累積機率:

Pr(yijk)=logistic ⁣(αiθjκik),\Pr(y_{ij} \ge k) = \operatorname{logistic}\!\big(\alpha_i\,\theta_j - \kappa_{ik}\big),

其中 κi1<κi2<\kappa_{i1} < \kappa_{i2} < \cdots 是第 ii 題各級之間逐級遞增的門檻,保證類別有序;落在恰好第 kk 級的機率,是相鄰兩條累積曲線相減。這個模型有一個二元 IRT 沒有的好處:軸的方向由類別順序固定。鑑別力 αi\alpha_i 限為正之後,θ\theta 大就對應「更常投向違憲側」,不必估完再由人指認哪一端是哪一端;二元理想點模型的正負號可以整體翻轉,得靠外部知識指定方向,有序尺度沒有這個問題。

估計要用貝氏。這屆只有十九位大法官,扣掉一致決與無變異的項後剩九十八個有分歧的主文項、一千三百多筆觀測,參數個數對觀測數的比例偏高;邊際最大概似的 EM 迭代跑了三千輪仍不收斂,十九位受試者要支持九十八題的邊際最大概似本來就過度參數化。先驗在這裡是正則項,資料多時影響小,資料少時防止估計發散;代價是後驗會受先驗影響,區間寬度不能和大樣本的信賴區間直接比,換來的是把真正的不確定性顯示出來。估計用馬可夫鏈蒙地卡羅(MCMC),從後驗抽樣描出每個 θj\theta_j 的分布。本例四條鏈、每條暖機一千、取樣兩千,最大 R^\hat R1.0031.003、最小有效樣本數三千多、零次發散轉移。

選型上有兩件事該講明。這條有向尺度讓 θ\theta 與反應是單調關係(θ\theta 越高越常投違憲側),所以合用的是單調的優勢模型;把偏好當單峰的展開模型(那適合「離理想點太遠、兩邊都反對」的原始同意資料)在這裡不對口。其一,單調有序模型不只 GRM 一種:GRM 屬「累積 logit」家族,另一支主流是「相鄰類別 logit」的部分計分模型(PCM)與其一般化(GPCM),後者參數更省、小樣本常更穩;本研究用 GRM、未與 GPCM/PCM 做擬合對照,這是一個未證成的選擇。其二,這個選擇的影響可能有限,因為這份資料的「分級」幾乎沒發生——98 個有分歧的主文項裡,92 個實際只觀測到兩個類別,五級只在 6 題成立,中間的分向票有 78% 出自單一案(113 年憲判字第 9 號)。大多數題退化成二元、兩家族在二元下等價;真正脆弱的其實在別處:「分向票偏違憲側」是否真落在同一條軸的中間,這個順序假設幾乎靠一個案子撐著。還有一層相依:同一件裁判的多個主文項並不獨立,違反 GRM 的題內局部獨立假設,本研究以裁判為塊的 bootstrap 讓區間吸收這層相依,概似本身則沒有建模它,更貼的做法是把「案」當 testlet 的多層 GRM。這幾點一併列入限度。

4.2 推論:假設檢定、置換與 null 的紀律

虛無假設(H0H_0)是「提名總統這個標籤與 θ\theta 無關」——同一位總統提名的大法官,在這條軸上不會比隨機配對更靠近彼此;對立假設是他們更靠近,那是任命政治化該有的方向。N=19N=19 讓任何依賴大樣本漸近分布的檢定都站不住,這裡用:把提名總統的標籤在十九人之間反覆重排,每重排一次算一次組間差,堆成「H0H_0 為真時組間差該長什麼樣」的分布,再看真實的組間差落在這個分布的哪裡。當真實組間差落在分布中段、pp 值不小,H0H_0 就推翻不了;本文把這種「測不到差異、推翻不了 H0H_0」的結果稱為 null。

用一個檢定之前,要不要先用另一個檢定查資料符不符合它的前提假設?古典做法裡有這種預檢(t 檢定前驗常態、變異數分析前驗等變異),但方法學上它被勸退:兩段式會讓最終檢定的 pp 值變成「已通過預檢」的條件值、不是名目值,而且在 N=19N=19 這種樣本上,預檢自己的檢定力低到幾乎驗不出偏離。更穩的路是一開始就用對假設穩健的方法。置換檢定正是如此——它不假設常態、不假設等變異、不靠大樣本近似,唯一倚賴的是 H0H_0 下的可交換性,而可交換性由「H0H_0 為真時標籤本就可隨意重排」保證,不是一個要在資料上先驗的分布性質。真正會破壞可交換性的是混淆變數:若資歷、世代同時牽動分組與 θ\theta,標籤就不能自由重排。本研究對付它靠設計層的條件化(共同視窗只比同時在任者、逐案件層級比較、任命批次分離、以及 dyad 層的 MRQAP),而非一個資料預檢。

一個 null 要能發表,不能只是「跑一下沒顯著」。至少要回答三個追問:這個設計能測到多大的效果(檢定力)、效果能壓到多窄的範圍()、換一套口徑會不會翻案(規格曲線)。這三道正是回應 Hanretty 那條警告的手段:把 null 讀成「無結構」之前,先證明這個設計本來能測到多大的效果。

4.3 協作層:階層 dyadic 模型

共同具名是「對」的屬性:每一對大法官有一個「每件共事案裡共同具名的比例」,同一位大法官出現在許多對裡,這些對並不獨立,忽略這種相依會讓標準誤失真。但置換在這裡會退化:固定住「誰跟誰在哪些案子共事」之後,提名總統幾乎就是提名時點的函數,沒有可自由重排的餘地。推論因此改用帶法官隨機效果的階層二項模型,保留全部的對、用逐案測度直接估係數,每位大法官的隨機效果吸收「某些人整體較常共同具名」的節點層差異:

共同具名ijBinomial ⁣(共事件數ij,  logistic(β0+β同提名sij+β資歷dij+ua+ub+eij)).\text{共同具名}_{ij} \sim \operatorname{Binomial}\!\big(\text{共事件數}_{ij},\; \operatorname{logistic}(\beta_0 + \beta_{\text{同提名}}\,s_{ij} + \beta_{\text{資歷}}\,d_{ij} + u_a + u_b + e_{ij})\big).

5 結果

5.1 投票層理想點與它的不確定性

古典(只有位置)貝氏(位置+90% 可信區間)朱富美蔡彩貞張瓊文詹森林蔡宗珍林俊益黃瑞明黃虹霞許宗力楊惠欽蔡烱燉陳忠五許志雄呂太郎吳陳鐶謝銘洋黃昭元蔡明誠尤伯祥越右=越常投違憲 →
顏色=提名總統:蔡英文馬英九
十九位大法官的違憲宣告傾向。左欄是古典多維標度法的位置,只有一個點;右欄是貝氏分級反應模型的估計,每個位置多一條 90% 可信區間。區間普遍很寬、相鄰彼此重疊,顏色(提名總統)交錯不成塊——同一位總統提名的大法官在投票立場上並沒有站在一起。貝氏 GRM:19 位、1388 筆觀測,R̂ 1.0034、0 divergent;傾向值與違憲側淨異議率相關 0.967。

左邊是古典的描述性尺度化,古典多維標度法(MDS),把「同意率距離」壓成一維座標。它給每個人一個點,看起來乾淨、精準。右邊是同一批人、同樣順序的貝氏 GRM 估計,每個位置多了一條 90% 可信區間。

θ\theta 排序有面效度:最傾向違憲的尤伯祥(θ=+1.42\theta = +1.42)、蔡明誠、黃昭元,正是在 113 年憲判字第 9 號寫下「全部規定均違憲」的那批人,θ\theta 與最粗的描述統計(違憲側淨異議率)相關 0.9670.967。這個高相關同時點出一件事:在點估計的排序上,正式模型幾乎就是淨異議率換了刻度,沒有撈到一個描述統計看不到的位置。模型真正多給的東西在右邊那條可信區間。它平均寬約 1.071.07,是改善後的數字:把方向資訊與分向票用起來、加上貝氏正則化,比只靠二元投票的理想點(平均寬 1.991.99)壓掉了將近一半的不確定性。不過這個減半有多少來自方向資訊、有多少來自先驗收縮,本文沒有分離;第 4.1 節說過這份資料的分級幾乎沒發生,方向那一份可能有限。即使壓掉一半,區間相對於 θ\theta 的全距(約 3.43.4)仍然偏寬,顏色也交錯不成塊。

把逐法官的不確定區間攤開,這種不可區分更清楚。二元 IRT 的十九位法官依點估計排序後,相鄰兩兩的區間全部重疊,十八組沒有一組例外;最窄的是全程在任、異議又少的陳忠五(0.580.58)與許宗力(0.690.69),最寬的是薄資料的蔡明誠(3.883.88)與蔡彩貞(3.603.60),有效資訊差到近四倍。這屆的大法官在正式測量模型裡多半彼此不可區分:模型排得出先後,分不出某個人和鄰座之間的位置差。這正是 Hanretty 警告的定性版本換成了本屆的數字。

一個看似有力的反例要先擋下。二元 IRT 的點估計裡,蔡明誠與吳陳鐶兩位馬英九提名的大法官被推到最極端,像是「提名人裂痕在正式模型下浮現」。但這兩位正是上一段裡區間最寬的那類,吳陳鐶的 90% 區間 [2.51,+0.07][-2.51,\, +0.07] 幾乎觸零、蔡明誠的更寬到跨過零。所謂「極化」落在區間最不確定的那幾個估計上,只看點估計會得到這個印象,把區間放回去,印象就撐不住。

5.2 沿提名總統的 null,以及它的邊界

四個維度(提名總統、任命批次、職業背景、留學背景)的置換檢定全部不顯著。以 GRM 的 θ\theta 逐法官均值做組間比較,提名總統維度的均值差是 0.46-0.46(馬英九提名者平均 +0.10+0.10、蔡英文提名者 0.36-0.36),雙尾 pp0.340.34,觀測到的組間差落在 H0H_0 下的分布的 90% 範圍之內。方向上馬英九提名者的 θ\theta 反而略高,和「蔡提名者較傾向宣告違憲」的直覺相反,但 n=4n=4p=0.34p=0.34,這個符號不足以支持任何結論。

這個 null 的數字邊界要換一個單位更好解讀的口徑來算。θ\theta 是有序估計、全距約 3.43.4,它的均值差難以直接說多小算小;把同一組比較放回原始的同意率差(範圍 0011,提名總統組間同意率差約 0.0450.045),檢定力與等價分析就有了可解讀的刻度。以八成把握測到效果,真效果得達同意率差 0.0850.085,是觀測差的將近兩倍;在觀測到的效果量附近,這個設計的檢定力只有約 0.370.37。90% 可信區間把效果上界壓到約同意率差 ±0.1\pm 0.1,壓不到 ±0.05\pm 0.05。效果若存在,其量級以同意率差計在約 ±0.1\pm 0.1 內;小於 0.0850.085 的效果本設計測不到;觀測到的差和「無效果」與「中等效果」都相容。這個 0.370.37 就是第 7 節「投票層檢定力低」的數字版本:本設計能把自己的檢定力量化,因此說得出效果上界,即便這個檢定力並不高。相較 GGL(2011)與 DPGL(2012)停在不顯著、且建立在反推測量上的 null,這是一個量得出自己上界、且用真投票測出來的 null。

5.3 協作層的正效果

1×(沒差)1.5×主模型(控資歷)1.44×主模型+年代趨勢1.53×釋字期固定效果1.40×限制樣條1.52×零膨脹二項1.41×零膨脹二項+年代1.38×beta 二項1.42×beta 二項+年代1.48×
每一列是一種算法設定(不同共事門檻、年代控制、過度離散寫法);點是同提名人效果的勝算倍數,橫線是 90% 可信區間。八條全部在「1×(沒差)」右邊、下界都大於 1——同一位總統提名的大法官每件共事案共同具名的勝算約高一點五倍,換算法都成立。貝氏階層二項模型,111 位法官、1144 對共事;種子 20260718 可重現。

圖上每一列是一種算法設定:不同的共事門檻、不同的年代控制形狀(線性、二次、限制樣條、釋字期固定效果)、不同的過度離散寫法(常態隨機效果、零膨脹二項、beta-二項)。點是同提名人效果的勝算倍數,橫線是 90% 可信區間。八條全部落在「1×1\times(沒差)」的右邊、下界都大於 11:同一位總統提名的大法官,每件共事案共同具名的勝算約高一點五倍(相對於約 7.6%7.6\% 的基線、雙尾 pp 落在 0.010.010.040.04),換算法都成立。這是一個中等強度、且要調整過才成立的效果,底下兩點交代它撐得住什麼、又只撐到哪裡。

同一層另有一個結論相反的檢定該擺上檯面。把共同具名當 dyad、用可自由重排的節點層置換檢定(MRQAP)估同提名人效果,四個共事門檻全部測不到(pp 介於 0.250.250.780.78);真正被這個檢定挑出來、且高度顯著的是資歷差:首任年越接近的兩人越常共同具名。兩個引擎的落差不是矛盾,是同一件事的兩面。節點層置換要把跨屆連任者各壓成一位總統,丟掉的正是識別同提名人所需的跨屆變異,於是它只說得出「在共事網絡裡分不開總統與世代」,說不出「效果為零」。上面那條正效果來自能保留跨屆變異的階層模型,代價是它得靠模型設定去承載那批變異,換不到置換那種免分布保證。哪一個較可信是判斷:本研究採階層模型的正號為主結論,但把節點層的 null 一併陳明,因為兩者的差距本身就是「同提名人幾乎與同世代同義」這個識別限制的證據。

這裡有一個必須交代的辛普森反轉。原始的、未調整的比例方向相反,同提名人的合併共同具名率反而較低。反轉來自早期的釋字:1949 到 2002 年間的大法官同屬一位總統提名、共事數十年,但意見書制度尚未成熟、共同具名極少,這段時期同時是「同提名人、高曝光、近零共同具名」,把合併比率拉低。各期分開看,每一個釋字期的原始率都是同提名人不低於不同提名人;只留現代期重估,係數仍為正、可信區間仍排除零。這個模型也做了兩道對照:正向對照用真實設計模擬一個已知的正效果,模型乾淨回收;陰性對照把同提名人標籤打散,係數退回零、區間含零。觀測到的正號因此是測得到的效果,協作層的檢定力足夠。要補一句分寸:八條穩健性變的是年代控制的形狀與過度離散的寫法,它們共享「已對早期釋字塊做年代調整」這個前提,而把邊際反號翻成正號的是這個調整本身,它不在八條變異的軸上。各釋字期分開看原始率都同向、正負對照也都過,這支持調整不是憑空翻號,卻不等於證明年代該一路控制到底;若年代是提名的下游,控制它就帶著過度調整的風險。這一點連同識別問題留給第 7 節。

6 討論:兩層各說各的

最硬的投票層(真投票、有序尺度、貝氏 GRM)測不到任命政治,四個維度全 null,且是有檢定力邊界、有等價檢定、換口徑不翻案的有紀律 null。較軟的協作層(共同具名、階層二項模型)測得到同提名人的中等正效果,換八種算法都穩、兩個對照都過。兩層測的是不同人群裡的不同行為,本就不在同一個母體上:協作層的正效果來自 1949 年以來跨屆上百位出庭者的共同具名,投票層的 null 只針對現任十九人的主文立場。前者說同提名人較常署在一起,後者說這一屆的立場排不出提名人陣營;一個測得到、一個測不到,說的是不同的事,兩者不相印證,也不相矛盾。至於共同具名能不能代理投票立場,第 7 節列為限度。

這個結論把既有文獻各接了一段。對 Hanretty(2012),它是「另一個方向的案例」:西葡回收到結構、台灣沒有,差別的關鍵不在有沒有政治,在異議密度與可估性,而本研究用檢定力與等價分析證明了自己的 null 不是估不出來的假象。對 GGL(2011)與 DPGL(2012),它用真投票、可量化檢定力的設計,把兩篇建立在反推測量上的 null 換成一個更硬的版本,並補上它們未觸及的協作層。對陳英鈐(2020),它把「個別意見產出增加」與「投票聯盟結構微弱」分成兩件可並存的事,兩者跨方法收斂到同一張高共識的圖。

7 限度與效度威脅

三處限度,一處都不該藏。第一是識別:一屆、十九人,留任者、提名總統與最資深資歷高度共線,「同提名人」和「同批任命、共事日久養成的協作習慣」原則上分不開,係數確定、機制只是詮釋。第二是代理:共同具名反映的是結盟,反映不了投票一致,從它推到「任命政治」這個構念,比估計量本身更沒把握。第三是新穎性:與本題最接近的 Lee、Lin 與 Ho(2018)尚無正式發表版,未讀之前只能寫「查無同題已發表研究」。三處限度合起來,結論到不了強因果宣稱,全文因此用「同質性」「群聚」「更常共同具名」這類描述語言。

檢定力兩層相反,這一點最該說清楚。投票層檢定力低,是 N=19N=19、一屆、爭議項一百出頭的資料限制,加模型解不掉,唯一的解是跨屆真投票累積;null 因此一律讀成「測不到,不等於不存在」。協作層檢定力足夠,且有正向對照的直接證明。

8 結論

高共識法院能不能用投票定位大法官,這篇的答案是有條件的能。方向資訊與貝氏正則化把逐法官估計的不確定性壓掉將近一半,θ\theta 排序對得上已知的司法行為;但這屆的稀疏異議讓多數人的可信區間彼此重疊,位置排得出先後、分不出鄰座。沿提名總統的分組測不到效果,而這個 null 配上了檢定力、等價與規格曲線,說得出效果上界。協作層則測到同提名人中等而穩健的正效果。台灣既有實證研究沒有一篇用過官方逐項真投票,本研究補上這個缺口;投票層報 null,靠的是完整的檢定力與等價分析,協作層報正效果,靠的是正負對照的驗證。兩邊的結論都沒有超過資料能支持的範圍。

已作答 0 / 4
  1. 1

    甲、乙兩位大法官的不同意率都是 40%。這是否表示測量模型會把兩人放在理想點軸上幾乎同一個位置?

  2. 2

    十九位大法官依理想點估計排序後,相鄰兩兩的 90% 可信區間全部重疊。這是否表示「已經測到大家的立場其實都在中間、沒有差別」?

  3. 3

    提名總統維度的置換檢定 p 約為 0.34(不顯著)。本文還報告了 MDE 0.085、90% 區間把效果上界壓到約 ±0.1。加報後兩個數字的作用,是否只是讓 null 看起來比較豐富?

  4. 4

    協作層測到「同提名人更常共同具名」(勝算約高一點五倍),投票層卻測不到任命政治。以下讀法是否正確:「既然協作層有訊號,投票層的 null 應該修正成也有效果。」

資料來源

  1. 1.Keith T. Poole & Howard Rosenthal(1997)。Congress: A Political-Economic History of Roll Call Voting,New York: Oxford University Press。NOMINATE 理想點;以正確分類率與 APRE 判維度;排除壓倒性表決(lopsided vote)的慣例。
  2. 2.Joshua Clinton, Simon Jackman & Douglas Rivers(2004)。The Statistical Analysis of Roll Call Data,American Political Science Review 98(2): 355–370。把空間投票寫成項目反應模型;推論對象從投票紀錄轉成理想點與議案切點。
  3. 3.Andrew D. Martin & Kevin M. Quinn(2002)。Dynamic Ideal Point Estimation via Markov Chain Monte Carlo for the U.S. Supreme Court, 1953–1999,Political Analysis 10(2): 134–153。美國最高法院動態理想點;貝氏 MCMC 測量模型。
  4. 4.Chris Hanretty(2012)。Dissent in Iberia: The Ideal Points of Justices on the Spanish and Portuguese Constitutional Tribunals,European Journal of Political Research 51(5): 671–692. DOI: 10.1111/j.1475-6765.2012.02056.x。西班牙 2000–2009、葡萄牙 1989–2009 非一致決;二參數 probit IRT(MCMCirt1d);西命中率 89.2%/APRE 0.47、葡 84.4%/APRE 0.41(Table 1);p.4 挑西葡因其較政治、異議夠多,並警告異議稀疏可能估不出理想點。
  5. 5.Nuno Garoupa, Veronica Grembi & Shirley Ching-ping Lin(2011)。Explaining Constitutional Review in New Democracies: The Case of Taiwan,Pacific Rim Law & Policy Journal (Washington International Law Journal) 20(1): 1–40。1988–2008、97 件政治性解釋、44 位大法官、1,357 筆個人票;logit 配「提名總統×親國民黨聲請人」交互項(Table 3, p.22)。p.16 fn.85:大法官投票秘密進行、拒寫個別意見的少數票一律計入多數方——此為全期制度特徵,非限 1993 年前。
  6. 6.Lucia Dalla Pellegrina, Nuno Garoupa & Shirley Ching-ping Lin(2012)。Judicial Ideal Points in New Democracies: The Case of Taiwan,National Taiwan University Law Review 7(1): 123–165。1988–2009、101 件、49 位大法官、1,415 筆票;靜態一維兩參數 IRT(R MCMCpack),錨定楊建華、李志鵬於 -2/+2(p.140–142);理想點與提名總統無相關(p.142);馬提名者僅 4 件、模型不收斂(fn.89);跨 22 年非重疊法官壓在同一尺(p.128, 141)。措辭見引文(p.144)。
  7. 7.陳英鈐(2020)。共識與歧異——司法院大法官解釋的數量危機,收於蘇彥圖主編,《憲法解釋之理論與實務》第十輯,頁 105–182。臺北:中央研究院法律學研究所。釋字第 313–739 號、427 件;策略行為模型+案件層卡方描述統計(SPSS 19),非迴歸。p.170:越要求跨越三分之二門檻,解釋案越少、每案分別意見書越多。
  8. 8.李韶曼(2010)。判決風格的功能——以大法官解釋為中心,國立臺灣大學法律學系碩士論文(指導教授張文貞),152 頁。Airiti DocID: U0001-1908201009505900。釋字第 1–677 號全部解釋(理由書自第 80 號起);量解釋文篇幅、段落、修辭(表一、表二);p.77 明文把個別意見書排除在「解釋風格」測量之外;無顯著性檢定。
  9. 9.吳睿恩(2023)。憲法法院的選案決策,國立臺灣大學法律學系碩士論文(指導教授蘇彥圖)。DOI: 10.6342/NTU202300284。許宗力法庭(2016-11-11 至 2021-12-24)2,623 件不受理決議+67 件受理比較組;存活分析+獨立性檢定(p.82);p.81 明言不知大法官個別票決、無法做個人層次。
  10. 10.Shao-Man Lee, Chien-Chih Lin & Han-Wei Ho(2018)。Do Justices’ Scholarly Backgrounds Affect the Writing of Separate Opinions,會議論文,Chicago–Tsinghua Young Faculty Forum on Law and Social Science, Tsinghua University(2018 年 5–6 月);查無正式發表版。問題意識與本研究高度重疊(大法官學術背景是否影響撰寫個別意見);2026-07 複查仍無公開全文,資料規模與方法不可知。
  11. 11.Fumiko Samejima(1969)。Estimation of Latent Ability Using a Response Pattern of Graded Scores,Psychometrika Monograph No. 17 (Psychometrika 34, Suppl. 1, pp. 1–97). Richmond: Psychometric Society。有序類別反應的分級反應模型:累積機率 P(Y>=k)=logistic(a·theta - b_k),共用鑑別度、逐級遞增門檻。
  12. 12.Joseph Bafumi, Andrew Gelman, David K. Park & Noah Kaplan(2005)。Practical Issues in Implementing and Understanding Bayesian Ideal Point Estimation,Political Analysis 13(2): 171–187。小樣本理想點的分離與不穩;主張貝氏先驗正則化(theta~N(0,1) 同時定尺度並約束資料稀薄處)。
  13. 13.Bob Carpenter, Andrew Gelman, Matthew D. Hoffman, et al.(2017)。Stan: A Probabilistic Programming Language,Journal of Statistical Software 76(1): 1–32. DOI: 10.18637/jss.v076.i01。以 Hamiltonian Monte Carlo 從後驗抽樣,適合帶潛在變數的階層模型。
  14. 14.Aki Vehtari, Andrew Gelman, Daniel Simpson, Bob Carpenter & Paul-Christian Bürkner(2021)。Rank-Normalization, Folding, and Localization: An Improved R-hat for Assessing Convergence of MCMC,Bayesian Analysis 16(2): 667–718. DOI: 10.1214/20-BA1221。rank-normalized R-hat 與有效樣本數;R-hat 貼近 1 表示各鏈已抽自同一分布。
  15. 15.Ronald A. Fisher(1935)。The Design of Experiments,Edinburgh: Oliver and Boyd (1st ed.)。Ch. II, §5 'The Statement of Experiment', p.13(茶品實驗設定:8 杯,4 杯先加奶);§8 'The Null Hypothesis',p.18(1935 初版;部分刷次標為 p.19)。原文
  16. 16.Phillip I. Good(2005)。Permutation, Parametric, and Bootstrap Tests of Hypotheses,3rd ed. Springer Series in Statistics. New York: Springer。置換檢定作為小樣本精確推論的系統整理;樣本小是其適用場景。
  17. 17.Jacob Cohen(1988)。Statistical Power Analysis for the Behavioral Sciences,Hillsdale, NJ: Lawrence Erlbaum (2nd ed.)。§2.2「The Effect Size Index: d」,pp.24-27(小 d=.2、中 d=.5、大 d=.8 的約定,以及各自的真實對照物:雙胞胎與非雙胞胎的平均智商差距約當小效果,14 歲與 18 歲女孩的平均身高差距約當中效果,博士學位持有者與大一新生的平均智商差距約當大效果)。Cohen 在同節自承這組對應是任意的。原文
  18. 18.Roger L. Berger and Jason C. Hsu(1996)。Bioequivalence Trials, Intersection–Union Tests and Equivalence Confidence Sets,Statistical Science, 11(4), pp.283-319 (with discussion)。全篇:TOST 與信賴區間內含法之對偶關係的嚴謹處理。核心結果——以 90% 信賴區間是否落在 ±Delta 內,來判定 alpha=0.05 的等價,兩者給出完全相同的決策(Berger–Hsu 對偶);並把等價檢定放進交集—聯集檢定(intersection–union)的架構。DOI 10.1214/ss/1032280304。原文
  19. 19.Uri Simonsohn, Joseph P. Simmons & Leif D. Nelson(2020)。Specification Curve Analysis,Nature Human Behaviour 4: 1208–1214。把多種合理口徑一起攤開、用聯合置換做推論,防止事後挑一個好看的口徑。
  20. 20.David Krackhardt(1988)。Predicting with Networks: Nonparametric Multiple Regression Analysis of Dyadic Data,Social Networks 10: 359–381。MRQAP:以節點標籤置換處理 dyadic 資料的網絡自相關。
  21. 21.Ingwer Borg & Patrick J. F. Groenen(2005)。Modern Multidimensional Scaling: Theory and Applications,2nd ed. Springer Series in Statistics. New York: Springer。古典 MDS(Torgerson 雙中心化)把距離矩陣尺度化成低維座標;描述性、無題目參數與不確定性量化。
  22. 22.Sander Greenland, Stephen J. Senn, Kenneth J. Rothman, John B. Carlin, Charles Poole, Steven N. Goodman, and Douglas G. Altman(2016)。Statistical Tests, P Values, Confidence Intervals, and Power: A Guide to Misinterpretations,European Journal of Epidemiology, vol. 31, no. 4, pp.337–350。§2「常見誤讀清單」,列舉 25 條——正文標題即為 "Twenty-five misinterpretations" 對應段落原文