五套國際大型評比,十個項目
每一套評比的主辦單位、施測年齡與測驗取向都不同,把它們放在一起看,臺灣的輪廓才完整。上方的資料庫篩選可以只保留你要看的那一套。
選擇資料庫
點任一張卡片即可只保留該資料庫的分析分頁。
三個輪次,一百七十四萬名學生
資料取自 OECD 公開使用檔。每一個估計值都同時處理兩種變異來源:複雜抽樣設計,以及能力值本身是推估而非實測。
跨輪次比較必須納入連結誤差
連結誤差反映的是「同一道量尺在不同輪次之間對齊」本身的不確定性。它與樣本大小無關,再多的樣本也消不掉。數值取自 PISA 2022 技術報告 Annex Table 14.A.19。
臺灣三輪表現
括號內為標準誤。2018 是三輪中的低點,選哪一年當基期會講出完全不同的故事。
兩端同時擴大
加權描述統計
PISA 依學校規模與抽樣機率賦權,未加權的統計描述的是樣本,不是母體。以下每一張圖都以最終學生權重計算。
各輪平均分數與 95% 信賴區間
陰影帶為 95% 信賴區間。區間重疊不等於差異不顯著,正式檢定請看「連結誤差」分頁。
全部國家的逐輪數值
點欄位標題可排序。標星號者代表該變化在納入連結誤差後仍達統計顯著。
打開開關,看結論如何翻盤
兩輪次的差異檢定,標準誤應為 √(SE₁² + SE₂² + 連結誤差²)。漏掉第三項會低估不確定性,把不顯著的差異判成顯著。
會下錯結論的比較
下列每一組,忽略連結誤差時判為顯著,正確計算後並不顯著。
連結誤差對照表
PISA 2022 技術報告 Annex Table 14.A.19。空格表示該領域在該輪次尚非主測領域,OECD 明示不可比較。
注意 2006 年的閱讀連結誤差高達 8.56 分。以 2006 為基期談閱讀趨勢時,十五分的差距未必顯著。
PISA 2022 各國平均與信賴區間
完整數值表
點欄位標題可排序。臺灣以底色標示。
成績高,不代表分配公平
成績差異有多少來自「讀哪一所學校」
學生的成績差異可以精確拆成兩塊:同一所學校之內的差異,與學校之間的差異。後者占比越高,代表教育機會越取決於就讀的學校而非個人。
各國數值
點欄位標題可排序。臺灣以底色標示。
兩種估計標的,不該混為一談
同一份臺灣 2022 數學資料,本平台的設計基礎分解得 ICC = 0.405,Mplus 的兩層隨機效果模型得 0.422(預設權重縮放)或 0.455(不縮放)。三者並非彼此矛盾,而是在估計不同的量。
設計基礎分解回答的是描述性問題:在全體 15 歲學生的成績變異中,有多少比例落在學校之間。它使用完整抽樣權重,且校間與校內恆等相加為總變異。OECD 報告中的「校間變異百分比」採此定義。
模型基礎的變異成分是階層模型中的潛在參數,其總和不必等於觀測變異,且會隨權重縮放方式改變。Mplus 的 TYPE = TWOLEVEL 預設會在叢集內重新縮放權重。
迴歸係數的一致性則高得多:Mundlak 分解在 R 得校內效應 20.8、學校組成效應 131.6;Mplus 兩層模型得 19.9 與 125.0。差異來自 Mplus 僅用單一個推估值,且校層採隨機效果設定。
Mplus 空模型的校間殘差變異自 5,537 降至 1,485,即學校社經組成解釋了 73.2% 的校間差異;本平台的加權 R² 對同一問題給出 71.2%。兩條獨立路徑收斂到同一結論。
創造思考、財金素養與數學分測驗
PISA 2022 除了數學、閱讀、科學,還有兩個選考領域與數學的八個分測驗。這些資料與核心領域一起發布,卻很少被使用。
各國數值
TIMSS 2023
TIMSS 測的是各國課程實際教過的內容,四年級與八年級各抽一批獨立樣本。與 PISA 的差異不只在測什麼,抽樣與計分設計也不同:5 個合理推估值搭配 JK2 折刀法,直接套用 PISA 的程式會得到錯誤的標準誤。
各國數值
學生、教師與校長怎麼說
TIMSS 除了成就測驗,還向學生、教師與校長各發一份問卷。這些量表以 IRT 量尺化,國際平均 10、標準差 2,而且一律「高分=較有利」——包括「被霸凌」「課堂秩序」這類反向構念,本平台已逐一實測確認方向。
各參與者數值
量表的方向不能用猜的
「學生被霸凌」(BSBGSB)這個量表,分數高代表被霸凌得多還是少?從名稱看不出來,而猜錯會讓整張圖的意思顛倒。本平台的作法是查對應的分類版(IDX)各類別的連續分數平均:BSDGSB 的類別「幾乎從不」對應的 SCL 平均為 11.75,「幾乎每週」為 6.90——高分代表較少被霸凌。
同樣的檢查套用到每一個反向構念:「數學課秩序混亂」類別「很少或沒有」對應最高分 13.17,「教學受資源短缺影響」類別「未受影響」對應最高分 12.62。結論一致——IEA 的合成量表一律將高分設為較有利的一端。本平台因此把中文標籤全部改寫成正向說法(「免於霸凌」「數學課堂秩序」「數學教學資源充足度」),讓圖表的「往右=較好」在每一列都成立。
這次檢查也抓出一個標錯:PIRLS 的 ASBGERL 起初被寫成「入學前識字能力」,實際的官方標籤是 STUDENTS ENGAGED IN READING LESSONS,即閱讀課的投入程度,與入學前無關。
PIRLS 2021
PIRLS 測四年級學生的閱讀素養,分為兩個閱讀目的(文學經驗、獲取資訊)與兩個理解歷程(提取與直接推論、詮釋整合評鑑)。這是臺灣在十項評比中相對位置最低者之一。
各參與者數值
四份問卷:學生、家長、教師、校長
PIRLS 是本平台涵蓋的評比中唯一附有家長問卷者,能問到入學前的家庭讀寫活動——這正好落在臺灣相對弱的閱讀項目上。臺灣的家長問卷回收率 99.4%,全體中位數 89.6%,因此以下結果不是低回收造成的選樣偏誤。
各參與者數值
ICCS 2022
ICCS 測八年級學生的公民與公民素養知識。這是臺灣在十項國際評比中相對位置最高的一項,與創造思考的第 16 名形成強烈對比——同樣不是數理科目,結果卻南轅北轍。
各參與者數值
公民態度的 30 個量表
ICCS 除了公民知識測驗,還有 30 個公民態度與參與意向的量表(IRT 量尺,國際平均 50、標準差 10)。臺灣在其中 11 個排第 1、6 個排第 2——這個結果本身值得警覺,因為它也可能來自作答傾向而非實質差異。
各參與者數值
排名第 1 有兩種可能
臺灣在 30 個公民態度量表中有 11 個排第 1、6 個排第 2,而且整體平均 52.91 是 24 個參與者之冠。這有兩種解讀:一是臺灣學生的公民態度確實普遍較正向;二是存在應答風格——對 Likert 式的正向敘述較容易表示同意。單看原始分數無法區分這兩者。
本平台採用的檢查是國內置中(ipsatization):把每個參與者的各量表分數減去該參與者在 30 個量表上的平均,只留下「相對於自己的強弱」。這個轉換會把整體作答傾向消掉,代價是也消掉了真實的整體差異——因此它是穩健性檢查,不是更正確的答案。
結果具有診斷力。臺灣在「在校的公民學習經驗」「對移民的正向態度」「對同學互動的觀感」「對師生關係的觀感」四項置中後仍是第 1,這些不能只用作答傾向解釋。但「預期參與合法抗議」「校外討論政治社會議題」「預期積極政治參與」「以數位媒體參與公共議題」四項置中後全部落到第 24——原本的中段名次是被整體偏高的作答傾向撐起來的。
另有一項自動攔截:S_NISB(家庭社經地位指標)的各國加權平均全距為 0.000,因為它在各國內部標準化,本來就不能跨國排名,已排除於所有圖表之外。
臺灣拿第 1,有一部分是別人掉下來
ICCS 2022 的 24 個參與者中,有 15 個也參加了 2016 年。把兩輪並排看,臺灣 2022 年的第 1 名有了不同的意義。
各參與者的變化
這裡的標準誤比 PISA 那一頁寬鬆
本平台在 PISA 的趨勢分析中示範過:跨輪次比較必須把連結誤差納入標準誤,否則會把不顯著的差異判成顯著(PISA 的 396 組比較中有 16 組因此翻轉)。同一個要求也適用於 ICCS,但本平台目前沒有取得 ICCS 2022 的連結誤差數值,因此此頁的標準誤只含兩輪各自的抽樣與推估變異,是低估的。
這對結論的影響是可以評估的:挪威 −34.5、丹麥 −30.4 這類幅度遠超過任何合理的連結誤差,方向與顯著性不會改變;而臺灣 +1.9 分在目前的寬鬆標準下就已經不顯著,加入連結誤差只會讓它更不顯著。真正受影響的是中間地帶——立陶宛 −8.9 與荷蘭 −14.6 這種量級的判定應視為暫定。
態度量表的跨輪比較還多一層不確定:兩輪的量尺是否完全等價,本平台未能驗證。兩輪的整體平均(2016 年 50.23、2022 年 49.72)接近,顯示量尺沒有大幅漂移,但這只是必要條件而非充分條件。態度趨勢圖因此標示為型態參考,不作為效果量的精確估計。
TALIS 2024 與 2018
TALIS 問的不是學生,而是教師與校長。它沒有成就測驗,因此也沒有合理推估值——量表分數直接由題項合成。變異數以 Fay 平衡重複半樣本法估計,100 組重複權重(PISA 為 80 組)。
臺灣參加 2018、未參加 2024
TALIS 2024 的 55 個參與者含日本、韓國、新加坡與越南,但沒有臺灣,該輪結果為國際脈絡。臺灣參加的是 TALIS 2018,樣本為 202 位國中校長(校長問卷;各量表有效樣本 199–200 位),故本頁的臺灣數值全部來自 2018 輪。兩輪的量表題項與計分不同,不可跨輪比較。
各國數值
Fay 係數是從資料判定的
TALIS 的技術文件說明變異數以平衡重複半樣本法估計,但傳統 BRR 與 Fay 法的縮放係數不同,用錯會讓標準誤系統性偏誤。本平台不倚賴文件記載,而是直接檢查重複權重與最終權重的比值:取值集中於 0.5 與 1.5,對應 Fay 係數 k = 0.5(若為傳統 BRR 會集中於 0 與 2)。
驗證時另有一個容易踩的坑:以 survey 套件比對時,其預設 mse = FALSE 會把離差取自 100 個重複估計值的平均,而技術報告要求取自全樣本估計值。設為 mse = TRUE 後,本平台的實作與其差異為 5.55 × 10⁻¹⁷,即浮點運算的雜訊。預設值下則會有約 2% 的差距。
不是每一個量表都能拿來排名
TALIS 2018 的 20 個校長量表中,有 7 個算出來的各國加權平均幾乎完全相同。以「校園違規與暴力」(T3PDELI)為例,個體分數在 2.277 至 20.323 之間有充分變異,未加權的各國平均也介於 6.763 至 7.440,但加權後 47 個參與者的平均全部落在 6.8500 至 6.8504——全距僅 0.001。
這不是程式錯誤。本平台先以手算的 Σxw / Σw 逐國核對,結果與估計核心完全一致,確認計算無誤後才回頭查量表本身。答案寫在變數標籤裡:這些量表標示為 Configural 或 Metric,即僅達構形或metric不變性。TALIS 對未達純量不變性(scalar invariance)的量表會在各國內部進行中心化,各國平均因而被設計成相等,比較平均數等同於比較捨入誤差。
若不查標籤直接排名,會得到「臺灣校園違規程度為 47 個參與者中第 3 高」這樣的結論——分數差距在小數點第四位,卻被排成名次。本平台因此只採用實質有變異的九項量表(學校自主五項、資源短缺三項、多元文化信念一項,全距 1.1 至 2.8,相異值 43–47 個)繪製上方圖表。其中「多元文化信念」對部分國家群僅達構形不變性,惟其 47 個參與者呈現 47 個相異值,未見中心化的聚集現象,故予保留並單獨標示。連標示為部分純量不變的「教學領導」(T3PLEADS,全距 3.206)也被排除,因為 47 個參與者僅有 12 個相異值,代表多數國家仍被中心化,名次不可靠。
TALIS 2024 的量表標籤未帶不變性限定詞,且實際變異充分(教師自我效能感 7.14–12.04,55 個參與者 55 個相異值),故本頁 2024 輪的跨國比較不受此問題影響。
教師與人工智慧
「哪一個大型數據有 AI 問卷?」本平台把手上五套評比的變數字典逐一搜過,答案是只有 TALIS 2024 的教師問卷——28 個題目,涵蓋使用經驗、用途、不使用的原因、對助益與風險的信念,以及專業發展。校長問卷沒有,其餘四套評比也沒有。
跨單位的中位數與計數一律以 53 個不重複計算的單位為基礎:TALIS 的參與單位不全是主權國家,比利時同時以整體與兩個語言社群出現,三者樣本重疊(比利時整體 1,663 人=荷語區 798+法語區 865),逐單位的長條圖仍列出全部 55 個以利與官方報告對照。
臺灣未參加 TALIS 2024
這代表在目前唯一一份跨國、具代表性抽樣的教師 AI 使用資料裡,沒有臺灣。以下全部為國際脈絡。臺灣參加的是 TALIS 2018,該輪早於生成式 AI 普及,問卷中沒有任何 AI 題目(僅 11 題 ICT)。
五套評比逐一搜過的結果
搜尋字串為 artificial intelligence、AI、chatbot、machine learning、generative、ChatGPT、large language,比對範圍是各檔案的完整變數標籤,不是變數名稱。ICT 欄為對照組,用來確認搜尋本身有效——PISA 2022 學生問卷有 136 題 ICT 但 0 題 AI,不是搜尋失靈,是題目確實不存在。
各參與者數值
三分之一的教師沒答,這不是缺失
AI 模組的有效作答只有 62,763 人/194,521 人(32.3%)。這個數字乍看像嚴重的無回應,實際上是輪換題本設計:55 個參與者全部施測,但每位教師只拿到三份題本之一,AI 模組落在其中一份。各國的作答比率一致落在 0.289 至 0.334 之間,正是三分之一。
判斷依據不只是比率整齊。答題者與未答題者的平均權重為 28.18 與 28.11,幾乎相同,確認分派與教師特徵無關。因此沿用 TCHWGT 即為母體的不偏估計,代價只是有效樣本約為三分之一、標準誤較大。若誤把它當成無回應而去做加權調整,反而會引入偏誤。
三種題目的分母不同,混用會得到無法解釋的數字。「是否使用過 AI」的分母是全體作答者;「用 AI 做什麼」只有使用者作答,本平台換算成全體教師的比率(未使用者計為 0),因此各項可直接相互比較;「不使用的原因」只有未使用者作答,分母即為未使用者,且可複選,各項合計超過 100%。
參與單位不全是主權國家。比利時同時以整體與兩個語言社群出現於資料庫,三者的樣本重疊——比利時整體的模組作答為 1,663 人,荷語區 798 加法語區 865 亦為 1,663,同一批教師被計入兩次。本頁的中位數、全距與計數因此一律以 53 個不重複計算的單位為基礎(保留比利時整體、排除兩個語言社群),逐單位的長條圖與表格則仍列出全部 55 個,以利與官方報告對照。上海(中國)、加拿大亞伯達省與比利時兩個語言社群屬次國家層級的參與實體,與主權國家並列比較本身仍有其限制。
還有一個資料設計上的限制:「已接受的專業發展含 AI」與「對 AI 技能的需求」落在不同的輪換題本上,兩者的個體層次重疊為 0。這代表無法回答「想學 AI 的人是不是正在用 AI」這類問題——不是本平台沒做,是資料設計上就答不了。上方那張供需圖是國家層次的兩個比率並列,不是個體層次的交叉。
最後,AI 模組沒有官方的合成量表。本平台因此一律以是非題的加權比率呈現,不自行建構李克特平均——理由見 ICCS 那一頁關於作答風格的討論:自建量表分數要面對跨國可比性的問題,而比率的分母講得清楚、也相對穩健。
還有兩個來源,一個現有、一個未來
ICILS 2023(IEA 國際電腦與資訊素養調查)在校長問卷中加了一組生成式 AI 的選答題。但這組題目是在北半球資料蒐集開始之後才追加的,北半球國家只能以另一次補收的方式施測,南半球國家則可直接納入——因此各參與者的可得性與時點並不一致。本平台目前未納入 ICILS,若要使用須先確認每個參與者的施測狀況。
PISA 2029 規劃了「媒體與人工智慧素養」(Media & Artificial Intelligence Literacy, MAIL)創新領域。PISA 2025 的主測領域是科學並新增外語評量,不含 AI 素養評量。
跨評比對照
不同主辦單位、不同施測年齡、不同測驗取向。單看一套評比得到的結論,換一套未必成立——所以要放在一起看。
各資料庫的設計差異
把 PISA 的程式直接套到 TIMSS 上不會報錯,但會得到錯誤的標準誤——推估值個數與變異數估計法都不同。本平台為 IEA 系列另寫 lib_timss.R,為 TALIS 另寫 lib_talis.R,並各自以獨立實作驗證:TIMSS 臺灣八年級數學 602.430(SE 3.074),ICCS 臺灣 583.060(SE 2.303),兩者皆與 r-stats 的 survey_mean 逐位數一致。
臺灣本土資料庫
TASA(國家教育研究院臺灣學生學習成就評量資料庫)與 TEPS/TEPS-B(中央研究院)都需要申請取得,無法自動下載。本平台已寫好接入骨架,資料到位後把檔案放進指定目錄即可沿用同一套估計程序。
TASA 線上申請,需檢附研究計畫書與 IRB 核可文件。抽樣為分層叢集設計,提供學生權重與複本權重。
TEPS/TEPS-B 向學術調查研究資料庫(SRDA)申請。這是所有資料庫中唯一的追蹤設計,自 2001 年起追蹤同一批學生——因此也是唯一能做個人成長軌跡、交叉延宕模型與個體固定效果的資料。其餘皆為重複橫斷,每輪抽取不同學生,只能做群體層次的趨勢比較。
PISA 能不能做縱貫分析
不能,至少不是一般意義的縱貫分析。PISA 是重複橫斷設計,每三年抽一批新的 15 歲學生,沒有任何學生被重複測量。2022 年的受測者與 2018 年的受測者是完全不同的人。
可以做
- 國家或群體層次的表現趨勢
- 分布變化:低成就比率、高成就比率、分數離散程度
- 關係強度的變化,例如社經梯度斜率是否變陡
- 世代比較:1999 年出生世代對比 2006 年出生世代
不能做
- 個人成長軌跡
- 潛在成長模型、成長混合模型
- 交叉延宕模型、隨機截距 CLPM
- 個體層次的固定效果模型
若研究問題非談個人成長不可,PISA 本身做不到。可考慮臺灣教育長期追蹤資料庫(TEPS、TEPS-B),或部分國家對 PISA 樣本所做的後續追蹤研究。
複雜抽樣與權重
PISA 採兩階段叢集抽樣:先依規模機率抽學校,再在校內抽學生。學生被抽中的機率並不相同,因此每一筆資料都帶有權重。
W_FSTUWT最終學生權重,幾乎所有分析都用這個SENWT參議院權重,把各國權重總和標準化為相同值,只在跨國合併且希望各國等權時使用W_FSTURWT1–80重複權重,只用於變異數估計,不可拿來算點估計W_SCHGRNRABWT學校層級分析用
用錯權重的後果不是稍有偏差,而是估計值本身沒有意義。以 PISA 2022 數學為例,80 個國家與經濟體中,加權與未加權平均的差異中位數為 2.07 分,最大達 20.6 分(泰國),臺灣則是 13.1 分。
兩個變異來源
抽樣變異
以 Fay 平衡重複半樣本法估計,80 組重複權重,Fay 係數 0.5:
V_抽樣 = 1 / (80 × (1 − 0.5)²) × Σ (θᵣ − θ)² = (1/20) × Σ (θᵣ − θ)²
推估變異
學生能力不是實測值,而是從後驗分配抽出的 10 個合理推估值。依 Rubin 規則合併:
V_推估 = (1 + 1/M) × (1/(M−1)) × Σ (θₘ − θ̄)², M = 10
總標準誤為兩者相加後開根號。只用單一個推估值、或把 10 個推估值平均後當成觀測值,都會低估標準誤。
三方驗證
本平台的估計核心經過三種獨立實作交叉驗證,結果完全一致:自建的 lib_pisa.R、R 套件 intsvy、以及 r-stats MCP 的 survey_mean。以臺灣 PISA 2022 數學為例,三者皆得平均 547.09、標準誤 3.778,其中抽樣成分 3.728、推估成分 0.611。臺灣 2015 年三領域的估計亦與 OECD 公布值一致。
跨輪次可比性的硬限制
各領域最早可與 2022 比較的輪次
每個領域最早只能回溯到它首次成為主測領域的那一輪:閱讀到 2000、數學到 2003、科學到 2006、財金素養到 2012。超出此範圍不是「誤差比較大」,而是沒有共同量尺。
施測模式改變
2015 年起主要改為電腦施測,此前為紙筆。OECD 已在量尺連結中處理模式效應,但跨越 2015 這條線的比較,不確定性本質上高於 2015 之後各輪之間的比較。
ESCS 只能回溯到 2012
ESCS 在 2022 年重新校準過,各輪原始 ESCS 不可直接跨輪比較。OECD 另發布 trend ESCS,把 2012、2015、2018 三輪重新計算到 2022 的量尺。
PISA 2022 的特殊情況
2022 年施測期間橫跨 COVID-19 疫情,部分國家延後施測或調整樣本。解讀 2018 到 2022 的變化時,教育政策效果與疫情衝擊難以分離。
從 OECD 檔案伺服器到本頁圖表
本頁所有圖表都是 R 的輸出,不是網頁重畫的。分析在持續的 R 工作階段中執行(透過 r-stats MCP),估計函式與終端機分析共用同一份 lib_pisa.R。
目錄結構
從零重建一行完成:Rscript -e 'source("~/PISA/R/00_config.R"); rebuild_all()'
APA 第七版報告
頁面上的每一張圖與每一個表,都可以一次打包成 Word 檔。
報告內容
每一張圖與每一個表都附編號、斜體標題(置於上方)與研究結果說明(置於下方的「註」),並包含研究方法、描述統計、趨勢、各國比較、公平性、學校層級、選考領域、IEA 系列評比、結論與研究限制等章節。
- 中文字體標楷體,西文與數字 Times New Roman,12 pt
- 兩倍行高,內文左右對齊
- A4 版面,上下左右邊界 2.54 公分
- 表格採 APA 體例:僅頂線、標題列下方線與底線,無直線
APA 第七版正文原訂靠左對齊、右側不齊;本報告依需求改為左右對齊,此為刻意的體例調整。
資料範圍與限制
已納入
PISA 2015、2018、2022 的學生檔與學校檔,以及 2022 年的創造思考(63 國)與財金素養(20 國)選考領域。合計 174 萬名學生。
三個容易踩的坑
- 越南 2018 OECD 未將其合理推估值放進主學生檔,另以獨立檔案發布。不處理的話越南 2018 的所有估計都是空值。
- 創造思考檔沒有權重 認知檔只有推估值與試題反應,權重在主學生檔,必須以學生編號併回。
- 財金素養壓縮檔內有三個資料檔 只有問卷檔含推估值與權重,試題檔兩者皆無。
2012 以前無法自動取得
OECD 於 2024 年改版官網,舊的檔案網址全部失效,新的資料集頁面啟用了人機驗證。這部分需要以瀏覽器手動下載,且提供的是 ASCII 定寬檔加上 SPSS 讀取語法。
PISA 2025
首波結果預定 2026 年 9 月 8 日發布。屆時在來源清單加一列網址、重跑流程、更新連結誤差表即可納入。