特殊教育 AI 工作坊
文字大小

實作主題四.評量

多元作答評量系統

評量調整不是把題目改簡單,
是把取用能力造成的障礙拿掉。同一份題目、多種作答方式、一套評分規準。

須建置資料庫第一天下午約 60 分鐘兩階段實作皆適用
第一天下午 這個案例要接資料庫。含報讀音檔批次產生器 延伸:資料儀表板 →

問題界定

《特殊教育課程實施規範》就評量方式調整已明列多種形式,包含紙筆、口試、指認、實作、點字試卷、放大試卷、電子試題、有聲試題,以及提供試卷並報讀等。但在紙筆評量的實體情境裡,要同時提供多種形式很難做到:同一節課內,沒辦法幫不同學生各準備一種試卷。

做成線上系統,這個限制就解掉了。學生自己選作答方式,你拿到的結果用同一份評分規準判。

段考報讀之完整拆解過程,見設計方法之報讀案例。該案例示範五個提問如何導出一份可實作的規格,並對照國中教育會考之語音報讀服務規範。該規範明列圖形、表格、特殊符號、形音義辨、區辨整合五類不以語音報讀,其中後兩類係因報讀將使該題所測量之能力消失,屬須逐題判斷之事項。

關鍵在於:該項障礙屬所欲測量之能力,抑或屬取用該能力所需之附帶能力。Ketterlin-Geller(2005)於無障礙評量文獻中將前者稱為目標技能(target skills),後者稱為取用技能(access skills)。以閱讀理解為測量目標時,書寫能力屬取用技能,應予移除;以國字書寫為測量目標時,書寫本身即為目標技能,不得替代。

Messick(1989/1995)指出效度之兩大威脅為構念代表性不足與構念無關變異。分數差異若源自非所欲測量之能力,即屬測量誤差;移除該項障礙係提升效度,而非降低標準。此為向任課教師與學校行政說明評量調整時,最站得住的一項依據。

實作(一):試題建置

第一天下午。

  1. 先用一句話寫下這次要測什麼
    寫不出這一句,就先不要往下做。後面每一個判斷都是回頭看這句話。
  2. 一題一題標:哪個是要測的能力,哪個是取用能力
    每題問一次:學生答不出來,是因為他真的不會,還是因為打不了字、看不清楚題目、讀不懂題意?後面這幾種全部都要處理掉。
  3. 給三種作答方式
    打字、點選、口述錄音。三種都要能對到同一份評分規準。這是這一主題的核心,也是最難的一步。
  4. 寫一份三種方式通用的評分規準
    「口述三項理由」和「寫出三項理由」要給一樣的分數。規準做不到這件事,三種方式就不等值,等於偷偷把標準降低了。

第一次做的人:下面這份指令是完整版,看起來很長。不用從這裡開始。先用指令模板的模板 A 起手,後面接模板 B、C 就好。下面這份等你熟了再回來看。

康軒 KUSE 指令
請建置一個線上評量網頁,主題為〔單元/能力〕,
對象為〔年級/學習功能等級〕,共〔N〕題。

本次評量之測量目標為:〔以一句話敘明〕
不屬於前述目標之任何能力,均不得影響作答結果。

每一題請提供三種作答方式供學生自行選擇:
1. 文字輸入
2. 點選(選項式,選項數不超過四項)
3. 口述錄音

三種方式共用同一份評分規準。請列出該規準,
並逐條說明同一評分等級於三種方式下之具體表現。

題目本身另行提供朗讀並同時顯示文字,題幹關鍵詞可展開檢視解釋。
無障礙規格:字級至少 20px 且放大兩倍不破版、對比度 4.5:1 以上、
全程可僅以鍵盤操作、不以顏色單獨傳達訊息、不設倒數計時。

「不設倒數計時」是故意的。時間限制是最常見的隱形障礙,而且多數評量根本沒把作答速度當成要測的東西。真的要測速度,就寫進前面那句「測量目標」裡。

實作(二):資料留存

第一天下午後半。

不留資料的線上評量,功能跟電子版試卷沒兩樣。存下來之後才答得了這幾個問題:哪一題錯得特別多(通常是題目本身有問題)、用不同作答方式的人表現有沒有差(可能是評分規準沒等值)、同一個學生前後兩次差多少。

欄位怎麼設、能收什麼、權限怎麼驗,見資料庫建置與個人資料保護。這一主題碰到的資料敏感度最高,動手之前請把那一頁讀完。

三項禁止事項
  • 不要存姓名或學號。存隨機碼,對照表印成紙本留在學校。
  • 不要存障礙類別,也不要存班級型態。欄位裡出現「資源班」三個字,就是在標記身分。
  • 作答方式那一欄要存中性代碼(typed/selected/spoken),不要取「輔具需求」這種一看就知道在指誰的名字。

三向度檢核

多元表徵
題目本身會不會就是障礙
  • 題幹有沒有朗讀,而且唸的同時看得到文字
  • 題幹的閱讀難度,會不會比你要測的能力還難
  • 圖表題的圖有沒有文字描述
多元行動與表達
三種作答方式真的等值嗎
  • 拿同一份規準,三種方式各答一題,分數判得出來一致嗎
  • 口述那條路,在吵的教室做得到嗎;聽覺障礙學生有沒有另一條等值的路
  • 有沒有設倒數計時
多元參與
學生知不知道自己現在答到哪
  • 做完知不知道對幾題、錯在哪
  • 中途離開,回得來繼續答嗎
  • 選了作答方式之後還能不能換

延伸:報讀音檔批次產生

段考報讀之完整拆解見設計方法之報讀案例。本節為該規格導出之實作。

做法比照國中教育會考的語音報讀:一題一軌,另外附一份曲目對照表。依規範不報讀的題目一樣產生一軌,裡面提示自行閱讀試題本,這樣軌號和題號永遠對得上,學生不會因為跳號而錯亂。

三個步驟

  1. 先拿到純文字,不要上傳試卷照片
    用裝置內建功能在自己電腦上擷取:Mac 和 iPhone 的照片可以直接選取文字,Windows 11 的剪取工具有文字動作。出題老師手上有電子檔的,這步跳過。
  2. 轉成報讀腳本
    讓 AI 照報讀規則整理一遍,並把圖形、表格、特殊符號、形音義辨、區辨整合這五類標成不報讀。指令範本見設計方法的報讀案例。
  3. 批次合成音檔
    跑腳本,一次產出逐題音檔和曲目對照表。實測七題約五秒,三十題約二十秒。語音合成用作業系統內建功能,離線執行,題目文字不會外傳。

腳本格式

報讀腳本.txt
# 01
下列選項中,何者為質數?
選項 A,四。
選項 B,七。

# 04 [不報讀]
本題含幾何圖形。
批次產生器。原始碼置於本站 tools/ 目錄,可自行修改。
環境語音來源輸出格式檔案
macOS內建 say,九種臺灣中文語音裝有 lame 者為 MP3,否則 M4A make-readaloud.sh
Windows內建 System.Speech裝有 ffmpeg 者為 MP3,否則 WAV make-readaloud.ps1

兩者輸入格式相同,輸出均含逐題音檔、曲目對照表 CSV 與可列印之 HTML。使用說明見 tools/README.md,輸入範例見範例腳本。

macOS 和 Windows 的內建工具都沒辦法直接編碼 MP3:Mac 的 afconvert 只能解碼,Windows 的語音合成只吐 WAV。腳本會自動偵測,改用能用的格式。真的需要 MP3,Mac 執行 brew install lame,Windows 裝 ffmpeg。其實 M4A 和 WAV 多數播放器都放得出來。

三項前提
  • 試卷照片不要上傳,先在自己電腦上擷取文字,再交給 AI 處理
  • 音檔可以重複播放,跟人工報讀一到兩次不是同一件事,這是強度不同的評量調整,要在個別化教育計畫會議記載
  • 題目文字用完就從平台移掉,音檔在考試結束後一併刪除