初考-統計資料處理大意115 年第 49 題單選題
大型語言模型(LLM)主要有訓練(Training)與推理(Inference)兩階段,下列描述何者正確?
A訓練階段主要仰賴 CPU 進行權重計算
B推理比訓練需要更多原始訓練資料
C訓練會持續修改權重,推理僅固定讀取權重正確答案
D推理階段的總計算量遠高於訓練
C正確答案
訓練階段不斷更新權重,推理階段凍結權重只做前向計算輸出結果。
為什麼答案是 C
訓練透過反向傳播持續調整權重以降低 loss;推理時權重已凍結,僅做前向傳播產生輸出,這是兩階段的本質差異。
載入中…
完整詳解
Pro · 無限重點 訓練階段不斷更新權重,推理階段凍結權重只做前向計算輸出結果。
記口訣:訓練=寫筆記(改權重)、推理=查筆記(讀權重)。
逐選項分析
A✕ 陷阱
訓練階段涉及大量矩陣運算與反向傳播,主要依賴 GPU/TPU 並行加速,CPU 效能根本跟不上。
B✕
推理只需使用者當下輸入的 prompt,不需要原始訓練資料;反而是訓練才需要海量語料。
C✓ 正確
訓練透過反向傳播持續調整權重以降低 loss;推理時權重已凍結,僅做前向傳播產生輸出,這是兩階段的本質差異。
D✕ 陷阱
訓練一次要跑遍整個資料集數個 epoch 並反向傳播,總計算量遠大於單次推理;雖然推理次數多,但題目問『計算量』訓練仍高。
LLM 訓練 vs 推理
| 比較項目 | 訓練 Training | 推理 Inference |
|---|
| 權重 | 持續更新 | 固定凍結 |
| 運算方向 | 前向+反向傳播 | 僅前向傳播 |
| 資料 | 大量訓練語料 | 使用者 prompt |
| 硬體 | 大量 GPU/TPU 叢集 | GPU 或優化過的 CPU |
| 總計算量 | 極高 | 單次較低 |
B、D 選項把訓練與推理的特性對調。考生要記住:原始資料與高計算量都屬於『訓練』階段,推理只是拿訓練好的模型來使用,不再改動權重也不需原始語料。