專技高考-醫事檢驗師醫學分子檢驗學與臨床鏡檢學(包括寄生蟲學)115 年第 50 題單選題
進行基因表現微陣列晶片(gene expression microarray)之數據分析時,各樣本所有基因點的原始訊號分布存在差異。則比較各樣本間之基因相對表現量前,應先進行下列何種處理最適當?
A正常化/標準化(normalization)正確答案
B去除各樣本的極端值,減少差異
C以 Student's t-test對基因在各樣本間進行顯著差異分析
D忽略訊號變異最大的第3樣本後,再進行分析
A正確答案
微陣列晶片各樣本原始訊號分布不同(如圖所示),比較前必須先做normalization消除系統性偏差,才能有效比較基因相對表現量。
為什麼答案是 A
各樣本整體訊號分布存在系統性差異(圖中四個箱形圖的中位數與四分位距明顯不同),必須先進行normalization(如quantile normalization、loess normalization等)消除技術性誤差,讓各樣本訊號具可比性,才能進行後續差異基因分析。
載入中…
完整詳解
Pro · 無限重點 微陣列晶片各樣本原始訊號分布不同(如圖所示),比較前必須先做normalization消除系統性偏差,才能有效比較基因相對表現量。
圖中4個樣本的箱形圖中位數明顯不同(樣本1≈8.5、樣本2≈13.5、樣本3≈8.5、樣本4≈17.5),這代表系統性偏差,必須normalization才能比較。
逐選項分析
A✓ 正確
各樣本整體訊號分布存在系統性差異(圖中四個箱形圖的中位數與四分位距明顯不同),必須先進行normalization(如quantile normalization、loess normalization等)消除技術性誤差,讓各樣本訊號具可比性,才能進行後續差異基因分析。
B✕ 陷阱
圖中各樣本的整體訊號強度中位數本身就存在差異(樣本2和樣本4中位數明顯偏高),這是系統性偏差而非極端值問題。單純去除極端值無法解決各樣本整體分布不同的根本問題,且可能刪去生物上真實有意義的訊號。
C✕
Student's t-test是統計顯著性分析工具,屬於normalization之後的下游分析步驟。若尚未normalization就直接進行t-test,各樣本訊號的系統性偏差會導致統計結果失真,產生大量假陽性或假陰性。
D✕ 陷阱
圖中樣本3的鬚(whisker)延伸至接近0,IQR較大,變異確實最大,但這可能反映真實的生物差異或需要normalization處理的技術誤差,不應隨意捨棄整個樣本。捨棄樣本會降低統計力並導致偏頗結論。
微陣列數據分析標準流程
| 步驟 | 操作 | 目的 |
|---|
| 1 | 原始訊號讀取(Raw data) | 取得各探針螢光強度值 |
| 2 | 背景值校正(Background correction) | 去除非特異性訊號 |
| 3 | 標準化(Normalization) | 消除技術性系統偏差,使各樣本可比較 |
| 4 | 差異基因篩選(DEG analysis) | t-test/ANOVA/fold change找出差異基因 |
| 5 | 功能分析(GO/KEGG等) | 解讀生物意義 |
選項D利用圖中樣本3的鬚延伸至0附近、變異最大的視覺特徵,誘導考生認為「變異大=問題樣本=應捨棄」。但正確邏輯是:各樣本整體分布不同是需要normalization處理的技術問題,而非棄用樣本的理由。樣本3的高變異可能恰好包含重要的生物訊息。
醫學分子檢驗學與臨床鏡檢學(包括寄生蟲學) 相關題目