AI Knowledge Index

知識庫

不是另一門課,而是把官方題目背後的知識點整理成可快速搜尋、辨識與回題驗證的索引。

258 個 Canonical Concepts41 個 P0 必會
258 個結果
P2 · 辨識即可人在迴圈中初級中級Human-in-the-loop · HITL

在高風險或超出授權的決策上保留人類最終把關,避免 AI 自動決定直接損害當事人權益。

P0 · 必會卜瓦松分佈中級Poisson Distribution

用於每分鐘來電數、每日故障次數等計數資料建模;同一過程中事件間隔時間則改用指數分佈。

P1 · 應會大型語言模型幻覺初級中級LLM Hallucination

生成式 AI 用在醫療、工程、金融等高風險場域時,要先驗證產出內容是否正確(與來源或專家判斷比對),並以檢索依據、限制回答範圍與人工審核降低幻覺。

P1 · 應會分層 K 折交叉驗證中級Stratified K-Fold Cross-Validation

類別不平衡的分類問題中,避免隨機切分讓某些折幾乎沒有少數類,造成評估結果波動或失真。

P0 · 必會分類、迴歸與分群初級中級Classification, Regression and Clustering

看題幹要模型輸出什麼,就能判斷任務類型,再選對演算法與評估指標:輸出類別 → 分類,輸出數值 → 迴歸,沒有答案只想分組 → 分群。

P1 · 應會主成分分析初級中級Principal Component Analysis · PCA

降低特徵維度、去除重複資訊,讓模型更快、更不易過擬合,也方便視覺化;它是把特徵「轉換」成新特徵,不是從原特徵中挑選。

P0 · 必會半監督式學習初級中級Semi-supervised Learning

標註成本高、資料很多但只有一小部分有標籤時,可以用上全部資料;只有正常樣本、異常難以標記的異常偵測也常歸在這類。

P0 · 必會去識別化初級中級De-identification

讓資料能用於訓練、研究或分享,同時降低認出特定個人的風險;搭配資料最小化(只給必要欄位),是從源頭保護個資的做法。

P0 · 必會召回率初級中級Recall

用來衡量漏掉正例的程度;越不能漏判,越重視召回率。

P0 · 必會可解釋 AI初級中級Explainable AI · XAI

使用者看得到依據才敢採用結果;醫療、授信等高風險決策也要能向當事人說明理由、讓專業人員審核,出問題時才能追查原因與責任。

P0 · 必會生成式與鑑別式 AI初級中級Generative vs. Discriminative AI

依需求選對類型:要判斷、分類、預測用鑑別式;要產生文字、影像、模擬資料用生成式。兩者也能合作,例如用生成式產生模擬資料,幫鑑別式模型訓練。

P1 · 應會合成少數類過採樣初級中級Synthetic Minority Over-sampling Technique · SMOTE

類別極度不平衡、無法補真實資料且只能動資料前處理時,用來增加少數類樣本,提升少數類的偵測能力。

P1 · 應會同態加密初級中級Homomorphic Encryption

資料可以集中處理,但即使在運算過程中也不想讓處理方看到明文時使用,例如把加密的敏感資料交給雲端計算。

P0 · 必會多代理與 A2A初級中級Multi-agent Systems and A2A

把複雜任務分給不同角色的代理協作完成;要先定義清楚角色與任務啟動條件,並同步彼此的上下文,否則會重複工作或依舊資訊做出不一致的決策。

P1 · 應會自動化機器學習初級中級AutoML

團隊有自己的資料、卻缺乏機器學習專業人才時,可以快速建立並比較模型,不必自己寫訓練程式。

P2 · 辨識即可決策樹與隨機森林初級中級Decision Tree and Random Forest

決策樹好解釋、不受特徵尺度影響;隨機森林綜合多棵樹,降低單棵樹過擬合,預測更穩定。

P1 · 應會卷積神經網路初級中級Convolutional Neural Network · CNN

處理影像這類有空間結構的資料,例如影像分類、瑕疵檢測、車輛辨識;比把影像攤平的多層感知機更有效率。

P1 · 應會延遲測試初級中級Latency Testing

確認模型上線後回應速度能滿足即時應用的時間要求,例如推薦要在 100 毫秒內回應。

P0 · 必會非監督式學習初級中級Unsupervised Learning

適合分群、降維與異常探索等尚未先定義正確答案的任務。

P1 · 應會前處理造成的資料洩漏初級中級Data Leakage in Preprocessing

讓測試集真正代表沒見過的資料,評估結果才可信;否則離線分數看起來很好,上線後卻變差。

P0 · 必會負責任 AI 治理初級中級Responsible AI Governance

AI 用在授信、醫療、招聘等影響權益的決策時,不只看準確率,還要確保過程公平、可說明、出錯可追責;也用來把實際問題對應到被違反的原則。

P1 · 應會差分隱私初級中級Differential Privacy

防止攻擊者靠多次查詢、比對結果推回特定個人的資料,在隱私保護與統計效用之間取得平衡。

P1 · 應會時間序列驗證初級中級Time Series Validation

讓評估結果反映真實的預測情境;隨機切分的時間序列會評估過於樂觀,上線後誤差變大。抽樣時也要保留時間結構。

P0 · 必會特徵工程初級中級Feature Engineering

讓模型更容易從資料中學到規律:好的特徵常比換更複雜的模型更能提升效果。挑選特徵時會參考目標變數的,稱為監督式特徵選擇。

P2 · 辨識即可特徵萃取與微調中級Feature Extraction vs Fine-tuning

依新任務資料量與和原任務的相似度選策略:資料少且相近用特徵萃取,資料較多或差異較大才微調。

P1 · 應會迴歸評估指標初級中級Regression Metrics

判斷房價、銷量、住院天數這類數值預測準不準,並比較不同模型;分類用的精確率、召回率不適用。

P0 · 必會密度分群演算法中級Density-Based Spatial Clustering of Applications with Noise · DBSCAN

處理形狀不規則、含雜訊的資料分群,不需預設群數,並能順便標出離群點。

P0 · 必會常見啟動函數初級中級Activation Functions

讓神經網路能學習非線性關係,並依位置選擇:隱藏層多用 ReLU(梯度傳遞較好),輸出層依任務選 Sigmoid(二元)或 Softmax(多類別)。

P0 · 必會強化學習初級中級Reinforcement Learning · RL

適合需要連續決策、延遲回饋及探索與利用權衡的任務。

P1 · 應會情感分析與關鍵詞提取初級中級Sentiment Analysis and Keyword Extraction

了解大眾對議題的態度與討論焦點:情感分析判斷立場或情緒,關鍵詞提取找出高頻議題;只分析內容,不需辨識個人身分。

P1 · 應會敘述性統計初級中級Descriptive Statistics

資料剖析的第一步,快速掌握各欄位的範圍、分布與缺失情形,例如 pandas 的 describe()。

P2 · 辨識即可異常偵測初級中級Anomaly Detection

異常通常罕見又難事先標註,及早發現能預防故障停機、詐騙或入侵。

P0 · 必會結構化、半結構化與非結構化資料初級中級Structured, Semi-structured and Unstructured Data

判斷資料屬於哪一類,才能選對儲存與處理方式:結構化資料用資料庫與 SQL,半結構化資料要解析標籤,非結構化資料需要 NLP、電腦視覺等技術。

P0 · 必會詞向量訓練方法中級Word2Vec and GloVe

取代 One-Hot 高維稀疏、無法表達語意相似度的表示,作為文本分類、相似度計算等下游任務的詞特徵。

P0 · 必會超參數調校中級Hyperparameter Tuning

在有限運算預算內找出驗證表現最好的超參數組合;超參數不能從資料直接學到,只能透過搜尋決定。

P1 · 應會損失函數初級中級Loss Function

把預測的落差量化成一個數字,讓模型知道該往哪個方向調整參數;它和給人看成效的評估指標分工不同。

P1 · 應會概念漂移與資料漂移初級中級Data Drift vs. Concept Drift

上線後效能下滑時,用來判斷原因與偵測方式:資料漂移在拿到實際結果前,比較輸入分布就能發現;概念漂移要等實際結果回來,看到預測與實際對不上才會發現。

P0 · 必會資料不平衡處理初級中級Imbalanced Data Handling

避免模型一律猜多數類仍得到高準確率,卻完全抓不到詐欺、罕病等真正重要的少數類。

P1 · 應會資料清理與品質初級中級Data Cleaning and Quality

讓模型學到的是真實的模式而不是資料錯誤:依欄位意義處理遺漏、異常、重複與格式不一致,避免一律刪除或一律填 0 這類會製造偏差的做法。

P0 · 必會資料視覺化選擇初級中級Choosing Data Visualizations

依想回答的問題選圖:看單一變數分布、看兩變數關係、看時間趨勢、比較類別,各有適合的圖。

P2 · 辨識即可資料漂移初級中級Data Drift

及早發現模型面對的資料已和訓練時不同,以便補充新資料或重新訓練。

P1 · 應會資料增強改善過擬合初級中級Data Augmentation against Overfitting

訓練資料不夠多元、模型開始過擬合時,不必另外蒐集資料就能擴充訓練樣本。

P0 · 必會資料隱私與安全初級中級Data Privacy and Security

導入 AI 時決定資料能不能用、能送到哪裡、誰能存取:敏感或機密資料可採私有化部署、在隔離環境處理,並建立存取控管與稽核紀錄。

P0 · 必會過擬合與泛化初級中級Overfitting and Generalization

模型的價值在於預測未來的新資料。比較訓練與測試(或驗證)表現的差距,判斷是否過擬合,再決定要加資料、降低模型複雜度,還是加正則化。

P1 · 應會演算法偏誤治理初級中級Algorithmic Bias Governance

授信、核保、招聘、補助審核等高影響決策出現族群差異時,確保不因性別、族裔、年齡等受到歧視;只刪除敏感欄位不夠,其他特徵可能是它們的代理變數。

P0 · 必會精確率初級中級Precision

用來衡量誤報程度;越不能把負例誤判成正例,越重視 Precision。

P1 · 應會影像分割初級中級Image Segmentation

需要精確知道物體的範圍(例如煙霧、病灶、道路)時使用,逐像素標示;只要知道「有沒有」用影像分類,只要大概位置用物件偵測的方框。

P2 · 辨識即可標準化初級中級Standardization

讓數值範圍差很大的特徵放在同一尺度,避免大數值特徵主導模型訓練。

P0 · 必會標準化與正規化初級中級Standardization vs. Normalization

讓數值範圍差很多的特徵(例如年收入與年齡)放在同一尺度,避免大數值特徵主導 KNN、SVM 這類用距離的模型,或讓梯度下降收斂不穩。

P0 · 必會模型部署與效能初級中級Model Deployment and Performance

讓模型在實際使用時夠快、夠穩、成本可負擔,並符合資料隱私要求;模型越大、延遲與成本越高,部署前要先權衡。

P0 · 必會模型壓縮與效能優化初級中級Model Compression

在大致維持品質下,讓模型變小、變快、變便宜,適合降低推論成本或部署到資源有限的邊緣裝置。

P0 · 必會遮罩語言模型初級中級Masked Language Model · MLM

讓編碼器模型學到適合理解類任務(分類、抽取、命名實體辨識)的雙向語意表示,而非用來逐字生成文字。

P1 · 應會遷移學習初級中級Transfer Learning

新任務的標註資料少、但與既有任務相似時,用既有的預訓練模型為起點,少量資料就能有好表現,省下大量標註成本。

P0 · 必會機器學習類型初級中級Machine Learning Paradigms

面對新的業務情境時,先判斷手上的資料與回饋方式,才能選對學習方法,再進一步決定是分類、迴歸還是分群。

P1 · 應會優化器初級中級Optimizer

讓模型在訓練中逐步變好:依損失函數算出的梯度,決定每個參數要往哪個方向調、調多少,常見的有 SGD、Adam。

P0 · 必會檢索增強生成初級中級Retrieval-Augmented Generation · RAG

補充模型不知道或會更新的知識,並讓回答可依據企業文件。

P1 · 應會聯邦學習初級中級Federated Learning

醫院、銀行、不同部門等資料因法規或隱私不能集中時,仍能共同訓練出一個模型,並持續用各地的新資料優化。

P1 · 應會擴散模型初級中級Diffusion Model

生成高品質、細節穩定的影像與影片;訓練比 GAN 穩定,並能透過條件引導與取樣步數控制結果,是目前文字生成影像、影片的主流方法。

P0 · 必會羅吉斯迴歸初級中級Logistic Regression

需要輸出類別機率、可解釋係數、訓練與推論快速的分類任務,常作為大量資料下的基準模型。

P0 · 必會類別特徵編碼初級中級Categorical Encoding

把文字類別轉成模型能處理的數值,同時避免讓模型誤以為類別之間有大小或順序關係。

P1 · 應會顯著性圖初級中級Saliency Map

協助醫師、律師等專業人員理解與複核模型的判斷依據;它不會提升準確率,也不能拿來量測病灶大小。

P0 · 必會AI Agent 與工具調用初級中級AI Agent and Tool Use

讓 AI 不只回答文字,還能完成任務:依目標拆解步驟、呼叫工具(檢索、API、程式執行)、看結果再調整。

P0 · 必會API 系統整合初級中級API Integration

讓 AI 應用與既有系統(ERP、資料庫、通知平台)互相取得資料或執行功能;評估平台時,API 介接、Webhook 與開放式架構決定了整合能力。

P0 · 必會Autoencoder 與 VAE初級中級

自編碼器常用於異常偵測與資料壓縮:只用正常資料訓練,異常資料重建不好、誤差變大;VAE 則可以從潛在空間取樣,生成新的資料。

P1 · 應會CLIP 與 DINO初級中級CLIP and DINO

取得通用的影像表示:CLIP 讓文字與圖片在同一向量空間比較(可以文搜圖),DINO 不需標註就學會影像特徵。

P0 · 必會Fine-tuning 與 PEFT初級中級Fine-tuning and PEFT

需要模型在大量對話中穩定維持固定的語氣、格式或領域行為時使用;知識經常更新則較適合 RAG。資源有限時改用 PEFT。

P2 · 辨識即可k-fold 交叉驗證初級中級K-Fold Cross-Validation

比只切一次訓練/測試更穩定客觀;切分含隨機性時,固定隨機種子可讓結果可重現。

P1 · 應會L1 與 L2 正則化初級中級L1 and L2 Regularization

控制模型複雜度、提升泛化;需要順便挑出重要特徵時用 L1,只想讓權重整體變小時用 L2。

P1 · 應會LIME 局部解釋初級中級LIME (Local Interpretable Model-agnostic Explanations) · LIME

不管原本是什麼模型,都能針對單一筆預測說明理由,例如某位申請人為什麼被拒;它只負責解釋,不會提升或取代原模型。

P1 · 應會LoRA 參數高效微調初級中級LoRA (Low-Rank Adaptation) · LoRA

大幅減少要更新的參數與 GPU 記憶體需求,讓資源有限的團隊也能微調大型模型;原權重不動,也較不容易發生災難性遺忘。

P0 · 必會Precision、Recall 與 F1初級中級Precision, Recall and F1

依錯誤的代價選指標:誤報代價高看精確率,漏報代價高看召回率,兩者都要兼顧看 F1;資料不平衡時,準確率會被大量負例墊高而失真。

P1 · 應會ReAct:推理與行動交替初級中級ReAct (Reason and Act)

適合資訊一開始不夠、需要邊查邊推理、途中可能要改變方向的開放式任務。

P1 · 應會RNN 與 LSTM初級中級RNN and LSTM

處理時間序列與文字等有先後順序的資料,例如到站時間、需求量預測;需要記住較早期的資訊時用 LSTM。

P1 · 應會SHAP 值初級中級SHapley Additive exPlanations · SHAP

為個別預測提供局部解釋(如每筆貸款被拒的理由),也可把各樣本的絕對值彙總成全域特徵重要性。

P0 · 必會Transformer 與注意力初級中級Transformer and Attention

讓模型直接計算序列中任兩個位置的關聯,掌握長距離的關係,是大型語言模型的基礎;代價是注意力的計算量與記憶體隨序列長度平方成長,且上下文長度有上限。

P0 · 必會Z 分數初級中級Z-Score

比較不同尺度的數值、做標準化,以及用門檻(常見 |Z| ≥ 3)偵測異常值。

P1 · 應會二項分佈的常態近似中級Normal Approximation to the Binomial

讓大樣本的成功次數或比例問題可用 Z 值與常態表計算,是比例檢定與比例信賴區間的基礎。

P1 · 應會大數據特性初級中級Characteristics of Big Data (5V)

判斷專案主要面對哪種挑戰,才能選對技術:量大要分散儲存與運算,速度快要串流處理,多樣要整合不同格式。

P1 · 應會小批次梯度下降中級Mini-batch Gradient Descent

兼顧梯度估計的穩定性與更新速度,並能用 GPU 平行處理整批資料,是深度學習訓練的標準做法。

P1 · 應會不可否認性中級Non-repudiation

用於 AI 推論紀錄、交易與稽核日誌,發生爭議時能證明哪個系統或人員在何時做出哪個決策。

P2 · 辨識即可公平性指標初級中級Fairness Metrics

整體準確率高不代表公平;要靠指標找出對特定族群的差別待遇,包含經由相關特徵間接造成的偏誤。

P1 · 應會分位數迴歸中級Quantile Regression

資料偏態、厚尾或關心極端值(如尾部損失、尖峰需求)時,直接對特定分位建模,取得比平均更有用的風險資訊。

P1 · 應會分批讀取處理中級Chunked Processing

單機記憶體不足以一次載入大型檔案時,不必改用分散式系統也能完成彙總計算。

P1 · 應會分段摘要整合初級中級Hierarchical Summarization

處理超過上下文長度的長文件,同時維持重點與脈絡一致;摘要本來就會捨棄部分細節。

P1 · 應會分組聚合中級Pandas groupby Aggregation

計算各類別、各客戶的總額、平均或筆數,常接 sort_values 或 nlargest 排名,或直接接繪圖。

P1 · 應會分散式資料處理中級Distributed Data Processing

處理單機無法負荷的大量資料,縮短預處理與分析時間,並避免把全量資料集中到單一節點。

P0 · 必會分群初級中級Clustering

探索資料中自然形成的結構,例如顧客分群。

P1 · 應會分群監控中級Slice-based Monitoring

避免占比小但影響大的子群體(如高額理賠)表現惡化被整體平均掩蓋,讓問題能及早被發現。

P1 · 應會反向翻譯中級Back-Translation

低資源語言平行語料不足時,不需新增人工翻譯就能擴充機器翻譯的訓練資料、降低過擬合。

P1 · 應會支援向量機初級中級Support Vector Machine · SVM

在特徵多、樣本數不多的分類問題中表現良好;資料量很大時訓練成本高,也不擅長自動萃取影像特徵。

P2 · 辨識即可水平擴展與自動伸縮初級中級Horizontal Scaling and Auto Scaling

應付高流量與流量起伏,同時提高吞吐量與可用性,避免單台機器成為效能瓶頸或單點故障。

P1 · 應會可為空整數型態中級Pandas Nullable Integer · Int64

整數欄位含缺失值時會被讀成 float64,用 astype('Int64') 可轉回整數,又不必填入捏造的值。

P1 · 應會可重現性中級Reproducibility

讓第三方能驗證模型評估結果、追查問題與稽核,是 AI 風險管理中可驗證性的基礎。

P1 · 應會可變預設參數中級Mutable Default Argument

避免資料處理函式在多次呼叫間偷偷累積狀態;寫法是把預設值設為 None,再於函式內建立新的串列或字典。

P1 · 應會布林索引篩選中級Boolean Indexing

依條件挑出符合的資料列再做計算;多條件時用 & 與 |,並以括號包住各條件。

P2 · 辨識即可母體穩定性指數中級Population Stability Index · PSI

不需真實標籤就能預警資料漂移與模型效能衰退,常用於信用評分卡的穩定性監控。

P1 · 應會生成內容出處與浮水印初級中級Content Provenance and Watermarking

協助平台與企業辨識內容是否由 AI 生成、出自哪個工具,降低不實資訊與誤導的風險;它幫助辨識來源,但不保證內容真實。

P1 · 應會生成對抗網路初級中級Generative Adversarial Network · GAN

學習資料的分布並產生全新、逼真的樣本(影像、音樂等);生成速度快,但訓練不穩定,容易發生模式崩潰。

P1 · 應會丟棄法中級Dropout

避免神經元彼此過度依賴,抑制過擬合、提升泛化能力。

P1 · 應會交併比中級Intersection over Union · IoU

衡量物件偵測或影像分割的定位準確度,也是計算 mAP 時判定真陽性的依據。

P1 · 應會交易的 ACID 特性中級ACID Properties (Atomicity, Consistency, Isolation, Durability) · ACID

確保轉帳、扣庫存等多步驟更新,在失敗或並行時不會留下只做一半或互相覆蓋的錯誤資料。

P1 · 應會合成資料初級中級Synthetic Data

補足稀有、昂貴、危險或涉及隱私的場景(如極端天候駕駛、罕見故障),擴充訓練資料以提升泛化,而非取代真實資料。

P1 · 應會吉尼不純度中級Gini Impurity

作為決策樹(如 CART)選擇分裂特徵的準則:挑能讓子節點吉尼不純度下降最多的分裂方式。

P1 · 應會向量與矩陣運算中級Vector and Matrix Operations

機器學習的資料表示、模型計算與降維都建立在這些運算上;寫 NumPy 程式時要能預測每個運算的結果與形狀。

P1 · 應會向量檢索初級中級Vector Retrieval

讓 RAG 不只比對字面關鍵字,也能找語意相近的內容。

P1 · 應會多元持久化中級Polyglot Persistence

避免一套資料庫勉強包辦所有工作負載;代價是維運複雜度與跨資料庫一致性管理增加。

P1 · 應會多任務學習損失權重中級Multi-task Loss Weighting

平衡任務間的競爭,避免一個任務變好、另一個變差;可用手動調權重、不確定性加權或梯度正規化。

P1 · 應會多語言大型語言模型初級中級Multilingual LLM

跨國、跨語言的應用(例如整合各國法規的知識庫)不必為每種語言各維護一套模型,並能辨識不同語言條文之間的對應與差異。

P2 · 辨識即可多層神經網路初級中級Multilayer Neural Network

多層堆疊讓模型逐層學出由簡單到抽象的特徵,處理單層模型做不到的複雜非線性問題。

P1 · 應會多模態圖像描述初級中級Image Captioning

讓系統「看圖說話」:影像模型擷取圖片特徵,語言模型依這些特徵產生描述;關鍵是生成時要同時參考圖片內容。

P1 · 應會成本敏感學習中級Cost-sensitive Learning

資料極度不平衡或漏判代價遠高於誤判時,讓模型真正學會偵測少數類,且不必改動資料分布。

P1 · 應會成員推斷攻擊中級Membership Inference Attack · MIA

用來評估模型是否洩漏訓練資料的成員身分;模型越過擬合、對外輸出的信心資訊越完整,風險越高。

P1 · 應會成對樣本 t 檢定中級Paired Samples t-test

用於前後測、同一受試者接受兩種處理等相依樣本,排除個體差異後檢定效果是否顯著。

P1 · 應會早期停止中級Early Stopping

防止模型在訓練資料上越練越好、卻在驗證資料上開始變差的過擬合,同時省下多餘的訓練輪數。

P1 · 應會池化層中級Pooling Layer

減少後續層的參數量與計算量,並讓特徵對小幅平移較不敏感。

P1 · 應會自然語言轉 SQL中級Text-to-SQL

讓非技術人員用自然語言查詢結構化資料,由資料庫保證聚合運算精確,並沿用資料庫既有的權限控管與稽核。

P1 · 應會串流處理中級Stream Processing

需要秒級或毫秒級反應的情境,例如 IoT 即時監控、詐欺偵測、即時推薦的特徵更新。

P1 · 應會位置編碼中級Positional Encoding

讓模型區分「狗咬人」與「人咬狗」這類用詞相同、順序不同的序列。

P1 · 應會序列到序列模型初級中級Sequence-to-Sequence · Seq2Seq

處理輸入與輸出都是序列、且長度不對等的任務,例如機器翻譯、文本摘要、對話生成。

P1 · 應會批次大小與泛化中級Batch Size and Generalization

解釋為何加大批次能加速訓練卻可能降低測試表現,作為調整批次大小與學習率的依據。

P2 · 辨識即可批次正規化初級中級Batch Normalization · BN

加快深度網路收斂、允許使用較大的學習率,並減輕對權重初始化的敏感度。

P1 · 應會投資報酬率初級中級Return on Investment · ROI

判斷 AI 投資值不值得:把有形節省、無形效益,與導入成本、隱性成本(維運、更新、訓練)放在一起比較,而不是只看單一指標或回收期。

P1 · 應會災難性遺忘初級中級Catastrophic Forgetting

提醒微調與持續學習時要保留舊能力,常以凍結主體、參數高效微調或混入舊資料來緩解。

P1 · 應會取樣偏差初級中級Sampling Bias

用來診斷模型為何在部分族群表現特別差,並提醒蒐集資料時要涵蓋部署後會遇到的完整母體。

P1 · 應會奇異值分解中級Singular Value Decomposition · SVD

用於降維、資料壓縮、去雜訊、潛在語意分析(LSA)與推薦系統的矩陣分解;PCA 也可以透過 SVD 計算。

P1 · 應會物件偵測初級中級Object Detection

需要知道「畫面中有哪些東西、在哪裡」時使用,例如車流統計、工地安全裝備檢查;只偵測物品而不辨識人,也能在統計時保護個人隱私。

P1 · 應會知識圖譜與 RDF 三元組初級中級Knowledge Graph and RDF Triples · RDF

讓知識具備標準化語意,支援跨來源整合、語意查詢與依本體規則自動推理出新事實。

P1 · 應會近似分位數中級Approximate Quantile

海量或串流資料無法全量排序時,快速且省記憶體地取得分位數,例如監控服務延遲的 P99。

P1 · 應會金絲雀發布中級Canary Release

在可控風險下用真實使用者驗證新模型的線上成效;出問題時只影響少數人,且能快速回退。

P1 · 應會非凸最佳化與局部最優解中級Non-convex Optimization and Local Optima

深度神經網路的損失函數大多非凸,用來解釋訓練結果為何受初始值影響,以及動量、隨機重啟等手段的用意。

P1 · 應會信用評分卡模型中級Credit Scorecard

讓授信決策可解釋、可稽核並符合監理要求,上線後以母體穩定性指數(PSI)監控分數穩定。

P1 · 應會型一與型二錯誤中級Type I and Type II Errors

依誤判代價設定 α 與樣本數,例如誤報代價高就降低 α;也用來正確解讀「不拒絕 H₀」不等於證明 H₀ 為真。

P1 · 應會持續整合中級Continuous Integration · CI

減少多人開發的整合衝突與後期修錯成本;在 MLOps 中是自動化流水線的第一段,後接持續部署。

P1 · 應會相關係數中級Pearson, Spearman and Kendall Correlation

判斷兩變數是否同向變動及其強弱,用於探索分析、特徵篩選與共線性檢查。

P1 · 應會重排序器初級中級Reranker

RAG 通常只把前幾筆檢索結果交給模型;正確文件若排得太後面就會被漏掉,重排序器能把它往前拉。

P1 · 應會容器編排平台中級Kubernetes · K8s

讓模型服務能以容器形式穩定上線,依流量自動擴展,並在節點故障時自動重啟或搬移服務。

P2 · 辨識即可時間資訊洩漏初級中級Temporal Leakage

這種模型離線評估看起來很準,上線後卻失準;特徵必須限於預測時點已知的資料。

P1 · 應會時間複雜度中級Time Complexity

評估演算法在資料量變大時是否仍可行,例如兩兩比對全部資料是 O(n²),資料翻倍時間約變四倍。

P1 · 應會特徵融合中級Feature Fusion

結合異質資料各自的資訊,讓模型同時利用多個來源;先依各自特性處理再融合,避免單一方法硬套而失真。

P1 · 應會特徵儲存庫中級Feature Store

減少各團隊重複開發相同特徵,確保訓練與推論用的特徵計算一致,並支援毫秒級即時特徵查詢。

P1 · 應會特徵離散化中級Feature Discretization

讓模型學到數值在不同區段的非線性規律,降低極端值與雜訊影響,也讓結果更容易被業務人員解讀。

P1 · 應會留一交叉驗證中級Leave-One-Out Cross-Validation · LOOCV

在樣本很少時盡量用上每一筆資料訓練,取得偏差小的效能估計;代價是要訓練 N 次、計算成本高。

P1 · 應會矩陣乘法中級Matrix Multiplication

神經網路的線性層、注意力的 Query/Key/Value 投影都是矩陣乘法,用來推算各層輸入輸出形狀與參數量。

P1 · 應會訓練資料記憶與洩漏初級中級Training Data Memorization

辨識模型說出訓練資料中敏感資訊的原因,並從源頭預防:訓練前去識別化與篩選資料,輸出端加上個資過濾。

P1 · 應會訓練資料授權管理中級Training Data Licensing

從源頭降低生成式 AI 輸出侵犯著作權的風險;輸出比對與浮水印只能事後偵測與追溯,無法預防。

P0 · 必會迴歸初級中級Regression

回答「是多少」;輸出是可連續變化的數值。

P1 · 應會迴歸係數顯著性檢定中級OLS Coefficient Significance Test · OLS

判斷哪些自變數真的與應變數有關;statsmodels 的 OLS summary 提供係數、標準誤與 p 值,sklearn 只給係數不做檢定。

P1 · 應會假設檢定中級Hypothesis Testing

用樣本資料判斷觀察到的差異是否可能只是隨機誤差,例如新版本轉換率是否真的較高。

P1 · 應會偏差與變異權衡初級中級Bias-Variance Tradeoff

依訓練與驗證表現診斷欠擬合或過擬合,決定該提高模型複雜度,還是加正則化或增加資料。

P1 · 應會偏態分配初級中級Skewness

偏態資料的平均數會被長尾拉動,描述與建模時要改用中位數,或先做對數轉換。

P1 · 應會偏態資料的穩健估計初級中級

避免只用平均數與變異數時,被偏態與極端值扭曲估計結果。

P1 · 應會偏誤緩解的三個階段中級Pre-processing, In-processing and Post-processing Bias Mitigation

依資料、模型與法規限制選出可行的去偏時點,例如推論時不得使用敏感屬性,就無法做後處理。

P2 · 辨識即可動態批次處理中級Dynamic Batching

提高 GPU 使用率與吞吐量,改善小批次請求造成的 GPU 閒置與延遲抖動。

P2 · 辨識即可巢狀交叉驗證中級Nested Cross-Validation

避免用同一組驗證結果既挑超參數又報告效能而產生過度樂觀的偏差,適合資料少到無法另留獨立測試集時。

P1 · 應會晚期融合中級Late Fusion

在某一模態品質不穩或缺失時仍維持穩健,也讓各模態模型能獨立開發與替換。

P1 · 應會條件機率中級Conditional Probability

計算帶前提條件的機率,是貝氏定理、樸素貝氏與關聯規則信賴度的計算基礎。

P1 · 應會梯度加權類別激活映射中級Gradient-weighted Class Activation Mapping · Grad-CAM

解釋 CNN 影像模型「看哪裡做判斷」,計算成本低,適合有即時性要求、不能大量擾動採樣的場合。

P1 · 應會梯度裁剪中級Gradient Clipping

防止梯度爆炸讓單次更新幅度過大、損失突然變成 NaN,常用於 RNN、LSTM 與大型模型訓練。

P1 · 應會深度學習的自動特徵學習初級中級Feature Learning in Deep Learning

這是深度學習與傳統機器學習最主要的差別;需要大量資料與運算,但能處理影像、語音、文字等複雜資料。

P1 · 應會混合搜尋中級Hybrid Search

補足純向量搜尋對專有名詞、型號、代碼等字面精確匹配較弱的問題,提升 RAG 檢索階段的召回與準確度。

P1 · 應會混淆矩陣中級Confusion Matrix

看出模型錯在哪一類,並據以計算 Accuracy、Precision、Recall、F1 等指標。

P1 · 應會異質變異中級Heteroscedasticity

用來診斷線性迴歸假設是否成立;存在時係數的標準誤與顯著性檢定會失準,需改用轉換或穩健標準誤。

P1 · 應會盒鬚圖中級Box Plot

快速比較多組資料的集中位置、離散程度、偏態方向與離群值。

P1 · 應會累積分佈函數與機率密度函數中級Cumulative Distribution Function and Probability Density Function · CDF / PDF

計算隨機變數落在某範圍的機率,例如 P(a<X≤b)=F(b)−F(a)。

P1 · 應會單因子變異數分析中級One-Way Analysis of Variance · ANOVA

避免做多次兩兩 t 檢定而膨脹第一型錯誤率;結果顯著後再用事後檢定(如 Tukey)找出哪幾組不同。

P1 · 應會提示微調中級Prompt Tuning

以極少的可訓練參數讓同一個大模型適應不同任務,每個任務只需另存一組軟提示。

P1 · 應會殘差分析中級Residual Analysis

診斷迴歸模型是否漏掉非線性關係、受異常值影響或變異數不齊,再決定轉換變數、加入新項或換模型。

P1 · 應會殘差連接中級Residual Connection

解決網路加深後的梯度消失與退化問題(層數變多、訓練誤差反而上升),讓數十到上百層的網路仍能有效訓練。

P2 · 辨識即可稀疏注意力中級Sparse Attention

一是降低長序列全注意力 O(n²) 的計算與記憶體成本;二是改善注意力分布過於平均、模型無法聚焦的問題。

P1 · 應會詞性標註中級Part-of-Speech Tagging · POS Tagging

作為資訊擷取、句法分析、命名實體辨識的前處理,例如先找出名詞片語再擷取實體或關鍵詞。

P1 · 應會詞頻–逆文件頻率中級Term Frequency–Inverse Document Frequency · TF-IDF

用於關鍵詞提取、文件檢索與文本分類的特徵表示,壓低「的」「是」這類到處都出現的詞的權重。

P1 · 應會極限梯度提升中級eXtreme Gradient Boosting · XGBoost

表格型資料的分類與迴歸,想要高準確率又要控制過擬合時的常用選擇。

P2 · 辨識即可概念漂移初級中級Concept Drift

提醒模型上線後要持續監控成效,關係改變時需用新資料重新訓練或調整模型。

P2 · 辨識即可滑動窗口與滯後特徵中級Sliding Window and Lag Features

讓一般迴歸或分類模型能用歷史值預測未來;也可在窗口內計算移動平均等滾動統計量當特徵。

P1 · 應會資料表合併中級Pandas merge and join

整合分散在不同表的資訊,例如客戶資料與交易紀錄;與只依索引或位置拼接的 concat 不同。

P1 · 應會資料庫分片中級Database Sharding

突破單機的儲存容量與吞吐上限,達成水平擴展與負載均衡。

P1 · 應會資料湖與資料倉儲中級Data Lake and Data Warehouse

依資料型態與用途分工存放:原始影像、文本進資料湖供訓練,整理後的業務資料進倉儲供分析。

P1 · 應會資訊增益中級Information Gain · IG

作為決策樹(如 ID3、C4.5)每次分裂時選擇特徵的準則:挑資訊增益最大的特徵往下切。

P1 · 應會跨模態對齊中級Cross-Modal Alignment

讓模型能做圖文檢索、圖像描述等跨模態任務,建立不同模態之間的對應關係。

P1 · 應會圖形資料庫中級Graph Database

處理社群關係、詐欺網路、推薦路徑等重度依賴關聯的查詢,避免關聯式資料庫多層 JOIN 效能低落。

P1 · 應會實驗追蹤中級Experiment Tracking

在大量調參與重訓中找出哪次實驗最好、為什麼最好,並能重現該結果,屬於上線前的離線開發管理。

P1 · 應會對抗性攻擊中級Adversarial Attack

說明模型在推論階段可被精心設計的輸入誤導,提醒防禦必須放在 AI 管線本身。

P1 · 應會對抗性測試初級中級Adversarial Testing

上線前或上線後,主動模擬攻擊者的手法,找出模型容易被騙的弱點。

P1 · 應會對數刻度中級Log Scale

讓跨越多個數量級、高度右偏的資料在同一張圖中同時看清密集的低值區與稀疏的高值區。

P1 · 應會對數轉換中級Log Transformation

處理收入、金額等嚴重右偏特徵,降低極端值影響,讓線性模型更容易擬合;但不是所有特徵都適用。

P1 · 應會漸進式部署中級Phased Rollout

控制上線風險並集中收集回饋;任一階段出現問題可暫停或回退,修正後再繼續擴大。

P1 · 應會維度災難中級Curse of Dimensionality

解釋 KNN、DBSCAN、K-means 在高維資料上效果下降的原因,提示應先降維。

P1 · 應會蒙地卡羅方法中級Monte Carlo Method

估計風險值、專案完成時間分佈、條件機率等不確定結果;抽樣次數越多,估計越準。

P1 · 應會誤導性圖表中級Misleading Visualization

用來檢查圖表是否誠實呈現差異;以長度或面積表達大小的長條圖、面積圖,數值軸必須從 0 開始。

P1 · 應會增量學習中級Incremental Learning

適用於資料分布或特徵持續變化、需要模型及時跟上的系統,例如每天新增特徵的點擊率預測。

P1 · 應會寬表轉長表中級Pandas melt

seaborn 等繪圖工具需要長格式,才能把原本分散的多個欄位當成同一個類別軸比較或分組上色。

P2 · 辨識即可影像資料增強初級中級Image Data Augmentation

不必另外蒐集資料就能增加多樣性,減少過擬合、提升模型對新影像的泛化能力。

P1 · 應會數據密度原則中級Data Density

指導圖表與儀表板設計,把相關資料整合在同一畫面便於比較,而非拆成許多稀疏的小圖。

P1 · 應會標籤偏差中級Label Bias

幫助辨認偏見來源出在「答案」而非樣本分布,從而改用重新標註、多人標註或稽核標註流程來處理。

P1 · 應會模式崩潰初級中級Mode Collapse

辨識生成結果「太單一」的原因,並與過擬合、梯度消失等訓練問題區分。

P1 · 應會模型註冊庫中級Model Registry

讓團隊追溯某版模型的來歷、審核後推上線,出問題時快速回滾到前一版。

P2 · 辨識即可模型複雜度控制初級中級

在欠擬合與過擬合之間取得平衡,讓模型對新資料有較好的泛化表現。

P1 · 應會模態缺失處理中級Missing Modality

實際部署常遇到感測器故障、使用者只給文字等情況,需避免模型因單一模態缺席而失效。

P1 · 應會模態專屬編碼器中級Modality-specific Encoder

讓每種模態用最能捕捉其結構的模型萃取特徵,避免一種架構處理所有資料而失去空間或時間資訊。

P1 · 應會獎勵塑形中級Reward Shaping

稀疏獎勵難以學習時用中間獎勵加速訓練;代理人鑽漏洞時則重新設計獎勵,使其對齊真正的任務目標。

P1 · 應會學習曲線中級Learning Curve

判斷模型是過擬合、欠擬合還是仍在進步,並決定該停止訓練、加資料或調整模型複雜度。

P1 · 應會學習率中級Learning Rate

控制訓練收斂的速度與穩定性,是最優先調整的超參數,常搭配學習率排程或 Adam 等自適應優化器。

P2 · 辨識即可樸素貝氏初級中級Naive Bayes

計算快、所需資料量少,常用於文字分類與垃圾郵件過濾。

P1 · 應會機器學習維運中級Machine Learning Operations · MLOps

解決模型上線後難以重現、更新與監控的問題,讓模型隨資料變化自動再訓練,並能安全回滾。

P1 · 應會遺漏值偵測中級Missing Value Detection

資料清理的第一步,先掌握各欄缺失比例,才能決定刪除、填補或另建缺失指標欄位。

P2 · 辨識即可擬合與轉換中級fit and transform

讓前處理參數只從訓練集學一次,再用同一組參數轉換驗證集與測試集,避免資料洩漏。

P2 · 辨識即可檢索相關性初級中級Retrieval Relevance

是 RAG 回答品質的關鍵,可透過調整 Chunking、Embedding 或加入 Reranker 來提升。

P2 · 辨識即可擴散模型取樣參數中級Sampling Steps and Classifier-Free Guidance · CFG

不重新訓練模型,只調整生成設定來改善圖像細節、品質與貼合提示詞的程度。

P1 · 應會斷路器模式中級Circuit Breaker Pattern

防止單一外部服務逾時造成請求堆積,演變成整個系統的連鎖故障(Cascading Failure)。

P1 · 應會雙比例 Z 檢定中級Two-proportion Z-test

A/B 測試比較兩版本的轉換率、比較兩條產線良率等「比例」型資料的差異檢定。

P1 · 應會離線與線上評估指標中級Offline vs Online Metrics

離線指標高不保證業務成功,評估 AI 導入成效要結合線上業務指標、成本與對照組比較。

P1 · 應會穩健縮放中級Robust Scaling

特徵含明顯極端值時,用來取代 Min-Max 或 Z-score 標準化,讓大多數資料仍保有可區分的尺度。

P2 · 辨識即可邊緣運算初級中級Edge Computing

滿足毫秒級即時反應、降低網路頻寬與傳輸延遲,或在斷網、資料不宜外傳時仍能在現場做決策。

P1 · 應會關聯規則學習中級Association Rule Learning

用於購物籃分析、交叉銷售與推薦,找出值得一起陳列或促銷的商品組合。

P1 · 應會AI 導入評估與規劃初級中級AI Adoption Planning

讓 AI 專案從要解決的問題出發:先定目標與 KPI、盤點資料,再選技術與供應商,小範圍驗證後才擴大。

P1 · 應會Apriori 演算法中級Apriori Algorithm

從大量交易紀錄中有效率地找出常一起出現的商品組合,作為產生關聯規則的基礎。

P1 · 應會ARIMA 殘差診斷中級Residual Diagnostics

判斷時間序列模型是否配適足夠,決定要不要調整 AR 階數 p 或 MA 階數 q。

P1 · 應會Box-Cox 轉換中級Box-Cox Transformation

線性迴歸的目標變數右偏、變異數隨 X 增大時,用來校正偏態與異質變異。

P1 · 應會Embedding 與向量表示初級中級Embedding

讓電腦能比較「意思」而不只是比對字面:語意相近的內容向量距離近,是向量檢索與 RAG 的基礎。

P1 · 應會Encoder-Decoder 與 Decoder-only初級中級Encoder-Decoder vs. Decoder-only

理解不同語言模型的生成方式:解碼器都是逐詞產生,每一步參考已產生的內容(Encoder-Decoder 還會參考編碼器的語意表示)。

P1 · 應會GPU 記憶體最佳化中級GPU Memory Optimization

解決訓練時記憶體不足(Out of Memory)或推論時 GPU 使用率低的問題,在不換硬體下把模型跑起來。

P2 · 辨識即可K-近鄰初級中級K-Nearest Neighbors · KNN

不必事先建複雜模型,靠「相似的資料有相似的答案」完成分類或迴歸。

P1 · 應會k-匿名化初級中級k-Anonymity

公開或分享資料集時,防止他人用多個間接識別欄位組合起來認出特定個人。

P2 · 辨識即可K-means 分群中級K-means Clustering

不需標籤就能把相似的資料歸成一群,常用於顧客分群與市場區隔。

P2 · 辨識即可KL 散度中級Kullback-Leibler Divergence · KL

比較訓練期與上線後的特徵分布以偵測資料漂移,也用於 VAE 損失、知識蒸餾等需要衡量分布差距的場合。

P1 · 應會N 元語言模型中級N-gram Language Model

早期用於輸入法、語音辨識與拼字建議等短距離預測,也是理解 RNN 與 Transformer 為何需要長上下文的基準。

P1 · 應會ROC 與 AUC中級ROC Curve and AUC

比較分類模型時,不必先選定單一門檻,就能看出模型區分正負類的整體能力;門檻怎麼設,則決定誤報與漏報之間的取捨。

P1 · 應會Seaborn 繪圖函式選擇中級Seaborn Plot Functions

依分析目的與資料型態挑對繪圖函式與參數(如 estimator 指定彙總方式),把整理好的 DataFrame 畫成正確圖表。

P1 · 應會t 分布隨機鄰域嵌入中級t-distributed Stochastic Neighbor Embedding · t-SNE

視覺化高維資料(如詞向量、影像特徵)的群聚結構;不適合當模型特徵,因為無法直接轉換新資料,全域距離也不可靠。

P2 · 辨識即可Token 使用成本初級中級Token Cost

評估 AI 導入的 ROI 時,必須從省下的人工成本扣除這筆持續費用,不能只看一次性投入。

P2 · 辨識即可Wasserstein 生成對抗網路中級Wasserstein Generative Adversarial Network · WGAN

緩解原始 GAN 訓練不穩定、梯度消失與模式崩潰的問題,也讓損失值能反映生成品質。

P1 · 應會Z 檢定中級Z-test

母體變異已知或樣本夠大時檢定平均數;母體標準差未知且樣本小時改用 t 檢定。

P2 · 辨識即可分組交叉驗證中級Group K-Fold Cross-Validation

避免同一個體的資料同時出現在訓練與驗證,讓模型靠「認得這個人」得高分,以真實估計對新個體的表現。

P0 · 必會分類初級中級Classification

回答「是哪一類」;輸出通常是類別或各類別的機率。

P2 · 辨識即可分類決策門檻中級Decision Threshold

依漏判與誤判的業務代價調整模型行為,不必重新訓練模型。

P1 · 應會向量資料庫初級中級Vector Database

管理 Embedding,供 RAG 快速找回相關內容。

P2 · 辨識即可多重共線性中級Multicollinearity

檢查需要解釋係數的模型(如信用評分卡)是否可靠;常用 VIF 或相關係數偵測,以刪變數、PCA 或 Ridge 處理。

P2 · 辨識即可序列標註初級中級Sequence Labeling

不只判斷整段文字屬於哪一類,而是標出序列中每個位置扮演的角色。

P2 · 辨識即可技術可行性初級中級Technical Feasibility

在投入大筆預算前先確認「做得出來」,避免上線後才發現資料或技術撐不起來。

P2 · 辨識即可命名實體辨識初級中級Named Entity Recognition · NER

把非結構化文字裡的關鍵資訊抽出來,供搜尋、建檔或後續分析使用。

P2 · 辨識即可非結構化資料初級中級Unstructured Data

企業大部分資料屬於這類,通常要靠 NLP、電腦視覺等技術處理後,才能分析或給 AI 使用。

P2 · 辨識即可信賴區間中級Confidence Interval · CI

表達估計值的不確定程度,也可用來判讀假設檢定的結果。

P0 · 必會訓練集、驗證集與測試集初級中級Training, Validation and Test Sets

避免用同一批資料同時訓練、選擇與宣告模型成績。

P2 · 辨識即可訓練集與測試集切分初級中級Train-Test Split

讓評估結果反映真實表現;標準化等前處理也要切分後只用訓練集計算,避免資料洩漏。

P2 · 辨識即可偽陰性初級中級False Negative · FN

在疾病、詐欺、害蟲等漏檢代價高的任務,要壓低 FN,也就是提高召回率(Recall)。

P2 · 辨識即可梯度消失與梯度爆炸中級Vanishing and Exploding Gradients

用來診斷深層網路與 RNN 訓練困難的原因,並對應解法:ReLU、殘差連接、批次正規化、梯度裁剪、LSTM。

P2 · 辨識即可提示快取中級Prompt Caching

適合每次請求都帶相同長前綴的 RAG、客服系統;固定內容放開頭、變動內容放後面才能命中。

P2 · 辨識即可貸款決策解釋初級中級

讓審查人員能向客戶說明被拒原因,也便於檢查決策是否公平並處理申訴。

P2 · 辨識即可亂數回應機制中級Randomized Response

調查敏感問題(如逃稅、用藥)時,讓個人保有可否認性、降低說謊誘因,同時仍能估出群體統計。

P2 · 辨識即可傳統機器學習模型初級中級Classical Machine Learning Models

資料量不大、要求可解釋或運算資源有限時,常比深度學習更快、更實用。

P2 · 辨識即可過度離散中級Overdispersion

提醒計數資料不能硬套卜瓦松模型,否則會低估變異、高估顯著性;出現時改用負二項分佈。

P2 · 辨識即可影子部署中級Shadow Deployment

在不影響使用者的前提下比對新舊模型的預測差異、延遲與穩定性;但使用者看不到新結果,量不到點擊、轉換等業務指標。

P2 · 辨識即可線性判別分析中級Linear Discriminant Analysis · LDA

在保留類別鑑別資訊的前提下降維,或直接當作線性分類器使用。

P2 · 辨識即可輸入驗證初級中級Input Validation

在入口擋下 Prompt Injection 與有害輸入;但它只是多層防禦的一層,不能單獨依靠。

P2 · 辨識即可輸出監控初級中級Output Monitoring

即使惡意輸入繞過入口檢查,仍能在出口擋下不當或洩密的結果。

P2 · 辨識即可隱私、資安與合規初級中級Privacy, Security and Compliance

避免個資外洩、未經告知使用資料或違反法規,降低法律責任與信任風險。

P2 · 辨識即可API 計費初級中級API Pricing

讓企業能依實際用量估算費用,評估是否划算並選擇合適的模型。

P2 · 辨識即可PR 曲線下面積中級Area Under the Precision-Recall Curve · PR-AUC

正類很少的不平衡資料(如詐欺、疾病)中,ROC-AUC 容易被大量負類撐高,PR-AUC 較能反映實際表現。