P0 · 必會
機器學習
以回饋優化模型
是什麼
RLHF/RFT 透過獎勵訊號調整模型的行為偏好與回應策略,不等同只模仿標註答案的 SFT。
解決什麼問題
這題考以回饋優化模型的適用邊界,並要求找出不正確、最不符合或不屬於的選項。
考場 Trigger
- 先圈出『不/錯誤/非』,再判斷例外
- 看到 reward、偏好或行為策略 → 強化式微調
- 看到示範答案模仿 → SFT
容易搞混
Fine-tuning 與 PEFT機器學習類型與任務
初級深度
理解用途、典型情境與相近概念邊界即可,不需投入工程或研究層級細節。