← 返回知識庫刷題首頁
P0 · 必會

機器學習

以回饋優化模型

是什麼

RLHF/RFT 透過獎勵訊號調整模型的行為偏好與回應策略,不等同只模仿標註答案的 SFT。

解決什麼問題

這題考以回饋優化模型的適用邊界,並要求找出不正確、最不符合或不屬於的選項。

考場 Trigger

  • 先圈出『不/錯誤/非』,再判斷例外
  • 看到 reward、偏好或行為策略 → 強化式微調
  • 看到示範答案模仿 → SFT

容易搞混

Fine-tuning 與 PEFT機器學習類型與任務

初級深度

理解用途、典型情境與相近概念邊界即可,不需投入工程或研究層級細節。

Official Evidence

官方題目正在怎麼考

4 官方題3 考綱節點
練習這個 Concept(4 題)