← 返回知識庫刷題首頁
P1 · 應會

機器學習中級

獎勵塑形 (Reward Shaping)

是什麼

獎勵塑形是在強化學習中設計或調整獎勵函數,例如加入中間獎勵來引導代理人。設計不當時代理人會找出刷分漏洞(獎勵駭客,Reward Hacking),行為偏離真正目標。

解決什麼問題

稀疏獎勵難以學習時用中間獎勵加速訓練;代理人鑽漏洞時則重新設計獎勵,使其對齊真正的任務目標。

考場 Trigger

  • 代理人反覆做某動作刷分
  • 獎勵中間動作而非完成任務
  • 獎勵太稀疏學不起來

容易搞混

強化學習探索與利用的權衡

中級深度

遇到代理人鑽獎勵漏洞時,能判斷問題出在獎勵設計,並提出改成對齊最終任務完成的獎勵。

Official Evidence

官方題目正在怎麼考

1 官方題1 考綱節點