P1 · 應會
機器學習
獎勵塑形 (Reward Shaping)
是什麼
獎勵塑形是在強化學習中設計或調整獎勵函數,例如加入中間獎勵來引導代理人。設計不當時代理人會找出刷分漏洞(獎勵駭客,Reward Hacking),行為偏離真正目標。
解決什麼問題
稀疏獎勵難以學習時用中間獎勵加速訓練;代理人鑽漏洞時則重新設計獎勵,使其對齊真正的任務目標。
考場 Trigger
- 代理人反覆做某動作刷分
- 獎勵中間動作而非完成任務
- 獎勵太稀疏學不起來
容易搞混
強化學習探索與利用的權衡
中級深度
遇到代理人鑽獎勵漏洞時,能判斷問題出在獎勵設計,並提出改成對齊最終任務完成的獎勵。