← 返回知識庫刷題首頁
P0 · 必會

機器學習初級中級

強化學習 (Reinforcement Learning, RL)

是什麼

代理在環境中採取行動,依獎勵或懲罰回饋逐步學會較佳策略。

解決什麼問題

適合需要連續決策、延遲回饋及探索與利用權衡的任務。

考場 Trigger

  • Agent 與環境互動
  • 獎勵訊號
  • 學習行動策略

容易搞混

監督式學習以回饋優化模型Q-Learning 與 Deep Q-Learning

初級深度

理解狀態、行動、獎勵與策略的關係即可,不需推導演算法。

中級深度

要能辨認獎勵駭客(Reward Hacking):代理鑽獎勵漏洞刷分(如反覆放開再抓取),根因在獎勵設計,修正是讓獎勵對齊真正的任務目標(完成揀貨)。

Official Evidence

官方題目正在怎麼考

4 官方題5 考綱節點