← 返回知識庫刷題首頁
P2 · 辨識即可

機器學習

大型語言模型推理

是什麼

初級考試記法:GRPO = 以群組相對獎勵優化策略,常見於提升 LLM 數學/邏輯推理。

解決什麼問題

這題只需掌握 GRPO 常用來強化可被回饋或驗證的多步推理能力,尤其是數學與邏輯解題。

考場 Trigger

  • 看到『GRPO+LLM 表現』→ 優先找多步數學或邏輯推理任務

初級深度

看到名稱能辨識其類型與主要用途即可。

Official Evidence

官方題目正在怎麼考

1 官方題2 考綱節點
練習這個 Concept(1 題)