P1 · 應會
機器學習
GRPO 與推理任務
是什麼
初級考試記法:GRPO = 以群組相對獎勵優化策略,常見於提升 LLM 數學/邏輯推理。
解決什麼問題
這題只需掌握 GRPO 常用來強化可被回饋或驗證的多步推理能力,尤其是數學與邏輯解題。
考場 Trigger
- 看到『GRPO+LLM 表現』→ 優先找多步數學或邏輯推理任務
初級深度
掌握主要用途、考試線索與必要邊界即可。
機器學習
是什麼
初級考試記法:GRPO = 以群組相對獎勵優化策略,常見於提升 LLM 數學/邏輯推理。
解決什麼問題
這題只需掌握 GRPO 常用來強化可被回饋或驗證的多步推理能力,尤其是數學與邏輯解題。
考場 Trigger
初級深度
掌握主要用途、考試線索與必要邊界即可。
Official Evidence