P2 · 辨識即可
機器學習
大型語言模型推理
是什麼
初級考試記法:GRPO = 以群組相對獎勵優化策略,常見於提升 LLM 數學/邏輯推理。
解決什麼問題
這題只需掌握 GRPO 常用來強化可被回饋或驗證的多步推理能力,尤其是數學與邏輯解題。
考場 Trigger
- 看到『GRPO+LLM 表現』→ 優先找多步數學或邏輯推理任務
初級深度
看到名稱能辨識其類型與主要用途即可。
機器學習
是什麼
初級考試記法:GRPO = 以群組相對獎勵優化策略,常見於提升 LLM 數學/邏輯推理。
解決什麼問題
這題只需掌握 GRPO 常用來強化可被回饋或驗證的多步推理能力,尤其是數學與邏輯解題。
考場 Trigger
初級深度
看到名稱能辨識其類型與主要用途即可。
Official Evidence