P1 · 應會
資料
分散式資料處理 (Distributed Data Processing)
是什麼
把資料切分到多個節點平行計算、再彙總局部結果的處理方式,例如 Spark、Ray;可拆成局部加總的統計量應在各節點先算再合併。
解決什麼問題
處理單機無法負荷的大量資料,縮短預處理與分析時間,並避免把全量資料集中到單一節點。
考場 Trigger
- Spark 或 Ray
- 各 Executor 算局部統計量
- 不要把資料收回 Driver
- 平行預處理
容易搞混
分批讀取處理資料湖與資料倉儲資料庫分片
中級深度
能用筆數、總和、平方和的局部彙總算出分散式標準差,並指出把資料收回 Driver 的瓶頸。