← 返回知識庫刷題首頁
P1 · 應會

資料中級

分散式資料處理 (Distributed Data Processing)

是什麼

把資料切分到多個節點平行計算、再彙總局部結果的處理方式,例如 Spark、Ray;可拆成局部加總的統計量應在各節點先算再合併。

解決什麼問題

處理單機無法負荷的大量資料,縮短預處理與分析時間,並避免把全量資料集中到單一節點。

考場 Trigger

  • Spark 或 Ray
  • 各 Executor 算局部統計量
  • 不要把資料收回 Driver
  • 平行預處理

容易搞混

分批讀取處理資料湖與資料倉儲資料庫分片

中級深度

能用筆數、總和、平方和的局部彙總算出分散式標準差,並指出把資料收回 Driver 的瓶頸。

Official Evidence

官方題目正在怎麼考

2 官方題2 考綱節點