← 返回知識庫刷題首頁
P1 · 應會

資料中級

分批讀取處理 (Chunked Processing)

是什麼

把大於記憶體的檔案切成多批依序讀入、逐批處理並累計結果,記憶體用量只取決於每批大小,例如 pandas 的 read_csv 搭配 chunksize 參數。

解決什麼問題

單機記憶體不足以一次載入大型檔案時,不必改用分散式系統也能完成彙總計算。

考場 Trigger

  • 檔案大於記憶體
  • chunksize 參數
  • 逐批彙總
  • 單機處理大型 CSV

容易搞混

分散式資料處理串流處理

中級深度

能寫出 read_csv 的 chunksize 用法,並知道只有可逐批累加的統計量(筆數、總和)能這樣算。

Official Evidence

官方題目正在怎麼考

1 官方題1 考綱節點