資料量正以前所未有的速度增長,傳統本地分析的做法已經跟不上。這篇筆記整理我在 AWS 上規劃現代資料架構時的核心概念:為什麼需要資料湖、資料湖裡可以放哪些存儲類型,以及 AWS 數據湖的基本支柱服務。
為什麼會需要現代資料架構?
數據量正從 TB 級激增到 PB 級,有時甚至達到 EB 級。傳統的本地數據分析方法無法處理這些數據量,因為它們的擴展性不夠好,並且成本太高。
許多公司正在從各個資料孤島獲取所有數據,並將數據聚合到一個位置——許多人稱之為數據湖——以便直接在這些數據之上進行分析和機器學習。有時,公司也會把其他數據存儲在專門構建的數據存儲中,以分析結構化和非結構化數據並快速獲得見解。
這種數據移動可以是「由內而外」、「由外而內」、「圍繞周邊」或「跨區域共享」,因為數據具有重力——資料會吸引更多應用與分析圍繞它建立。

什麼是數據湖?
數據湖是一個集中式存儲庫,允許你存儲任意規模的所有結構化和非結構化數據。你可以按原樣存儲數據,無需預先建模,之後再運行不同類型的分析——從儀表板和可視化,到大數據處理、實時分析和機器學習——以指導更好的決策。
數據湖涵蓋哪些不同類型的存儲?
在數據湖架構中,資料庫通常用於存儲結構化或半結構化數據,來源包括企業應用系統、交易數據、用戶資訊等。資料庫提供結構化的儲存和查詢功能,並支援事務處理,適合存取需要高度結構化的數據。
除了資料庫,數據湖還可以包括其他類型的存儲:
- 物件存儲:存儲非結構化或半結構化數據,如影片、音頻、圖像、日誌文件等。物件存儲以對象的形式存儲數據,每個對象都有唯一的鍵(Key)標識。
- 分佈式文件系統:存儲大型文件和文件集,如文檔、報告、配置文件等,提供高可用與可擴展的存儲。
- 流式數據存儲:存儲即時生成的數據流,如傳感器數據、日誌數據等,支援高吞吐量、低延遲的讀寫。
- 其他存儲服務:依需求還可包含物聯網(IoT)資料庫、時序資料庫等。
總的來說,數據湖是一個集中式、可擴展的數據存儲與管理架構,可以容納多種格式與來源的數據。資料庫是其中一種重要存儲形式,但不是唯一的選擇——依應用需求選擇合適的存儲技術才是重點。
AWS 數據湖的基本支柱是什麼?
AWS 數據湖的基礎由這幾個服務構成:
- Amazon S3:物件存儲,作為資料湖的骨幹
- AWS Lake Formation:集中管理資料湖的建置與權限
- Amazon Athena:直接對 S3 進行 SQL 查詢
- Amazon EMR:大數據分散式處理
- AWS Glue:ETL 與資料目錄

數據湖通常用於存儲非結構化和半結構化數據,例如影片、音頻、圖像、日誌文件等;而關聯型數據庫(包括 Amazon RDS 和 Amazon Aurora)通常用於存儲具有固定模式和結構的結構化數據。
由於用途和數據類型不同,數據湖架構圖中通常不會把關聯型數據庫包含在內。在實務架構中,關聯型數據庫負責存儲和管理已轉換成結構化的資料子集——例如從數據湖中提取的特定數據——供更嚴格的查詢與分析需求使用。
延伸閱讀
常見問題
數據湖和資料倉儲有什麼不同?
數據湖以原始格式儲存結構化與非結構化數據,先儲存後建模,適合機器學習與探索式分析;資料倉儲則存放已清理、已建模的結構化數據,適合固定的報表與 BI 查詢。兩者在現代架構中常互相搭配。
為什麼數據湖架構要以 Amazon S3 為基礎?
S3 提供幾乎無限的擴展性、極低的儲存成本與 99.999999999% 的持久性,且能以物件原樣儲存任意格式資料。搭配 Lake Formation 權限管理和 Athena 查詢,能快速建立無伺服器的資料湖。
關聯型資料庫在數據湖架構中扮演什麼角色?
關聯型資料庫(如 Amazon RDS、Aurora)負責存放從數據湖萃取、轉換後的結構化資料子集,支援事務處理與嚴格的查詢需求。它與數據湖分工,而不是被取代。
什麼是數據的「重力」?
數據具有重力,指的是資料量越大,越容易吸引應用、分析與流程圍繞它聚集。因此架構設計上要思考數據移動的方向——由內而外、由外而內、圍繞周邊或跨區域共享——避免反覆搬運巨量資料。
參考資料
- AWS 官方文件:AWS Lake Formation、Amazon S3
- AWS Lake House 架構說明:aws.amazon.com/redshift/lake-house
最後更新
2026-08-28(原文發布於 2023-08-02,本文保留原始筆記內容並補上 GEO 結構。)
關於作者 {#author}
Claire Chang | 企業 AI 導入與流程轉型顧問。專注於 AI Agent 架構設計、ERP 系統整合與企業 AI 治理。
首次發布:2023-08-02
