Senior Data Engineer (Databricks)
Summary
Build and optimize scalable data pipelines on Databricks and AWS, designing a Lakehouse architecture with Delta Lake to support ETL/ELT, real-time streaming, and analytics for a fintech company.
我們正在尋找一位具備扎實實作能力,並對現代資料架構有良好理解的 資深資料工程師(Senior Data Engineer)。
你將負責使用 Databricks 與 AWS 設計、建置及持續優化可擴展的資料平台與資料管線。除了日常開發工作之外,你也需要參與資料平台的架構設計與技術決策,包括資料建模、資料匯入、儲存、處理、治理、可靠性、效能與擴展性。
此職位適合仍然重視 hands-on 開發,同時也具備整體資料平台與架構思維的工程師。
主要職責
使用 Databricks 設計、建置及維護可擴展的批次與即時資料管線。
建立可靠的 ETL / ELT 流程,整合資料庫、API、Kafka / Event Stream、檔案及其他企業系統。
設計與維護基於 AWS 與 Databricks 的 Data Lake / Lakehouse 架構。
使用 Delta Lake 與 Medallion Architecture 原則建立及優化 Bronze、Silver、Gold 資料層。
與業務及工程團隊合作,定義合適的資料模型、Schema 與 Data Contract。
參與資料架構設計,協助建立以下方面的標準:資料匯入, 資料儲存, 資料建模, Streaming 架構, 資料品質, 資料治理, 安全與存取控制, 系統擴展性與效能
在效能、可維護性、雲端成本及系統複雜度之間做出合理的技術取捨。
建立可重用的資料框架、共用元件與平台能力,而非只開發一次性的資料管線。
透過 Partitioning、Clustering、Query Optimisation、Caching 及 Spark 優化提升平台效能。
處理生產環境的資料問題並進行 Root Cause Analysis。
確保資料平台具備良好的可靠性、可觀測性及災難恢復能力。
參與技術設計 Review,並為其他 Data Engineer 提供技術指導。
推動資料工作負載的 CI/CD、自動化測試與部署流程。
持續改善資料平台、工程標準及整體技術架構。
技術棧
我們目前的核心資料平台主要包括:
Terraform 等 Infrastructure as Code 工具
不要求候選人熟悉所有技術,但我們希望候選人對 Databricks、Spark、Python、SQL 及 AWS 有較強的實際經驗。
必備經驗
5 年以上 Data Engineering、Data Platform Engineering 或相關工作經驗。
具備扎實的 Databricks 及 Apache Spark / PySpark 實戰經驗。
有設計及維護大型 Production ETL / ELT Pipeline 的經驗。
熟悉 Delta Lake 與 Lakehouse Architecture。
具備良好的 Data Modelling 與 Data Warehouse 基礎。
熟悉 AWS 資料相關服務,尤其是 S3、IAM、Glue 及相關服務。
有處理大規模資料量及高吞吐資料管線的經驗。
理解 Distributed Data Processing 及其效能考量。
有 Data Pipeline CI/CD 及軟體工程最佳實務經驗。
能夠獨立分析複雜技術問題,並提出可擴展的解決方案。
能清楚說明架構決策以及不同方案之間的 Trade-off。
我們希望你具備
扎實的技術能力,並願意保持 hands-on。
不只關注單一 Pipeline,而是能從整個資料平台角度思考問題。
理解不同架構方案的優缺點及 Trade-off。
能建立其他工程師容易維護、擴展與重用的系統。
對 Production Reliability 與 Data Quality 有高度責任感。
能獨立處理複雜技術問題。
能對現有設計提出挑戰,並提出更好的解決方案。
能將業務需求轉化為實際、可靠且可擴展的資料解決方案。
能與技術及非技術 Stakeholder 有效溝通。
此職位的成功標準
成功的 Senior Data Engineer 不只是交付資料管線。
我們期望你能協助建立一個 可靠、可擴展、可治理、可重用的資料平台,支援不斷增長的資料量、即時資料處理、分析、營運系統,以及未來的 AI / ML 應用。