Point your AI agent at freehire and let it find you a job.

Get the CLI →

DS STREAM

NewBe an early applicant

Data Engineer

Posted Updated 1 view
Discussion

Summary

Senior Data Engineer building a multicloud (Azure + GCP) data ecosystem on Databricks and Spark that powers production LLM/RAG systems — including document chunking, embeddings, vector search, and Airflow-orchestrated pipelines. Fully remote across Poland, with optional use of a Warsaw office.

[zdalnie] Senior Data Engineer LLM & RAG

🚀 Rozwijamy nasz zespół AI Data Engineering w DS STREAM!

Poszukujemy Senior Data Engineera, który dołączy do naszego zespołu i będzie rozwijał nowoczesne rozwiązania chmurowe zasilające systemy Generative AI, duże modele językowe (LLM) oraz architektury RAG (Retrieval-Augmented Generation).

📍 Praca w 100% zdalna na terenie Polski (z możliwością korzystania z biura w Warszawie).

O projekcie Dołączysz do projektu budującego zaawansowany ekosystem danych w środowisku multicloud (Azure oraz GCP), który stanowi fundament dla produkcyjnych wdrożeń LLM/RAG i wyszukiwania kontekstowego.

Środowisko wykorzystuje m.in. Azure Databricks, GCP Vertex AI (Vector Search), Unity Catalog, Spark Structured Streaming oraz Databricks, zapewniając wysoką wydajność, bezpieczeństwo i skuteczne zarządzanie danymi. Architektura rozwiązania oparta jest na modelu Medallion Architecture, połączonym z nowoczesnym przetwarzaniem danych niestrukturyzowanych (chunking, embeddingi) oraz orkiestracją LLM (LangChain / LlamaIndex).


Czego oczekujemy?

  • Python & SQL: Bardzo dobra, zaawansowana znajomość Pythona oraz SQL w kontekście budowania skalowalnych potoków danych.
  • Databricks & Spark: Min. 3 lata praktycznego doświadczenia w pracy z platformą Databricks, PySpark, Delta Lake oraz znajomość Unity Catalog i Databricks Asset Bundles.
  • Orkiestracja: Doświadczenie w tworzeniu i produkcyjnym utrzymaniu DAG-ów w Apache Airflow.
  • Doświadczenie Chmurowe (Azure / GCP): Praktyczna znajomość komponentów danych w Azure (Data Factory, Databricks, Blob/ADLS, AI Search) i/lub GCP (BigQuery, Cloud Composer, Vertex AI, Cloud Storage).
  • Streaming & API: Doświadczenie w integracji danych z interfejsów API oraz przetwarzania danych w czasie rzeczywistym (Spark Structured Streaming).
  • LLM/RAG Znajomość architektur LLM/RAG, technik podziału dokumentów (chunking), pracy z embeddings oraz bazami wektorowymi.
  • Inżynieria Oprogramowania: Znajomość Git, Docker, CI/CD oraz narzędzi IaC (Terraform).

Mile widziane

  • Certyfikaty: Databricks Certified Data Engineer Senior/Associate, Azure Data Engineer Associate (DP-203) lub Google Cloud Professional Data Engineer.

Skills

See also

Data Engineering jobs by country — openings, pay and top skills →

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available