Senior Data Engineer (AI Focus) remote from Poland
ITMAGINATION Senior Data Engineer (AI Focus) remote from Poland
This is a remote position.
- AI Data Infrastructure: Design and scale data architectures specifically tailored for Machine Learning (ML) lifecycles, including feature stores, vector databases, and model training pipelines.
- Pipeline Engineering: Architect, build, and maintain robust ETL/ELT pipelines that handle structured and unstructured data with a focus on low latency and high reliability.
- Data Governance & Quality: Implement automated testing and monitoring for data integrity, ensuring that "garbage in, garbage out" is never a reality for our AI models.
Requirements
- Proficiency in Python and SQL. Experience with Java or Scala is a plus.
- Big Data Tools: Hands-on experience with frameworks like Apache Spark, Flink, or Kafka.
- AI/ML Familiarity: Experience supporting AI projects (e.g., handling embeddings, managing datasets for LLM fine-tuning, or working with tools like LangChain or LlamaIndex).
- Infrastructure as Code: Comfortable with Terraform or Docker/Kubernetes to manage data environments.
- BigQuery: Advanced optimization and partitioning strategies.
- Vertex AI: Experience building and deploying data pipelines within the Vertex ecosystem.
- Dataflow/Dataproc: Professional experience with managed Apache Beam or Spark services.
- Building real-time event-driven architectures.
- APIs: Understanding of REST APIs and microservices architecture.