GenAI Data Engineer
Summary
Data engineer building a platform for processing unstructured data (documents, images, audio) for PKO BP bank, enabling semantic search, RAG and 'chat with data' tools. Day-to-day work spans Python/Rust services and pipelines, Qdrant vector indexing, embeddings/GenAI integration and DevSecOps operations, on a B2B contract in Warsaw.
Dołączysz do zespołu rozwijającego platformę do przetwarzania i udostępniania danych niestrukturalnych, takich jak dokumenty, obrazy i nagrania audio. Budujemy rozwiązania wspierające wyszukiwanie semantyczne, RAG oraz narzędzia typu „chat with data”. Projekt dla banku PKO BP.
Forma współpracy: B2B
Opis stanowiska
- budowa i rozwój pipeline’ów przetwarzania danych w trybie online i offline,
- przetwarzanie dokumentów, obrazów i nagrań audio, w tym ekstrakcja tekstu i metadanych,
- tworzenie usług oraz integracji API w Pythonie i/lub Rust,
- indeksowanie danych i rozwój wyszukiwania semantycznego z wykorzystaniem Qdrant,
- integracja z modelami embeddingowymi i rozwiązaniami GenAI,
- wdrażanie, monitorowanie i utrzymywanie rozwiązań zgodnie z podejściem DevSecOps,
- diagnozowanie incydentów oraz dbanie o jakość, wydajność i niezawodność procesów.
Wymagania
- dobra znajomość Pythona i/lub Rusta,
- doświadczenie w budowie pipeline’ów i usług przetwarzających dane,
- praktyczna znajomość wektorowych baz danych, w szczególności Qdrant,
- znajomość embeddingów, wyszukiwania semantycznego, filtrowania po metadanych i indeksowania,
- doświadczenie z REST API, mile widziana znajomość FastAPI,
- znajomość architektury sterowanej zdarzeniami, np. Kafka lub Pub/Sub,
- dobra znajomość systemu Linux,
- znajomość relacyjnych baz danych, np. PostgreSQL.
Mile widziane
- doświadczenie z Kubernetes, Docker oraz CI/CD,
- znajomość GCP, BigQuery, Dataflow, Dataproc lub Pub/Sub,
- znajomość Apache Airflow, Spark lub Beam,
- doświadczenie z OCR, transkrypcją audio oraz konwersją dokumentów,
- znajomość baz grafowych, np. Neo4j,
- doświadczenie z Knowledge Graph, GraphRAG lub klasycznymi rozwiązaniami RAG.
Nie oczekujemy znajomości wszystkich wymienionych technologii. Szukamy osoby z solidnymi podstawami inżynierii danych i gotowością do rozwoju w obszarze danych niestrukturalnych oraz AI.