Data Engineer

Centellic nació para responder a las preguntas legales más complejas mediante el uso de información, analítica de datos y herramientas de vanguardia apoyadas en Inteligencia Artificial.

Actualmente, se encuentran en una fase de transición crucial, orientando toda su infraestructura global hacia un ecosistema completamente unificado y nativo en la nube.

¡Sube al estrado, que empieza tu turno! 👩🏻‍⚖️

La organización se formó mediante la combinación de dos grandes players en el espacio de la información jurídica: ALM y LBR. Bajo la marca Centellic, sus productos estrella Law.com y Lexology continúan operando como plataformas líderes en el mercado.

Están en un momento clave de transformación. Forman parte de un grupo de inteligencia legal que durante 25 años se ha basado en la tecnología para impulsar la industria con inteligencia, análisis y muchos datos de rendimiento gracias a un equipo de más de profesionales.

Siempre han estado comprometidos a crear un lugar de trabajo integrador y positivo para todo el mundo. Prueba de ello es que han sido galardonados en los premios 2024 “Inspiring Workplaces”. Se toman muy en serio su lugar en este mundo, participando en iniciativas para la comunidad y caritativas, como su trabajo con la escuela Swawou en Sierra Leona para brindar educación a niñas.

Además, son internacionales y cuentan con sede en 5 ciudades: Londres, Hong Kong, New York, Washington y Austin.

🫵🏻 ¿Cuál es tu papel en todo esto?

Sus datos llevan años siendo el motor del negocio, pero ahora toca dar el siguiente paso: transformar conjuntos de datos dispares y aislados en un data lake unificado y enriquecido que dé servicio a sus usuarios internos y clientes.

Aterrizarás en un entorno donde hay una infraestructura por evolucionar y mucha libertad para proponer.

Te incorporarás a su división global de Product & Technology, un equipo internacional donde la tecnología y el negocio van de la mano. Manejarás información crítica sobre litigios civiles, transacciones corporativas millonarias y finanzas de grandes firmas de abogados.

En este viaje, tu impacto se centrará en tres pilares fundamentales:

  • Ingeniería de pipelines de datos: No vas a mantener simples scripts. Vas a desarrollar robustos flujos de datos en Python y SQL para la ingesta y procesamiento de grandes volúmenes de información en tiempo real.
  • Orquestación y arquitectura moderna: Tu día a día incluirá el uso de Apache Airflow y los Lakeflow Jobs de Databricks para orquestar los procesos ETL/ELT. Cazarás ineficiencias en los sistemas actuales y propondrás soluciones robustas en Azure.
  • Visión de negocio e integración: Contribuirás a documentar, planificar e identificar cómo desgranar proyectos complejos. Trabajarás estrechamente con los stakeholders y los equipos de desarrollo para facilitar integraciones downstream.

En resumen: no vas a mantener lo que ya hay, vas a colaborar en la construcción de la infraestructura troncal sobre la que se asentará el futuro de los datos de la compañía.

  • Desarrollarás e implementarás pipelines de datos complejos escritos en Python y SQL para la ingesta y procesamiento de grandes flujos de información.
  • Orquestarás flujos de trabajo eficientes utilizando Apache Airflow y Databricks' Lakeflow Jobs para garantizar la consistencia y resiliencia del dato.
  • Evaluarás problemas, cuellos de botella e ineficiencias en las tuberías de datos heredadas, proponiendo soluciones y arquitecturas alternativas para mejorar el rendimiento del sistema.
  • Contribuirás al diseño de su nueva arquitectura de datos para soportar sus crecientes capacidades analíticas y de inteligencia artificial aplicada.
  • Redactarás una documentación técnica excelente, clara y estructurada, siendo capaz de desglosar proyectos de datos complejos en tareas de ingeniería más pequeñas y asumibles.
  • Te coordinarás de forma asíncrona y directa con un equipo global y remoto de desarrollo y con diferentes stakeholders de negocio.
  • Participarás activamente en ceremonias, planificando sprints, identificando incrementos de trabajo y autoorganizándote para la entrega continua de valor técnico de alta calidad.

Formarás parte de un equipo distribuido geográficamente con un fuerte enfoque técnico y de producto. Trabajarás de forma independiente y asíncrona, pero con una comunicación constante y transparente con tus compañeros.

Aquí se prioriza la colaboración y la búsqueda conjunta de soluciones, tanto a nivel técnico como de producto. Todas las comunicaciones, dailies y documentación se llevan a cabo íntegramente en inglés, así que prepárate para pulir tu speaking.

En Centellic priorizan la comunicación asíncrona estructurada a través de Microsoft Teams para evitar la fatiga por exceso de reuniones. No creen en los daily standups obligatorios porque sí, prefieren saltar a una llamada de forma ágil cuando hay bloqueos reales o para hacer sesiones de pair programming enfocadas en problemas complejos.

Además, fomentan abiertamente el uso de herramientas de IA para facilitarte la vida en el desarrollo. Eso sí, tienen un enfoque maduro y gobernado del uso de la IA: prefieren usarla como un copiloto inteligente de soporte y arquitectura que se valida con el liderazgo técnico.

Tu stack principal será Python, SQL, Databricks (Spark) y Apache Airflow, todo gestionado a través de Git/GitHub, contenerizado en Docker sobre entornos Linux.

Buscan a personas con una base sólida a nivel de ingeniería de software y con una buena mochila de aprendizajes a sus espaldas que le permitan adquirir autonomía en sus decisiones en el corto plazo.

No buscan solo a alguien que sepa picar código, sino a una persona que entienda cómo fluyen los datos, cómo optimizar procesos complejos y cómo construir un ecosistema que escale a largo plazo.

Lo que necesitan sí o sí

  • Experiencia sólida en Python y SQL: Hablamos de construir pipelines robustos y manipular grandes volúmenes de datos.
  • Orquestación: Experiencia fuerte trabajando con Apache Airflow y entornos distribuidos con Databricks / Spark.
  • Experiencia en entornos de producción en la nube, incluyendo la gestión segura de infraestructuras y flujos de despliegue continuo (CI/CD).
  • Experiencia con sistemas de control de versiones (Git/GitHub), entornos Linux y contenedorización con Docker.
  • Inglés fluido: Tanto hablado como escrito. Defenderás decisiones técnicas y te comunicarás con un equipo global a diario.
  • Autogestión y comunicación: Capacidad para planificar tu propio trabajo, escribir documentación impecable y colaborar de forma asíncrona.

Lo que sumará muchos puntos

  • Experiencia previa trabajando con motores PostgreSQL y/o MySQL.

  • Experiencia en la ingesta y transformación de datos textuales complejos no estructurados para Elasticsearch u otros almacenes NoSQL.

  • Familiaridad con herramientas modernas de replicación y transformación ágil de datos como Fivetran o dbt.

  • 🏖️ 23 días de vacaciones

  • 🩺 Acceso al programa de asistencia a empleados.

  • 🧘‍♂️ Presupuesto para programas de bienestar o el cuidado de la vista.

  • 💼 Participar en su programa de pensiones.