Point your AI agent at freehire and let it find you a job.

Get the CLI →

Farmatalento

NewBe an early applicant

Lead Data & Platform Engineer

Posted Updated 2 views
Discussion

Summary

Leads the clinical data platform of a Spanish health research consultancy: owns architecture and the PostgreSQL clinical data model, builds event-driven ingestion with Kafka/Flink and CDC, delivers HL7 FHIR interoperability and OMOP mapping, and sets engineering standards while growing the data team.

Buscamos un/a “Lead Data & Platform Engineer” para la Unidad de Health Data Platform and Innovation de una compañía española de Consultoría, Investigación e Innovación en salud, fundada en 2022 y en plena expansion.

Responsabilidad técnica de la Plataforma de Datos: Arquitectura, Modelo de Datos, Integración de Fuentes, Ingesta Continua, Calidad, Rendimiento y Operación.

No es un puesto de mantenimiento ni de ejecución de decisiones ajenas: quien ocupa este puesto decide la arquitectura, la documenta y la sostiene.

El puesto tiene cuatro áreas principales:

1. Consolidar y escalar la Plataforma Clínica. Rediseñar el Modelo de Datos, el Rendimiento y la Trazabilidad para que soporte el crecimiento en volumen, en fuentes y en número de proyectos simultáneos.

2. Integrar nuevas Fuentes de Datos Sanitarios. Incorporar nuevos Orígenes Clínicos, Hospitalarios y Administrativos al modelo común, resolviendo la Heterogeneidad de Formatos, Terminologías e Identificadores que caracteriza al sector.

3. Arquitectura orientada a Eventos e Interoperabilidad. Diseñar y operar la Ingesta Continua y el Procesamiento de Datos Asistenciales sobre Arquitecturas orientadas a Eventos, con Interoperabilidad HL7 FHIR y bajo requisitos estrictos de seguridad y soberanía del dato. Es una parte central del puesto, no un complemento.

4. Estándar técnico y equipo. Definir las prácticas de Ingeniería de la Unidad, documentar la Arquitectura y las Decisiones, y participar en la incorporación y el desarrollo del equipo conforme crece. Trabajarás en estrecha colaboración con Data analysts, Data scientists, Bioestadísticos y el Equipo Científico y Clínico para garantizar que los datos estén disponibles, validados, trazables y listos para los proyectos, y reportarás a la Dirección de la unidad.

Herramientas de Trabajo

  • PostgreSQL on-premise (modelo propio de datos clínicos): tuning, particionado, RLS y replicación.
  • Python para procesamiento, integración y automatización de datos.
  • Apache Kafka / Confluent Platform: ingesta y procesamiento de eventos.
  • Change Data Capture desde sistemas asistenciales (Debezium, Kafka Connect).
  • Procesamiento distribuido de eventos: Kafka Streams, Apache Flink o ksqlDB.
  • Gobierno de esquemas y contratos de datos: Schema Registry, Avro/Protobuf, versionado y compatibilidad.
  • Interoperabilidad sanitaria: HL7 FHIR R4, HL7v2, CDA. Terminologías clínicas: SNOMED-CT, CIE-10, ATC, LOINC.
  • Modelos comunes de datos: OMOP CDM y otros estándares europeos aplicables.
  • Orquestación y transformación versionada: Airflow o Dagster, dbt.
  • Pipelines de LLM y agentes sobre datos clínicos estructurados. No se espera un dominio absoluto de todo el listado, sino que las arquitecturas orientadas a eventos y la operación en producción sean terreno conocido, y criterio suficiente para decidir en el resto.
  • Definir la arquitectura de la ingesta y el procesamiento de eventos: topología de clústeres, diseño de topics y particionado, garantías de entrega, idempotencia, retención, replicación y recuperación ante desastre.
  • Implantar Change Data Capture y validación en tránsito sobre datos asistenciales.
  • Diseñar la capa de interoperabilidad: transformación a recursos FHIR R4, perfiles e Implementation Guides, y su expresión como contratos de datos.
  • Traducir requisitos clínicos y normativos en decisiones de arquitectura verificables: latencia, trazabilidad, auditoría y calidad del dato en tránsito.
  • Colaborar con los equipos clínicos en la traducción de reglas de validación y plausibilidad clínica a lógica ejecutable sobre los flujos de datos. Plataforma y modelo de datos
  • Rediseñar y optimizar el modelo relacional sobre PostgreSQL: particionado, índices, RLS por estudio/usuario, tuning y replicación.
  • Diseñar, administrar y optimizar bases de datos orientadas a datos clínicos y de vida real, garantizando calidad, integridad, trazabilidad y seguridad a lo largo de todo el flujo.
  • Definir la arquitectura de datos que soporte el crecimiento de la compañía en fuentes, volumen y clientes. Integración de nuevas fuentes.
  • Construir pipelines de extracción desde HCE/EHR, incluyendo datos estructurados y no estructurados, registros clínicos y datos administrativos.
  • Incorporar nuevas fuentes al modelo común: análisis de origen, mapeo, resolución de identificadores de paciente y control de calidad de la carga.
  • Implementar y mantener procesos ETL/ELT para la integración, transformación y carga de datos procedentes de múltiples orígenes.
  • Curado y normalización a CDM (Common Data Model). Mapeo a terminologías clínicas: SNOMED-CT, CIE-10, ATC, LOINC. Seguridad, cumplimiento y soberanía del dato
  • Diseñar y operar la plataforma bajo los requisitos de ENS categoría ALTA y de RGPD/LOPDGDD aplicado a datos de salud.
  • Pseudonimización, anonimización y k-anonimato; gestión de identificadores de paciente; segregación por proyecto; auditoría de accesos y de consultas.
  • Sostener despliegues on-premise o aislados de red cuando el marco de soberanía del dato lo exija. Reproducibilidad y calidad
  • Versionado reproducible de cohortes (dbt o equivalente): snapshots fechados de criterios y resultados.
  • Tests automatizados de calidad de datos y observabilidad de pipelines.
  • Implementación y mantenimiento de Modelos Comunes de Datos (CDM) como OMOP u otros estándares europeos aplicables. Integración de IA
  • Desarrollo y mantenimiento de servidores MCP para el acceso controlado a datos clínicos: autenticación, scoping por proyecto y auditoría de consultas.
  • Pipelines de LLM para procesamiento y estructuración de la información clínica. Liderazgo técnico, DevOps y equipo
  • Establecer los estándares de ingeniería de la unidad: revisión de código, decisiones de arquitectura documentadas (ADR), gestión de deuda técnica.
  • Aplicar DevOps: Docker, Kubernetes, CI/CD, infraestructura como código y gestión de despliegues on-prem y cloud híbrido.
  • Liderar o participar en las discusiones técnicas con equipos de IT internos y externos y con proveedores tecnológicos.
  • Participar en la selección, incorporación y desarrollo del equipo de ingeniería de datos.
  • Elaborar y mantener la

Skills

See also

DevOps jobs by country — openings, pay and top skills →

Tailor your CV for this role?

We couldn't check your fit for this role — add a CV to your profile to see it next time.

A new version of freehire is available