Lead Data & Platform Engineer (España)

Lead Data & Platform Engineer (España)

10 sep
|
Farmatalento
|
España

10 sep

Farmatalento

España

Buscamos un/a “Lead Data & Platform Engineer” para la Unidad de Health Data Platform and Innovation de una compañía española de Consultoría, Investigación e Innovación en salud, fundada en 2022 y en plena expansión.

MISIÓN

Responsabilidad técnica de la Plataforma de Datos: Arquitectura, Modelo de Datos, Integración de Fuentes, Ingesta Continua, Calidad, Rendimiento y Operación.

No es un puesto de mantenimiento ni de ejecución de decisiones ajenas: quien ocupa este puesto decide la arquitectura, la documenta y la sostiene.

El puesto tiene cuatro áreas principales:

1. Consolidar y escalar la Plataforma Clínica. Rediseñar el Modelo de Datos, el Rendimiento y la Trazabilidad para que soporte el crecimiento en volumen, en fuentes y en número de proyectos simultáneos.

2. Integrar nuevas Fuentes de Datos Sanitarios. Incorporar nuevos Orígenes Clínicos, Hospitalarios y Administrativos al modelo común, resolviendo la Heterogeneidad de Formatos, Terminologías e Identificadores que caracteriza al sector.

3. Arquitectura orientada a Eventos e Interoperabilidad. Diseñar y operar la Ingesta Continua y el Procesamiento de Datos Asistenciales sobre Arquitecturas orientadas a Eventos, con Interoperabilidad HL7 FHIR y bajo requisitos estrictos de seguridad y soberanía del dato. Es una parte central del puesto, no un complemento.

4. Estándar técnico y equipo. Definir las prácticas de Ingeniería de la Unidad, documentar la Arquitectura y las Decisiones, y participar en la incorporación y el desarrollo del equipo conforme crece. Trabajarás en estrecha colaboración con Data analysts, Data scientists, Bioestadísticos y el Equipo Científico y Clínico para garantizar que los datos estén disponibles, validados, trazables y listos para los proyectos, y reportarás a la Dirección de la unidad.

Herramientas de Trabajo

- PostgreSQL on-premise (modelo propio de datos clínicos): tuning, particionado, RLS y replicación.
- Python para procesamiento, integración y automatización de datos.
- Apache Kafka / Confluent Platform: ingesta y procesamiento de eventos.
- Change Data Capture desde sistemas asistenciales (Debezium, Kafka Connect).
- Procesamiento distribuido de eventos: Kafka Streams, Apache Flink o ksqlDB.
- Gobierno de esquemas y contratos de datos: Schema Registry, Avro/Protobuf, versionado y compatibilidad.
- Interoperabilidad sanitaria: HL7 FHIR R4, HL7v2, CDA. Terminologías clínicas: SNOMED-CT, CIE-10, ATC, LOINC.
- Modelos comunes de datos: OMOP CDM y otros estándares europeos aplicables.
- Orquestación y transformación versionada: Airflow o Dagster, dbt.
- Kubernetes, Docker, CI/CD y despliegue on-premise y cloud híbrido.
- Pipelines de LLM y agentes sobre datos clínicos estructurados. No se espera un dominio absoluto de todo el listado, sino que las arquitecturas orientadas a eventos y la operación en producción sean terreno conocido, y criterio suficiente para decidir en el resto.

FUNCIONES DEL PUESTO

Arquitectura orientada a eventos

- Definir la arquitectura de la ingesta y el procesamiento de eventos: topología de clústeres, diseño de topics y particionado, garantías de entrega, idempotencia, retención, replicación y recuperación ante desastre.
- Implantar Change Data Capture y validación en tránsito sobre datos asistenciales.
- Diseñar la capa de interoperabilidad: transformación a recursos FHIR R4, perfiles e Implementation Guides, y su expresión como contratos de datos.
- Traducir requisitos clínicos y normativos en decisiones de arquitectura verificables: latencia, trazabilidad,



auditoría y calidad del dato en tránsito.
- Colaborar con los equipos clínicos en la traducción de reglas de validación y plausibilidad clínica a lógica ejecutable sobre los flujos de datos. Plataforma y modelo de datos
- Rediseñar y optimizar el modelo relacional sobre PostgreSQL: particionado, índices, RLS por estudio/usuario, tuning y replicación.
- Diseñar, administrar y optimizar bases de datos orientadas a datos clínicos y de vida real, garantizando calidad, integridad, trazabilidad y seguridad a lo largo de todo el flujo.
- Definir la arquitectura de datos que soporte el crecimiento de la compañía en fuentes, volumen y clientes. Integración de nuevas fuentes.
- Construir pipelines de extracción desde HCE/EHR, incluyendo datos estructurados y no estructurados, registros clínicos y datos administrativos.
- Incorporar nuevas fuentes al modelo común: análisis de origen, mapeo, resolución de identificadores de paciente y control de calidad de la carga.
- Implementar y mantener procesos ETL/ELT para la integración, transformación y carga de datos procedentes de múltiples orígenes.
- Curado y normalización a CDM (Common Data Model). Mapeo a terminologías clínicas: SNOMED-CT, CIE-10, ATC, LOINC. Seguridad, cumplimiento y soberanía del dato
- Diseñar y operar la plataforma bajo los requisitos de ENS categoría ALTA y de RGPD/LOPDGDD aplicado a datos de salud.
- Pseudonimización, anonimización y k-anonimato; gestión de identificadores de paciente; segregación por proyecto; auditoría de accesos y de consultas.
- Sostener despliegues on-premise o aislados de red cuando el marco de soberanía del dato lo exija. Reproducibilidad y calidad
- Versionado reproducible de cohortes (dbt o equivalente): snapshots fechados de criterios y resultados.
- Tests automatizados de calidad de datos y observabilidad de pipelines.
- Implementación y mantenimiento de Modelos Comunes de Datos (CDM) como OMOP u otros estándares europeos aplicables. Integración de IA
- Desarrollo y mantenimiento de servidores MCP para el acceso controlado a datos clínicos: autenticación, scoping por proyecto y auditoría de consultas.
- Pipelines de LLM para procesamiento y estructuración de la información clínica. Liderazgo técnico, DevOps y equipo
- Establecer los estándares de ingeniería de la unidad: revisión de código, decisiones de arquitectura documentadas (ADR), gestión de deuda técnica.
- Aplicar DevOps: Docker, Kubernetes, CI/CD, infraestructura como código y gestión de despliegues on-prem y cloud híbrido.
- Liderar o participar en las discusiones técnicas con equipos de IT internos y externos y con proveedores tecnológicos.
- Participar en la selección, incorporación y desarrollo del equipo de ingeniería de datos.
- Elaborar y mantener la documentación técnica de procesos, bases de datos y flujos de trabajo.

REQUISITOS

Formación: Grado en Ingeniería Informática, Ingeniería de Telecomunicaciones, Matemáticas o titulación afín. Se valora máster o estudios de posgrado en Big Data, Bases de Datos o Inteligencia Artificial.

Experiencia: Mínimo 10 años en ingeniería de datos o arquitectura de plataformas de datos,



de los cuales al menos 3–5 como referente técnico, lead o arquitecto/a.

- Haber liderado de principio a fin la construcción o modernización de una plataforma de datos crítica a escala regional, nacional o corporativa, con responsabilidad simultánea sobre arquitectura, implementación y operación en producción.
- Experiencia en entornos regulados o de sector público (sanidad, administración, banca, defensa, energía), con requisitos exigentes de seguridad, trazabilidad y soberanía del dato.
- Experiencia como interlocutor técnico ante proveedores tecnológicos y ante organismos públicos: comités de arquitectura, seguimiento de proyecto, especificaciones y pliegos.
- Haber liderado equipos técnicos (orientativamente entre 5 y 20 personas) sin dejar de estar hands-on.
- Experiencia con datos clínicos reales (HCE/EHR, registros, datos hospitalarios).

Se considerará también experiencia en dominios de complejidad y regulación equivalentes con voluntad clara de especialización en salud.

Conocimientos técnicos imprescindibles

- Apache Kafka / Confluent Platform en producción: diseño de topics y particionado, Kafka Connect, Schema Registry, semántica de entrega, replicación multi-clúster, seguridad (mTLS, RBAC, ACLs) y operación del día a día.

Se valorará muy positivamente certificación oficial Confluent (Kafka Developer y/o Kafka Administrator) o equivalente demostrable.

- Change Data Capture con Debezium o equivalente sobre orígenes relacionales.
- Procesamiento distribuido de eventos: Kafka Streams, Apache Flink o ksqlDB.
- PostgreSQL nivel avanzado: tuning, EXPLAIN, particionado, RLS y replicación.
- Python avanzado para procesamiento y automatización de datos, con soltura suficiente en el entorno JVM (Java/Scala) propio del ecosistema Kafka/Flink.
- Kubernetes y despliegue de sistemas distribuidos on-premise y en cloud híbrido; Docker, CI/CD, infraestructura como código.
- Observabilidad y operación de sistemas distribuidos: instrumentación, alertado, diagnóstico de incidentes en producción y análisis de rendimiento.
- Orquestación de pipelines (Airflow, Prefect o Dagster) y transformación versionada (dbt o herramienta equivalente).
- Interoperabilidad sanitaria y terminologías clínicas: HL7 FHIR R4 y SNOMED CT, CIE-10, ATC, LOINC. Se admite recorrido de aprendizaje si el resto del perfil es sólido.
- Control de versiones (Git), buenas prácticas de ingeniería de software y metodologías ágiles.
- Inglés nivel profesional (C1 o superior).

El trabajo con proveedores tecnológicos internacionales, con documentación y con soporte de producto se realiza en inglés.

SE OFRECE

- Responsabilidad técnica real. Decides la arquitectura, la documentas y la defiendes.
- Impacto real: los datos que vas a mover se usan para decidir sobre tratamientos y políticas de salud. No es un dashboard más.
- Problemas técnicos difíciles y reales: ingesta continua de datos asistenciales, interoperabilidad, soberanía del dato y calidad clínica. Poca gente en España trabaja en esta intersección.
- Un equipo en crecimiento: participas en la ampliación de la unidad, a quién se incorpora y cómo se trabaja.
- Presupuesto de formación y certificación oficial en las tecnologías del stack.
- Retribución acorde a un perfil de liderazgo técnico senior, a concretar en función de la experiencia aportada.
- Contrato fijo.
- Modalidad Híbrida - 3 días de oficina y 2 días de teletrabajo.

Sueldo: 50.000,00€-80.000,00€ al año

Ubicación del trabajo: Teletrabajo híbrido en Madrid, Madrid provincia

📌 Lead Data & Platform Engineer (España)
🏢 Farmatalento
📍 España

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: lead data & platform engineer (españa) / españa

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: lead data & platform engineer (españa) / españa