Lead Data & Platform Engineer (Madrid)

Lead Data & Platform Engineer (Madrid)

17 sep
|
Farmatalento
|
Madrid

17 sep

Farmatalento

Madrid

Buscamos un/a

“Lead Data & Platform Engineer”

para la Unidad de Health Data Platform and Innovation de una compañía española de Consultoría, Investigación e Innovación en salud, fundada en 2022 y en plena expansion.

Responsabilidad técnica de la Plataforma de Datos: Arquitectura, Modelo de Datos, Integración de Fuentes, Ingesta Continua, Calidad, Rendimiento y Operación.

No es un puesto de mantenimiento ni de ejecución de decisiones ajenas: quien ocupa este puesto decide la arquitectura, la documenta y la sostiene.

El puesto tiene cuatro áreas principales:

1. Consolidar y escalar la Plataforma Clínica. Rediseñar el Modelo de Datos, el Rendimiento y la Trazabilidad para que soporte el crecimiento en volumen, en fuentes y en número de proyectos simultáneos.

2. Integrar nuevas Fuentes de Datos Sanitarios. Incorporar nuevos Orígenes Clínicos, Hospitalarios y Administrativos al modelo común, resolviendo la Heterogeneidad de Formatos, Terminologías e Identificadores que caracteriza al sector.

3. Arquitectura orientada a Eventos e Interoperabilidad. Diseñar y operar la Ingesta Continua y el Procesamiento de Datos Asistenciales sobre Arquitecturas orientadas a Eventos, con Interoperabilidad HL7 FHIR y bajo requisitos estrictos de seguridad y soberanía del dato. Es una parte central del puesto, no un complemento.

4. Estándar técnico y equipo. Definir las prácticas de Ingeniería de la Unidad, documentar la Arquitectura y las Decisiones, y participar en la incorporación y el desarrollo del equipo conforme crece. Trabajarás en estrecha colaboración con Data analysts, Data scientists, Bioestadísticos y el Equipo Científico y Clínico para garantizar que los datos estén disponibles, validados, trazables y listos para los proyectos, y reportarás a la Dirección de la unidad.

Herramientas de Trabajo

PostgreSQL on-premise (modelo propio de datos clínicos): tuning, particionado, RLS y replicación.

Python para procesamiento, integración y automatización de datos.

Apache Kafka / Confluent Platform: ingesta y procesamiento de eventos.

Change Data Capture desde sistemas asistenciales (Debezium, Kafka Connect).

Procesamiento distribuido de eventos: Kafka Streams, Apache Flink o ksqlDB.





Gobierno de esquemas y contratos de datos: Schema Registry, Avro/Protobuf, versionado y compatibilidad.

Interoperabilidad sanitaria: HL7 FHIR R4, HL7v2, CDA. Terminologías clínicas: SNOMED-CT, CIE-10, ATC, LOINC.

Modelos comunes de datos: OMOP CDM y otros estándares europeos aplicables.

Orquestación y transformación versionada: Airflow o Dagster, dbt.

Pipelines de LLM y agentes sobre datos clínicos estructurados. No se espera un dominio absoluto de todo el listado, sino que las arquitecturas orientadas a eventos y la operación en producción sean terreno conocido, y criterio suficiente para decidir en el resto.

Definir la arquitectura de la ingesta y el procesamiento de eventos: topología de clústeres, diseño de topics y particionado, garantías de entrega, idempotencia, retención, replicación y recuperación ante desastre.

Implantar Change Data Capture y validación en tránsito sobre datos asistenciales.

Diseñar la capa de interoperabilidad: transformación a recursos FHIR R4, perfiles e Implementation Guides, y su expresión como contratos de datos.

Traducir requisitos clínicos y normativos en decisiones de arquitectura verificables: latencia, trazabilidad, auditoría y calidad del dato en tránsito.

Colaborar con los equipos clínicos en la traducción de reglas de validación y plausibilidad clínica a lógica ejecutable sobre los flujos de datos. Plataforma y modelo de datos

Rediseñar y optimizar el modelo relacional sobre PostgreSQL: particionado, índices, RLS por estudio/usuario, tuning y replicación.

Diseñar, administrar y optimizar bases de datos orientadas a datos clínicos y de vida real, garantizando calidad, integridad, trazabilidad y seguridad a lo largo de todo el flujo.

Definir la arquitectura de datos que soporte el crecimiento de la compañía en fuentes, volumen y clientes.



Integración de nuevas fuentes.

Construir pipelines de extracción desde HCE/EHR, incluyendo datos estructurados y no estructurados, registros clínicos y datos administrativos.

Incorporar nuevas fuentes al modelo común: análisis de origen, mapeo, resolución de identificadores de paciente y control de calidad de la carga.

Implementar y mantener procesos ETL/ELT para la integración, transformación y carga de datos procedentes de múltiples orígenes.

Curado y normalización a CDM (Common Data Model). Mapeo a terminologías clínicas: SNOMED-CT, CIE-10, ATC, LOINC. Seguridad, cumplimiento y soberanía del dato

Diseñar y operar la plataforma bajo los requisitos de ENS categoría ALTA y de RGPD/LOPDGDD aplicado a datos de salud.

Pseudonimización, anonimización y k-anonimato; gestión de identificadores de paciente; segregación por proyecto; auditoría de accesos y de consultas.

Sostener despliegues on-premise o aislados de red cuando el marco de soberanía del dato lo exija. Reproducibilidad y calidad

Versionado reproducible de cohortes (dbt o equivalente): snapshots fechados de criterios y resultados.

Tests automatizados de calidad de datos y observabilidad de pipelines.

Implementación y mantenimiento de Modelos Comunes de Datos (CDM) como OMOP u otros estándares europeos aplicables. Integración de IA

Desarrollo y mantenimiento de servidores MCP para el acceso controlado a datos clínicos: autenticación, scoping por proyecto y auditoría de consultas.

Pipelines de LLM para procesamiento y estructuración de la información clínica. Liderazgo técnico, DevOps y equipo

Establecer los estándares de ingeniería de la unidad: revisión de código, decisiones de arquitectura documentadas (ADR), gestión de deuda técnica.

Aplicar DevOps: Docker, Kubernetes, CI/CD, infraestructura como código y gestión de despliegues on-prem y cloud híbrido.

Liderar o participar en las discusiones técnicas con equipos de IT internos y externos y con proveedores tecnológicos.

Participar en la selección, incorporación y desarrollo del equipo de ingeniería de datos.

Elaborar y mantener la

#J-18808-Ljbffr

📌 Lead Data & Platform Engineer (Madrid)
🏢 Farmatalento
📍 Madrid

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: lead data & platform engineer (madrid) / madrid

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: lead data & platform engineer (madrid) / madrid