18 sep
|
Farmatalento
|
Madrid
18 sep
Farmatalento
Madrid
Buscamos un/a “Lead Data & Platform Engineer” para la Unidad de Health Data Platform and Innovation de una compañía española de Consultoría, Investigación e Innovación en salud, fundada en 2022 y en plena expansion.
¿Le gusta esta ocasión? Asegúrese de inscribirse rápido, ya que se espera un gran volumen de solicitudes. Desplácese hacia abajo para leer la descripción completa del puesto.
Responsabilidad técnica de la Plataforma de Datos: Arquitectura, Modelo de Datos, Integración de Fuentes, Ingesta Continua, Calidad, Rendimiento y Operación.
No es un puesto de mantenimiento ni de ejecución de decisiones ajenas: quien ocupa este puesto decide la arquitectura, la documenta y la sostiene.
El puesto tiene cuatro áreas principales:
1. Consolidar y escalar la Plataforma Clínica. Rediseñar el Modelo de Datos, el Rendimiento y la Trazabilidad para que soporte el crecimiento en volumen, en fuentes y en número de proyectos simultáneos.
2. Integrar nuevas Fuentes de Datos Sanitarios. Incorporar nuevos Orígenes Clínicos, Hospitalarios y Administrativos al modelo común, resolviendo la Heterogeneidad de Formatos, Terminologías e Identificadores que caracteriza al sector.
3. Arquitectura orientada a Eventos e Interoperabilidad. Diseñar y operar la Ingesta Continua y el Procesamiento de Datos Asistenciales sobre Arquitecturas orientadas a Eventos, con Interoperabilidad HL7 FHIR y bajo requisitos estrictos de seguridad y soberanía del dato. Es una parte central del puesto, no un complemento.
4. Estándar técnico y equipo. Definir las prácticas de Ingeniería de la Unidad, documentar la Arquitectura y las Decisiones, y participar en la incorporación y el desarrollo del equipo conforme crece. Trabajarás en estrecha colaboración con Data analysts, Data scientists, Bioestadísticos y el Equipo Científico y Clínico para garantizar que los datos estén disponibles, validados, trazables y listos para los proyectos, y reportarás a la Dirección de la unidad.
Herramientas de Trabajo
-
- PostgreSQL on-premise (modelo propio de datos clínicos): tuning, particionado, RLS y replicación.
- Python para procesamiento, integración y automatización de datos.
- Apache Kafka / Confluent Platform: ingesta y procesamiento de eventos.
- Change Data Capture desde sistemas asistenciales (Debezium,
Kafka Connect).
- Procesamiento distribuido de eventos: Kafka Streams, Apache Flink o ksqlDB.
- Gobierno de esquemas y contratos de datos: Schema Registry, Avro/Protobuf, versionado y compatibilidad.
- Interoperabilidad sanitaria: HL7 FHIR R4, HL7v2, CDA. Terminologías clínicas: SNOMED-CT, CIE-10, ATC, LOINC.
- Modelos comunes de datos: OMOP CDM y otros estándares europeos aplicables.
- Orquestación y transformación versionada: Airflow o Dagster, dbt.
- Pipelines de LLM y agentes sobre datos clínicos estructurados. No se espera un dominio absoluto de todo el listado, sino que las arquitecturas orientadas a eventos y la operación en producción sean terreno conocido, y criterio suficiente para decidir en el resto.
- Definir la arquitectura de la ingesta y el procesamiento de eventos: topología de clústeres, diseño de topics y particionado, garantías de entrega, idempotencia, retención, replicación y recuperación ante desastre.
- Implantar Change Data Capture y validación en tránsito sobre datos asistenciales.
- Diseñar la capa de interoperabilidad: transformación a recursos FHIR R4, perfiles e Implementation Guides, y su expresión como contratos de datos.
- Traducir requisitos clínicos y normativos en decisiones de arquitectura verificables: latencia, trazabilidad, auditoría y calidad del dato en tránsito.
- Colaborar con los equipos clínicos en la traducción de reglas de validación y plausibilidad clínica a lógica ejecutable sobre los flujos de datos. Plataforma y modelo de datos
- Rediseñar y optimizar el modelo relacional sobre PostgreSQL: particionado, índices, RLS por estudio/usuario, tuning y replicación.
- Diseñar, administrar y optimizar bases de datos orientadas a datos clínicos y de vida real, garantizando calidad, integridad, trazabilidad y seguridad a lo largo de todo el flujo.
- Definir la arquitectura de datos que soporte el crecimiento de la compañía en fuentes, volumen y clientes. Integración de nuevas fuentes.
- Construir pipelines de extracción desde HCE/EHR, incluyendo datos estructurados y no estructurados, registros clínicos y datos administrativos.
- Incorporar nuevas fuentes al modelo común: análisis de origen, mapeo, resolución de identificadores de paciente y control de calidad de la carga.
- Implementar y mantener procesos ETL/ELT para la integración, transformación y carga de datos procedentes de múltiples orígenes.
- Curado y normalización a CDM (Common Data Model). Mapeo a terminologías clínicas: SNOMED-CT, CIE-10, ATC, LOINC. Seguridad, cumplimiento y soberanía del dato
- Diseñar y operar la plataforma bajo los requisitos de ENS categoría ALTA y de RGPD/LOPDGDD aplicado a datos de salud.
- Pseudonimización, anonimización y k-anonimato; gestión de identificadores de paciente; segregación por proyecto; auditoría de accesos y de consultas.
- Sostener despliegues on-premise o aislados de red cuando el marco de soberanía del dato lo exija. Reproducibilidad y calidad
- Versionado reproducible de cohortes (dbt o equivalente): snapshots fechados de criterios y resultados.
- Tests automatizados de calidad de datos y observabilidad de pipelines.
- Implementación y mantenimiento de Modelos Comunes de Datos (CDM) como OMOP u otros estándares europeos aplicables. Integración de IA
- Desarrollo y mantenimiento de servidores MCP para el acceso controlado a datos clínicos: autenticación, scoping por proyecto y auditoría de consultas.
- Pipelines de LLM para procesamiento y estructuración de la información clínica. Liderazgo técnico, DevOps y equipo
- Establecer los estándares de ingeniería de la unidad: revisión de código, decisiones de arquitectura documentadas (ADR), gestión de deuda técnica.
- Aplicar DevOps: Docker, Kubernetes, CI/CD, infraestructura como código y gestión de despliegues on-prem y cloud híbrido.
- Liderar o participar en las discusiones técnicas con equipos de IT internos y externos y con proveedores tecnológicos. xqbhyrx
- Participar en la selección, incorporación y desarrollo del equipo de ingeniería de datos.
- Elaborar y mantener la
#J-18808-Ljbffr
📌 Lead Data & Platform Engineer (Madrid)
🏢 Farmatalento
📍 Madrid