04 ago
|
Capitole
|
España
ppBuscamos un/a Data Engineer Senior para diseñar y operar la plataforma de datos que alimenta un sistema de pricing ágil e inteligencia de negocio en entornos retail de alto volumen. La persona seleccionada será el referente técnico de la arquitectura de datos: desde la ingesta de fuentes operacionales (ERP, POS, e-commerce, footfall) hasta la exposición de datos listos para consumo por modelos de ML y herramientas de BI. /p pEl rol requiere dominio profundo de Databricks como plataforma central y sólido conocimiento de la arquitectura Medallion (Bronze / Silver / Gold), así como experiencia en modelado de datos dimensional y capacidad para trabajar con Azure Data Factory como orquestador de pipelines — aunque la mayor parte del trabajo de transformación residirá en Databricks. /p h32. Responsabilidades principales /h3 h3Arquitectura y plataforma de datos /h3 ul liDiseño y evolución de la arquitectura Medallion (Bronze Silver Gold) sobre Databricks / Delta Lake. /li liDefinición de estándares de ingesta, particionado, compactación y versionado de tablas Delta. /li liGobierno de la plataforma: Unity Catalog, gestión de permisos, linaje de datos y calidad (Great Expectations o similar). /li liEvaluación y decisión de patrones de procesamiento: batch, micro-batch (Structured Streaming) y near real-time según el caso de uso. /li /ul h3Modelado de datos /h3 ul liDiseño de modelos dimensionales (esquemas estrella y copo de nieve) orientados a casos de uso de pricing, forecasting y personalización. /li liDefinición de tablas de hechos y dimensiones: transacciones POS, catálogo de productos, maestro de tiendas, calendario promocional. /li liColaboración con el equipo de ML para diseñar y mantener el feature store sobre la capa Gold.
/li liDocumentación del modelo de datos en un catálogo semántico accesible para usuarios de negocio y analítica. /li liConstrucción de pipelines de ingesta desde fuentes heterogéneas: ERP (SAP u otros), POS, APIs de e-commerce, feeds de Retail Media, NPS. /li liUso de Azure Data Factory para orquestación de movimientos de datos entre sistemas origen y el lakehouse con preferencia por mantener la lógica de transformación en Databricks (PySpark / SQL). /li liImplementación de patrones de ingesta incremental (CDC, watermark, upsert con Delta Merge) para minimizar latencia y coste. /li liTesting de pipelines: validaciones de schema, checks de completitud y pruebas de regresión sobre datos. /li /ul h3Operación y fiabilidad /h3 ul liMonitorización de jobs en Databricks Workflows: alertas, reintentos y gestión de dependencias. /li liOptimización de costes de cómputo: sizing de clusters, uso de Photon, Auto Loader y optimizaciones de Delta (OPTIMIZE / ZORDER). /li liSoporte a incidencias de datos en producción (on-call rotatorio con el equipo). /li liTrabajo estrecho con Data Scientists para garantizar que el feature store cubra los requisitos de los modelos de pricing y recomendación. /li liAcompañamiento a analistas de negocio en la definición de métricas y KPIs sobre la capa Gold. /li liParticipación en code reviews,
definición de convenciones de nombrado y estándares de calidad del equipo. /li li5+ años de experiencia en ingeniería de datos en entornos productivos. /li liDatabricks: experiencia sólida con Databricks como plataforma principal; Delta Lake, Databricks Workflows, Unity Catalog. /li liArquitectura Medallion: diseño e implementación de capas Bronze / Silver / Gold con criterios claros de granularidad, particionado y SLA por capa. /li liModelado de datos: dominio de modelado dimensional (Kimball); diseño de esquemas estrella y copo de nieve; definición de claves surrogadas, SCDs y tablas de hechos. /li liLenguajes: PySpark y SQL avanzado (window functions, CTEs, optimización de queries). /li liAzure Data Factory: conocimiento funcional para orquestación y movimiento de datos; no es necesario dominio profundo. /li liExperiencia con patrones de ingesta incremental: CDC, watermark, Delta Merge / upsert. /li liFamiliaridad con control de versiones (Git) y prácticas de DataOps básicas. /li /ul h3Valorables /h3 ul liExperiencia en retail, travel retail o sectores con datos transaccionales de alto volumen. /li liConocimiento de herramientas de calidad de datos: Great Expectations, Soda o similar. /li liExperiencia con dbt (data build tool) para transformaciones SQL sobre la capa Silver/Gold. /li liFamiliaridad con eventos en streaming: Kafka, Event Hubs o Databricks Structured Streaming. /li liConocimiento de herramientas de catálogo y linaje: Purview, Alation o Unity Catalog avanzado. /li liExperiencia colaborando con equipos de ML en el diseño de feature stores (Feast, Tecton o solución custom). /li /ul /p #J-18808-Ljbffr
📌 Data Engineer (Databricks) (España)
🏢 Capitole
📍 España