En Aubay estamos buscando un/a Data engineer para participar en el soporte, mantenimiento, y evolución técnica de una plataforma DataHub.
Entre sus principales responsabilidades estarán:
Dar soporte a producción y realizar el mantenimiento del DataHub, resolviendo incidencias, anomalías y problemas relacionados con los datos, garantizando la estabilidad y disponibilidad de los procesos.
Modificar y optimizar el código existente según las necesidades de negocio, buscando mejorar su rendimiento y mantenibilidad.
Garantizar el rendimiento y la seguridad de la infraestructura de datos siguiendo buenas prácticas de Data Engineering.
Realizar modelado de datos y desarrollar pipelines eficientes y escalables para la ingesta, transformación y enriquecimiento de grandes volúmenes de datos con reglas de negocio complejas.
Diseñar e implementar pipelines de procesamiento utilizando principalmente Scala, Spark, Hadoop y almacenamiento de objetos cloud (COS/S3).
Integrar datos procedentes de múltiples fuentes y formatos en la capa Raw del DataHub.
Implementar procesos de transformación y controles de calidad que garanticen la consistencia y precisión de los datos.
Configurar pipelines de CI/CD para automatizar despliegues, testing y gestión del desarrollo.
Desarrollar y ejecutar pruebas unitarias y de validación para garantizar la calidad e integridad del código.
Implementar procesos de orquestación y scheduling mediante Apache Airflow para automatizar la ejecución de pipelines.
Participar en la migración de la infraestructura Hadoop hacia una arquitectura cloud basada en Kubernetes, almacenamiento de objetos (COS), Spark as a Service y Airflow as a Service.
Elaborar documentación técnica y operativa para garantizar la transferencia y conservación del conocimiento.
Requisitos
Requisitos técnicos obligatorios
Experiencia con Scala y Spark
SQL y bases de datos estructuradas
Hadoop y HDFS
Apache Airflow
Oozie
Almacenamiento de objetos S3/COS
Shell scripting
Herramientas CI/CD: GitLab, Jenkins o similares
Experiencia desarrollando y optimizando pipelines de datos
Procesos de transformación, enriquecimiento y calidad de datos
Integración de datos procedentes de distintas fuentes y formatos
Testing unitario y de validación
Conocimiento del ciclo de vida de desarrollo de software (SDLC)
Experiencia trabajando bajo metodologías Agile
Requisitos deseables
Kubernetes y containerización
Dremio
Elasticsearch y Kibana
Kafka y/o procesamiento de datos en streaming
HashiCorp Vault
Dataiku
Experiencia en migraciones de Hadoop hacia arquitecturas cloud