Mecalux Software Solutions es la compañía tecnológica del Grupo Mecalux, con sede en el Centro Tecnológico de Gijón y delegaciones en Badajoz y Salamanca.
Desarrollamos producto y plataforma software propios para la optimización de cadenas de suministro. No trabajamos por proyectos: evolucionamos una plataforma SaaS y on-premise de gran escala, con SLAs reales, alta disponibilidad, resiliencia y observabilidad.
Construimos y operamos una plataforma cloud y on-premise crítica (24x7) que gestiona procesos esenciales del negocio de nuestros clientes, con foco en Cloud/SRE, ciberseguridad, data/IA y producto.
Nuestra Plataforma Easy (Easy WMS) optimiza la gestión física y documental del flujo de productos, garantizando trazabilidad y eficiencia operativa en entornos complejos.
Contamos con un área de I+D y un área de Operaciones, donde trabajamos con stack y prácticas modernas (CI/CD, IaC, metodologías ágiles, SecOps) y con impacto directo en negocio.
Buscamos talento que quiera crecer en un entorno tecnológico exigente, crítico y en continua evolución. Puedes ver nuestro trabajo en el siguiente enlace:
Robots móviles autónomos (AMR) - Mecalux.es
? Ingeniero/a de Plataforma de IA e Infraestructura GPU
Construye la plataforma que hará posible la próxima generación de IA
¿Te interesa trabajar con GPU NVIDIA de última generación, Kubernetes, entrenamiento distribuido, MLOps y plataformas de IA a gran escala?
Buscamos un/a Ingeniero/a de Plataforma de IA e Infraestructura GPU para diseñar, construir y operar una plataforma de IA completa, desde la infraestructura GPU hasta la puesta en producción de modelos y servicios.
No buscamos simplemente a alguien que administre servidores o clústeres.
Buscamos a una persona que quiera construir la plataforma sobre la que otros equipos desarrollarán y desplegarán IA.
El reto combina infraestructura, plataforma, automatización, rendimiento, alta disponibilidad y MLOps, con un fuerte foco en convertir una infraestructura compleja en servicios sencillos y reutilizables para los equipos de desarrollo.
? El reto La posición tiene dos grandes ejes, con especial foco en el primero:
1. Plataforma para entrenamiento de IA — prioridad principal
Diseñar y evolucionar la infraestructura que permita ejecutar cargas de entrenamiento distribuidas de forma eficiente, escalable y reproducible, aprovechando al máximo los recursos GPU disponibles.
2. Operación de la plataforma — alta disponibilidad y alto rendimiento
Garantizar que la plataforma sea robusta, observable, segura y eficiente, preparada para cargas críticas de entrenamiento e inferencia.
Trabajarás con GPU NVIDIA H200 y participarás en la evolución de la plataforma hacia nuevas generaciones de infraestructura, incluyendo B300.
? ¿Qué vas a construir?
Tu trabajo abarcará toda la cadena de la plataforma de IA:
- Diseñar, desplegar y operar la plataforma sobre Kubernetes, incluyendo scheduler, NVIDIA GPU Operator y mecanismos avanzados de asignación de recursos.
- Gestionar y optimizar los nodos NVIDIA H200 y participar en el diseño e incorporación de nuevas generaciones de GPU, como B300.
- Configurar y evolucionar el uso de MIG, GPU completas y estrategias de asignación de recursos según las necesidades de cada workload.
- Optimizar red, almacenamiento y comunicaciones para cargas distribuidas de entrenamiento e inferencia.
- Gestionar drivers NVIDIA, CUDA, NCCL, imágenes base y matrices de compatibilidad, garantizando entornos reproducibles y soportados.
- Diseñar y operar container registries y model registries.
- Implantar y evolucionar MLflow y las capacidades de observabilidad, evaluación, auditoría y trazabilidad de modelos y experimentos.
- Diseñar y operar model gateways y API gateways para exponer modelos y servicios de inferencia de forma segura y controlada.
- Implementar mecanismos de IAM, RBAC, gestión de secretos, segregación de entornos y aislamiento multi-tenant.
- Diseñar estrategias de backup, disaster recovery y continuidad de servicio.
- Realizar capacity planning y desarrollar prácticas de GPU FinOps, midiendo utilización, eficiencia, costes y demanda futura.
- Construir componentes, plantillas y servicios reutilizables que permitan a los squads consumir la plataforma sin tener que gestionar su complejidad interna.
- Automatizar el ciclo de vida de la plataforma mediante Infrastructure as Code, CI/CD y GitOps.
- Operar la plataforma en entornos on-premise, cloud e híbridos.
- Definir estándares, arquitectura, procedimientos y buenas prácticas que permitan hacer crecer la plataforma de forma sostenible.
?️ Stack tecnológico
Buscamos experiencia práctica en varias de estas áreas:
Compute & AI Infrastructure
- NVIDIA H200 / experiencia con GPUs de datacenter.
- GPU Operator.
- MIG.
- CUDA.
- NCCL.
- Entrenamiento e inferencia distribuida.
Platform Engineering
- Kubernetes en producción.
- Alta disponibilidad.
- Scheduling y gestión avanzada de recursos.
- Helm.
- GitOps.
- Terraform.
- Ansible.
MLOps
- MLflow.
- Model registries.
- Container registries.
- Evaluación y trazabilidad de modelos.
- Observabilidad de workloads de IA.
Infrastructure
- Docker y construcción de imágenes.
- Redes de alto rendimiento.
- Almacenamiento compartido/distribuido.
- Automatización de infraestructura.
- Entornos on-premise, cloud e híbridos.
Security & Operations
- IAM / RBAC.
- Secret management.
- Multi-tenancy y aislamiento.
- Métricas, logs, trazas y alertas.
- Backup y disaster recovery.
- Capacity planning.
- GPU FinOps.
No es necesario dominar todas estas tecnologías. Valoramos especialmente la experiencia real en producción y la capacidad para entender y conectar las distintas capas de la plataforma.
? ¿Qué perfil buscamos?
Una persona con mentalidad de Platform Engineer, capaz de moverse entre arquitectura, automatización y operación.
Alguien que
- Disfrute resolviendo problemas complejos de infraestructura.
- Entienda que una plataforma no termina cuando se despliega: hay que operarla, medirla y mejorarla continuamente.
- Tenga una fuerte orientación a la automatización.
- Sea capaz de tomar decisiones técnicas y establecer estándares.
- Piense en los equipos de desarrollo como usuarios de la plataforma.
- Busque eliminar complejidad y trabajo manual mediante servicios y componentes reutilizables.
- Tenga autonomía y responsabilidad sobre entornos tecnológicos críticos.
- Sepa documentar, comunicar decisiones y transferir conocimiento.
? ¿Por qué puede ser un proyecto interesante?
Porque tendrás la oportunidad de trabajar en una plataforma donde confluyen algunas de las áreas más exigentes de la ingeniería actual:
GPU + Kubernetes + IA + entrenamiento distribuido + MLOps + automatización + alta disponibilidad.
No serás únicamente responsable de mantener infraestructura existente.
Participarás en el diseño de la plataforma, en sus decisiones de arquitectura y en su evolución.
Si te motiva construir infraestructura de IA de alto rendimiento y convertirla en una plataforma que otros equipos puedan utilizar de forma sencilla, este proyecto puede ser para ti.
¿Te interesa?
- Queremos hablar contigo si tienes experiencia construyendo y operando plataformas de infraestructura, Kubernetes, GPU computing o MLOps y quieres dar el siguiente paso hacia AI Platform Engineering.
Te brindamos la oportunidad de impulsar tu carrera en el vibrante sector de la logística, uno de los más prometedores en la actualidad. Si buscas crecer profesionalmente en un contexto de constante evolución, ¡nos encantaría contar contigo en nuestro equipo!
En Mecalux tenemos un compromiso con la igualdad de género. Por ello, nuestra voluntad es promover activamente la participación de mujeres y hombres en nuestros procesos de selección y así mismo, garantizar que éstos sean justos y objetivos sin distinción de sexo, orientación, identidad, colectivo, expresión de género o cualquier otra característica protegida por ley.
📌 Ingeniero/a de Plataforma IA + Infraestructura GPU (Gijón)
🏢 Mecalux
📍 Gijón