13 ago
|
Jobtailor
|
Madrid
Diseñar e implementar automatizaciones AIOps para tareas recurrentes de operación (triage, enriquecimiento de tickets, auto-remediación con "human-in-the-loop" cuando aplique). Integrar señales operativas (alertas, métricas, logs y trazas) con cadena operativa: (Observabilidad, ITSM, on-call, runbook). Construir y mantener dashboards y alertas que aporten valor real (calidad de señal, reducción de ruido, umbrales, tagging). Estandarizar runbooks y el empleo de código en la operación, con playbooks, plantillas, políticas y automatizaciones reutilizables. Colaborar con equipos de plataforma y aplicaciones para mejorar resiliencia, rendimiento y seguridad (RCA, tuning de alertas, hardening operativo). Documentar arquitectura, estándares y runbooks, pensando en la escalabilidad del modelo y la autonomía de los equipos de desarrollo. Actuar como soporte experto para incidencias complejas (cuando sea necesario), ayudando a que L1/L2 resuelvan más casos de manera autónoma. Requirements
Experiencia sólida en operación + automatización. Titulación universitaria en Ingeniería Informática, Sistemas de Información o similar. Experiencia práctica con al menos 1 Cloud: AWS o Azure o GCP (operación, troubleshooting, servicios base). Muy valorable certificación como AWS Architect Associate/Professional, AZ-104/305, Terraform Associate y/o de Observabilidad (Dynatrace, Datadog, Grafana o Zabbix). Automatización y scripting: Python o Bash/Powershell (capacidad para mantener scripts y servicios). Infrastructure as Code (IaC), una de las siguientes: Terraform/CloudFormation/Bicep. Observabilidad (al menos una familia): Dynatrace,
Datadog, Grafana + Prometheus. Conocimiento operativo ITSM (valorable ServiceNow). Lifecycle del incidente/problema/change, priorización y comunicación. Valorable contar con conocimientos en OpenTelemetry, experiencia con automatización de runbooks (SSM Automation), LLM, RAG. Buenas habilidades de comunicación, documentación y trabajo en equipo. Nivel conversacional de inglés, para tratar con vendors y documentación. Core Competencies
Demonstrates expertise in AIOps automation, cloud operations, and observability tools, with a strong focus on incident lifecycle management and effective communication. Capable of designing scalable solutions and collaborating with cross-functional teams to enhance operational resilience and performance. Highest-signal resume keywords
AIOps Automation Cloud Operations (AWS, Azure, GCP) Infrastructure as Code (Terraform, CloudFormation, Bicep) Observability Tools (Dynatrace, Datadog, Grafana) Incident Management (ITSM) ATS Optimization Keywords
Hard Skills
Automation and Scripting (Python, Bash, Powershell) Incident Lifecycle Management Runbook Automation Operational Tuning Documentation Standards Soft Skills
Communication Skills Team Collaboration Certifications & Qualifications
AWS Architect Associate/Professional AZ-104/305 Terraform Associate Observability Certification (Dynatrace, Datadog, Grafana, Zabbix) Industry Keywords
AIOps Operational Resilience Incident Management Change Management Runbook Standardization Tools & Technologies
ITSM (ServiceNow) OpenTelemetry Prometheus SSM Automation
#J-18808-Ljbffr
📌 AIOps Engineer (Madrid)
🏢 Jobtailor
📍 Madrid