05 sep
|
Deutsche Telekom
|
Madrid
05 sep
Deutsche Telekom
Madrid
Deine Aufgabe
Diese Rolle konzentriert sich auf den Aufbau und Betrieb von Kubernetes-Umgebungen, die AI-Engineering-Tools, interne Model-Gateways, Retrieval-Komponenten, Workflow-Services, CI/CD-Runner und Dokumentationsservices hosten. Du implementierst GitOps- und Infrastructure-as-Code-Muster für reproduzierbare Bereitstellung, Konfiguration, Policy-Durchsetzung, Plattform-Upgrades und Disaster-Recovery-Bereitschaft. Hauptaufgaben
Aufbau und Betrieb von Kubernetes-Umgebungen, die AI-Engineering-Tools, interne Model-Gateways, Retrieval-Komponenten, Workflow-Services, CI/CD-Runner und Dokumentationsservices hosten Implementierung von GitOps- und Infrastructure-as-Code-Mustern für reproduzierbare Bereitstellung, Konfiguration, Policy-Durchsetzung, Plattform-Upgrades und Disaster-Recovery-Bereitschaft Verwaltung von privaten Registries, Package-Mirrors, Secrets, Identity-Integration, Netzwerksegmentierung, Storage-Classes, Backup-Routinen und kontrollierten Konnektivitätsmodellen Bereitstellung von Observability für Engineering-Workloads, einschließlich Metriken, Logs, Traces, GPU- und CPU-Auslastung, Service-Health, Kostensignalen und operativen Runbooks Zusammenarbeit mit Software-, Security- und Architektur-Teams, um sicherzustellen, dass die Plattform AI-gestützte SDLC-Workflows unterstützt, ohne unkontrollierte Datenexposition oder Audit-Lücken zu schaffen Plattformkomponenten und Tools
Du arbeitest mit
Plattform-Tooling
wie Kubernetes, Helm, Terraform, Ansible, ArgoCD, Crossplane, GitLab-Runnern, Jenkins-Agents, privaten Registries und internen Package-Mirrors. Du verwaltest
AI-Plattformkomponenten
wie vLLM, Ollama, OpenAI-kompatible Gateways, Qdrant oder ähnliche Vector-Stores, Open WebUI, Continue-kompatible Endpoints und Workflow-Services. Du nutzt
Observability- und Operations-Stacks
wie Prometheus, Grafana, Loki, OpenTelemetry, ELK/OpenSearch, Alertmanager, SRE-Runbooks und Incident-Management-Tooling. Du implementierst
Security- und Governance-Komponenten
wie Vault, Keycloak, Network-Policies, RBAC, Admission-Controls, Image-Scanning, SBOM-Tooling und Audit-Logging. Du pflegst
Infrastruktur-Awareness
in Bezug auf GPU-gestützte Nodes, CPU-only-Fallback, Storage-Performance, Netzwerkisolation, Proxy-Muster, On-Premise-Umgebungen und dedizierte Landing-Zones. Profil
Wir suchen einen hochqualifizierten
Platform Engineer
mit umfangreicher Erfahrung in Kubernetes, Infrastruktur-Automatisierung und AI-Plattform-Betrieb. Der ideale Kandidat verfügt über tiefgreifende Expertise im Aufbau von produktionsreifen Engineering-Plattformen mit starkem Fokus auf Sicherheit, Observability und operativer Exzellenz in hochsicheren, souveränitätsorientierten Umgebungen. Muss-Kriterien
Mindestens 5 Jahre Erfahrung in SRE-, Platform-Engineering-, DevOps-, Cloud-Infrastruktur- oder Operations-Rollen Ausgeprägte Kubernetes-Expertise Ausgeprägte Linux-Expertise Nachgewiesene Erfahrung im Aufbau und Betrieb von produktionsreifen Engineering-Plattformen Erfahrung mit GitOps-Praktiken und -Mustern Erfahrung mit Infrastructure as Code Erfahrung in der Implementierung von Observability-Lösungen Erfahrung in der Erstellung und Pflege von operativen Runbooks Praktische Kenntnisse in Terraform Praktische Kenntnisse in Ansible Praktische Kenntnisse in Helm Praktische Kenntnisse in Python oder Shell-Scripting Erfahrung mit CI/CD-Runnern Erfahrung mit privaten Registries Erfahrung mit sicherem Konfigurationsmanagement Gutes Verständnis von Netzwerkkonzepten und deren Implementierung Gutes Verständnis von Speichersystemen und deren Verwaltung Gutes Verständnis von Secrets Management Gutes Verständnis von Zugriffskontrollmechanismen Gutes Verständnis von Monitoring und Observability Gutes Verständnis von Backup und Disaster Recovery Gutes Verständnis von operativem Hardening in hochsicheren Umgebungen Sicherer Umgang mit der Unterstützung von AI-gestützten Engineering-Workloads in souveränitätsorientierten Kontexten Erfahrung mit Isolations- und kontrollierten Datenverarbeitungsanforderungen Erfahrung in der Sicherstellung von Zuverlässigkeit und Nachvollziehbarkeit in sicheren Umgebungen Über uns
T‑Systems
ist Teil der Deutschen Telekom Gruppe mit rund 30.000 Mitarbeitern weltweit. Wir schaffen Technologie mit Sinn, um einen positiven Einfluss auf die Gesellschaft zu erzeugen. Wir suchen neugierige Talente, die lernbegierig sind, Herausforderungen annehmen und Ideen einbringen, die die Erfahrung unserer Kunden transformieren. Wir vertrauen Menschen: Wir bieten dir Autonomie, kontinuierliche Unterstützung und ein kollaboratives Umfeld, in dem du ohne Grenzen wachsen kannst. Wir sind ein globales Team, geleitet von Respekt, Integrität und der Leidenschaft, jeden Tag besser zu werden. Leistungen
Flexibler Vergütungsplan (Krankenversicherung, Essensgutscheine, Kinderbetreuung, Transport) Telemedizin Lebens- und Unfallversicherung Sozialfonds 26+ Arbeitstage Urlaub pro Jahr Kostenloser Zugang zu Fachdiensten (medizinisch, rechtlich, Wellness) 100% Gehaltsfortzahlung während Krankheitsurlaub Unternehmensrichtlinien
T-Systems Iberia verarbeitet nur die Lebensläufe von Kandidaten, die die für jedes Angebot angegebenen Anforderungen erfüllen Weitere Details
Arbeitsumfeld & Flexibilität
Internationales, dynamisches und kollaboratives Umfeld T-Social: soziale Initiativen (Sport, Community, Gesundheit, ...) Hybrides Arbeitsmodell (remote/vor Ort) Adaptable Arbeitszeiten Wachstum & Entwicklung
Maßgeschneiderte Schulungen: Zugang zu Coursera, um zu lernen, was du willst, wann du willst Wöchentliche Sprachkurse (Englisch & Deutsch) Internationale Mentoring-Sessions & Experience Days Wohlbefinden & Freizeit
26+ Arbeitstage Urlaub pro Jahr Kostenloser Zugang zu Fachdiensten (medizinisch, rechtlich, Wellness) 100% Gehaltsfortzahlung während Krankheitsurlaub Und viele weitere Vorteile, Teil von T-Systems zu sein!
#J-18808-Ljbffr
📌 Sovereign Engineering Platform SRE (m/w/d) (Madrid)
🏢 Deutsche Telekom
📍 Madrid