04 oct
|
Deutsche Telekom
|
Granada
04 oct
Deutsche Telekom
Granada
Deine Aufgabe Diese Rolle konzentriert sich auf den Aufbau und Betrieb von Kubernetes-Umgebungen, die AI-Engineering-Tools, interne Model-Gateways, Retrieval-Komponenten, Workflow-Services, CI/CD-Runner und Dokumentationsservices hosten. Du implementierst GitOps- und Infrastructure-as-Code-Muster für reproduzierbare Bereitstellung, Konfiguration, Policy-Durchsetzung, Plattform-Upgrades und Disaster-Recovery-Bereitschaft. Hauptaufgaben Aufbau und Betrieb von Kubernetes-Umgebungen, die AI-Engineering-Tools, interne Model-Gateways, Retrieval-Komponenten, Workflow-Services, CI/CD-Runner und Dokumentationsservices hosten Implementierung von GitOps- und Infrastructure-as-Code-Mustern für reproduzierbare Bereitstellung, Konfiguration, Policy-Durchsetzung, Plattform-Upgrades und Disaster-Recovery-Bereitschaft Verwaltung von privaten Registries, Package-Mirrors, Secrets, Identity-Integration, Netzwerksegmentierung, Storage-Classes, Backup-Routinen und kontrollierten Konnektivitätsmodellen Bereitstellung von Observability für Engineering-Workloads, einschließlich Metriken, Logs, Traces, GPU- und CPU-Auslastung, Service-Health, Kostensignalen und operativen Runbooks Zusammenarbeit mit Software-, Security- und Architektur-Teams, um sicherzustellen, dass die Plattform AI-gestützte SDLC-Workflows unterstützt, ohne unkontrollierte Datenexposition oder Audit-Lücken zu schaffen
Plattformkomponenten und Tools Du arbeitest mit Plattform-Tooling
wie Kubernetes, Helm, Terraform, Ansible, ArgoCD, Crossplane, GitLab-Runnern, Jenkins-Agents, privaten Registries und internen Package-Mirrors. Du verwaltest AI-Plattformkomponenten
wie vLLM, Ollama, OpenAI-kompatible Gateways, Qdrant oder ähnliche Vector-Stores, Open WebUI, Continue-kompatible Endpoints und Workflow-Services. Du nutzt Observability- und Operations-Stacks
wie Prometheus, Grafana, Loki, OpenTelemetry, ELK/OpenSearch, Alertmanager, SRE-Runbooks und Incident-Management-Tooling. Du implementierst Security- und Governance-Komponenten
wie Vault, Keycloak, Network-Policies, RBAC, Admission-Controls, Image-Scanning, SBOM-Tooling und Audit-Logging.
Du pflegst Infrastruktur-Awareness
in Bezug auf GPU-gestützte Nodes, CPU-only-Fallback, Storage-Performance, Netzwerkisolation, Proxy-Muster, On-Premise-Umgebungen und dedizierte Landing-Zones. Profil Wir suchen einen hochqualifizierten Platform Engineer
mit umfangreicher Erfahrung in Kubernetes, Infrastruktur-Automatisierung und AI-Plattform-Betrieb. Der ideale Kandidat verfügt über tiefgreifende Expertise im Aufbau von produktionsreifen Engineering-Plattformen mit starkem Fokus auf Sicherheit, Observability und operativer Exzellenz in hochsicheren, souveränitätsorientierten Umgebungen. Muss-Kriterien Mindestens 5 Jahre Erfahrung in SRE-, Platform-Engineering-, DevOps-, Cloud-Infrastruktur- oder Operations-Rollen Ausgeprägte Kubernetes-Expertise Ausgeprägte Linux-Expertise Nachgewiesene Erfahrung im Aufbau und Betrieb von produktionsreifen Engineering-Plattformen Erfahrung mit GitOps-Praktiken und -Mustern Erfahrung mit Infrastructure as Code Erfahrung in der Implementierung von Observability-Lösungen Erfahrung in der Erstellung und Pflege von operativen Runbooks Praktische Kenntnisse in Terraform Praktische Kenntnisse in Ansible Praktische Kenntnisse in Helm Praktische Kenntnisse in Python oder Shell-Scripting Erfahrung mit CI/CD-Runnern Erfahrung mit privaten Registries Erfahrung mit sicherem Konfigurationsmanagement Gutes Verständnis von Netzwerkkonzepten und deren Implementierung Gutes Verständnis von Speichersystemen und deren Verwaltung Gutes Verständnis von Secrets Management Gutes Verständnis von Zugriffskontrollmechanismen Gutes Verständnis von Monitoring und Observability Gutes Verständnis von Backup und Disaster Recovery Gutes Verständnis von operativem Hardening in hochsicheren Umgebungen Sicherer Umgang mit der Unterstützung von AI-gestützten Engineering-Workloads in souveränitätsorientierten Kontexten Erfahrung mit Isolations- und kontrollierten Datenverarbeitungsanforderungen Erfahrung in der Sicherstellung von Zuverlässigkeit und Nachvollziehbarkeit in sicheren Umgebungen
Über uns T‑Systems
ist Teil der Deutschen Telekom Gruppe mit rund 30.000 Mitarbeitern weltweit. Wir schaffen Technologie mit Sinn, um einen positiven Einfluss auf die Gesellschaft zu erzeugen. Wir suchen neugierige Talente, die lernbegierig sind, Herausforderungen annehmen und Ideen einbringen, die die Erfahrung unserer Kunden transformieren. Wir vertrauen Menschen: Wir bieten dir Autonomie, kontinuierliche Unterstützung und ein kollaboratives Umfeld, in dem du ohne Grenzen wachsen kannst. Wir sind ein globales Team, geleitet von Respekt, Integrität und der Leidenschaft, jeden Tag besser zu werden. Leistungen Flexibler Vergütungsplan (Krankenversicherung, Essensgutscheine, Kinderbetreuung, Transport) Telemedizin Lebens- und Unfallversicherung Sozialfonds 26+ Arbeitstage Urlaub pro Jahr Kostenloser Zugang zu Fachdiensten (medizinisch, rechtlich, Wellness) 100% Gehaltsfortzahlung während Krankheitsurlaub
Unternehmensrichtlinien T-Systems Iberia verarbeitet nur die Lebensläufe von Kandidaten, die die für jedes Angebot angegebenen Anforderungen erfüllen
Weitere Details Arbeitsumfeld & Flexibilität Internationales, dynamisches und kollaboratives Umfeld T-Social: soziale Initiativen (Sport, Community, Gesundheit, ...) Hybrides Arbeitsmodell (remote/vor Ort) Adaptable Arbeitszeiten
Wachstum & Entwicklung Maßgeschneiderte Schulungen: Zugang zu Coursera, um zu lernen, was du willst, wann du willst Wöchentliche Sprachkurse (Englisch & Deutsch) Internationale Mentoring-Sessions & Experience Days
Wohlbefinden & Freizeit 26+ Arbeitstage Urlaub pro Jahr Kostenloser Zugang zu Fachdiensten (medizinisch, rechtlich, Wellness) 100% Gehaltsfortzahlung während Krankheitsurlaub
Und viele weitere Vorteile, Teil von T-Systems zu sein!
#J-18808-Ljbffr
📌 Sovereign Engineering Platform SRE (m/w/d) (Granada)
🏢 Deutsche Telekom
📍 Granada