15 ago
|
Deutsche Telekom
|
Granada
15 ago
Deutsche Telekom
Granada
Deine Aufgabe Diese Rolle konzentriert sich auf den Aufbau und Betrieb von Kubernetes-Umgebungen, die AI-Engineering-Tools, interne Model-Gateways, Retrieval-Komponenten, Workflow-Services, CI/CD-Runner und Dokumentationsservices hosten. Du implementierst Git Ops- und Infrastructure-as-Code-Muster für reproduzierbare Bereitstellung, Konfiguration, Policy-Durchsetzung, Plattform-Upgrades und Disaster-Recovery-Bereitschaft. Hauptaufgaben Aufbau und Betrieb von Kubernetes-Umgebungen, die AI-Engineering-Tools, interne Model-Gateways, Retrieval-Komponenten, Workflow-Services, CI/CD-Runner und Dokumentationsservices hosten Implementierung von Git Ops- und Infrastructure-as-Code-Mustern für reproduzierbare Bereitstellung, Konfiguration, Policy-Durchsetzung, Plattform-Upgrades und Disaster-Recovery-Bereitschaft Verwaltung von privaten Registries, Package-Mirrors, Secrets, Identity-Integration, Netzwerksegmentierung, Storage-Classes, Backup-Routinen und kontrollierten Konnektivitätsmodellen Bereitstellung von Observability für Engineering-Workloads, einschließlich Metriken, Logs, Traces, GPU- und CPU-Auslastung, Service-Health, Kostensignalen und operativen Runbooks Zusammenarbeit mit Software-, Security- und Architektur-Teams, um sicherzustellen, dass die Plattform AI-gestützte SDLC-Workflows unterstützt, ohne unkontrollierte Datenexposition oder Audit-Lücken zu schaffen Plattformkomponenten und Tools Du arbeitest mit Plattform-Tooling wie Kubernetes, Helm, Terraform, Ansible, Argo CD, Crossplane, Git Lab-Runnern, Jenkins-Agents, privaten Registries und internen Package-Mirrors. Du verwaltest AI-Plattformkomponenten wie v LLM, Ollama, Open AI-kompatible Gateways, Qdrant oder ähnliche Vector-Stores, Open Web UI, Continue-kompatible Endpoints und Workflow-Services. Du nutzt Observability- und Operations-Stacks wie Prometheus, Grafana, Loki, Open Telemetry, ELK/Open Search, Alertmanager, SRE-Runbooks und Incident-Management-Tooling. Du implementierst Security- und Governance-Komponenten wie Vault, Keycloak, Network-Policies, RBAC, Admission-Controls, Image-Scanning, SBOM-Tooling und Audit-Logging.
Du pflegst Infrastruktur-Awareness in Bezug auf GPU-gestützte Nodes, CPU-only-Fallback, Storage-Performance, Netzwerkisolation, Proxy-Muster, On-Premise-Umgebungen und dedizierte Landing-Zones. Profil Wir suchen einen hochqualifizierten Platform Engineer mit umfangreicher Erfahrung in Kubernetes, Infrastruktur-Automatisierung und AI-Plattform-Betrieb. Der ideale Kandidat verfügt über tiefgreifende Expertise im Aufbau von produktionsreifen Engineering-Plattformen mit starkem Fokus auf Sicherheit, Observability und operativer Exzellenz in hochsicheren, souveränitätsorientierten Umgebungen. Muss-Kriterien Mindestens 5 Jahre Erfahrung in SRE-, Platform-Engineering-, Dev Ops-, Cloud-Infrastruktur- oder Operations-Rollen Ausgeprägte Kubernetes-Expertise Ausgeprägte Linux-Expertise Nachgewiesene Erfahrung im Aufbau und Betrieb von produktionsreifen Engineering-Plattformen Erfahrung mit Git Ops-Praktiken und -Mustern Erfahrung mit Infrastructure as Code Erfahrung in der Implementierung von Observability-Lösungen Erfahrung in der Erstellung und Pflege von operativen Runbooks Praktische Kenntnisse in Terraform Praktische Kenntnisse in Ansible Praktische Kenntnisse in Helm Praktische Kenntnisse in Python oder Shell-Scripting Erfahrung mit CI/CD-Runnern Erfahrung mit privaten Registries Erfahrung mit sicherem Konfigurationsmanagement Gutes Verständnis von Netzwerkkonzepten und deren Implementierung Gutes Verständnis von Speichersystemen und deren Verwaltung Gutes Verständnis von Secrets Management Gutes Verständnis von Zugriffskontrollmechanismen Gutes Verständnis von Monitoring und Observability Gutes Verständnis von Backup und Disaster Recovery Gutes Verständnis von operativem Hardening in hochsicheren Umgebungen Sicherer Umgang mit der Unterstützung von AI-gestützten Engineering-Workloads in souveränitätsorientierten Kontexten Erfahrung mit Isolations- und kontrollierten Datenverarbeitungsanforderungen Erfahrung in der Sicherstellung von Zuverlässigkeit und Nachvollziehbarkeit in sicheren Umgebungen Über uns T‑Systems ist Teil der Deutschen Telekom Gruppe mit rund 30.000 Mitarbeitern weltweit. Wir schaffen Technologie mit Sinn, um einen positiven Einfluss auf die Gesellschaft zu erzeugen. Wir suchen neugierige Talente, die lernbegierig sind, Herausforderungen annehmen und Ideen einbringen, die die Erfahrung unserer Kunden transformieren. Wir vertrauen Menschen: Wir bieten dir Autonomie, kontinuierliche Unterstützung und ein kollaboratives Umfeld, in dem du ohne Grenzen wachsen kannst. Wir sind ein globales Team, geleitet von Respekt, Integrität und der Leidenschaft, jeden Tag besser zu werden. Leistungen Flexibler Vergütungsplan (Krankenversicherung, Essensgutscheine, Kinderbetreuung, Transport) Telemedizin Lebens- und Unfallversicherung Sozialfonds 26+ Arbeitstage Urlaub pro Jahr Kostenloser Zugang zu Fachdiensten (medizinisch, rechtlich, Wellness) 100% Gehaltsfortzahlung während Krankheitsurlaub Unternehmensrichtlinien T-Systems Iberia verarbeitet nur die Lebensläufe von Kandidaten, die die für jedes Angebot angegebenen Anforderungen erfüllen Weitere Details Arbeitsumfeld & Flexibilität Internationales, dynamisches und kollaboratives Umfeld T-Social: soziale Initiativen (Sport, Community, Gesundheit,...) Hybrides Arbeitsmodell (remote/vor Ort) Versátil Arbeitszeiten Wachstum & Entwicklung Maßgeschneiderte Schulungen: Zugang zu Coursera, um zu lernen, was du willst, wann du willst Wöchentliche Sprachkurse (Englisch & Deutsch) Internationale Mentoring-Sessions & Experience Days Wohlbefinden & Freizeit 26+ Arbeitstage Urlaub pro Jahr Kostenloser Zugang zu Fachdiensten (medizinisch, rechtlich, Wellness) 100% Gehaltsfortzahlung während Krankheitsurlaub Und viele weitere Vorteile, Teil von T-Systems zu sein! #J-18808-Ljbffr
📌 Sovereign Engineering Platform Sre (M/W/D) (Granada)
🏢 Deutsche Telekom
📍 Granada