01 ago
|
Deutsche Telekom
|
Madrid
01 ago
Deutsche Telekom
Madrid
Deine AufgabeDie Mission dieser Rolle ist es, eine souveräne AI-Toolchain zu entwerfen, aufzubauen und zu betreiben, die in isolierten oder streng kontrollierten Umgebungen eingesetzt wird. Dies umfasst Model Serving, Retrieval, Orchestrierung, Observability sowie den sicheren Plattformbetrieb für Enterprise-AI-Engineering-Workloads. Der Fokus dieser Rolle liegt auf Open-Source- oder Open-Weight-LLM-Stacks, Air-Gapped- oder isolierten Deployment-Models, Kubernetes-basierter Platform Engineering, GPU-fähigen Umgebungen und prüfbaren AI-Operationen, die für souveränitätskritische Programme geeignet sind.
Aufgaben
Entwurf und Betrieb von Kubernetes-Umgebungen, die für AI-Inferenz, Retrieval, Experimentierung und Agenten-Ausführung in sicheren oder isolierten Settings optimiert sind
Deployment und Betrieb von Open-Source- oder Open-Weight-Modell-Stacks, Modell-Gateways, Vektordatenbanken und unterstützenden Plattformkomponenten
Aufbau einer reproduzierbaren Plattformautomatisierung mittels Infrastructure as Code und GitOps-Ansätzen für eine stabile und prüfbare Bereitstellung
Verwaltung von lokalen Registries, Package-Mirrors, Secrets, Zugriffskontrollen, Storage, Networking und Observability in Umgebungen mit begrenzter oder keiner Public-Cloud-Abhängigkeit
Optimierung der GPU-, Compute- und Storage-Nutzung für zuverlässige AI-Workloads unter Einhaltung der Sicherheits- und Datensouveränitätsanforderungen
Dein ProfilWir suchen einen professionellen Platform Engineer / MLOps Specialist mit umfangreicher Erfahrung in Kubernetes, Linux und KI-Infrastruktur,
speziell mit Fokus auf dem Deployment und Betrieb von souveränen, air-gapped oder isolierten LLM-Stacks.
Muss-Kriterien
Mindestens 5 Jahre Erfahrung in Platform Engineering, DevOps, SRE oder MLOps
Ausgeprägte Expertise in Kubernetes und Linux
Nachgewiesene Erfahrung mit KI-Infrastruktur und Model Serving
Erfahrung mit privaten oder On-Prem-Deployments sowie Produktionsbetrieb für LLM-basierte Workloads
Starke Hands-on-Kenntnisse in Python
Versiertheit in Automatisierungstools wie Terraform, Ansible und Helm
Erfahrung mit GitOps-Workflows
Tiefes Verständnis von Networking, Storage, Zugriffskontrolle und Monitoring
Erfahrung mit operational Hardening in HochsicherheitsumgebungenFähigkeit, in souveränitätsgetriebenen Umgebungen zu arbeiten, die Auditierbarkeit, Isolation und kontrollierte Datenverarbeitung erfordern
Kenntnisse von Inference- und Local-Serving-Stacks wie vLLM, Ollama, llama.cpp oder OpenAI-kompatiblen, selbstgehosteten Endpunkten
Erfahrung mit Open-Source- oder Open-Weight-Modellen für souveräne Deployments
Erfahrung mit Vector Stores wie Qdrant oder ähnlichen Tools
Erfahrung mit internen Interfaces wie Open WebUI oder vergleichbaren Tools
Kenntnisse von Integrationsoptionen für Entwickler, wie VS Code-kompatible Extensions oder lokale Modell-Connectoren im Stil von Continue
Hardware-Know-how bezüglich GPU-gestützter Nodes, CPU-only Fallback-Optionen, Storage-Performance und Netzwerkisolation
Über unsT-Systems
ist Teil der Deutsche Telekom Gruppe mit rund 30.000 Mitarbeitern weltweit. Wir schaffen Technologie mit Sinn, um eine positive Wirkung auf die Gesellschaft zu erzielen. Wir suchen neugierige Talente, die lernwillig sind, Herausforderungen annehmen und Ideen beisteuern, die das Erlebnis unserer Kunden transformieren.
Wir vertrauen den Menschen: Wir bieten
Autonomie, kontinuierliche Unterstützung und ein kollaboratives Umfeld , in dem du ohne Grenzen wachsen kannst. Wir sind ein globales Team, geleitet von Respekt, Integrität und der Leidenschaft, jeden Tag besser zu werden.
Flexibler Vergütungsplan: beinhaltet Krankenversicherung, Essensgutscheine, Kinderbetreuung und Transport
Telemedizin
Lebens- und Unfallversicherung
Sozialfonds
Urlaub: 26+ Arbeitstage pro Jahr
Kostenloser Zugang zu Fachdiensten (medizinisch, rechtlich, Wellness)
100 % Gehaltsfortzahlung während des Krankenstands
T-Social: soziale Initiativen (Sport, Community, Gesundheit etc.)
Weitere Details
Wachstum & Entwicklung:
Maßgeschneiderte Trainings via Coursera
Wöchentliche Sprachkurse (Englisch & Deutsch)
Internationale Mentoring-Sessions & Experience Days
Zeitplan: Adaptable Arbeitszeiten
#J-18808-Ljbffr
📌 Sovereign AI Platform Engineer (m/w/d) T Cloud Public (Madrid)
🏢 Deutsche Telekom
📍 Madrid