evoila Frankfurt GmbH
Mainz, DE · On-site · Full-time
Du brennst für Kubernetes, Plattform-Engineering und moderne AI-Technologien? Du möchtest nicht nur einzelne Modelle deployen, sondern die Infrastruktur und Plattformen schaffen, auf denen innovative AI-Anwendungen zuverlässig, sicher und skalierbar betrieben werden? Dann bist du bei uns genau richtig. Als (Senior) AI Platform Engineer (m/f/d) entwickelst, betreibst und optimierst du moderne AI- und ML-Plattformen für unsere Kunden. Du arbeitest mit Kubernetes, GPU-Infrastrukturen, Infrastructure as Code sowie modernen CI/CD-, MLOps- und LLMOps-Ansätzen und unterstützt Unternehmen dabei, Generative AI und Machine Learning erfolgreich in den produktiven Einsatz zu bringen. Dich erwarten spannende Projekte in unterschiedlichsten Branchen, technologischer Gestaltungsspielraum und ein Team aus Cloud-, Plattform-, Data- und AI-Spezialisten, das Innovation nicht nur diskutiert, sondern täglich umsetzt. Aufgaben Planung, Aufbau und Betrieb von hochverfügbaren AI/ML-Plattformen und -Services, insbesondere auf Basis von Kubernetes in On-Premises-, Hybrid- und Cloud-Umgebungen. Design und Umsetzung skalierbarer GPU-Infrastrukturen innerhalb von Kubernetes-Clustern – inklusive GPU-Scheduling und -Sharing (z. B. Kueue, KAI-Scheduler, Run:ai, NVIDIA MIG/Time-Slicing) mit Blick auf Auslastung und Kosteneffizienz. Aufbau und Betrieb von Model-Serving- und Inferenz-Diensten (z. B. vLLM, NVIDIA Triton, KServe, NVIDIA NIM, Ray) für klassische ML-Modelle und Large Language Models. Entwicklung und Betrieb von MLOps-/LLMOps-Workflows für produktive GenAI-Services – inklusive Guardrails & Policies, Evaluierung, Regressionstests sowie Kosten- und Qualitätsmonitoring. Bereitstellung von Fine-Tuning- und Re-Training-Workflows (z. B. LoRA, kontinuierliches Re-Training) auf der Plattform. Monitoring, Troubleshooting und Performance-Tuning von AI-Plattformen (u. a. GPU-Auslastung, Inferenz-Latenz, Durchsatz), um höchste Performance und Verfügbarkeit sicherzustellen. Beratung unserer Kunden in Bezug auf Best Practices, AI-Governance, Datensicherheit und Datenschutz im Kontext von AI-Plattformen auf Kubernetes. Enge Zusammenarbeit mit Data-Science-, Data-Platform- und Entwicklungsteams zur Sicherstellung der nahtlosen Integration von AI-Lösungen. Qualifikation Mindestens 3 Jahre Erfahrung im Betrieb und der Optimierung von Plattformen und Services at Scale in Kubernetes-Umgebungen, egal ob On-Premise oder in der Cloud. Fundierte Kenntnisse in der Architektur und dem Betrieb von skalierbaren Lösungen unter Verwendung von Kubernetes, idealerweise inklusive GPU-Workloads. Programmierkenntnisse in Python, idealerweise ergänzt um Golang oder Java. Erfahrung mit mindestens einem Model-Serving-Framework (z. B. vLLM, NVIDIA Triton, KServe) sowie erste oder vertiefte Erfahrung mit MLOps-Werkzeugen (z. B. MLflow, Kubeflow, ClearML). Erfahrung mit Infrastructure-as-Code-Tools wie Ansible und Terraform sowie CI/CD- und GitOps-Werkzeugen (z. B. Argo CD, Flux). Sehr gute Kommunikation
evoila Frankfurt GmbH
Posted via Arbeitnow
Apply Now takes you to Rozgoo, where auto-apply can submit your application for this role. Updated today.
Apply Now