developerjobs.ch
← Alle Stellen

Machine Learning Training Infrastructure Engineer

Logitech Europe S.A.

Anstellung
Vollzeit
Ort
Lausanne · Remote möglich
Erstmals ausgeschrieben
Jetzt bewerben

Logitech ist der ideale Ort für Menschen, die möchten, dass ihr Handeln eine positive globale Wirkung hat, während sie gleichzeitig die Flexibilität haben, dies auf ihre eigene Weise zu tun. Die Rolle: Wir suchen einen ML Training Infrastructure Engineer, um die Engineering-Praktiken unserer Machine Learning und EdgeAI-Teams zu verbessern und deren Geschwindigkeit zu erhöhen. In dieser Rolle werden Sie als gemeinsamer Verfechter von DevOps / MLOps-Exzellenz fungieren. Ihre Mission ist es, ein hervorragendes Modelltraining durch die Gestaltung des wiederverwendbaren Gerüsts (Templates, CI/CD-Pipelines und Datenmanagement-Workflows) voranzutreiben, das es unseren ML-Ingenieuren ermöglicht, schneller, smarter und mit absoluter Konsistenz zu arbeiten. Ein Schwerpunkt dieser Rolle liegt auf der Optimierung von Trainings-Pipelines, um unsere High Performance Computing (HPC) Infrastruktur voll auszuschöpfen und Skalierbarkeit sowie Performance sicherzustellen. Sie sind die Schnittstelle zu unserem Digital Office (das die zentralen AWS/HPC-Ressourcen und die MLOps-Infrastruktur verwaltet) und den angewandten ML-Teams, wobei Sie sicherstellen, dass Wissenstransfer und Engineering-Best-Practices nahtlos integriert werden. Ihr Beitrag: Seien Sie Sie selbst. Seien Sie offen. Bleiben Sie hungrig und bescheiden. Arbeiten Sie zusammen. Fordern Sie heraus. Entscheiden Sie und tun Sie es einfach. Teilen Sie unsere Leidenschaft für Gleichberechtigung und die Umwelt. Dies sind die Verhaltensweisen und Werte, die Sie für den Erfolg bei Logitech benötigen werden. In dieser Rolle kümmern Sie sich um: Infrastruktur-Rollout & Onboarding: Leitung der Infrastrukturmigration und -einführung durch die Anleitung von ML-Ingenieuren zu neuen gemeinsamen Rechenumgebungen, Optimierung von Entwickler-Workflows zur Reduzierung von Reibungsverlusten sowie Bereitstellung umfassender Dokumentation und praxisnaher Schulungen zur Sicherstellung des Team-Upskillings. Enablement & Wissenstransfer: Agieren Sie als interner Berater und Coach für ML-Teams zur High Performance Computing (HPC) Optimierung. Führen Sie Workshops durch, arbeiten Sie im Pair-Programming an Pipeline-Engpässen und dokumentieren Sie moderne MLOps-Standards, um die Engineering-Organisation weiterzubilden und den Wissensaustausch zu fördern. Standardisierung & Templating: Entwerfen und pflegen Sie „Cookie-Cutter“-Projekt-Templates. Stellen Sie sicher, dass jeder ML-Ingenieur ein neues Repository erstellen kann, das automatisch konform, strukturiert und mit Daten-/Artefakt-Versioning integriert ist. CI/CD & Continuous Training (CT): Aufbau und Wartung robuster Automatisierungs-Pipelines. Design von Triggern und Workflows, die die Datenvalidierung, das Modell-Retraining und die Evaluierung automatisieren, wenn neue Daten eintreffen oder Performance-Baselines sich ändern. Compute & Code-Optimierung: Zusammenarbeit mit ML-Ingenieuren zur Profilierung und Optimierung von Trainings-Pipelines sowie lokalem/Edge-Inference-Code in Pair-Arbeit, um eine hohe Effizienz auf lokalen Host-Computern und spezialisierten Rechenressourcen zu gewährleisten. Digital Office Liaison: Fungieren Sie als primärer technischer Ansprechpartner, um die AWS-Richtlinien des Digital Office, hocheffiziente Compute-Setups und Infrastruktur-Realitäten in praktische, entwicklerfreundliche Workflows für die ML-Teams zu übersetzen. Sie sind der Product Owner der MLOps-Toolchain und stellen sicher, dass die Anforderungen des ML-Teams durch das Digital Office als Tools implementiert werden. AI Governance & Data Stewardship: Etablierung und Durchsetzung von Frameworks für ethische KI, Modelltransparenz (via Model Cards) und Einhaltung des Datenschutzrechts. Agieren Sie als Verwalter unseres Daten-Ökosystems, indem Sie Prozesse für die Dateninventur, das Lifecycle-Management und die Zugänglichkeit abstimmen, um sicherzustellen, dass qualitativ hochwertige, konforme Daten für Training und Inference in allen Projekten bereitstehen. Wichtige Qualifikationen: Für eine Berücksichtigung müssen Sie die folgenden Mindestkenntnisse und Erfahrungen in unser Team einbringen: Ausbildung: PhD oder MSc in Informatik, Computer Engineering oder einem eng verwandten Bereich. Erfahrung: 5+ Jahre Erfahrung in MLOps, DevOps oder Software Engineering mit einem starken Fokus auf Developer Tooling, Automatisierung, Platform Enablement und Pipeline-Optimierung. Hands-on-Erfahrung im Entwurf, Aufbau oder der Wartung von groß angelegten ML-Training-Infrastrukturen. Sie haben ML-Modelle im Rahmen Ihrer bisherigen Erfahrung auf HPC-Plattformen trainiert und sind mit den verschiedenen Elementen des Stacks vertraut, vom Datenmanagement bis zum Driver-Management. Das „Leadership“-Mindset: Nachgewiesene Erfolge im Mentoring von Teams, in der Etablierung von Best Practices und in der Erstellung sauberer Dokumentation, die Ingenieure tatsächlich gerne nutzen. Daten- & Workflow-Tooling: Starke, praktische Erfahrung mit Daten-Versioning, Experiment-Tracking-Tools und modernen CI/CD-Plattformen (z. B. GitLab CI, GitHub Actions). Beherrschung von Software & Packaging: Tiefgehende Kenntnisse in Python und PyTorch mit Erfahrung im Ausführen von Trainings-Workloads auf GPUs/TPUs. Starkes Verständnis von Containerisierung (Docker) und der Paketierung von Modellen für die Distribution auf Edge-Geräte oder Host-Computer. Starke Software-Engineering-Praktiken: Code-Qualität, Design-Reviews, Testing, Observability, CI/CD. Vertrautheit mit Infrastruktur: Fundiertes Verständnis von Cloud-Konzepten (AWS) für eine effektive Zusammenarbeit mit dem Digital Office, auch wenn das Cloud-Deployment nicht im Aufgabenbereich liegt. System- & Performance-Optimierung: Starkes Verständnis von Profiling, Betriebssystemen (OS), Caching-Mechanismen und Hardware (HW)-Architektur. Fundiertes Verständnis von verteilten Systemkonzepten (Parallelisierungsstrategien, Fehlertoleranz, Synchronisation). Bei Logitech fördern wir die Zusammenarbeit und unterstützen das spiel

Automatisch aus dem Original übersetzt.

Ausgeschrieben vor 2 Wochen

Ort

Auf Google Maps ansehen