Machine Learning Training Infrastructure Engineer
- Tipo di contratto
- Tempo pieno
- Luogo
- Lausanne · Telelavoro possibile
- Prima pubblicazione
Logitech è il posto ideale per le persone che vogliono che le proprie azioni abbiano un impatto globale positivo, mantenendo al contempo la flessibilità di farlo a modo proprio. Il Ruolo:Cerchiamo un ML Training Infrastructure Engineer per elevare le pratiche ingegneristiche in tutti i nostri team Machine Learning ed EdgeAI e migliorarne la velocità. In questo ruolo, agirai come campione condiviso dell'eccellenza DevOps / MLOps. La tua missione sarà quella di guidare un eccellente addestramento dei modelli progettando lo scaffolding riutilizzabile (template, pipeline CI/CD e workflow di gestione dei dati) che permetta ai nostri ingegneri ML di lavorare più velocemente, in modo più intelligente e con assoluta coerenza. Un obiettivo chiave di questo ruolo è l'ottimizzazione delle pipeline di addestramento per sfruttare appieno la nostra infrastruttura High Performance Computing (HPC), garantendo scalabilità e prestazioni. Sarai l'interfaccia tra il nostro Digital Office (che gestisce le risorse core AWS/HPC e l'infrastruttura MLOps) e i team di ML applicato, assicurando che il trasferimento di conoscenze e le migliori pratiche di ingegneria siano integrati senza soluzione di continuità. Il Tuo Contributo:Sii te stesso. Sii aperto. Mantieni fame e umiltà. Collabora. Sfida. Decidi e agisci. Condividi la nostra passione per l'Uguaglianza e l'Ambiente. Questi sono i comportamenti e i valori necessari per avere successo in Logitech. In questo ruolo ti occuperai di: Rollout dell'infrastruttura e onboarding: guidare la migrazione e l'adozione dell'infrastruttura guidando gli ingegneri ML verso i nuovi ambienti di calcolo condivisi, ottimizzando i workflow degli sviluppatori per ridurre gli attriti e fornendo documentazione completa e formazione pratica per garantire l'aggiornamento delle competenze del team. Enablement & Knowledge Transfer: Agire come consulente interno e coach per i team ML per l'ottimizzazione dell'High Performance Computing (HPC). Gestire workshop, fare pair-programming sui colli di bottiglia delle pipeline e documentare gli standard MLOps moderni per potenziare l'organizzazione ingegneristica e facilitare la condivisione delle conoscenze. Standardizzazione e Templating: Progettare e mantenere template di progetto "cookie-cutter". Garantire che ogni ingegnere ML possa avviare un nuovo repository che sia automaticamente conforme, strutturato e integrato con il versionamento di dati/artefatti. CI/CD & Continuous Training (CT): Costruire e mantenere pipeline di automazione robuste. Progettare i trigger e i workflow che automatizzano la validazione dei dati, il retraining del modello e la valutazione quando arrivano nuovi dati o cambiano i baseline delle prestazioni. Ottimizzazione di Calcolo e Codice: Collaborare con gli ingegneri ML per profilare e ottimizzare le pipeline di addestramento e il codice di inferenza locale/edge tramite pair work, garantendo un'elevata efficienza sui computer host locali e sulle risorse di calcolo specializzate. Liaison con il Digital Office: Agire come principale punto di contatto tecnico per tradurre le policy AWS del Digital Office, le configurazioni di calcolo ad alta efficienza e le realtà dell'infrastruttura in workflow pratici e user-friendly per i team ML. Sarai il product owner della toolchain MLOps, assicurandoti che i requisiti del team ML siano implementati come strumenti dal Digital Office. AI Governance & Data Stewardship: Stabilire e applicare framework per l'IA etica, la trasparenza dei modelli (tramite model cards) e la conformità alla privacy dei dati. Agire come steward del nostro ecosistema di dati allineando i processi per l'inventario dei dati, la gestione del ciclo di vita e l'accessibilità, garantendo che dati di alta qualità e conformi siano prontamente disponibili per l'addestramento e l'inferenza in tutti i progetti. Qualifiche Chiave:Per essere presi in considerazione, devi portare i seguenti requisiti minimi di competenze ed esperienze al nostro team: Istruzione: PhD o MSc in Computer Science, Computer Engineering o un campo strettamente correlato. Esperienza: oltre 5 anni di esperienza in MLOps, DevOps o Software Engineering con un forte focus su developer tooling, automazione, platform enablement e ottimizzazione delle pipeline. Esperienza pratica nella progettazione, costruzione o manutenzione di infrastrutture di addestramento ML su larga scala. Hai addestrato modelli ML su piattaforme HPC come parte della tua esperienza precedente e hai familiarità con i diversi elementi dello stack, dalla gestione dei dati alla gestione dei driver. Mentalità di "Leadership": Comprovata esperienza nel mentoring di team, nell'istituzione di best practice e nella creazione di una documentazione pulita che gli ingegneri apprezzino effettivamente usare. Data & Workflow Tooling: Forte esperienza pratica con il versionamento dei dati, strumenti di experiment tracking e moderne piattaforme CI/CD (ad es. GitLab CI, GitHub Actions). Padronanza di Software & Packaging: Profonda competenza in Python e PyTorch, con esperienza nell'esecuzione di carichi di lavoro di addestramento su GPU/TPU. Forte comprensione della containerizzazione (Docker) e dell'impacchettamento dei modelli per la distribuzione su dispositivi edge o computer host. Forti pratiche di software engineering: qualità del codice, design reviews, testing, osservabilità, CI/CD. Familiarità con l'Infrastruttura: Solida comprensione dei concetti cloud (AWS) per collaborare efficacemente con il Digital Office, anche se il deployment cloud è fuori ambito. Ottimizzazione di Sistemi e Prestazioni: Forte comprensione di profiling, sistemi operativi (OS), meccanismi di caching e architettura hardware (HW). Solida comprensione dei concetti di sistemi distribuiti (strategie di parallelismo, fault tolerance, sincronizzazione). In Logitech incoraggiamo la collaborazione e promuoviamo il gioco. Aiutiamo i team a collaborare/imparare da ovunque, senza compromettere la produttività o la continuità
Tradotto automaticamente dall’originale.
Pubblicato 2 settimane fa