Machine Learning Platform Engineer
- Tipo di contratto
- Tempo pieno
- Luogo
- Zürich
- Prima pubblicazione
Informazioni su A1
Oggi ci sono oltre 5 miliardi di utenti che utilizzano applicazioni di base come email, note, task che non sono AI-native. La nostra missione è costruire un assistente intelligente proattivo per gli utenti quotidiani per portare intelligenza nelle conversazioni, nelle commissioni, nell'organizzazione e nei flussi di lavoro, con un prompting minimo.
Il nostro prodotto si concentra sul raggiungimento di un'elevata affidabilità per workflow a lunga durata, contesto persistente e completamento di task nel mondo reale. Il sistema deve gestire il ragionamento multi-step, interagire con strumenti esterni e rimanere affidabile nonostante il comportamento non deterministico del modello. Il nostro obiettivo è aiutare gli utenti a completare i task quotidianamente in modo piacevole con un tempo ridotto di oltre ~90%*.
Informazioni sul Ruolo
In qualità di ML Platform Engineer, costruirai l'infrastruttura e i sistemi che alimentano le capacità AI di A1.
Progetterai e gestirai i sistemi dietro lo stack AI, dall'addestramento e valutazione del modello al deployment, l'inferenza, l'osservabilità e il miglioramento continuo.
Lavorerai a stretto contatto con ingegneri AI, ricercatori e ingegneri di prodotto per trasformare i modelli in sistemi di produzione affidabili, scalabili ed efficienti in termini di costi. Costruirai le piattaforme, gli strumenti e l'infrastruttura che consentono al team di sperimentare rapidamente e portare le capacità AI in produzione con fiducia.
Focus
- Costruire e gestire l'infrastruttura e le piattaforme ML che alimentano i prodotti AI di A1
- Progettare sistemi per l'addestramento, la valutazione, il deployment, l'inferenza e la sperimentazione del modello
- Costruire e ottimizzare l'infrastruttura di model serving e inferenza per carichi di lavoro ad alto throughput e bassa latenza
- Migliorare l'affidabilità, la scalabilità, la latenza e l'efficienza dei costi dei sistemi AI
- Sviluppare pipeline affidabili per la preparazione dei dati, l'addestramento, la valutazione, il rilascio del modello e il miglioramento continuo
- Costruire piattaforme e strumenti che consentano agli ingegneri AI e ai ricercatori di sperimentare, valutare e rilasciare modelli più velocemente
- Sviluppare infrastrutture di valutazione e benchmarking per misurare la qualità, le prestazioni e le regressioni del modello
- Costruire osservabilità, monitoraggio, tracing e alerting di produzione per carichi di lavoro AI/ML
- Migliorare i sistemi AI in termini di affidabilità, scalabilità, latenza, throughput e costi
- Identificare colli di bottiglia in tutto lo stack ML e migliorare continuamente le prestazioni del sistema
- Lavorare a stretto contatto con ingegneri AI, ricercatori e team di prodotto per trasformare i requisiti dei modelli in evoluzione in infrastrutture pronte per la produzione
Tech Stack
- Python
- PyTorch / JAX
- Infrastruttura di servizio LLM e ML come vLLM, SGLang o TensorRT-LLM
- Infrastruttura cloud
- Sistemi distribuiti
- Pipeline ML/dati e orchestrazione dei workflow
- Infrastruttura GPU e strumenti di performance
- Database vettoriali e infrastruttura di retrieval
Esperienza Ideale
- Solidi fondamenti di ingegneria del software ed esperienza nella costruzione di sistemi di produzione
- Esperienza nella costruzione di infrastrutture ML, piattaforme o sistemi di machine learning di produzione
- Esperienza con il deployment dei modelli, l'inferenza, la valutazione o le pipeline di dati
- Forte comprensione dei sistemi distribuiti e dell'affidabilità del sistema
- Capacità di scrivere codice pulito, manutenibile e di qualità per la produzione
- Capacità di lavorare in ambienti ambigui e in rapida evoluzione
- Propensione verso l'ownership, la sperimentazione e il miglioramento continuo
Risultati
- L'infrastruttura AI supporta in modo affidabile i carichi di lavoro di produzione su scala
- I modelli possono essere addestrati, valutati, implementati e migliorati efficientemente
- I sistemi di inferenza offrono prestazioni elevate di latenza, throughput, affidabilità ed efficienza dei costi
- Le pipeline ML sono riproducibili, osservabili, manutenibili e robuste
- Le regressioni del modello e dell'infrastruttura vengono rilevate rapidamente e diagnosticate efficientemente
- Le capacità comuni dell'infrastruttura ML diventano primitive di piattaforma riutilizzabili piuttosto che essere ricostruite per ogni prodotto AI
- Lo stack AI può evolversi rapidamente con l'emergere di nuovi modelli, architetture e tecniche di inferenza
Tradotto automaticamente dall’originale.
Pubblicato 1 settimana fa