Member of Technical Staff, Data Engineering
- Tipo di contratto
- Tempo pieno
- Luogo
- Zürich
- Prima pubblicazione
CHI SIAMO
Odyssey https://odyssey.ml è un laboratorio di IA all'avanguardia nello sviluppo di modelli di mondo generali: sistemi causali e multimodali che imparano a prevedere e interagire con il mondo su lunghi orizzonti temporali. Questa tecnologia fondamentale promette di rivoluzionare la robotica, la scienza, l'assistenza sanitaria, l'istruzione, il gaming, la difesa e molto altro.
I fondatori di Odyssey sono stati in precedenza pionieri dell'applicazione più complessa dell'IA fisica: le auto a guida autonoma. Hanno ora riunito un team di ricerca di livello mondiale proveniente da DeepMind, Tesla, Waymo, Meta, Apple e Wayve, che hanno apportato contributi significativi ai modelli linguistici (DeepMind Gemini), ai modelli video (DeepMind Veo), ai modelli di mondo (Wayve GAIA) e ai sistemi autonomi (Tesla FSD).
Odyssey ha raccolto importanti capitali di rischio da GV, Amazon, AMD, EQT, NVIDIA, Natural Capital, In-Q-Tel, Elad Gil, Jeff Dean, Guillermo Rauch, Garry Tan, Kyle Vogt e ricercatori di OpenAI, DeepMind, MSL, Recursive e Thinking Machines.
COSA STIAMO CERCANDO
I dati stanno diventando rapidamente uno dei maggiori colli di bottiglia nella creazione di modelli di mondo. I nostri modelli sono validi solo quanto i dati che li alimentano, e ottenere i dati corretti è uno dei problemi più difficili e importanti che abbiamo. Cerchiamo un data engineer che voglia essere la persona che trova la soluzione: costruire e curare i dataset multimodali su larga scala su cui si addestrano i nostri modelli, attraverso video, robotica e audio.
Il lavoro spazia tra ricerca e infrastruttura. Alcuni giorni perfezionerai la piattaforma che elabora milioni di ore di video e audio. Altri giorni lavorerai sui dati stessi: estraendo segnali, migliorando le didascalie e collaborando con i ricercatori su cosa inserire nel mix di addestramento. Non consideriamo queste come mansioni separate, quindi cerchiamo qualcuno che sia a proprio agio nel fare entrambe le cose.
Ci interessa più il tuo modo di pensare ai dati che i tuoi anni di esperienza o il tuo record di pubblicazioni. Potresti aver iniziato nel data engineering e spostarti verso la ricerca, o aver iniziato nella ricerca o data science e spostarti verso l'engineering. In ogni caso, ti piace lavorare sui dati e hai esperienza pratica con video e/o audio.
COSA FARAI
- Costruire e gestire pipeline di dati per dataset multimodali su larga scala, dal video grezzo, dalla robotica e dall'audio fino a dati di addestramento curati e arricchiti.
- Estrarre segnali utili dai dati grezzi: rilevamento dei parlanti, isolamento dell'audio di sottofondo, tracciamento di punti e caratteristiche nei video e altri segnali che influenzano ciò che i modelli imparano.
- Lavorare sul mix di addestramento. Deduplicare, ribilanciare i cluster e scavare in ciò che è effettivamente presente nei dati per poter trovare lacune e mantenerli equilibrati.
- Lavorare direttamente con i ricercatori, trasformando i requisiti del modello in una strategia di dati e le loro domande in lavoro sulle pipeline.
- Migliorare la piattaforma: archiviazione, livelli del database, throughput e deployment, affinché l'intero sistema funzioni in modo più veloce e affidabile.
CHI SEI
- Sei bravo a trovare soluzioni. Ti viene dato un problema di dati ambiguo e mal definito e tu capirai cosa conta davvero, per poi costruirlo. Questo è il tratto che ci interessa di più.
- Ti piace il lavoro sui dati in sé. Scavare attraverso dati multimodali disordinati per trovare un segnale è la parte interessante per te, non un mezzo per un fine.
- Sai passare dal lavoro su piattaforma e infrastruttura al lavoro su funzionalità rivolte alla ricerca, e vedi come i due si alimentino a vicenda.
- Hai lavorato con dati video e/o audio reali e sai cosa serve per elaborarli su larga scala.
- Sei a tuo agio nel lavorare fianco a fianco con i ricercatori, traducendo le loro necessità in lavoro concreto sui dati.
- Circa da 1 a 5 anni di esperienza pertinente. Siamo aperti in termini di seniority e assumiamo per la persona, non per il titolo.
PUNTI BONUS
- Esperienza in computer vision, inclusa la CV classica come optical flow e tracciamento di feature o punti, non solo modelli deep.
- Esperienza con pre-addestramento video o multimodale su larga scala, data mix e cura dei dati a quella scala.
- Un background che unisca statistica o data science all'engineering, oltre ad un'esperienza pratica nell'analisi di immagini e video.
- Esposizione a dati robotici, dati sul movimento umano o altre modalità emergenti come i wearable o domini ad alta densità audio.
- Esperienza specifica nell'audio, che è difficile da trovare e che valutiamo molto.
Tradotto automaticamente dall’originale.
Pubblicato 3 giorni fa