Member of Technical Staff, Data Engineering
- Type de contrat
- Temps plein
- Lieu
- Zürich
- Première publication
QUI NOUS SOMMES
Odyssey https://odyssey.ml est un laboratoire d'IA pionnier dans les modèles de monde généraux : des systèmes causaux et multimodaux qui apprennent à prédire et à interagir avec le monde sur de longs horizons. Cette technologie fondamentale promet de révolutionner la robotique, la science, la santé, l'éducation, le gaming, la défense et bien plus encore.
Les fondateurs d'Odyssey ont précédemment été les pionniers de l'application la plus complexe de l'IA physique : les voitures autonomes. Ils ont maintenant réuni une équipe de recherche de classe mondiale issue de DeepMind, Tesla, Waymo, Meta, Apple et Wayve, qui ont apporté des contributions significatives aux modèles de langage (DeepMind Gemini), aux modèles vidéo (DeepMind Veo), aux modèles de monde (Wayve GAIA) et aux systèmes autonomes (Tesla FSD).
Odyssey a levé d'importants capitaux à risque auprès de GV, Amazon, AMD, EQT, NVIDIA, Natural Capital, In-Q-Tel, Elad Gil, Jeff Dean, Guillermo Rauch, Garry Tan, Kyle Vogt, ainsi que des chercheurs d'OpenAI, DeepMind, MSL, Recursive et Thinking Machines.
CE QUE NOUS RECHERCHONS
Les données deviennent rapidement l'un des plus grands goulots d'étranglement dans la construction de modèles de monde. Nos modèles ne sont aussi bons que les données qui les alimentent, et obtenir ces données correctement est l'un des problèmes les plus difficiles et les plus importants auxquels nous sommes confrontés. Nous recherchons un ingénieur de données qui souhaite être la personne qui trouve la solution : construire et organiser les ensembles de données multimodaux à grande échelle sur lesquels nos modèles s'entraînent, à travers la vidéo, la robotique et l'audio.
Le travail englobe la recherche et l'infrastructure. Certains jours, vous peaufinerez la plateforme qui traite des millions d'heures de vidéo et d'audio. D'autres jours, vous serez au cœur même des données : extraire des signaux, améliorer les légendes et travailler avec les chercheurs sur ce qui compose le mélange d'entraînement. Nous ne considérons pas ces tâches comme des métiers distincts, nous voulons donc quelqu'un à l'aise avec les deux.
Nous accordons plus d'importance à votre façon de penser les données qu'à vos années d'expérience ou à votre historique de publications. Vous avez peut-être commencé par l'ingénierie de données pour évoluer vers la recherche, ou commencé par la recherche ou la science des données pour évoluer vers l'ingénierie. Dans les deux cas, vous aimez travailler sur les données et vous avez une expérience pratique de la vidéo et/ou de l'audio.
CE QUE VOUS FEREZ
- Construire et gérer des pipelines de données pour des ensembles de données multimodaux à grande échelle, depuis la vidéo brute, la robotique et l'audio jusqu'aux données d'entraînement organisées et enrichies.
- Extraire des signaux utiles des données brutes : détecter les locuteurs, isoler l'audio d'arrière-plan, suivre des points et des caractéristiques dans la vidéo, et d'autres signaux qui affectent l'apprentissage des modèles.
- Travailler sur le mélange d'entraînement. Dédupliquer, rééquilibrer les clusters et analyser ce qui se trouve réellement dans les données afin que nous puissions identifier les lacunes et maintenir l'équilibre.
- Travailler directement avec les chercheurs, en transformant les exigences des modèles en une stratégie de données et leurs questions en travail de pipeline.
- Améliorer la plateforme : stockage, couches de bases de données, débit et déploiement, afin que l'ensemble du système fonctionne plus rapidement et plus de manière fiable.
QUI VOUS ÊTES
- Vous êtes doué pour trouver des solutions. Donnez-vous un problème de données ambigu et mal défini, et vous comprendrez ce qui compte réellement, puis vous passerez à la construction. C'est le trait que nous valorisons le plus.
- Vous aimez le travail sur les données en lui-même. Creuser dans des données multimodales désordonnées pour trouver un signal est pour vous la partie intéressante, et non un simple moyen d'arriver à une fin.
- Vous pouvez passer du travail de plateforme et d'infrastructure au travail de fonctionnalités orientées recherche, et vous voyez comment les deux se nourrissent mutuellement.
- Vous avez travaillé avec de réelles données vidéo et/ou audio et savez ce qu'il faut pour les traiter à grande échelle.
- Vous êtes à l'aise pour travailler aux côtés des chercheurs, en traduisant leurs besoins en travail de données concret.
- Environ 1 à 5 ans d'expérience pertinente. Nous sommes ouverts sur la séniorité et recrutons pour la personne, pas pour le titre.
POINTS BONUS
- Expérience en vision par ordinateur, incluant la CV classique comme le flux optique et le suivi de caractéristiques ou de points, pas seulement les modèles profonds.
- Expérience avec le pré-entraînement vidéo ou multimodal à grande échelle, les mélanges de données et l'organisation de données à cette échelle.
- Un parcours mêlant statistiques ou science des données avec l'ingénierie, plus une expérience pratique de l'analyse d'images et de vidéos.
- Exposition aux données de robotique, aux données de mouvement humain ou à d'autres modalités émergentes comme les wearables ou les domaines fortement axés sur l'audio.
- Expérience spécifique en audio, ce qui est difficile à trouver et que nous valorisons énormément.
Traduit automatiquement depuis l’original.
Publié il y a 3 jours