Middle+ AI Engineer (Native Omnimodality & VLA)
удалёнка, гибрид, Москва
Команда исследует и создаёт нативные омнимодальные архитектуры для изображений, аудио, видео и текста. Вы будете проектировать универсальные энкодеры, shared latent spaces и VLA-архитектуры для стриминга и взаимодействия с роботами, повышая возможности продуктов и исследований.
ГрейдMiddle/Senior
Стек
PythonPyTorchdvcDockerbashgit
Задачи
- •Разработка мультимодальных представлений и механизмов кодирования
- •Создание универсальных энкодеров и shared latent spaces
- •Проектирование VLA-архитектур и стрим-взаимодействия с роботами
- •Обучение и исследование end-to-end омнимодальных моделей на масштабных датасетах
Обязательно
- •Отличный Python 3 и опыт с PyTorch
- •Глубокое понимание representation learning и multimodal learning
- •Опыт с vision, audio и video моделями
- •Понимание трансформеров, contrastive learning и joint embeddings
- •Опыт работы с bash, git, Docker и dvc
- •Умение быстро разбирать и воспроизводить идеи из научных статей
Будет плюсом
- •Опыт с VLA / Embodied AI / Robotics
- •Знание self-supervised и multimodal pretraining подходов
- •Опыт работы со streaming video/audio
- •Публикации, open-source вклад или исследовательский исследовательский опыт