Middle+ AI Engineer (Native Omnimodality & VLA)
гибрид, Москва
Команда работает над нативными омнимодальными архитектурами для объединения vision/audio/video/text. Вы будете исследовать и реализовывать универсальные энкодеры, shared latent spaces и VLA-архитектуры для стрим‑взаимодействия с роботами и обучения на масштабных мультимодальных датасетах
ГрейдMiddle/Senior
Стек
PythonPyTorchDockerDVCgitbash
Задачи
- •разработка мультимодальных представлений и методов кодирования (vision, audio, video, text)
- •создание универсальных энкодеров и shared latent spaces
- •исследование и реализация Vision‑Language‑Action (VLA) архитектур и стрим‑взаимодействия с роботами
- •исследование end-to-end омнимодальных моделей и обучение на масштабных мультимодальных датасетах
- •воспроизведение и проверка идей из научных статей
Обязательно
- •отличное владение Python 3
- •опыт с PyTorch
- •опыт работы с Docker, dvc, git и bash
- •глубокое понимание representation learning и multimodal learning
- •опыт с vision, audio и video моделями
- •понимание трансформеров, contrastive learning и joint embeddings
- •умение быстро разбирать и воспроизводить идеи из научных статей
Будет плюсом
- •опыт с VLA / Embodied AI / Robotics
- •знание self‑supervised и multimodal pretraining подходов
- •опыт работы со стримингом video/audio
- •публикации или вклад в open‑source, исследовательский опыт