ML Engineer — Omnimodal Full-Duplex
Москва
Исследовательская команда развивает омнимодальную full‑duplex архитектуру, объединяющую аудио, текст и видео для одновременного восприятия и генерации речи в реальном времени. Работы направлены на снижение латентности, стриминг и естественное интерактивное общение с пользователями.
ГрейдMiddle/Senior
Опыт3–6 лет
Стек
PythonPyTorchHugging Face TransformersDockerDVCGitbash
Задачи
- •Разработка full‑duplex мультимодальных моделей для одновременного восприятия и генерации речи
- •Обработка перебиваний, пауз и поддержка естественного диалога в реальном времени
- •Интеграция аудио, текста и визуальных модальностей в единую архитектуру
- •Оптимизация и обучение моделей для низкой латентности и стриминга
- •Исследование и внедрение state‑of‑the‑art методов (streaming transformers, multimodal LLMs)
Обязательно
- •Отличное владение Python 3
- •Опыт разработки на PyTorch
- •Знание speech & audio processing (ASR, TTS, DSP ML)
- •Опыт работы с большими аудио‑датасетами
- •Опыт разработки streaming / real‑time систем
- •Понимание трансформеров, attention, KV‑cache
- •Опыт с MLOps практиками: мониторинг моделей, дрейф данных, CI/CD, контейнеризация и версионирование моделей (Docker, DVC, Git)
Будет плюсом
- •Опыт в доменах речи, музыки или голосовых ассистентов
- •Знание мультимодальных LLM / VLM / Audio‑LM
- •Публикации или исследовательский бэкграунд