ML-разработчик в команду ускорения инференса
гибрид
Команда работает над ускорением инференса генеративных LLM в production для Alice AI. Вы будете исследовать публикации, проводить эксперименты и внедрять оптимизации, снижающие затраты на GPU и повышающие пропускную способность и latency
ГрейдMiddle/Senior
Стек
PythonPyTorchCUDAC++
Задачи
- •Анализ и систематизация исследований по ускорению инференса LLM
- •Проведение экспериментов и проверка гипотез на Alice AI LLM
- •Измерение качества моделей и метрик ускорения (latency, RPS, VRAM)
- •Реализация и интеграция практических оптимизаций инференса
- •Разработка переиспользуемых инструментов для ML-инженеров
Обязательно
- •Опыт работы с современными LLM и понимание их архитектуры
- •Профессиональная разработка на Python и опыт с Torch
- •Глубокие знания в NLP и пайплайне инференса генеративных моделей
- •Знание оптимизаций инференса, включая KV-кеширование
- •Понимание влияния batch_size на вычисления и производительность
- •Понимание требований API: RPS, latency per token/sample, GPU VRAM, SM utilization
Будет плюсом
- •Уверенное владение C++
- •Знакомство с программированием на CUDA