Ведущий инженер по AI/LLM-платформе
удалёнка
Работа в команде платформенной инфраструктуры: вы будете развивать внутреннюю AI/LLM-платформу для запуска моделей и агентных решений на корпоративной GPU-инфраструктуре, переводить прототипы в промышленные сервисы и обеспечивать их производительность, надёжность и безопасность
ГрейдLead
Стек
vLLMKubernetesDockerPrometheusTensorRT-LLMTGILinuxOpenTelemetryGrafana
Задачи
- •Оценка и тестирование open-weight моделей и систем инференса на GPU
- •Проектирование маршрутизации моделей, механизмов управления нагрузкой, квотирования и кэширования
- •Перевод прототипов и экспериментов в надёжные промышленные решения
- •Повышение производительности, отказоустойчивости и наблюдаемости платформы инференса
- •Формирование инженерных стандартов по безопасности, версионированию, тестированию и сопровождению
- •Взаимодействие с внутренними командами для внедрения платформенных решений
Обязательно
- •Сильная инженерная база и опыт проектирования промышленных программных систем
- •Опыт работы с LLM, ML-инфраструктурой, распределёнными системами или высокопроизводительными вычислениями
- •Знание компромиссов при инференсе LLM: latency, throughput, batching, concurrency, длина контекста, потребление памяти, квантизация
- •Опыт эксплуатации сервисов под Linux с контейнерами, мониторингом и современными практиками развёртывания
- •Понимание принципов распределённых систем: маршрутизация, балансировка нагрузки, backpressure, admission control, повторные запросы, тайм‑ауты, отказоустойчивость
- •Умение проектировать понятные API, границы сервисов и эксплуатационные интерфейсы
- •Умение диагностировать проблемы производительности и надёжности на уровне приложения, инфраструктуры, сети и GPU
Будет плюсом
- •Опыт промышленного запуска open-weight LLM с SGLang, vLLM, TensorRT-LLM, TGI или аналогами
- •Опыт эксплуатации крупных dense или mixture-of-experts моделей и понимание tensor/pipeline/data/expert/sequence parallelism
- •Опыт работы с квантизацией моделей, speculative decoding, prefix caching и многоуровневым KV-кэшем
- •Опыт проектирования OpenAI-совместимых API, tool calling, structured output, потоковой генерации и долгих агентных сценариев
- •Опыт разработки систем динамического выбора моделей, cache-aware routing, управления квотами и приоритетами
- •Опыт обеспечения безопасности агентных систем: управление учётными данными, sandboxing, аудиты и контроль цепочки поставки
- •Опыт с Kubernetes, Docker Compose, Prometheus, Grafana, OpenTelemetry или аналогичными инструментами