билайнбилайн

Ведущий инженер по AI/LLM-платформе

удалёнка

Работа в команде платформенной инфраструктуры: вы будете развивать внутреннюю AI/LLM-платформу для запуска моделей и агентных решений на корпоративной GPU-инфраструктуре, переводить прототипы в промышленные сервисы и обеспечивать их производительность, надёжность и безопасность

ГрейдLead

Стек

vLLMKubernetesDockerPrometheusTensorRT-LLMTGILinuxOpenTelemetryGrafana

Задачи

  • Оценка и тестирование open-weight моделей и систем инференса на GPU
  • Проектирование маршрутизации моделей, механизмов управления нагрузкой, квотирования и кэширования
  • Перевод прототипов и экспериментов в надёжные промышленные решения
  • Повышение производительности, отказоустойчивости и наблюдаемости платформы инференса
  • Формирование инженерных стандартов по безопасности, версионированию, тестированию и сопровождению
  • Взаимодействие с внутренними командами для внедрения платформенных решений

Обязательно

  • Сильная инженерная база и опыт проектирования промышленных программных систем
  • Опыт работы с LLM, ML-инфраструктурой, распределёнными системами или высокопроизводительными вычислениями
  • Знание компромиссов при инференсе LLM: latency, throughput, batching, concurrency, длина контекста, потребление памяти, квантизация
  • Опыт эксплуатации сервисов под Linux с контейнерами, мониторингом и современными практиками развёртывания
  • Понимание принципов распределённых систем: маршрутизация, балансировка нагрузки, backpressure, admission control, повторные запросы, тайм‑ауты, отказоустойчивость
  • Умение проектировать понятные API, границы сервисов и эксплуатационные интерфейсы
  • Умение диагностировать проблемы производительности и надёжности на уровне приложения, инфраструктуры, сети и GPU

Будет плюсом

  • Опыт промышленного запуска open-weight LLM с SGLang, vLLM, TensorRT-LLM, TGI или аналогами
  • Опыт эксплуатации крупных dense или mixture-of-experts моделей и понимание tensor/pipeline/data/expert/sequence parallelism
  • Опыт работы с квантизацией моделей, speculative decoding, prefix caching и многоуровневым KV-кэшем
  • Опыт проектирования OpenAI-совместимых API, tool calling, structured output, потоковой генерации и долгих агентных сценариев
  • Опыт разработки систем динамического выбора моделей, cache-aware routing, управления квотами и приоритетами
  • Опыт обеспечения безопасности агентных систем: управление учётными данными, sandboxing, аудиты и контроль цепочки поставки
  • Опыт с Kubernetes, Docker Compose, Prometheus, Grafana, OpenTelemetry или аналогичными инструментами
Откликнуться на сайте компании

Похожие вакансии

Смотреть ещё

JobsWave
Найти работу в IT