Инженер по обеспечению надежности генеративного ИИ
Москва
Команда развивает платформу GenAI: AI Gateway, LLM-инференс, RAG, Agent Runtime и мониторинг. Роль отвечает за проектирование, эксплуатацию и надежность инфраструктуры и сервисов, чтобы обеспечить стабильную, безопасную и экономичную работу GenAI-приложений
ГрейдSenior
Стек
PythonTriton Inference ServerFAISSKubernetesvLLMText Generation Inferencellama.cppQdrantMilvusOpenSearchElasticsearchDockerGitLab CIHelm
Задачи
- •Проектирование и развитие AI Gateway: маршрутизация, лимиты, фоллбэки, авторизация и аудит
- •Развитие платформы LLM-инференса: развертывание, управление версиями, потоковая генерация и оптимизация производительности
- •Развитие RAG-платформы: эмбеддинги, векторные/гибридные индексы, версионирование и кэширование
- •Развитие Agent Runtime: оркестрация агентных графов, управление состоянием и отказоустойчивость
- •Автоматизация жизненного цикла артефактов: сборка образов, CI/CD, интеграционные тесты, канареечные релизы и откаты
- •Внедрение наблюдаемости и защитных механизмов: трассировка, метрики качества, защита от prompt injection и контроль стоимости
Обязательно
- •Промышленный опыт разработки, внедрения или эксплуатации GenAI/ML/Data-платформ
- •Практический опыт работы с LLM-инференсом (vLLM, Text Generation Inference, Triton Inference Server, llama.cpp или аналоги)
- •Опыт проектирования OpenAI-совместимых API: авторизация, лимиты, маршрутизация и отказоустойчивость
- •Знание принципов RAG и опыт с векторными хранилищами/поисковыми движками (FAISS, Qdrant, Milvus, OpenSearch/Elasticsearch)
- •Опыт запуска и сопровождения сервисов в Kubernetes (workloads, autoscaling, ingress, observability, Helm)
- •Уверенное владение Python для разработки платформенных сервисов и автоматизации
- •Опыт работы с Docker/OCI-образами, безопасная работа с секретами и уверенное владение Linux