Аналитик качества продуктовых агентских сценариев
офис, удалёнка, гибрид, Москва
Команда Alice AI работает над продуктовыми агентскими сценариями для чата Алисы. Вы будете строить метрики и надёжные бенчмарки, разрабатывать виртуальные среды вокруг сервисов Яндекса и управлять пайплайнами сбора эталонных траекторий для улучшения качества моделей и реальных интеграций
Стек
PythonSQLReinforcement LearningGPU-кластерыLLMAPISQL-аналитика
Задачи
- •Разрабатывать и поддерживать продуктовые бенчмарки и метрики для агентских задач
- •Создавать виртуальные среды, оборачивая API сервисов (Маркет, Яндекс Еда и др.)
- •Собирать данные и строить эталонные траектории для RL-пайплайнов
- •Управлять пайплайнами сбора данных: краудсорс, редакторы, LLM-as-a-judge
- •Анализировать логи и тексты моделей, выявлять узкие места и предлагать улучшения
Обязательно
- •Отличное владение Python, умение писать чистый сложный код для виртуальных сред
- •Уверенное владение SQL и анализ сложных структур данных
- •Знание теории вероятностей и математической статистики
- •Понимание устройства агентских систем или опыт участия в их создании
- •Интерес к развитию LLM и готовность глубоко погружаться в тему
- •Высокая самостоятельность и готовность решать SOTA-задачи
Будет плюсом
- •Опыт работы в кросс-сервисных командах
- •Понимание RL в контексте языковых моделей
- •Опыт работы с метриками в NLP или создании синтетических пайплайнов генерации данных
- •Свободное чтение технической документации на английском