ГНГНИВЦ
ML-инженер
офис, гибрид, удалёнка, Москва
Команда разрабатывает систему автоматической классификации товарных позиций для аналитики и налогового мониторинга. Вы будете готовить датасеты, обучать и оптимизировать трансформер-модели и внедрять их в продакшен для повышения качества и автоматизации процессов.
ГрейдMiddle
Опыт1–3 года
Стек
PythonPyTorchPostgreSQLDockerHugging Face TransformerspandasdatasetsregexGitLinux
Задачи
- •Разработка и оптимизация классификатора названий товарных позиций на базе BERT-подобных моделей
- •Предобучение, дообучение и экспериментирование с архитектурами (BERT, DistilBERT, кастомные головы, ансамбли)
- •Организация и контроль разметки данных, автоматизация пайплайнов разметки
- •Подготовка датасетов: очистка, нормализация и ETL с использованием pandas и datasets
- •Мониторинг моделей в продакшене: метрики качества, drift-детекция, A/B-тестирование и автоматизированное дообучение
- •Интеграция моделей в production: контейнеризация Docker, мониторинг GPU/CPU и деплой моделей
Обязательно
- •Высшее образование (компьютерные науки, математика или смежные)
- •2+ года опыта в NLP/ML, включая fine-tuning трансформеров (BERT/RoBERTa/DistilBERT)
- •Глубокий опыт с PyTorch и Hugging Face Transformers
- •Владение pandas и Hugging Face datasets для подготовки данных
- •Опыт работы с PostgreSQL: SQL, создание/оптимизация схем, хранимые функции, оптимизация запросов
- •Знание техник оптимизации моделей: quantization, layer-wise LR, custom loss functions
- •Опыт production ML: monitoring, anomaly detection, model serving; уверенное владение Python, Git и Linux/Shell scripting
Будет плюсом
- •Опыт классификации текстов для каталогов, поиска и рекомендаций
- •Навыки организации разметки данных и конвейеров предобработки/ETL
- •Опыт работы с ONNX для inference
- •Опыт multi-GPU обучения (DDP)