Data-инженер
гибрид, Москва
Команда строит мультиагентную систему иерархического графа причинно-следственных связей для корпоративных клиентов. Вы будете проектировать и выводить в production ETL/ELT‑пайплайны, витрины и интеграции для ML, RAG и ИИ‑агентов, обеспечивая качество и доступность данных
ГрейдJunior/Middle
Опытот 2 лет
Стек
PythonApache SparkHadoopAirflowSQLParquetGitCI/CDJSONCSVPySparkSpark+ScalaLangChainLangGraph
Задачи
- •проектирование и разработка ETL/ELT‑пайплайнов для табличных и событийных данных
- •интеграция и загрузка данных в векторные, графовые и документные СУБД
- •проработка трансформаций, расчёт и поддержка аналитических витрин для ML, RAG и ИИ‑агентов
- •организация поставки данных в лабораторный контур для исследований и обучения моделей
- •вывод ETL‑пайплайнов и витрин в промышленный контур и сопровождение в PROD
- •профилирование данных, оптимизация вычислений и мониторинг пайплайнов
Обязательно
- •опыт работы в роли Data Engineer от 2 лет
- •уверенное знание Python (ООП, структуры данных, алгоритмы) и библиотек для анализа/обработки данных
- •отличное знание SQL и навыки оптимизации запросов
- •опыт работы с Hadoop, Apache Spark (PySpark, Spark+Scala), знание форматов хранения Parquet/JSON/CSV
- •понимание процессов ETL/ELT и опыт построения пайплайнов для табличных и событийных данных
- •опыт вывода решений в промышленный контур (Production)
- •уверенное владение Git, понимание принципов CI/CD, опыт работы с Airflow и системами мониторинга
Будет плюсом
- •опыт интеграции с векторными, графовыми и документными СУБД для поддержки RAG и ИИ‑агентов
- •понимание основ машинного обучения и опыт работы с LangChain/LangGraph