Python разработчик (Gigadata)
офис, гибрид, Москва
Команда собирает качественные данные для обучения моделей ИИ. Вы будете развивать масштабируемый краулер и пайплайны обработки: URL‑фронтирование, планировщики обхода, дедупликацию и observability, чтобы обеспечить стабильный сбор больших объёмов данных
ГрейдSenior
Опыт6+ лет
Стек
PythonasyncioPostgreSQLKafkaRedisClickHouseMongoDBRabbitMQDockerKubernetesCI/CD
Задачи
- •Проектировать и развивать распределённый краулер и URL‑фронтир
- •Оптимизировать пропускную способность: async I/O, connection pooling, DNS‑кэширование, батчинг
- •Разрабатывать адаптивные crawl‑планировщики и приоритизацию по freshness и значимости
- •Реализовывать дедупликацию контента и дедупликацию URL на масштабе миллиардов
- •Проектировать отказоустойчивую архитектуру: stateless‑воркеры, failover, graceful degradation
- •Строить пайплайны обработки: парсинг, нормализация, индексация и observability
Обязательно
- •Коммерческий опыт разработки на Python от 6 лет
- •Глубокая экспертиза в async и мультипоточной разработке (asyncio, uvloop, multiprocessing)
- •Отличное понимание сетевого стека: TCP/UDP, HTTP/1.1/2/3, TLS, DNS, WebSocket
- •Опыт проектирования и эксплуатации распределённых систем высокой нагрузки
- •Практический опыт работы с масштабными веб‑краулерами (десятки миллионов страниц в сутки)
- •Опыт с потоковыми системами и очередями (Kafka, Redis Streams, RabbitMQ)
- •Опыт с БД и хранилищами (PostgreSQL, Redis, ClickHouse, MongoDB)
Будет плюсом
- •Опыт проектирования sharding/consistent hashing и репликации на масштабе
- •Опыт построения observability, мониторинга и автоматического failover
- •Опыт работы с геораспределённой инфраструктурой для снижения латентности
- •Навыки глубокого troubleshooting (tcpdump, strace, perf, flamegraphs)