About the vacancy
Ищут Data Engineer уровня Middle+ или Senior для разработки data lakehouse-решения под NDA в Москве. Работа гибридная: три дня в офисе и два дома; проект рассчитан до конца года с возможностью продления.
Основные задачи
- Разработка и оптимизация ETL/ELT-пайплайнов под большие объёмы данных
- Парсинг, валидация и трансформация XML-данных
- Построение слоёв raw, processed и curated с использованием Parquet и S3
- Реализация нормализации, дедупликации и формирования золотых записей
- Тюнинг производительности и обеспечение стабильности в продакшене
- Подготовка решений к переносу в закрытый контур заказчика
- Взаимодействие с аналитиками, архитектором, DevOps и командой
Условия
Локация: Москва.
Гибридный график: 3 дня в офисе и 2 дня дома.
Срок проекта до конца этого года с возможностью продления.
Проект выполняется под NDA для крупного заказчика.
Оценка грейда
Для уровня Middle+ указана уверенная работа с Apache Spark на кластере из 2–3 и более узлов и опыт 4 года. Для уровня Senior — самостоятельное проектирование слоёв lakehouse, оптимизация cost/performance, менторство и опыт переноса решений в закрытые контуры.
Сильными плюсами будут глубокая оптимизация Apache Spark, Trino или Presto, табличные форматы Apache Iceberg, Delta Lake или Hudi, опыт в закрытых или air-gapped средах, Data Mesh или Data Fabric, а также тестирование пайплайнов.