Dans le cadre du renforcement de son équipe Data, nous recherchons des Data Engineers confirmés. L'équipe Data intervient sur la construction et l'industrialisation de pipelines de données au sein d'une architecture de type Data Mesh, avec des exigences fortes de qualité, de performance et de documentation.
Concevoir, développer et industrialiser des pipelines de traitement de données avec Python, Spark et Scala.
Contribuer à l'architecture Data Mesh du client, organisée en couches Bronze, Silver et Gold.
Mettre en place et optimiser le stockage objet des données sur MinIO.
Modéliser et partitionner les données sur PostgreSQL pour garantir performance et scalabilité.
Structurer les données au format Parquet dans une logique d'optimisation du stockage et des requêtes.
Exposer et requêter les données via SQL fédéré à l'aide de Trino / Starburst.
Participer à l'exploitation et au déploiement des services sur une infrastructure conteneurisée pilotée via Rancher, dans un environnement Cloud.
Mettre en œuvre des flux de streaming et de capture de changement de données (Kafka, Debezium) et orchestrer les traitements avec Airflow.
Rédiger la documentation technique et les documents de présentation de chaque contexte / domaine de données.
Contribuer aux bonnes pratiques d'ingénierie data (qualité, tests, standards de code, revue de code).Stack technique
Langages : Python, Scala
Traitement de données : Apache Spark
Stockage objet : MinIO
Base de données : PostgreSQL (partitionnement de tables)
Format de données : Parquet
Architecture : Data Mesh (Bronze / Silver / Gold)
Requêtage SQL fédéré : Trino
Orchestration de workflows : Apache Airflow
Streaming & CDC (Change Data Capture) : Kafka, Debezium
Conteneurisation / orchestration : Rancher (SUSE), Kubernetes
Cloud : environnement Cloud public, stockage objet compatible S3, gestion des identités et accès
CI/CD & Infrastructure as Code : GitLab CI, Terraform
Observabilité : Prometheus, Grafana, centralisation des logs
Gouvernance & catalogage des données : outils de data catalog
Versioning : Git
Documentation : rédaction de documents de présentation par contexte / domaineProfil recherché
Formation Bac+5 (école d'ingénieur, université) en informatique, data ou équivalent.
4 ans d'expérience minimum en tant que Data Engineer sur des environnements de production.
Maîtrise de Python et Scala, et bonne connaissance d'Apache Spark.
Expérience concrète des architectures Data Mesh (Bronze / Silver / Gold) et des lacs / entrepôts de données.
Connaissance de Trino pour le requêtage SQL fédéré.
Bonne maîtrise de PostgreSQL, notamment le partitionnement de tables.
À l'aise avec les environnements conteneurisés et orchestrés (Kubernetes, Rancher).
Bonnes capacités rédactionnelles pour la documentation technique.
Autonomie, rigueur, esprit d'équipe et capacité à s'intégrer rapidement chez le client.