Ingénieur Data Senior Spark (H/F)
À propos de cette offre
DGTL / Signe + est le facilitateur pour tous les acteurs qui recherchent des ressources ou des missions DATA.
Spécialiste du marché Data et BI, nous intervenons dans toute la France comme à l'étranger ; en sous-traitance, pré-embauche, recrutement, portage commercial, portage salarial, etc.
Depuis 2018, nous accompagnons nos clients avec proximité, juste prix et préoccupation éthique de tous les instants.
https://www.dgtl-performance.com
Le poste :
Vous rejoindrez un grand groupe du secteur audiovisuel et médias pour concevoir et développer le MVP d'une plateforme Data On-Premise innovante. Ce projet stratégique vise à moderniser l'infrastructure data existante en intégrant une stack Open Source performante (Kafka, NiFi, Spark, Iceberg, Trino) et à faciliter la transition vers le traitement temps réel tout en validant l'interopérabilité avec les services cloud publics.
Au sein de la Direction IT Transverse, vous piloterez l'architecture et la mise en œuvre d'une plateforme data scalable et robuste, intégrée au socle technique existant (Kubernetes, GitLab CI, Prometheus/OpenTelemetry). Vous travaillerez en collaboration étroite avec les équipes métiers et techniques du groupe pour transformer des flux ETL existants, démontrer la faisabilité de migration depuis les systèmes actuels, et établir les bonnes pratiques de la nouvelle plateforme.
Ce rôle combine architecture data, ingénierie de plateforme et mentorat technique dans un environnement moderne et exigeant, avec un fort impact sur la modernisation de l'écosystème data du groupe.
Responsabilités :
- Architecturer une plateforme Data On-Premise scalable, robuste et intégrée à l'infrastructure existante (Kubernetes, GitLab CI, Prometheus/OpenTelemetry)
- Sélectionner, configurer et déployer les composants Open Source clés : Apache Kafka (streaming), Apache NiFi (ingestion et orchestration), Apache Spark (traitement distribué), Apache Iceberg (gestion de tables analytiques) et Trino (requêtage SQL distribué)
- Implémenter des cas d'usage concrets en transformant des flux ETL existants et en mettant en place des pipelines de données en streaming (Kafka + Spark Structured Streaming)
- Alimenter et optimiser un datalake On-Premise basé sur Iceberg, avec requêtage via Trino
- Valider l'interopérabilité et les patterns d'intégration avec les services Big Data en environnement cloud public (GCP)
- Collaborer avec l'équipe Data et IA pour aligner les besoins métiers et techniques, et avec les équipes DevOps/Infrastructure pour l'intégration du socle
- Documenter les choix architecturaux, les décisions techniques et établir les bonnes pratiques de la plateforme
- Former et accompagner les équipes internes sur les nouveaux outils, processus et méthodologies
Télétravail : 2/3 jours par semaine
Localisation : Paris / Rennes
Profil recherché :
Indispensables :
- Plus de 5 ans d'expérience en ingénierie data et architecture de plateforme
- Expertise approfondie d'Apache Spark et de Spark Structured Streaming pour le traitement distribué en batch et temps réel
- Maîtrise de l'écosystème Big Data Open Source : Kafka, NiFi, Iceberg, Trino
- Expérience confirmée en architecture et déploiement d'infrastructures data On-Premise et cloud
- Connaissances solides de Kubernetes, des pipelines CI/CD (GitLab CI ou équivalent) et des outils de monitoring (Prometheus, OpenTelemetry)
- Capacité à concevoir des solutions scalables, performantes et maintenables dans des environnements complexes
- Excellentes compétences en communication technique et capacité à documenter et transmettre les connaissances
- Rigueur, autonomie et pragmatisme dans la résolution de problèmes techniques
Fortement appréciés :
- Expérience antérieure avec Apache NiFi pour l'orchestration et l'ingestion de flux de données
- Familiarité avec les tables analytiques (Apache Iceberg, Delta Lake ou Apache Hudi)
- Expérience en migration et refactorisation de flux ETL existants vers des architectures modernes
- Connaissance des architectures hybrides (On-Premise + Cloud Public) et des patterns d'intégration associés
- Expérience avec la gestion des données en streaming et les architectures événementielles (event-driven)
- Certifications ou projets antérieurs en architecture cloud (GCP, AWS ou Azure)
- Expérience dans un secteur médias, audiovisuel ou télécommunications
Repère marché
Explorer les offres liées
Offres similaires
Voir toutes les offres similairesBusiness Analyst PBI Salesforce (H/F)
Ingénieur IA - Agentic Automation (H/F)
Data Engineer Databricks Senior (H/F)
Data Manager Gouvernance Data (H/F)
Architecte Solution Databricks Senior (H/F)
Architecte Solutions Data Senior GCP (H/F)
Questions fréquentes
Quel salaire puis-je attendre ?
Cette annonce n’indique pas de salaire. Des postes similaires à Paris tournent souvent autour de 42 350 € (médiane sur 83 offres).
Comment postuler ?
Ouvrez la page source d’origine et contactez l’employeur. Finder ne facture jamais les candidats.
Ces offres sont-elles à jour ?
Oui. Finder actualise régulièrement les offres des sources publiques et retire les annonces clôturées.
Où voir le type de contrat et le mode de travail ?
Les conditions clés sont affichées au-dessus de la description. Vous pouvez aussi ouvrir les listes liées pour DGTL Performance et Paris.