Julian Barone's home page

E-mail étudiant : barone@et.esiea.fr

E-mail personnel : contact@jbarone.dev

Étudiant ingénieur en cybersécurité à l'ESIEA.

Accueil / Mon Stage technique à l'ASNR

Mon Stage technique à l'ASNR

Stage technique centré sur l'intégration de données historiques de Tchernobyl dans la base SYRACUSE. Le travail combine analyse métier, compréhension de modèles de données, conception ETL, contrôles de cohérence et automatisation d'exécution.

Les informations présentées ici suffisent à expliquer le périmètre technique du stage sans entrer dans un niveau de détail inutile sur les données elles-mêmes.


Contexte

Le sujet portait sur la reprise et l'intégration de données historiques issues du contexte post-Tchernobyl. Ces données devaient être analysées, rapprochées des modèles existants, préparées, puis injectées dans une base cible utilisée pour la consultation et l'exploitation métier.

La difficulté principale venait du caractère historique et hétérogène des sources : structures différentes, référentiels à harmoniser, champs à traduire, règles de gestion à comprendre et écarts à documenter.


Missions réalisées

  • Conception d'un pipeline ETL sous Talend pour intégrer les données historiques de Tchernobyl dans la base SYRACUSE.
  • Analyse des modèles de données, mapping des tables, création de tables de traduction et alimentation de la base cible.
  • Automatisation de l'exécution du pipeline avec Rundeck afin de rendre les traitements rejouables et plus simples à exploiter.
  • Exploration des données historiques pour identifier leur structure, leurs règles de gestion, les référentiels associés et les transformations nécessaires.

Pipeline ETL

Le pipeline Talend assurait la lecture des sources, la normalisation des champs, l'application des règles de transformation, la correspondance avec les référentiels et le chargement vers SYRACUSE.

Étapes principales du traitement
Analyse des sourcesCompréhension des fichiers d'entrée, des champs disponibles, des formats et des écarts de structure.
MappingCorrespondance entre les données historiques et les tables de la base cible.
Tables de traductionCréation de tables intermédiaires pour harmoniser les valeurs et les référentiels.
AlimentationChargement contrôlé dans SYRACUSE avec vérification des transformations attendues.
AutomatisationExécution orchestrée avec Rundeck pour faciliter la relance et l'exploitation.

Analyse métier et données

Une partie importante du stage a consisté à comprendre le sens des données avant de les transformer. Le travail ne se limitait pas à déplacer des colonnes : il fallait identifier les règles de gestion, repérer les valeurs de référence, comprendre les exceptions et vérifier que le modèle cible pouvait représenter correctement les informations importées.

  • Étude des structures existantes et des dépendances entre tables.
  • Identification des référentiels nécessaires à l'intégration.
  • Repérage des transformations obligatoires avant chargement.
  • Documentation des choix de mapping et des limites rencontrées.

Contrôles et exploitabilité

Le pipeline devait rester compréhensible et vérifiable. Les traitements ont donc été pensés pour faciliter les contrôles de cohérence, la reprise d'une exécution et l'explication des transformations appliquées.

Le point clé du stage : transformer une base historique hétérogène en flux d'intégration exploitable, traçable et rejouable.


Travaux exploratoires possibles

Des pistes complémentaires ont aussi été étudiées autour du rapprochement et de l'enrichissement de données : comparaison de pipelines de matching, mesure de complétude, similarité, vectorisation, clustering et résolution géographique via des référentiels INSEE avec validation par Nominatim/OpenStreetMap.

Ces éléments restent secondaires par rapport au cœur du stage, qui portait d'abord sur l'intégration ETL, le mapping et l'alimentation de SYRACUSE.