Aller au contenu principal

Créer un pipeline

Ce guide montre comment construire un pipeline ETL dans l'éditeur visuel de Fluhoms. L'édition se fait toujours dans une copie de travail (Studio) ; voir Studio : copies de travail.

Vue d'ensemble de l'éditeur​

L'éditeur occupe tout l'écran, avec un fil d'Ariane pour revenir au projet.

L'éditeur de pipeline Le canvas, le panneau de réglages d'une brick et le panneau d'exécution.

Zones de l'interface​

ZoneDescription
Palette de bricksListe catégorisée des bricks disponibles (Sources, Transformations, Destinations, Contrôle, Actions)
CanvasEspace de travail pour construire le flux (graphe orienté)
Panneau de réglagesConfiguration de la brick sélectionnée (voir Configurer les bricks)
Panneau d'exécutionTiroir en bas de l'écran : logs, timeline, données, historique des runs
Barre d'outilsOnglets Pipeline / Réglages / Versions, état de validation du DAG, indicateur d'autosave, Ajouter brick, Exécuter

Un bandeau de métriques rappelle la dernière exécution, la durée moyenne et le nombre de runs sur 30 jours.

Étape 1 : ouvrir l'éditeur dans une copie de travail​

  1. Depuis un projet société, cliquez sur Travailler dessus (checkout), ou ouvrez une copie existante depuis le Studio ;
  2. Dans l'onglet Pipelines de la copie, cliquez sur Nouveau pipeline ou ouvrez un pipeline existant.

Un pipeline ouvert depuis un projet société s'affiche en lecture seule (bandeau « Projet société · lecture seule ») : le bouton Checkout pour éditer crée la copie de travail nécessaire.

Étape 2 : ajouter des bricks​

Cliquez sur Ajouter brick (ou sur le bouton + d'un port de sortie) pour ouvrir la palette.

La palette de bricks La palette, organisée par catégorie, avec recherche et bricks récentes.

Les catégories​

  • Sources : lecture des données, avec Source fichier (CSV, JSON, Excel, Parquet, XML… depuis n'importe quelle connexion de stockage), Source base de données (PostgreSQL, MySQL, Snowflake, SQL Server, Oracle, SQLite, BigQuery, Redshift, Databricks), REST API, Import Mémoire, Code Python (source) ;
  • Transformations : les méga-bricks (une brick regroupe une famille d'opérations que l'on chaîne à l'intérieur) : Colonnes, Chaînes de caractères, Dates, Lignes, Valeurs, Agrégations, Combinaisons, JSON, Qualité, Structure… plus Exécuter SQL et Code Python ;
  • Destinations : écriture, avec Écriture fichier, Écriture base de données, Export API, Export Mémoire, Notification, Code Python (sortie) ;
  • Contrôle : le routage du flux, avec Jointure, Union, Route, Comparaison, Match ;
  • Actions : observabilité en pass-through, avec Assertion, Alerte, Instantané, Aperçu, Étiqueter l'exécution.
Méga-bricks

Plutôt que d'empiler dix bricks atomiques (renommer, puis caster, puis trier…), ouvrez une méga-brick (Colonnes, Lignes…) et chaînez les opérations à l'intérieur, dans l'ordre voulu. Le pipeline reste lisible.

Sous-pipelines​

Le bouton Sous-pipeline crée un conteneur nommé dans le canvas : un groupe de bricks que l'on peut réduire, désactiver ou exécuter isolément.

Étape 3 : connecter les bricks​

  1. Survolez le port de sortie d'une brick (à droite) ;
  2. Cliquez-glissez vers le port d'entrée de la brick cible (à gauche) ;
  3. Relâchez pour créer le lien.

Certaines bricks ont plusieurs entrées (Jointure, Union, Combinaisons) ou plusieurs sorties (Route, Filtre : flux retenu / flux exclu).

Étape 4 : configurer les bricks​

Cliquez sur une brick pour ouvrir son panneau de réglages (onglets Connexion, Entrée, Configuration, Sortie, Tests). Le détail est couvert dans Configurer les bricks.

Rendez les configurations dynamiques avec les variables du projet, par exemple ${var.env.DB_URL} ; voir Utiliser les variables.

Étape 5 : valider​

Il n'y a pas de bouton Valider : l'éditeur valide le DAG en continu. La barre d'outils affiche un badge :

  • DAG valide : rien à signaler ;
  • N problèmes / N avertissements : cliquez sur le badge pour la liste (brick isolée, entrée obligatoire non connectée, paramètre requis manquant, cycle dans le graphe…).

Tant qu'il reste des problèmes bloquants, le bouton Exécuter est désactivé.

Étape 6 : sauvegarde et versions​

L'éditeur sauvegarde automatiquement : le badge Sauvegardé / Sauvegarde… de la barre d'outils reflète l'état : il n'y a pas de bouton Sauvegarder ni de raccourci à retenir.

  • L'onglet Versions de l'éditeur ouvre le comparateur de versions : deux panneaux synchronisés (vue Affichage ou Code), liste des différences et restauration d'une version antérieure ;
  • pour figer une version (commit) et la proposer au projet société, passez par l'onglet Versions de la copie de travail (voir Studio : copies de travail).

Étape 7 : exécuter​

Cliquez sur Exécuter : en Studio, le pipeline part sur votre runner personnel (résolu automatiquement, ou verrouillé par la politique du projet) et le panneau d'exécution se déplie (Logs, Timeline, Data, Historique). Le détail (y compris l'exécution sur un environnement) est couvert dans Exécuter un pipeline.

Exemple complet : import CSV vers base de données​

[Source fichier] ──→ [Lignes] ──→ [Colonnes] ──→ [Écriture base de données]
│ │ │ │
│ │ │ └─ table clients (upsert)
│ │ └─ renommer, caster
│ └─ filtrer status = 'active', dédupliquer
└─ connexion storage + format CSV
  1. Source fichier : connexion de stockage, format CSV, fichier clients.csv ;
  2. Lignes : opération filtrer (status = active), puis dédupliquer sur email ;
  3. Colonnes : opérations renommer (first_name → prenom) et caster ;
  4. Écriture base de données : connexion PostgreSQL, table clients, mode upsert sur la clé email.

Bonnes pratiques​

  • Nommer explicitement les bricks (le nom apparaît dans les logs et la timeline) ;
  • utiliser des variables plutôt que des valeurs en dur : leurs valeurs changent par environnement ;
  • tester sur son runner personnel en Studio avant de pousser, puis déployer sur un environnement ;
  • committer régulièrement avec des messages clairs (onglet Versions de la copie de travail).

Prochaines étapes​