Composants ETL
La palette de l'éditeur de pipelines regroupe quatre familles de composants (les « bricks ») :
| Famille | Composants | Rôle |
|---|---|---|
| Extract | 17 | Lire les données et démarrer un flux |
| Transform | 70, dont 10 méga-bricks | Transformer, filtrer, combiner les flux |
| Load | 17 | Écrire les données vers une destination |
| Orchestration | 18 | Déclencher et enchaîner des pipelines (workflows) |
Ces totaux comptent le catalogue complet, y compris les bricks legacy conservées pour compatibilité mais masquées de la palette (voir l'encadré ci-dessous) ; la palette n'affiche que les bricks unifiées et méga-bricks.
L'identité d'un composant est son attribut name, affiché en français
dans la palette (ex. Source fichier, Écriture base de données). La recherche
de la palette couvre les noms et leurs synonymes (français et anglais).
La palette, organisée par famille. Glissez un composant sur le canvas pour
l'ajouter au pipeline.
La plupart des transformations sont des méga-bricks : un seul composant qui enchaîne plusieurs opérations dans l'ordre de votre choix (ex. la brick Chaînes de caractères fait trim, casse, regex, split, concat…). Cela remplace les dizaines de bricks atomiques d'autrefois par une poignée de composants riches.
Les pipelines créés avec les anciennes bricks atomiques (Rename Column, Trim Strings, CSV Import…) continuent de fonctionner : elles sont automatiquement converties vers les méga-bricks et bricks unifiées équivalentes au chargement. Ces bricks legacy restent dans le catalogue (elles comptent dans les totaux ci-dessus) mais sont masquées de la palette.
Sources (Extract)
Les sources lisent les données et démarrent un flux.
| Composant | Description |
|---|---|
| Source fichier | Lit des fichiers depuis une connexion storage. Format (CSV / JSON / Excel / Parquet / XML / PDF / brut) choisi sur la brick. |
| Lister fichiers | Énumère les fichiers d'une connexion storage sans lire leur contenu : une ligne par fichier. |
| Source base de données | Lit depuis n'importe quelle base (PostgreSQL, MySQL, SQL Server, Oracle, SQLite, Snowflake…), table entière ou requête SQL. |
| REST API | Appelle une API REST en mode autonome ou en enrichissement par ligne. |
| Code Python (source) | Génère un flux avec du code Python (pandas). |
| Import Mémoire | Relit une donnée stockée plus tôt par un Export Mémoire. |
Transformations
Le cœur de la palette : les méga-bricks (chaînables) et quelques transformations spécialisées.
Méga-bricks
| Composant | Opérations enchaînables |
|---|---|
| Colonnes | renommer, supprimer, convertir le type, réordonner, ajouter une colonne calculée, coalesce, remplir les null, hash |
| Lignes | filtrer, trier, échantillonner, dédoublonner, limiter |
| Chaînes de caractères | trim, casse, regex replace, accents, split, concat, base64, url, format |
| Dates | parser, formater, extraire (year/month…), différence entre 2 colonnes |
| Valeurs | remplacer des valeurs, mapper via dictionnaire |
| JSON | aplatir, parser, sérialiser |
| Agrégations | group by + agrégats, pivot, unpivot, window functions |
| Qualité | valider (regex / range / not-null / in-set), match |
| Combinaisons | union (empilement) ou lookup (enrichissement clé/valeur) |
Transformations spécialisées
| Composant | Description |
|---|---|
| Correspondance | Mappage de champs façon Talend (expressions, types de sortie). |
| Exécuter SQL | Exécute du SQL sur une connexion base, placeholders alimentés par les lignes. |
| Code Python | Transforme le flux avec du code Python (pandas). |
| Pour chaque ligne | Traite les lignes une par une, plusieurs en parallèle, chacune dans son propre processus. |
| From XML | Extrait des champs d'une colonne XML via XPath (Factur-X, réponses d'API stockées). |
| Générer avec l'IA | Interroge un modèle sans données en entrée et produit ses réponses en lignes. |
| Appel IA | Océrise un document, interroge un modèle sur du texte, ou extrait des champs directement d'un document. Indépendant du fournisseur. |
| Aperçu | Affiche un aperçu des lignes dans les logs (debug). |
La brick legacy Structure (réorganisation de colonnes) est masquée de la palette : ses opérations sont couvertes par la méga-brick Colonnes, voir Bricks héritées.
Contrôle de flux
| Composant | Description |
|---|---|
| Jointure | Jointure SQL multi-tables (inner / left / right / full / cross). |
| Route | Aiguille les lignes vers plusieurs sorties selon des conditions. |
| Contrôle de schéma | Sépare les lignes conformes au schéma déclaré de celles qui ne le sont pas, motif à l'appui. |
| Comparaison | Compare deux datasets (ajouts / suppressions / modifications). |
| Combinaisons | Union ou lookup de deux entrées (voir méga-bricks). |
Actions
Composants pass-through (1→1) : le DataFrame ressort inchangé, l'action est un effet de bord. Voir la page Actions.
| Composant | Description |
|---|---|
| Assertion | Vérifie des assertions, plante le pipeline si violées. |
| Instantané | Sauvegarde l'état courant du DataFrame (debug / replay). |
| Alerte | Envoie une alerte conditionnelle sans interrompre le flux. |
| Étiqueter l'exécution | Pose un label sur l'exécution (visible en monitoring). |
Destinations (Load)
| Composant | Description |
|---|---|
| Écriture fichier | Écrit des fichiers vers une connexion storage (format choisi sur la brick). |
| Écriture base de données | Écrit dans n'importe quelle base (append / replace / upsert). |
| Export API | Envoie les données vers une API REST (par lot ou par ligne). |
| Notification | Mail / Slack / Webhook à chaque exécution, template Markdown. |
| Code Python (sortie) | Consomme le flux avec du code Python (export libre). |
| Export Mémoire | Stocke en mémoire pour réutilisation par un Import Mémoire. |
Orchestration
Composants de workflow (type ORCH), pour déclencher et enchaîner des
pipelines. Voir Orchestration et le
détail par sous-famille :
Déclencheurs,
Contrôle de flux,
Actions.
Utilisation
- Glissez un composant depuis la palette vers le canvas (ou cherchez-le par nom ou synonyme).
- Connectez les ports d'entrée / sortie entre composants.
- Configurez les paramètres dans le panneau de droite.
- Exécutez le pipeline (voir Exécuter un pipeline).
Ports de connexion
| Port | Position | Description |
|---|---|---|
| Entrée | Gauche | Reçoit les données |
| Sortie | Droite | Envoie les données traitées |
| Sorties dynamiques | Droite | Certaines bricks (Route, REST API, Export API) créent des sorties nommées selon leur configuration |