Saagie
Payant
La plateforme DataOps française pour industrialiser et gouverner ses pipelines de données.
Avant de pouvoir analyser ou exploiter des données, il faut les rassembler : les extraire de dizaines de sources (applications, bases, fichiers, API), les transformer dans un format cohérent et les charger là où elles seront utilisées. C'est le rôle de l'intégration de données, socle technique de tout projet analytique ou IA. Cette sous-catégorie couvre les outils d'ETL et d'ELT, la transformation, l'orchestration de pipelines et les entrepôts de données qui stockent et interrogent ces données à grande échelle.
Le vocabulaire a évolué avec les usages. L'ETL classique extrait, transforme puis charge les données ; l'ELT moderne les charge d'abord dans un entrepôt cloud avant de les transformer sur place, une approche popularisée par des outils comme Fivetran pour l'ingestion et dbt pour la transformation. Autour, des orchestrateurs comme Kestra planifient et surveillent les pipelines, tandis que les entrepôts de données comme Snowflake, BigQuery ou Redshift fournissent la puissance de stockage et de calcul.
C'est, de tout le domaine data, l'un des terrains les moins fournis en solutions souveraines françaises. Le champion historique, Talend, est français d'origine mais est passé sous contrôle américain via son rachat par Qlik, lui-même détenu par le fonds Thoma Bravo, et sa solution Stitch suit le même sort. Les grands entrepôts et la plupart des outils d'ingestion sont édités aux États-Unis et soumis au Cloud Act, ce qui, pour des données centralisées en masse, n'est pas neutre. L'angle souverain repose donc surtout sur deux leviers : quelques éditeurs français comme Kestra (orchestration open source) et Saagie (DataOps), et surtout la richesse de l'open source. Airbyte, dbt, ClickHouse ou Meltano peuvent être auto-hébergés sur un cloud souverain français, ce qui permet de construire une chaîne d'intégration complète sans dépendre d'un fournisseur étranger. Côté européen, le tchèque CloverDX et le danois Weld complètent le tableau.
Le choix dépend de l'architecture et des compétences : une suite managée pour aller vite, une stack open source auto-hébergée pour maximiser le contrôle et la souveraineté, ou une combinaison des deux. SaaSTeaser indique pour chaque fiche l'éditeur, le pays d'hébergement et le badge de souveraineté, avec une vigilance particulière sur un domaine où la donnée transite et se concentre, et où les solutions réellement souveraines passent le plus souvent par l'open source auto-hébergé.
1 logiciel affiché
L'ETL extrait, transforme puis charge les données, tandis que l'ELT les charge d'abord dans un entrepôt cloud avant de les transformer sur place. L'ELT, plus récent, s'appuie sur la puissance des entrepôts modernes.
Talend, français d'origine, est désormais sous contrôle américain. Côté souverain, on s'oriente vers des éditeurs français comme Kestra (orchestration) ou Saagie (DataOps), et surtout vers des outils open source comme Airbyte, dbt ou Meltano, auto-hébergeables sur cloud souverain.
Oui, en s'appuyant sur des outils open source comme Airbyte pour l'ingestion, dbt pour la transformation, Kestra ou Meltano pour l'orchestration et ClickHouse comme entrepôt, tous auto-hébergeables sur un cloud souverain français, on garde les données sous contrôle de bout en bout.
C'est une base de données conçue pour stocker et interroger de grands volumes de données à des fins d'analyse. Snowflake, Google BigQuery et Amazon Redshift en sont les références cloud, ClickHouse en étant une alternative open source.
Snowflake, BigQuery ou Redshift proposent des régions européennes, mais leurs éditeurs américains restent soumis au Cloud Act. Pour un contrôle total, un entrepôt open source comme ClickHouse auto-hébergé sur cloud souverain est plus adapté.