Panorama stratégique des technologies du marché : Dictionnaire, Catalogue, Lineage, Data Quality, Observabilité, RAG, MCP & IA agentique
2026-03-01 · Pejman Gohari — CDO & CIO Advisory
Synthèse de l'étude. 7 briques analysées, 30+ solutions, 12 sources analystes.
Cette étude couvre l'écosystème complet de la gouvernance data, élargi aux briques émergentes liées a l'IA agentique. 30+ solutions ont ete analysées sur la base des rapports Gartner (MQ Metadata Management 2025, MQ D&A Governance 2025 et 2026), IDC MarketScape (AI Governance 2025-2026), G2 Winter 2026, Precedence Research, et des données publiques des éditeurs (pricing, fonctionnalités, roadmaps).
| Brique | Maturité | Solutions dominantes | Constat principal |
|---|---|---|---|
| Dictionnaire | 6/10 | Collibra, Atlan, DataGalaxy, Databricks Unity | Complétude moyenne autour de 30% dans les organisations. Evolution vers couche sémantique active (métadonnée active, +70% adoption d'ici 2027 selon Gartner). |
| Catalogue | 8.5/10 | Atlan, Collibra, Alation, DataGalaxy, Databricks Unity, Informatica | Brique la plus mature. Le critere différenciant en 2026 est la capacite a cataloguer les assets IA (modeles, agents, serveurs MCP). Les Cloud Provider Catalogs (Purview, Google) couvrent un périmètre mono-cloud limité. |
| Lineage | 7/10 | IBM MANTA, Atlan, Collibra, OpenLineage/Marquez, Datafold | Brique la plus sous-estimée et la plus difficile a maintenir. OpenLineage (LFAI) s'impose comme standard vendor-neutral. IBM MANTA reste la référence pour le parsing de code complexe. |
| Data Quality | 7.5/10 | Monte Carlo, Soda, Great Expectations, Bigeye, Elementary | Marche de $346M en 2024 (+20.8% YoY, Gartner). 53% des leaders data ont implemente l'observabilité (Gartner 2025). Convergence data quality et data observability. Metaplane racheté par Datadog (avr. 2025). |
| IA Agentique | 5/10 | Databricks Unity/Agent Bricks, Kore.ai, Salesforce Agentforce, LangChain/LangSmith | 62% des entreprises experimentent, 2/3 n'ont pas déployé a l'échelle (McKinsey). Les entreprises pratiquant la gouvernance IA mettent 12x plus de projets en production (Databricks 2026). 57% des données ne sont pas AI-ready (Deloitte 2026). |
| MCP | 4.5/10 | AAIF (Linux Foundation), MCP Manager, Kong, API gateways | 10 000+ serveurs publics. Standard transféré a l'AAIF (dec. 2025, 146 membres). Risques sécurité identifiés : prompt injection, supply chain, tool poisoning. Roadmap 2026 : auth, events, extensions. |
| RAG | 6.5/10 | Elastic, Contextual AI (RAG 2.0), Vectara, LangChain, Weaviate | Marche de $1.85Mds en 2025, projeté a $67.4Mds en 2034 (CAGR 49%, Precedence Research). 73% des implémentations en grandes organisations. |
Notation /10 par axe, pondérée : IA 25%, Gouvernance 20%, Lineage 15%, Observabilité 15%, Souveraineté 15%, UX 10%.
| # | Solution | Score | Forces | Faiblesses |
|---|---|---|---|---|
| 1 | Databricks Unity | 72.0 | IA 9/10, Lineage 9/10, Obs 8/10 | Souveraineté 4/10 |
| 2 | DataGalaxy | 69.0 | Souv 10/10, Gov 9/10, UX 8/10 | IA 4/10, Obs 5/10 |
| 3 | Atlan | 63.5 | UX 9/10 | Souv 4/10, Obs 6/10 |
| 4 | OpenMetadata | 59.0 | Equilibre, Souv 7/10 (OSS) | Gov 5/10, IA 5/10, UX 5/10 |
| 5 | Collibra | 57.5 | Gov 9/10 (700+ clients) | IA 3/10, Obs 5/10, UX 5/10 |
| 6 | Informatica (Salesforce) | 56.5 | Lineage 8/10 (200+ connecteurs) | IA 4/10, UX 4/10, Souv 5/10 |
Detail des justifications et méthodologie dans l'onglet Benchmark & Recommandations.
| Archétype | Solutions | Positionnement analyste | Déploiement |
|---|---|---|---|
| Enterprise | Collibra (700+ clients), Informatica/Salesforce ($8Mds, nov. 2025), IBM | Leaders Gartner MQ Metadata + D&A Gov. | 3-9 mois |
| Modern / Unifie | DataGalaxy (200+ clients, +200% YoY, acquisition YOOI fev. 2025) | Niche Player MQ D&A Gov. MQ Metadata G2 4.8/5 | Semaines-Mois |
| Lightweight | Atlan (Leader 2 MQ 2026). Secoda → Atlassian, Select Star → Snowflake, CastorDoc → Coalesce | Atlan : Leader Metadata + D&A Gov. 2026 | Semaines |
| Lakehouse / Data Platform | Databricks Unity Catalog (Business Semantics, lineage colonne auto, Iceberg interop), Snowflake Horizon Catalog (+ Select Star, + Observe) | Leader IDC MarketScape 2025-2026 | Natif Databricks |
| Cloud Provider | Microsoft Purview, Google Data Catalog | Natif cloud, inclus abonnement | Natif |
| Open Source | OpenMetadata, DataHub (Acryl Data), Amundsen | LFAI / Linux Foundation | Semaines (engineering) |
| Profil | Catalogue | Lineage | Quality / Observabilité |
|---|---|---|---|
| Grand compte régulé | Collibra / Informatica | IBM MANTA + OpenLineage | Monte Carlo |
| ETI / Scale-up | Atlan / DataGalaxy | Atlan + OpenLineage | Soda + Elementary |
| Lakehouse-native | Databricks Unity | OpenLineage + Datafold | Great Expectations |
| Souveraineté EU | DataGalaxy | DataGalaxy + OpenLineage | Soda (EU-hosted) |
| PME / Budget limité | Secoda (via Atlassian) / OpenMetadata | OpenLineage + Marquez | Soda Core + dbt tests |
| Maturité inégale | Le catalogue est a 8.5/10 de maturité marché, le MCP a 4.5/10. L'ecart cree un risque : les organisations deploient des agents sur des fondations de gouvernance incompletes. |
| Donnee multi-usage | Une meme donnee sert desormais 5 couches (reporting, analytics, ML, RAG, agentique). Chaque couche ajoute des exigences de qualite, fraicheur et sémantique. Sans catalogue comme point de vérité unique, chaque couche diverge silencieusement. |
| Commoditisation | Les outils standalone de data discovery perdent leur indépendance. En 12 mois, Secoda (→ Atlassian), Select Star (→ Snowflake), CastorDoc (→ Coalesce) et Data.world (→ ServiceNow) ont ete absorbés par des plateformes horizontales. Le risque n'est plus théorique : les LLM scannant nativement les schemas via MCP ou Iceberg REST API, la valeur ajoutee du "wrapper" de discovery migre vers l'interface de l'agent. Atlan reste le seul acteur lightweight indépendant de premier plan. |
| Consolidation accélérée | En 12 mois, les plateformes horizontales (Snowflake, Atlassian, ServiceNow, Salesforce, Coalesce) ont absorbé 6 acteurs du catalogue et de l'observabilité. Le « context layer » — dictionnaire + catalogue + tribal knowledge package pour les agents — est devenu un actif stratégique que chaque plateforme veut intégrér nativement plutot que laisser a un tiers. |
| Souveraineté | DataGalaxy (on-premise, self-hosted AI, multilingue) est le seul acteur europeen dans 2 Gartner MQ. La parité de performance entre modeles souverains (Mistral) et frontier (GPT-5, Claude Opus) reste un arbitrage ouvert. |
| Sécurité MCP | Le protocole MCP ouvre des surfaces d'attaque nouvelles : prompt injection, supply chain, tool poisoning, exfiltration de données. L'AAIF structure la gouvernance, mais les controles d'autorisation, DLP et registres prives restent a implementer par chaque organisation. |
L'écosystème de la gouvernance data connait une transformation profonde sous l'effet de l'IA agentique, du protocole MCP et de la convergence des outils.
| Brique | Fonction cle | Maturité marché | Impact IA agentique |
|---|---|---|---|
| Dictionnaire de données | Contrat sémantique : definir les termes metier | Critique ; un agent qui ingere une donnee mal definie raisonne sur une base sémantique fausse | |
| Catalogue de données | Inventaire des assets : tables, APIs, modeles, dashboards | Doit intégrér serveurs MCP, pipelines RAG, versions de modeles | |
| Lineage | Tracabilite des transformations de la source au KPI | Indispensable pour l'explicabilité des décisions agentiques | |
| Data Quality | Mesurer et garantir la fiabilite des données | L'IA amplifie exponentiellement les erreurs de qualite | |
| Observabilité data | Monitoring, detection d'anomalies, alerting proactif | 53% des leaders data ont deja implemente, 43% prevoient sous 18 mois | |
| RAG (Retrieval-Augmented Generation) | Contextualiser les LLM avec les données d'entreprise | Marche projeté a $67Mds en 2034 (CAGR 49%) | |
| MCP (Model Context Protocol) | Standard d'interconnexion agents IA ↔ outils/données | Gouverne par l'AAIF (Anthropic, OpenAI, Block) sous Linux Foundation |
Une meme donnee, "chiffre d'affaires net consolide", traverse aujourd'hui cinq couches d'usage simultanees. Chaque couche herite des exigences de la precedente et en ajoute de nouvelles. La gouvernance doit couvrir l'ensemble, sinon chaque couche diverge silencieusement des autres.
| Couche d'usage | Qualite requise | Fraicheur | Exigence sémantique | Consequence d'une erreur |
|---|---|---|---|---|
| Reporting reglementaire | Certifiee, auditee | Cloture (J+n) | Formelle (IFRS, Bale, Solvency) | Amende, sanction, perte de licence |
| Analytics operationnel | Fiable, coherente | Quotidienne | Contextualisee metier | Mauvaise décision humaine, visible dans un dashboard |
| ML / Scoring | Statistiquement stable | Batch ou streaming | Encodee, normalisee, sans biais | Drift du modele, biais, predictions erronees |
| RAG / GenAI | Complete, a jour | Quasi temps reel | Indexable, chunkable, desambiguisee | Hallucination contextuelle, reponse fausse mais plausible |
| IA Agentique | Toutes les precedentes | Temps reel | Interpretable par un LLM, sans ambiguite | Decision autonome fausse, non detectable car syntaxiquement correcte |
La derniere ligne est le point de bascule : l'agent herite de toutes les exigences des couches precedentes et en ajoute une nouvelle : l'interpretabilite machine. Un dictionnaire incomplet ne genait personne quand seuls les analystes SQL l'utilisaient. Quand un agent autonome le consomme, l'erreur se propage a la vitesse de l'inference.
Le contenu complet de cette étude est réservé. Il est servi par l'API sur présentation d'un code — il n'est pas inclus dans les pages publiques.