Taille et parts du marché des lacs de données

Analyse du marché des lacs de données par Mordor Intelligence
La taille du marché des lacs de données devrait passer de 18,68 milliards USD en 2025 à 22,8 milliards USD en 2026 et devrait atteindre 61,84 milliards USD d'ici 2031, à un TCAC de 22,08 % sur la période 2026-2031. Cette croissance est portée par l'explosion des volumes de données non structurées générées par les pipelines d'IA générative, l'élargissement des obligations réglementaires de conservation des enregistrements et le passage vers des architectures de type lakehouse qui fusionnent les empreintes des lacs et des entrepôts en un seul niveau. Les entreprises du Fortune 500 font état d'économies totales de 35 à 40 % sur le coût total de possession après l'adoption des lakehouses, tandis que les charges de travail ESG en temps réel et de simulation de stress sur les risques étendent les cas d'usage aux domaines industriel et financier. Les formats de tables ouvertes sans serveur ancrent désormais les stratégies de portabilité multi-cloud, et des couches de gouvernance automatisées émergent pour prévenir les écueils des « marécages de données » sans freiner l'innovation.
Points clés du rapport
- Par offre, les solutions ont représenté 69,35 % des revenus en 2025 ; les services devraient progresser à un TCAC de 24,77 % jusqu'en 2031.
- Par déploiement, le cloud a capté 64,20 % des parts du marché des lacs de données en 2025, tandis que le cloud hybride/multi-cloud devrait croître à un TCAC de 23,1 % entre 2026 et 2031.
- Par taille d'organisation, les grandes entreprises ont représenté 71,10 % de la taille du marché des lacs de données en 2025 ; les PME sont les plus dynamiques avec un TCAC de 26,1 % jusqu'en 2031.
- Par fonction métier, les opérations et la chaîne d'approvisionnement ont détenu 29,40 % des parts du marché des lacs de données en 2025, tandis que la finance et le risque progressent à un TCAC de 25,2 % jusqu'en 2031.
- Par secteur d'utilisation final, l'informatique et les télécommunications ont mené avec 21,60 % des revenus en 2025 ; la santé et les sciences de la vie devraient progresser à un TCAC de 25,6 % jusqu'en 2031.
- Par géographie, l'Amérique du Nord a dominé avec 37,40 % des parts en 2025, tandis que l'Asie devrait s'accélérer à un TCAC de 23,5 % jusqu'en 2031.
Remarque : Les chiffres de la taille du marché et des prévisions de ce rapport sont générés à l’aide du cadre d’estimation propriétaire de Mordor Intelligence, mis à jour avec les données et analyses les plus récentes disponibles en 2026.
Tendances et perspectives du marché mondial des lacs de données
Analyse de l'impact des moteurs*
| Moteur | (~) % d'impact sur les prévisions de TCAC | Pertinence géographique | Horizon temporel de l'impact |
|---|---|---|---|
| Explosion des données non structurées et multimodales issues des charges de travail d'IA générative | +7.5% | Mondial avec concentration en Amérique du Nord et en Europe occidentale | Moyen terme (2 à 4 ans) |
| Les obligations de résidence des données en Europe accélèrent l'adoption des lacs basés sur le cloud | +5.2% | Union européenne, Royaume-Uni, Suisse et APAC | Court terme (≤ 2 ans) |
| La convergence vers les lakehouses génère des économies de 35 à 40 % sur le coût total de possession pour les entreprises du Fortune 500 | +6.3% | Mondial avec adoption précoce en Amérique du Nord | Moyen terme (2 à 4 ans) |
| Les formats de tables sans serveur (Iceberg/Delta) permettent la portabilité multi-cloud | +4.8% | Mondial, plus fort là où les stratégies multi-cloud sont actives | Moyen terme (2 à 4 ans) |
| Exigences de capture de données ESG Scope 3 en temps réel dans le secteur industriel | +3.2% | Europe, Amérique du Nord, économies avancées de l'APAC | Long terme (≥ 4 ans) |
| Les tests de résistance réglementaires dans les services financiers exigeant la conservation de données tick sur une décennie | +2.9% | Centres financiers mondiaux (New York, Londres, Singapour, Hong Kong) | Moyen terme (2 à 4 ans) |
| Source: Mordor Intelligence | |||
Explosion des données non structurées et multimodales issues des charges de travail d'IA générative
Les applications d'IA générative créent d'immenses volumes d'images, d'audio et de texte qui nécessitent un stockage avec schéma à la lecture. Les entreprises s'attendent à ce que 30 % de la sphère mondiale de données de 175 zettaoctets nécessite un traitement en temps réel d'ici 2025, un profil inadapté aux entrepôts rigides. Les lacs de données deviennent ainsi la zone d'atterrissage par défaut pour les corpus multimodaux utilisés dans les boucles d'ingénierie de prompts.[1]Acceldata, "Lacs de données d'entreprise : révolutionner les données métier," acceldata.ioLe plan directeur lakehouse de Google Cloud montre comment le stockage en format natif associé à l'indexation vectorielle accélère l'affinage des modèles de fondation tout en réduisant les coûts de stockage. Les entreprises qui retardent l'adoption risquent des cycles d'innovation plus lents et des coûts unitaires plus élevés sur les charges de travail d'IA.
Les obligations de résidence des données en Europe accélèrent l'adoption des lacs basés sur le cloud
L'Acte sur la gouvernance des données et l'Acte sur les données de l'UE contraignent les organisations à localiser les charges de travail sensibles. Les hyperscalers réagissent : AWS investit 7,8 milliards EUR dans une région de cloud souverain dotée de contrôles intégrés de localisation des données.[2]Databricks, "Databricks accepte d'acquérir Tabular," databricks.com Les entreprises déploient désormais des lacs de données segmentés par région qui respectent les règles de résidence tout en restant interrogeables via des moteurs fédérés, stimulant la demande de catalogues de métadonnées riches en lignage capables de faire remonter les usages transfrontaliers des données dans les rapports d'audit.
La convergence vers les lakehouses génère des économies de 35 à 40 % sur le coût total de possession
Un lakehouse à niveau unique supprime la duplication qui affectait autrefois les lacs et entrepôts séparés. Les entreprises interrogées qui migrent leurs tâches analytiques vers des moteurs lakehouse font état d'une réduction de moitié des coûts de déplacement des données et d'économies de stockage grâce à la compression. Les gains de performance des planificateurs de requêtes vectoriels réduisent encore les durées d'exécution des calculs, libérant du budget pour l'expérimentation en IA. Quatre-vingt-un pour cent des entreprises entraînent désormais leurs modèles d'apprentissage automatique directement sur des tables lakehouse, ce qui indique que la convergence n'est plus une pratique marginale mais un modèle dominant.
Les formats de tables sans serveur permettent la portabilité multi-cloud
Apache Iceberg, Delta Lake et Hudi introduisent les transactions ACID, l'évolution de schéma et le voyage dans le temps pour les magasins d'objets. Ces formats découplent le calcul du stockage, permettant aux moteurs analytiques de clouds concurrents d'interroger les mêmes ensembles de données sans réplication. L'acquisition de Tabular par Databricks en 2024 souligne la valeur stratégique des métadonnées de tables ouvertes, tandis que la fonctionnalité Omni de Google BigLake interroge les partitions Iceberg dans des clouds concurrents, validant la thèse du format neutre.[3]Commission européenne, "Une stratégie européenne pour les données," digital-strategy.ec.europa.eu
Analyse de l'impact des freins*
| Frein | (~) % d'impact sur les prévisions de TCAC | Pertinence géographique | Horizon temporel de l'impact |
|---|---|---|---|
| Dérive des métadonnées créant des « marécages de données » | -3.8% | Mondial, plus aigu dans les déploiements hérités | Court terme (≤ 2 ans) |
| Pénurie de talents en ingénierie des lacs de données | -2.9% | APAC, Amérique latine, Moyen-Orient et Afrique | Moyen terme (2 à 4 ans) |
| Les cas d'usage sensibles à la latence préfèrent encore les entrepôts | -2.1% | Centres financiers et de télécommunications dans le monde entier | Court terme (≤ 2 ans) |
| Tarification cloud opaque basée sur la consommation | -1.7% | Entreprises du marché intermédiaire dans le monde entier | Moyen terme (2 à 4 ans) |
| Source: Mordor Intelligence | |||
Dérive des métadonnées créant des « marécages de données »
Lorsque l'ingestion dépasse les mises à jour du catalogue, les lacs de données se transforment en référentiels impossibles à rechercher. D'ici 2025, le volume mondial de données atteindra 163 zettaoctets, augmentant le risque de fichiers cloisonnés sans contexte. Les entreprises réagissent en adoptant des traceurs de lignage automatisés tels que Unity Catalog, qui enregistre chaque lecture-écriture et signale les ressources orphelines. Sans contrôles similaires, la charge de gouvernance peut effacer les économies projetées de la consolidation lakehouse.
Pénurie de talents en ingénierie des lacs dans les régions émergentes
Les entreprises de l'APAC et d'Amérique latine citent une pénurie d'ingénieurs maîtrisant les systèmes de fichiers distribués, les formats de tables ouvertes et l'optimisation des coûts cloud. Les données de POPsights montrent que la création de postes liés à l'IA dépasse l'offre de formation locale. Les recherches de l'OCDE mettent en évidence un fossé croissant entre zones urbaines et rurales dans l'accès aux compétences avancées en données.[4]OCDE, "Création d'emplois et développement économique local 2024," oecd.org Les services gérés et les pipelines à faible code atténuent les pénuries, mais la rareté des talents allonge encore les cycles de déploiement, ralentissant la pénétration du marché des lacs de données.
*Nos prévisions considèrent les impacts des moteurs et des contraintes comme directionnels et non additifs. Les prévisions d'impact reflètent la croissance de référence, les effets de composition et les interactions entre variables.
Analyse des segments
Par offre : les solutions dominent, les services progressent rapidement
Les solutions ont généré 69,35 % des revenus du marché des lacs de données en 2025, soit une taille de marché de 12,95 milliards USD. Cette domination provient des entreprises qui standardisent leurs moteurs de stockage, accélérateurs de requêtes et suites de gouvernance constituant l'épine dorsale des environnements prêts pour l'IA. Les fournisseurs regroupent des tableaux de bord d'optimisation des coûts, du tiering automatisé et un support natif des tables ouvertes, maintenant leur pertinence à mesure que les charges de travail évoluent.
Le sous-segment des services progresse rapidement à un TCAC de 24,77 % jusqu'en 2031, reflétant la demande de plans de migration, d'optimisation des performances et d'opérations gérées 24h/24 et 7j/7. De nombreuses entreprises manquent de personnel capable de migrer les parcs Hadoop hérités, et font donc appel à des spécialistes qui garantissent des résultats de niveau de service prévisibles. Le marché des talents tendu garantit que les réservations de services professionnels continueront de croître plus vite que le marché global des lacs de données.

Note: Les parts de chaque segment individuel sont disponibles à l'achat du rapport
Par déploiement : le cloud domine, le cloud hybride s'accélère
Les déploiements cloud ont capté 64,20 % des parts du marché des lacs de données en 2025, les organisations recherchant une évolutivité instantanée et une sécurité intégrée. Les magasins d'objets élastiques comme Amazon S3 éliminent les dépenses d'investissement tout en offrant une automatisation du cycle de vie qui transfère automatiquement les données froides vers des classes à faible coût. Les moteurs analytiques se lancent ensuite à la demande, alignant les dépenses de calcul sur le rythme des projets.
Les configurations hybrides et multi-cloud progressent à un TCAC de 23,1 % jusqu'en 2031. Les formats de tables ouvertes permettent à une seule définition de métadonnées de couvrir des compartiments sur site et dans le cloud public, réduisant considérablement les besoins de réplication. Les règles de conformité régionales alimentent davantage les stratégies hybrides, les entreprises ancrant les charges de travail réglementées dans des régions souveraines tout en les interrogeant via des structures multi-cloud. En conséquence, la taille du marché des lacs de données pour les environnements hybrides augmente en parallèle des lancements de clouds souverains.
Par taille d'organisation : les grandes entreprises dominent, les PME gagnent du terrain
Les grandes entreprises ont représenté 71,10 % de la taille du marché des lacs de données en 2025, soit environ 13,28 milliards USD. Leurs parcs complexes à l'échelle du pétaoctet nécessitent un contrôle d'accès basé sur les rôles avancé, un lignage automatisé et une gouvernance FinOps. Les banques, les fabricants et les opérateurs de télécommunications s'appuient sur les lakehouses pour consolider les silos et prendre en charge les applications d'IA en temps réel.
Les petites et moyennes entreprises enregistrent le TCAC le plus rapide à 26,1 % grâce aux plans gérés par les fournisseurs qui proposent désormais une facturation « à l'usage traité ». L'orchestration à faible code et les schémas basés sur des modèles raccourcissent les cycles de déploiement. Les éditions communautaires d'Iceberg et de Delta exposent des capacités de niveau entreprise sans frais de licence, permettant aux entreprises aux ressources limitées d'intégrer le marché principal des lacs de données.
Par fonction métier : les opérations stables, la finance et le risque en forte progression
Les charges de travail liées aux opérations et à la chaîne d'approvisionnement ont généré 29,40 % des dépenses de 2025, les fabricants combinant la télémétrie IoT, les données EDI fournisseurs et les flux logistiques pour la maintenance prédictive. La flexibilité du schéma à la lecture rend les lacs idéaux pour fusionner des fichiers de capteurs semi-structurés avec des tables ERP, prenant en charge des tableaux de bord de tour de contrôle qui réduisent le risque de temps d'arrêt.
Les applications de finance et de risque progressent à un TCAC de 25,2 %. Les régulateurs exigent désormais des historiques de données tick sur une décennie, et les lakehouses stockent ces volumes efficacement. La proposition de règle sur les coussins de fonds propres de la Réserve fédérale d'avril 2025 souligne la nécessité de modéliser les impacts sur les fonds propres dans des conditions de stress. Les banques qui centralisent les données de risque, de trésorerie et d'ESG dans un lac gouverné éliminent les délais de réconciliation, gagnant en agilité de reporting.

Note: Les parts de chaque segment individuel sont disponibles à l'achat du rapport
Par secteur d'utilisation final : l'informatique et les télécommunications en tête, la santé progresse
Les opérateurs informatiques et de télécommunications ont détenu 21,60 % des revenus de 2025. Les opérateurs ingèrent des enregistrements détaillés des appels, des KPI réseau et des transcriptions d'assistance dans des lacs, puis exécutent des analyses de détection de fraude et d'attrition qui améliorent la valeur à vie. Softteco note que Vodafone et AT&T utilisent des architectures de lacs pilotées par l'IA pour optimiser les tours et personnaliser les offres.
La santé et les sciences de la vie devraient progresser à un TCAC de 25,6 %. Les hôpitaux associent les dossiers de santé électroniques, l'imagerie et la génomique dans des référentiels unifiés qui alimentent les études de médecine de précision. Les déploiements de Microsoft Fabric illustrent comment des pipelines d'ingestion unifiés réduisent les temps de préparation des données, permettant des alertes cliniques en temps réel. Les entreprises pharmaceutiques exploitent des flux de travail de lacs reproductibles pour raccourcir les cycles de découverte, stimulant un investissement soutenu dans le marché des lacs de données.
Analyse géographique
L'Amérique du Nord a généré 37,40 % des revenus de 2025 et continue d'établir des références en matière de maturité architecturale. Les institutions financières allongent la rétention des séries temporelles pour répondre aux modèles de tests de résistance en évolution, tandis que les réseaux hospitaliers construisent des graphes de patients multimodaux qui sous-tendent les diagnostics pilotés par l'IA. Le capital-risque alimente également la formation de start-ups spécialisées dans la gouvernance, assurant un écosystème dynamique.
L'Asie-Pacifique est la région en expansion la plus rapide, enregistrant un TCAC de 23,5 % jusqu'en 2031. Les gouvernements du Japon, de l'Inde et de Singapour parrainent des projets de cloud souverain, stimulant la demande de zones de lacs conformes aux exigences régionales. Les opérateurs de télécommunications en Chine analysent d'immenses journaux 5G pour la planification des capacités, tandis que les fintechs indonésiennes partagent des lacs d'intelligence sur la fraude pour lutter contre la cybercriminalité. Les fournisseurs établissant des sièges sociaux en APAC, comme Wasabi au Japon, visent à profiter de la hausse projetée de 36 % de l'IaaS.
L'Europe accélère son adoption sous des mandats stricts de souveraineté des données. La Stratégie européenne pour les données stimule les investissements dans l'hébergement local, et AWS ouvrira une région dans le Brandebourg d'ici fin 2025 pour satisfaire les règles de résidence. Les fabricants stockent les émissions Scope 3 en temps réel pour le reporting CSRD, et les banques affinent leurs calculs Bâle III dans des lacs prêts pour l'audit. Les modèles de tests de résistance 2025 de l'Autorité bancaire européenne renforcent les exigences techniques que les lakehouses satisfont.

Paysage réglementaire
Les exigences réglementaires relatives à l'accès aux données, à leur localisation et à leur gouvernance se durcissent, ce qui influe sur la manière dont les entreprises conçoivent et exploitent leurs data lakes. Dans l'Union européenne, le Data Act (règlement (UE) 2023/2854) entre en application par étapes, avec une entrée en vigueur au 12 septembre 2025 et des échéances clés d'application à partir du 12 septembre 2026. Ce texte renforce les obligations en matière d'accès aux données et de portabilité, ce qui accroît la demande de métadonnées standardisées, de contrôles de partage auditables et d'architectures multi-environnements. Par ailleurs, l'AI Act de l'UE introduit des exigences explicites de gouvernance des données pour les systèmes d'IA à haut risque. L'article 10 fixe des exigences relatives à la qualité et à la gouvernance des données d'entraînement, de validation et de test, et les obligations complètes applicables aux systèmes à haut risque (y compris les articles 10 à 12) s'appliquent à partir du 2 août 2026, renforçant la priorité accordée à la traçabilité, à la provenance et à la documentation des jeux de données au sein des couches de gouvernance des lakehouses et des data lakes.
Les facteurs de conformité du secteur public et transfrontaliers relèvent également le niveau d'exigence de base en matière de sécurité et de gestion de l'information sur les plateformes de données à grande échelle. Aux États-Unis, les mémorandums de l'OMB M-25-04 (directives de l'exercice 2025 sur les exigences fédérales de sécurité de l'information et de gestion de la confidentialité au titre du FISMA) et M-25-05 (directives de mise en œuvre de la phase 2 du Foundations for Evidence-Based Policymaking Act de 2018 sur l'accès et la gestion des données ouvertes) renforcent les exigences en matière de traitement rigoureux des données, de contrôle d'accès et d'artefacts de gouvernance. Ces exigences correspondent étroitement aux modèles de catalogage, d'application des politiques et de stockage prêt pour l'audit utilisés dans les data lakes d'entreprise. Au Royaume-Uni, la politique gouvernementale de gestion des actifs de données publiée en mai 2026 exige que les départements identifient, enregistrent et déclarent de manière centralisée leurs actifs de données au Government Digital Service, ce qui accentue l'importance de la découvrabilité et des inventaires de données standardisés, favorisant les modèles opérationnels de catalogue et de lac d'entreprise.
Paysage concurrentiel
Le marché des lacs de données est modérément fragmenté. Les hyperscalers — AWS, Microsoft Azure, Google Cloud — dominent l'infrastructure, tirant parti de leurs régions mondiales et de leur gouvernance intégrée. Des plateformes spécialisées telles que Databricks et Snowflake se distinguent par leurs performances, leur intégration de notebooks et leur complétude en tant que lakehouses. Les communautés open source pilotent Iceberg, Delta et Hudi, offrant aux acheteurs des options de format qui desserrent l'emprise des fournisseurs.
Les acquisitions stratégiques reconfigurent les chaînes de valeur. Databricks a acquis Tabular en 2024 pour intégrer le lignage Iceberg dans les flux de travail Delta, signalant un pari sur les métadonnées universelles. Fivetran a racheté Census en 2025, unifiant l'ingestion et l'ETL inversé pour fermer la boucle d'activation. L'accord Clumio de Commvault en 2024 ajoute des instantanés de récupération après ransomware pour les lacs S3. Ces mouvements indiquent un avenir où des suites intégrées couvrent l'ingestion, la gouvernance, la protection et l'activation.
Malgré le poids des hyperscalers, les cinq premiers fournisseurs captent environ 55 % des dépenses totales, laissant de la place aux innovateurs spécialisés dans l'optimisation des coûts, l'accélération des requêtes multi-cloud et les plans de gouvernance spécifiques aux secteurs verticaux. L'observabilité de la qualité des données augmentée par l'IA et la gouvernance du cloud souverain sont deux espaces blancs émergents susceptibles d'attirer de nouveaux entrants.
Leaders du secteur des lacs de données
Microsoft Corporation
Amazon.com Inc.
Capgemini SE
Oracle Corporation
Teradata Corporation
- *Avis de non-responsabilité : les principaux acteurs sont triés sans ordre particulier

Opportunités de marché et perspectives d'avenir
La gouvernance imposée par la conformité et l'interopérabilité multiplateforme élargissent l'espace commercial disponible autour des data lakes au-delà du stockage et des requêtes, en particulier dans les contextes d'IA réglementée et de souveraineté des données. L'AI Act de l'UE introduit des obligations exécutoires de gouvernance des données pour les systèmes d'IA à haut risque à partir du 2 août 2026 (y compris l'article 10). Cela crée une demande pour des solutions permettant d'opérationnaliser la provenance des jeux de données, les processus d'évaluation des biais, la traçabilité et les contrôles sur la préparation et la documentation des données. En conséquence, les acheteurs se tournent vers des implémentations lakehouse et de tables ouvertes où les politiques de gouvernance, les catalogues et les autorisations granulaires peuvent être audités, et les fournisseurs et prestataires de services peuvent proposer des architectures de référence prêtes pour la gouvernance de l'IA, une publication contrôlée des produits de données et des opérations de conformité gérées.
L'exécution dans le secteur des télécommunications met également en évidence des voies d'investissement actives liées à des fondations de données unifiées pour des opérations pilotées par l'IA. En avril 2026, IBM a déployé un data lakehouse prêt pour l'IA utilisant IBM watsonx pour Tata Play Fiber afin de consolider des données fragmentées couvrant le client, le marketing, la finance et les opérations réseau. En juin 2026, Nokia et Databricks ont achevé une preuve de concept conjointe pour une plateforme de données unifiée et indépendante du substrat, destinée à soutenir des réseaux autonomes pilotés par l'IA. Ensemble, ces programmes soulignent des opportunités autour de la génération automatisée de produits de données, des superpositions de data fabric et de mesh, et des modèles de calcul au plus près des données qui réduisent le déplacement des données sensibles tout en améliorant leur réutilisation. À mesure que les formats de table ouverts tels qu'Apache Iceberg et Delta Lake deviennent des standards d'achat pour la portabilité, les fournisseurs peuvent se différencier par des fonctionnalités d'interopérabilité, une automatisation de la gouvernance évitant les dérives de type « data swamp », et une modernisation orientée services pour les environnements hybrides et multi-cloud où la résidence des données et le contrôle des coûts orientent les choix d'architecture.
Développements récents du secteur
- Juin 2026 : AWS a mis à jour Lake Formation pour permettre la lecture et l'écriture des fichiers de données Amazon S3 sous-jacents pour les tables enregistrées dans l'AWS Glue Data Catalog, alignant les autorisations entre les modèles d'accès SQL et basés sur les fichiers. Ce changement soutient les modèles opérationnels à moteurs mixtes où différents outils interagissent avec les mêmes tables du data lake, relevant le niveau requis en matière de gouvernance unifiée et réduisant les frictions dans les déploiements multi-outils de data lakes.
- Février 2026 : Microsoft a annoncé la disponibilité générale de l'interopérabilité entre OneLake et Snowflake, permettant le stockage natif des tables Apache Iceberg gérées par Snowflake dans OneLake. Cela renforce Iceberg comme couche de table neutre et aide les entreprises à réduire la duplication en conservant les données dans une fondation de stockage de lac partagée, tout en permettant à plusieurs plateformes analytiques d'y opérer.
- Mai 2025 : Fivetran a acquis Census, ajoutant des capacités de reverse-ETL qui activent les données dans les systèmes opérationnels. Cette opération relie l'ingestion et l'activation dans un cycle de vie des données plus complet, renforçant le rôle stratégique des environnements de data lake et de lakehouse comme source gouvernée alimentant les applications métiers en aval.
Cadre de la méthodologie de recherche et portée du rapport
Définition et périmètre du marché
Ce marché couvre les revenus générés par les logiciels de data lake et les services associés qui aident à stocker, organiser et analyser de grands volumes de données structurées et non structurées, dans des environnements cloud, sur site et hybrides.
Exclusions du périmètre : nous excluons les dépenses purement matérielles à usage général et l'externalisation informatique globale qui n'est pas directement liée à la mise en œuvre ou à l'exploitation d'un environnement de data lake.
Aperçu de la segmentation
- Par offre
- Solutions
- Découverte et catalogage des données
- Intégration des données et ETL/ELT
- Outils d'analyse et de visualisation
- Plateformes de gouvernance et de sécurité
- Services
- Services professionnels (conseil, intégration)
- Services gérés
- Solutions
- Par déploiement
- Cloud
- Cloud public
- Cloud privé
- Cloud hybride/multi-cloud
- Sur site
- Cloud
- Par taille d'organisation
- Grandes entreprises
- Petites et moyennes entreprises (PME)
- Par fonction métier
- Opérations et chaîne d'approvisionnement
- Finance et risque
- Ventes et marketing
- Ressources humaines
- Par secteur d'utilisation final
- Informatique et télécommunications
- BFSI
- Santé et sciences de la vie
- Commerce de détail et e-commerce
- Fabrication et industrie
- Médias et divertissement
- Gouvernement et secteur public
- Énergie et services publics
- Autres (éducation, hôtellerie)
- Par géographie
- Amérique du Nord
- États-Unis
- Canada
- Mexique
- Amérique du Sud
- Brésil
- Argentine
- Chili
- Pérou
- Reste de l'Amérique du Sud
- Europe
- Allemagne
- Royaume-Uni
- France
- Italie
- Espagne
- Reste de l'Europe
- Asie-Pacifique
- Chine
- Japon
- Inde
- Australie
- Nouvelle-Zélande
- Reste de l'Asie-Pacifique
- Moyen-Orient
- Émirats arabes unis
- Arabie saoudite
- Turquie
- Reste du Moyen-Orient
- Afrique
- Afrique du Sud
- Reste de l'Afrique
- Amérique du Nord
Sources de données, dimensionnement du marché et validation
Recherche documentaire
Le travail documentaire commence par la constitution d'une base factuelle simple autour de la croissance des données d'entreprise, de l'adoption du cloud et des besoins de gouvernance des données, car ces facteurs suivent étroitement les déploiements de data lakes dans les départements informatiques. Nous nous référons à des sources publiques telles que le US Bureau of Labor Statistics pour les signaux de dépenses informatiques, le US Census Bureau pour le nombre d'entreprises par secteur, et les indicateurs de l'OCDE et de la Banque mondiale pour les comparaisons de l'économie numérique entre régions.
Nous examinons également les indicateurs techniques et d'adoption issus de sources telles que les publications du NIST, les revues à comité de lecture sur les architectures de gestion des données, et les portails de marchés publics qui révèlent le langage des appels d'offres autour des plateformes analytiques et de la modernisation des données. Les rapports annuels des entreprises, les notes de conférences téléphoniques sur les résultats et les présentations aux investisseurs nous aident à comprendre le conditionnement des produits (logiciel versus services) et la manière dont les revenus liés au cloud et aux abonnements sont comptabilisés. Le cas échéant, nous utilisons des abonnements payants pour les données financières et d'intelligence économique des entreprises, les actualités et données financières, ainsi que des bases de données de brevets pour recouper les calendriers et la propriété des principales capacités des plateformes. Les sources listées ici sont illustratives, et de nombreuses autres références publiques ont été utilisées pour collecter, valider et clarifier les données.
Entretiens et enquêtes primaires
Les données primaires sont utilisées pour tester les hypothèses d'adoption et les fourchettes de prix avec des personnes qui achètent, déploient et exploitent des environnements de data lake, notamment des responsables informatiques, des managers d'ingénierie des données, des architectes cloud et des partenaires de services. Pour obtenir une vision mondiale, nous répartissons les entretiens sur les principales régions de demande, puis nous vérifions à nouveau tout écart important par des questions de suivi, afin que le modèle final reflète les déploiements types en entreprise.
Répartition des répondants de la recherche primaire sur le terrain
| Type d'entreprise | Poste du répondant | Région |
|---|---|---|
| Premier rang : 35 % | Directeurs (CXO) : 16 % | Asie-Pacifique : 43 % |
| Rang intermédiaire : 44 % | Responsables fonctionnels/d'unité : 25 % | EMEA : 37 % |
| Acteurs plus petits : 21 % | Managers : 59 % | Amériques : 20 % |
Dimensionnement et prévisions de marché
Le dimensionnement est construit selon une approche descendante, où les pools de dépenses en plateformes de données d'entreprise sont reconstitués par région, puis filtrés selon les taux d'adoption et de migration propres aux cas d'usage des data lakes. Nous corroborons les totaux par des vérifications ascendantes sélectives, telles que l'échantillonnage des valeurs contractuelles annuelles types, la validation du mix solution-services, et la vérification des volumes par des entretiens avec les canaux de distribution et les calendriers de mise en œuvre.
Les principales données d'entrée du modèle comprennent le mix de déploiement cloud versus sur site, la progression moyenne des prix d'abonnement et de support, les taux d'attachement des services pour la mise en œuvre et les opérations gérées, la croissance de la charge de travail liée aux projets analytiques, et les différences d'adoption sectorielle entre secteurs réglementés. Lorsqu'une donnée manque pour un pays ou un secteur vertical, nous combons les lacunes à l'aide d'indicateurs proxy tels que le nombre d'entreprises et la maturité cloud, puis nous ajustons le résultat après examen avec les répondants primaires. Les prévisions utilisent une analyse de scénarios appuyée par des tests de sensibilité de type régression sur les principaux moteurs (rythme de migration vers le cloud, croissance des données et modernisation induite par la conformité), et les hypothèses sont mises à jour lorsque les experts signalent un changement clair dans le comportement d'achat.
Validation des données et cycle de mise à jour
La validation s'effectue par des recoupements répétés entre le modèle et des signaux indépendants, tels que l'orientation des dépenses informatiques régionales, les indices de croissance des services cloud, et les évolutions des priorités de gestion des données d'entreprise. Les valeurs aberrantes sont signalées tôt, et les hypothèses qui les sous-tendent sont examinées par un autre analyste avant la finalisation des chiffres, ce qui aide à réduire les écarts évitables.
Le travail est actualisé annuellement, et des mises à jour intermédiaires sont déclenchées lorsque surviennent des événements significatifs tels que des changements de prix importants, des évolutions réglementaires majeures, ou un changement d'ampleur clair dans les modèles d'adoption du cloud. Avant la livraison, nous effectuons une dernière relecture pour garantir que les développements récents sont pris en compte, et tout écart important par rapport aux éditions précédentes est expliqué et retesté au moyen de nouveaux contacts rapides avec des experts.
Taille du marché des data lakes selon Mordor Intelligence comparée à d'autres estimations publiées
Les tailles de marché publiées pour les data lakes peuvent sembler très éloignées, même lorsqu'elles décrivent des besoins d'acheteurs similaires, car les choix de périmètre ne sont pas toujours cohérents et la logique de tarification n'est pas toujours expliquée. Des écarts apparaissent également lorsqu'une estimation se base sur une année de référence différente ou utilise une fenêtre de prévision plus longue, ce qui peut modifier ce qui est comptabilisé comme revenu actuel.
L'écart principal provient du fait que les catégories de gestion des données adjacentes sont ou non intégrées dans le total. Dans ce travail, Mordor Intelligence comptabilise les solutions de data lake et les services associés, mais évite d'y inclure les plateformes plus larges d'entreposage de données et d'analytique générale, sauf si elles sont vendues et déployées dans le cadre d'un environnement de data lake.
Comparaison de référence
| Source | Taille du marché | Lacunes de la méthodologie de recherche |
|---|---|---|
| Mordor Intelligence | 18,68 milliards USD (2025) | |
| Cabinet de conseil mondial A | 11,07 milliards USD (2025) | Utilise une captation de revenus plus restreinte pour l'année de référence, ce qui peut sous-estimer l'attachement des services et les déploiements hybrides qui alimentent encore des travaux de plateforme et d'intégration payants. |
| Éditeur sectoriel B | 10,70 milliards USD (2025) | Applique une répartition des composantes différente et s'appuie souvent sur une conversion en dollars américains plus conservatrice pour l'année de référence, ce qui peut réduire le total 2025 déclaré par rapport aux modèles qui normalisent la tarification et le mix de déploiement. |
En examinant le tableau, l'écart s'explique principalement par ce qui est comptabilisé dans le pool de dépenses relatif aux data lakes et par la manière dont les services et les cas d'usage hybrides sont traités dans l'année de référence. En maintenant les données d'entrée liées à des hypothèses claires d'adoption, de mix de déploiement et de tarification, nous pouvons expliquer chaque étape et revérifier les totaux lorsque de nouveaux signaux de marché apparaissent, sans devoir reconstruire le modèle depuis le début.
Questions clés auxquelles le rapport répond
Pourquoi les entreprises migrent-elles des entrepôts vers les lakehouses ?
Les lakehouses réduisent le coût total de possession analytique de 35 à 40 % et prennent en charge l'entraînement de modèles d'IA sur des données brutes tout en préservant les garanties de performance ACID.
Quelle est la taille du marché des lacs de données en 2026 ?
Le marché des lacs de données est évalué à 22,8 milliards USD en 2026 et devrait atteindre 61,84 milliards USD d'ici 2031.
Quelle région connaît la croissance la plus rapide en matière d'adoption des lacs de données ?
L'Asie-Pacifique est en tête avec un TCAC projeté de 23,5 % entre 2026 et 2031, portée par une transformation numérique rapide et des investissements dans les clouds souverains.
Quel est le principal défi empêchant les lacs de données de délivrer de la valeur ?
La dérive des métadonnées peut transformer les lacs en « marécages de données », incitant à investir dans des catalogues automatisés et le suivi du lignage pour maintenir la confiance.
Comment les formats de tables ouvertes affectent-ils la dépendance aux fournisseurs ?
Des formats tels qu'Apache Iceberg et Delta Lake permettent la portabilité multi-cloud en découplant le stockage des moteurs de calcul, permettant aux équipes d'interroger les mêmes données sur différents clouds.
Quel secteur vertical devrait connaître la croissance la plus rapide ?
La santé et les sciences de la vie devraient progresser à un TCAC de 25,6 % jusqu'en 2031, exploitant les lacs de données pour la médecine de précision et l'analyse des patients en temps réel.
Dernière mise à jour de la page le:



