Taille et part du marché des modèles de langage de petite taille (SLMs)
Analyse du marché des modèles de langage de petite taille (SLMs) par Mordor Intelligence
La taille du marché des modèles de langage de petite taille (SLMs) devrait s'étendre de 1,05 milliard USD en 2025 et 1,37 milliard USD en 2026 à 4,84 milliards USD d'ici 2031, enregistrant un CAGR de 28,71 % de 2026 à 2031. Le marché se développe à mesure que les entreprises orientent leurs dépenses en intelligence artificielle vers des modèles spécifiques à des tâches pouvant fonctionner en périphérie, sur site ou dans des environnements de cloud privé, permettant un meilleur contrôle des coûts et des performances. La hausse des coûts d'inférence pour les API de grands modèles, le renforcement des règles de traitement des données dans les grandes économies et l'amélioration des performances des unités de traitement neuronal poussent les acheteurs vers des architectures plus faciles à déployer à grande échelle. Le marché des modèles de langage de petite taille bénéficie également de changements plus larges dans le comportement d'achat des entreprises, où les organisations préfèrent désormais une infrastructure de modèles durable et des piles de déploiement reproductibles plutôt que des expériences ponctuelles avec des systèmes à usage général. La concurrence s'éloigne d'une simple course à l'échelle pour se diriger vers la flexibilité des licences, l'optimisation matérielle et une intégration plus profonde en entreprise, qui sont les facteurs façonnant l'adoption en production. La pression sur les prix exercée par les publications de modèles à poids ouverts et le regroupement par les grands fournisseurs de cloud est susceptible d'intensifier la consolidation, tout en laissant de la place aux fournisseurs capables d'assurer un déploiement efficace, un support et une adaptation au domaine sur l'ensemble du marché des modèles de langage de petite taille.
Principaux enseignements du rapport
- Par offre, les frameworks ont représenté 68,45 % de la part des revenus sur le marché des modèles de langage de petite taille (SLMs) en 2025, tandis que les services devraient se développer à un CAGR de 26,34 % jusqu'en 2031.
- Par mode de déploiement, le cloud a représenté 57,38 % de la part des revenus sur le marché des modèles de langage de petite taille (SLMs) en 2025, tandis que les appareils en périphérie devraient se développer à un CAGR de 28,98 % jusqu'en 2031.
- Par application, l'IA conversationnelle a représenté 34,26 % de la part des revenus sur le marché des modèles de langage de petite taille (SLMs) en 2025, tandis que la recherche sémantique et la récupération d'informations devraient se développer à un CAGR de 27,65 % jusqu'en 2031.
- Par utilisateur final, les fournisseurs de technologie et de logiciels ont représenté 27,84 % de la part des revenus sur le marché des modèles de langage de petite taille (SLMs) en 2025, tandis que la santé et les sciences de la vie devraient se développer à un CAGR de 28,12 % jusqu'en 2031.
- Par géographie, l'Amérique du Nord a capturé 37,89 % de la part des revenus sur le marché des modèles de langage de petite taille (SLMs) en 2025, tandis que l'Asie-Pacifique devrait se développer à un CAGR de 29,76 % jusqu'en 2031.
Note : La taille du marché et les prévisions figurant dans ce rapport sont générées à l'aide du cadre d'estimation exclusif de Mordor Intelligence, mis à jour avec les dernières données et informations disponibles en janvier 2026.
Tendances et perspectives mondiales du marché des modèles de langage de petite taille (SLMs)
Analyse de l'impact des moteurs*
| Moteur | Impact (~) % sur les prévisions de CAGR | Pertinence géographique | Calendrier d'impact |
|---|---|---|---|
| Demande croissante d'IA sur appareil à faible latence | +6.2% | Mondial, avec une dynamique concentrée en Amérique du Nord, en Asie-Pacifique et en Europe occidentale | Court terme (≤ 2 ans) |
| Pression sur les coûts par rapport à l'économie d'inférence des modèles de pointe | +5.8% | Mondial, plus aigu en Amérique du Nord et en Europe où les dépenses en IA cloud sont les plus élevées | Court terme (≤ 2 ans) |
| Confidentialité des données, résidence des données et exigences d'IA souveraine | +4.5% | Union européenne, Moyen-Orient, Inde et Corée du Sud | Moyen terme (2-4 ans) |
| Cas d'usage d'automatisation d'entreprise optimisés pour la périphérie | +4.0% | Corridor industriel Asie-Pacifique et industrie manufacturière en Amérique du Nord | Moyen terme (2-4 ans) |
| Écosystèmes de modèles open source et cycles de fine-tuning rapides | +3.2% | Mondial, avec des écosystèmes de développeurs denses en Amérique du Nord, en Europe et en Asie-Pacifique | Moyen terme (2-4 ans) |
| Gains d'efficacité matérielle dans les NPU, GPU et accélérateurs d'IA | +2.8% | Mondial, avec la plus forte concentration dans les pôles de fabrication d'Asie-Pacifique | Long terme (≥ 4 ans) |
| Source: Mordor Intelligence | |||
Demande croissante d'IA sur appareil à faible latence
L'inférence à faible latence est passée d'une préférence technique à une exigence commerciale sur l'ensemble du marché des modèles de langage de petite taille. Les entreprises s'attendent désormais à ce que les fonctions d'IA offrent des temps de réponse plus rapides, une consommation d'énergie réduite et moins de dépendances réseau lorsqu'elles sont intégrées dans des logiciels et des appareils. Microsoft a rendu Phi-4-mini-reasoning disponible sur les PC Copilot+ équipés de Snapdragon en mai 2025, démontrant que les charges de travail de raisonnement pouvaient s'exécuter avec un déchargement NPU plutôt que de reposer sur une exécution gourmande en CPU.[1]Microsoft Azure Blog, "Une année de Phi, les modèles de langage de petite taille font de grands bonds en IA," Microsoft Azure Blog, MICROSOFT.COM Apple a également publié un modèle de fondation sur appareil lors de la WWDC 2025 qui a réduit l'utilisation de la mémoire cache KV de 37,5 % tout en maintenant des performances multilingues dans 15 langues, renforçant la praticité de l'inférence entièrement hors ligne.[2]Apple, "Mises à jour des modèles de langage de fondation sur appareil et serveur d'Apple," Apple Machine Learning Research, APPLE.COM Google a étendu cette direction en avril 2026 avec Gemma 4 sur Google Cloud, qui prenait en charge plus de 140 langues et comprenait des variantes orientées vers la périphérie conçues pour le déploiement mobile et sur appareil.[3]Google Cloud Team, "Présentation de Gemma 4 sur Google Cloud, nos modèles ouverts les plus performants à ce jour," Google Cloud Blog, GOOGLE.COM En conséquence, le marché des modèles de langage de petite taille est tiré vers l'avant par des catégories matérielles et logicielles qui considèrent désormais la capacité d'IA locale comme une fonctionnalité de base plutôt qu'une amélioration optionnelle.
Pression sur les coûts par rapport à l'économie d'inférence des modèles de pointe
Le coût d'inférence est devenu l'un des moteurs d'adoption les plus clairs sur le marché des modèles de langage de petite taille, car il modifie la façon dont les entreprises comparent les architectures de production. Les acheteurs ne choisissent plus les modèles uniquement sur la base des benchmarks de capacité, car les coûts récurrents des API peuvent rapidement dépasser tout avantage de performance dans les flux de travail à volume élevé. Le marché des modèles de langage de petite taille gagne donc du terrain non seulement parce que les modèles compacts sont moins chers aujourd'hui, mais aussi parce que leur économie pousse même les fournisseurs de modèles de pointe à publier des alternatives plus petites et plus efficaces.
Confidentialité des données, résidence des données et exigences d'IA souveraine
Les règles de traitement des données façonnent les décisions de déploiement plus tôt dans le cycle d'achat sur l'ensemble du marché des modèles de langage de petite taille. La conformité réglementaire n'est plus un filtre secondaire, car de nombreuses organisations ont désormais besoin d'une architecture qui répond déjà aux exigences locales de stockage, d'audit et de divulgation avant de sélectionner un fournisseur. Les obligations de transparence de la loi européenne sur l'IA en vertu de l'article 50 devaient entrer en vigueur le 2 août 2026, et elles exigent que les systèmes d'IA qui interagissent avec des individus divulguent leur nature d'IA et étiquettent le contenu généré par l'IA sous forme lisible par machine.[4]Francesca Blythe et Eleanor Dodding, "Obligations de transparence de la loi européenne sur l'IA, préparation à la conformité d'ici le 2 août 2026," Sidley Data Matters, SIDLEY.COM Le même cadre prévoit des pénalités pouvant atteindre 15 millions EUR (16,93 millions USD) ou 3 % du chiffre d'affaires mondial en cas de non-conformité, en utilisant le taux de change annuel moyen IRS 2025 pour la conversion en euros, car les taux moyens annuels 2026 n'étaient pas encore disponibles. Ces règles favorisent les déploiements sur site et étroitement gouvernés, où les entreprises peuvent contrôler les flux de données et la documentation de manière plus directe. Le marché des modèles de langage de petite taille bénéficie donc du soutien des programmes d'IA souveraine et des secteurs sensibles à la confidentialité qui ont besoin de modèles de déploiement compacts, auditables et spécifiques à une région.
Cas d'usage d'automatisation d'entreprise optimisés pour la périphérie
L'automatisation industrielle fournit au marché des modèles de langage de petite taille une source stable de demande pratique. De nombreux flux de travail en usine, en logistique et sur le terrain génèrent des tâches d'inférence étroites et répétitives qui ne nécessitent pas un modèle de pointe, mais qui exigent une faible latence et un formatage de sortie fiable. Mitsubishi Electric a annoncé en juin 2025 qu'il avait développé un modèle de langage axé sur la fabrication pour le déploiement sur appareils en périphérie en utilisant sa technologie d'IA Maisart, avec un objectif d'application produit dans les équipements industriels et les robots au cours de l'exercice 2026. Le ministère de l'Industrie et des Technologies de l'Information de Chine a publié son plan d'action spécialisé « IA + Fabrication » en janvier 2026, ciblant 1 000 agents d'IA industriels de haut niveau et 100 ensembles de données industriels de haute qualité, créant ainsi un cadre politique clair pour le déploiement industriel local. Cathay Financial Holdings a également montré en juin 2026 que des modèles compacts open source affinés pour la classification des intentions des clients pouvaient remplacer les appels d'API cloud dans des flux de travail financiers structurés, ce qui reflétait la même poussée vers l'inférence locale et une gouvernance plus stricte dans un contexte opérationnel différent. À mesure que ces flux de travail d'entreprise étroits se développent, le marché des modèles de langage de petite taille bénéficie d'un cycle d'amélioration des modèles dans lequel chaque interaction déployée peut devenir des données d'entraînement pour un fine-tuning ultérieur.
Analyse de l'impact des contraintes*
| Contrainte | Impact (~) % sur les prévisions de CAGR | Pertinence géographique | Calendrier d'impact |
|---|---|---|---|
| Profondeur de contexte limitée par rapport aux modèles de fondation plus grands | -2.8% | Mondial, plus contraignant en Amérique du Nord et en Europe où les cas d'usage complexes en entreprise sont concentrés | Court terme (≤ 2 ans) |
| Fragmentation des benchmarks et faible comparabilité entre modèles | -1.5% | Mondial | Moyen terme (2-4 ans) |
| Complexité d'intégration dans les piles d'entreprise héritées | -1.2% | Amérique du Nord et Europe, où l'infrastructure ERP et middleware héritée est la plus ancrée | Moyen terme (2-4 ans) |
| Contraintes de la chaîne d'approvisionnement matérielle et sensibilité aux coûts des accélérateurs | -0.9% | Asie-Pacifique pour la fabrication et l'approvisionnement, et Amérique du Nord pour les achats de matériel d'entreprise | Long terme (≥ 4 ans) |
| Source: Mordor Intelligence | |||
Profondeur de contexte limitée par rapport aux modèles de fondation plus grands
La profondeur de contexte reste la limite technique la plus claire quant à la portée du marché des modèles de langage de petite taille dans les tâches analytiques complexes. De nombreux modèles compacts fonctionnent bien dans des flux de travail délimités, mais la révision de longs documents, la mémoire étendue des agents et le raisonnement en couches exposent encore l'écart avec les systèmes plus grands. Apple a déclaré que son modèle de fondation sur appareil prend en charge une fenêtre de contexte de 4 000 tokens, tandis que son chemin Private Cloud Compute prend en charge 32 000 tokens, soulignant le compromis entre le déploiement axé sur la confidentialité et une capacité contextuelle plus large. Mistral a comblé une partie de cet écart en juillet 2026 avec Magistral Small 2507, qui prenait en charge une fenêtre de contexte de 128 000 tokens sous une licence Apache 2.0 tout en restant déployable sur site. Même avec ces progrès, le marché des modèles de langage de petite taille est toujours confronté à un compromis de conception entre l'efficacité en périphérie et la mémoire contextuelle plus large nécessaire pour les cas d'usage d'entreprise les plus exigeants.
Fragmentation des benchmarks et faible comparabilité entre modèles
Le marché des modèles de langage de petite taille est également confronté à des frictions parce que les acheteurs manquent encore de normes d'évaluation claires et comparables. Les équipes d'approvisionnement ont souvent besoin de preuves reflétant les conditions réelles de déploiement, mais les résultats des benchmarks restent fragmentés entre les tâches, les configurations matérielles et les choix d'environnement d'exécution. Une revue systématique publiée par Springer Nature en juin 2026 a identifié l'absence de benchmarks standardisés et l'absence de mesure de puissance isolée par NPU comme des lacunes majeures dans l'évaluation de l'efficacité du matériel d'IA. La même revue a indiqué que l'optimisation de la pile logicielle seule peut créer une différence d'efficacité de 15 % à 30 % même lorsque le matériel reste le même. Cette variabilité rend plus difficile pour les secteurs réglementés de justifier les choix de fournisseurs avec des preuves internes reproductibles. Elle favorise également les grands fournisseurs sur le marché des modèles de langage de petite taille, car ils sont mieux positionnés pour financer la validation indépendante, les environnements d'exécution optimisés et une documentation de déploiement plus large.
*Nos prévisions considèrent les impacts des moteurs et des contraintes comme directionnels et non additifs. Les prévisions d'impact reflètent la croissance de référence, les effets de composition et les interactions entre variables.
Analyse des segments
Par offre : les frameworks ancrent la pile, les services élargissent la base de revenus
Les frameworks ont capturé 68,45 % des revenus en 2025, les plaçant au centre du marché des modèles de langage de petite taille pendant une période où les entreprises standardisaient encore leur approche de déploiement. Cette position reflétait le besoin d'environnements d'exécution d'inférence, de couches d'orchestration, de pipelines de fine-tuning et de backends optimisés pour le matériel avant qu'une application métier puisse passer en production. Les entreprises ont généralement traité cette couche comme un choix d'infrastructure à long terme, car une fois qu'un framework est intégré dans les flux de travail internes, il tend à prendre en charge de nombreuses versions de modèles ultérieures. Le marché des modèles de langage de petite taille a donc montré des dépenses initiales plus importantes sur la plomberie de modèles réutilisables que sur des solutions ponctuelles étroites. Ce schéma suggérait également que les acheteurs construisaient des environnements capables d'héberger des modèles propriétaires et à poids ouverts successifs plutôt que de s'engager sur un algorithme fixe unique.
Les optimisations Phi basées sur ONNX de Microsoft pour les NPU équipés de Snapdragon, disponibles à partir de mai 2025, et le framework Core AI d'Apple introduit lors de la WWDC26 ont tous deux montré comment les fournisseurs de plateformes cherchent à contrôler le chemin du modèle au matériel, de la compilation à la gestion de l'environnement d'exécution. Cette stratégie est importante car les publications de modèles à poids ouverts réduisent la valeur de rareté de l'accès aux frameworks de base sur l'ensemble du marché des modèles de langage de petite taille. Mistral Small 3 en janvier 2025 et Mistral Small 4 en mars 2026 ont tous deux été publiés sous la licence Apache 2.0, ce qui a accru la pression sur les fournisseurs qui s'appuient uniquement sur la différenciation de frameworks propriétaires. Les services devraient croître à un CAGR de 26,34 % jusqu'en 2031, et ce changement indique une couche de monétisation ultérieure où les entreprises souhaitent un fine-tuning géré, une adaptation au domaine et une surveillance une fois la pile de base en place. En ce sens, le secteur des modèles de langage de petite taille passe de la sélection de frameworks au support opérationnel, où la profondeur des services devient une source de revenus plus durable que l'accès au framework lui-même.
Par mode de déploiement : le cloud domine aujourd'hui, les appareils en périphérie façonnent la prochaine phase
Le cloud a représenté 57,38 % des revenus en 2025, lui conférant la plus grande part du marché des modèles de langage de petite taille au début de l'adoption par les entreprises. De nombreuses organisations ont choisi le cloud en premier lieu parce qu'il réduisait les engagements matériels initiaux, s'intégrait aux systèmes d'identité existants et permettait des tests basés sur l'utilisation avant que des décisions d'infrastructure plus importantes ne soient prises. Cette domination initiale ne signifiait pas que le cloud était la réponse à long terme pour chaque charge de travail, car les secteurs réglementés avaient encore besoin d'un contrôle plus strict sur l'endroit où les données circulaient et sur la façon dont l'inférence était gérée. Les déploiements sur site ont continué à servir les utilisateurs de la santé, du BFSI et d'autres secteurs à forte gouvernance qui ne pouvaient pas facilement acheminer des tâches sensibles via des environnements cloud tiers. Le marché des modèles de langage de petite taille a donc maintenu une structure de déploiement multi-voies, chaque mode correspondant à une combinaison différente de coût, de vitesse et de besoins de conformité.
Les appareils en périphérie devraient se développer à un CAGR de 28,98 % jusqu'en 2031, ce qui en fait le mode de déploiement à la croissance la plus rapide sur le marché des modèles de langage de petite taille. Cette croissance reflète davantage une traction matérielle qu'une offre logicielle, car les entreprises considèrent désormais l'inférence locale comme une option de production pratique plutôt qu'un exercice de laboratoire. Les publications Phi de Microsoft pour les PC Copilot+ équipés de Snapdragon et les outils de développement d'Apple autour de l'inférence sur appareil ont tous deux contribué à faire de l'exécution locale compacte un chemin plus standardisé. Springer Nature a rapporté en juin 2026 que les NPU peuvent offrir une efficacité énergétique 40 à 60 fois supérieure à celle des GPU pour l'inférence en périphérie dans leur plage de fonctionnement, modifiant ainsi l'économie du déploiement d'IA distribué. Le plan d'action « IA + Fabrication avancée 2026-2027 » de Shenzhen a également soutenu l'élagage, la quantification et la distillation pour le déploiement en ligne de production, indiquant que la politique publique renforçait la demande côté appareil sur le marché des modèles de langage de petite taille.
Par application : l'IA conversationnelle maintient sa part, les cas d'usage de récupération gagnent du terrain
L'IA conversationnelle a capturé 34,26 % des revenus en 2025, lui conférant la plus grande part de marché parmi les segments d'application sur le marché des modèles de langage de petite taille. Cette avance reflétait la force pratique des interactions étroites et auditables où la latence est visible, les sorties peuvent être vérifiées et le retour sur investissement est plus facile à mesurer. Le support client, les fonctions de service d'assistance interne et les interfaces de langage d'entreprise avaient déjà constitué une base de demande avant que la vague actuelle de modèles compacts ne s'accélère. Le marché des modèles de langage de petite taille a bénéficié de cette demande installée parce que les acheteurs pouvaient remplacer les anciennes architectures de chatbot par des systèmes plus performants sans repenser le cas métier. Cela a fait de l'IA conversationnelle le point d'entrée à court terme le plus clair pour les organisations souhaitant déployer en production sans prendre le risque complet de flux de travail génératifs ouverts.
La recherche sémantique et la récupération d'informations devraient se développer à un CAGR de 27,65 % jusqu'en 2031, soulignant comment le marché des modèles de langage de petite taille s'enfonce davantage dans l'accès aux connaissances et les flux de travail riches en documents. Les entreprises souhaitent de plus en plus une recherche contextuelle dans les référentiels, les politiques, les contrats et les bases de connaissances internes, car les tâches qui récompensent la cohérence et les performances à faible latence l'emportent sur la production créative large. Cathay Financial Holdings a présenté des résultats de production en juin 2026 montrant que des modèles compacts open source affinés pour la classification des intentions des clients pouvaient remplacer les appels d'API cloud dans des flux de travail structurés, ce qui soutient le cas du déploiement spécifique au domaine dans des environnements riches en informations. La traduction, la localisation, l'extraction de données, l'analyse de documents et la surveillance des sentiments se développent également, même lorsque la portée du flux de travail est étroite et que le formatage des sorties doit rester prévisible. Le secteur des modèles de langage de petite taille voit donc la demande d'applications se déplacer vers des systèmes capables de transformer le contenu d'entreprise en actions en aval reproductibles, et pas seulement en texte semblable à celui d'un humain.
Note: Parts de segment de tous les segments individuels disponibles à l'achat du rapport
Par utilisateur final : les fournisseurs de technologie en tête, la santé prend de l'élan
Les fournisseurs de technologie et de logiciels ont représenté 27,84 % des revenus en 2025, leur conférant la plus grande part de marché parmi les groupes d'utilisateurs finaux sur le marché des modèles de langage de petite taille. Leur rôle de premier plan découlait d'un double rôle : ils développent à la fois des piles de modèles et les consomment dans des produits logiciels plus larges. Ces entreprises absorbent généralement les frameworks plus tôt, s'intègrent plus rapidement et testent davantage d'options de déploiement que les autres secteurs, ce qui les maintient en avance lors de la formation initiale du marché. Le marché des modèles de langage de petite taille s'aligne également sur leur stratégie produit, car les modèles compacts peuvent être intégrés dans des offres de logiciels en tant que service sans la même charge d'inférence récurrente que les API de pointe. Cela fait de ce groupe à la fois le plus grand acheteur direct et un canal indirect par lequel les modèles compacts atteignent les utilisateurs d'entreprise.
La santé et les sciences de la vie devraient se développer à un CAGR de 28,12 % jusqu'en 2031, ce qui en fait le segment d'utilisateurs finaux à la croissance la plus rapide sur le marché des modèles de langage de petite taille. La croissance est soutenue par l'automatisation des flux de travail cliniques, de solides exigences en matière de confidentialité et la valeur du fine-tuning sur des données biomédicales organisées. La famille Sara d'Innovaccer, construite sur les familles de modèles Gemma 3 et Gemma 4 de Google, couvrait 12 tâches de flux de travail cliniques et démontrait des temps de réponse sur site inférieurs à 500 millisecondes au début de 2026. Au sein du marché des modèles de langage de petite taille, cette combinaison d'adéquation à la conformité et d'ajustement au domaine aide la santé à combler l'écart avec les fournisseurs de technologie plus rapidement que les autres groupes d'utilisateurs finaux.
Analyse géographique
L'Amérique du Nord a représenté 37,89 % des revenus mondiaux en 2025, ce qui en fait la plus grande région sur le marché des modèles de langage de petite taille. L'avance de la région reposait sur la concentration d'entreprises adoptant précocement, une infrastructure cloud mature et la présence de grandes entreprises de plateformes telles que Microsoft, Google LLC, Amazon Web Services et Apple. Elle est également restée le centre le plus clair pour la consolidation des frameworks, car les entreprises réglementées avaient tendance à réduire leurs achats autour d'un plus petit nombre de plateformes validées en production. Les orientations du secteur financier de New York en 2026 sur le risque de cybersécurité lié à l'IA ont renforcé ce schéma en soulignant la nécessité de déploiements auditables et gouvernés localement dans des environnements sensibles à la conformité. En conséquence, le marché des modèles de langage de petite taille en Amérique du Nord a continué à faire face à une forte demande dans un contexte d'examen plus strict de l'architecture de déploiement par les entreprises.
L'Asie-Pacifique devrait se développer à un CAGR de 29,76 % jusqu'en 2031, ce qui en fait le marché régional à la croissance la plus rapide pour les modèles de langage de petite taille. La croissance est portée par la demande d'IA en périphérie dans le secteur manufacturier au Japon et en Corée du Sud, un écosystème de modèles domestiques très actif en Chine et une demande de déploiement sensible aux coûts en Inde. Mitsubishi Electric a annoncé un modèle de langage axé sur la fabrication pour le déploiement en périphérie en juin 2025, et la société visait une application produit dans les équipements industriels et les robots au cours de l'exercice 2026. Tokyo Electron Device a lancé son programme de support « Try it! SLM on Edge » en juin 2026 pour aider les fabricants à évaluer et à industrialiser des modèles compacts dans des environnements en périphérie. Ces développements ont montré que le marché des modèles de langage de petite taille en Asie-Pacifique passait de l'expérimentation à l'intégration en production, notamment dans les environnements industriels où l'inférence locale s'aligne sur les besoins opérationnels.
L'Europe est restée le troisième marché régional, et son schéma d'adoption était défini par des choix de déploiement axés sur la réglementation sur le marché des modèles de langage de petite taille. Les obligations de transparence de la loi européenne sur l'IA en vertu de l'article 50 devaient s'appliquer à partir du 2 août 2026, ce qui a accru l'importance de la divulgation, de l'étiquetage et de la documentation dans les systèmes d'IA en contact avec les clients. L'Allemagne et le Royaume-Uni ont mené les achats d'entreprise dans la région, tandis que les pays nordiques gagnaient en pertinence en tant que centres de conception pour les architectures d'IA souveraine. L'Amérique du Sud était encore dans une phase de croissance précoce avec les services bancaires, le commerce électronique et la localisation des médias soutenant l'adoption initiale, tandis que les marchés du Moyen-Orient et certaines parties de l'Afrique se développaient autour de l'infrastructure d'IA souveraine et de la demande de services en langue locale.
Paysage concurrentiel
Le marché des modèles de langage de petite taille est resté modérément fragmenté car la concurrence s'étendait aux développeurs de modèles, aux fournisseurs de frameworks et aux spécialistes des services gérés plutôt que d'être concentrée chez un seul fournisseur dominant. Microsoft, Google LLC, Meta Platforms et Apple ont ancré la couche de frameworks grâce à des familles de modèles telles que Phi, Gemma, Llama et Apple Foundation Models. Leur concurrence n'était plus définie uniquement par l'échelle des paramètres, car les acheteurs d'entreprise accordaient une attention plus grande à la posture de licence, à l'efficacité de l'environnement d'exécution et à la compatibilité avec l'infrastructure existante. Ce changement favorisait les fournisseurs capables de connecter les publications de modèles avec des outils de déploiement réels, des contrôles de sécurité et un support matériel. Le marché des modèles de langage de petite taille a donc continué à récompenser les fournisseurs qui combinaient performance technique et environnement opérationnel prêt pour la production.
La stratégie de licence est devenue l'un des outils concurrentiels les plus visibles sur le marché des modèles de langage de petite taille. Mistral AI a publié Mistral Small 3 en janvier 2025 sous Apache 2.0, suivi de Mistral Small 4 en mars 2026 sous la même licence, démontrant un effort délibéré pour utiliser l'accès open source comme voie d'acquisition de clients. Cette approche a déplacé la monétisation vers le support d'entreprise, le déploiement privé et les services de fine-tuning plutôt que de facturer l'accès au modèle de base seul. NVIDIA a également approfondi son rôle en 2026 avec TensorRT Edge-LLM pour Jetson et DRIVE AGX Thor, offrant aux entreprises un moyen d'optimiser l'inférence compilée avec prise en charge des précisions FP16, INT8 et INT4. En parallèle, Apple a étendu son chemin de framework sur appareil lors de la WWDC26, tandis que Microsoft a continué à aligner les publications Phi avec l'optimisation ONNX et Snapdragon, démontrant comment le contrôle au niveau de la plateforme devenait un différenciateur clé.
Des fournisseurs spécialisés tels que Cohere Inc., Liquid AI et AI21 Labs ont continué à se démarquer en se concentrant sur la qualité de l'intégration en entreprise, les sorties gouvernées et la pertinence du domaine plutôt que sur l'échelle brute des modèles. Les opportunités d'espace blanc restaient les plus fortes dans les applications verticales telles que l'automatisation des flux de travail cliniques, le diagnostic des pannes industrielles et la révision de documents juridiques, où les modèles à usage général peinent souvent avec les exigences de sortie structurée. L'accent mis par Cohere sur la récupération d'entreprise et l'ancrage des citations illustrait comment les fonctionnalités de gouvernance peuvent soutenir le positionnement dans les cycles d'approvisionnement réglementés. Sur l'ensemble du marché des modèles de langage de petite taille, l'équilibre concurrentiel devrait rester large tant que les publications de modèles à poids ouverts, la diversité matérielle et les besoins de déploiement spécifiques à l'industrie continueront de limiter la concentration totale sur un petit nombre de fournisseurs.
Leaders du secteur des modèles de langage de petite taille (SLMs)
-
Microsoft Corporation
-
Google LLC
-
Meta Platforms, Inc.
-
Nomic AI, Inc.
-
NVIDIA Corporation
- *Avis de non-responsabilité : les principaux acteurs sont triés sans ordre particulier
Développements récents du secteur
- Juin 2026 : Apple a présenté Siri AI lors de la WWDC26, reconstruit sur la prochaine génération d'Apple Foundation Models avec une inférence sur appareil prenant en charge la saisie d'images, un meilleur suivi des instructions, l'appel d'outils et une fenêtre de contexte de 4 000 tokens, traitant toutes les données utilisateur localement sans transmission aux serveurs Apple. Le lancement a étendu l'écosystème SLM sur appareil d'Apple à l'iPhone, l'iPad et le Mac et a étendu le framework Foundation Models aux applications de développeurs tiers.
- Juin 2026 : Google a publié Gemma 4 12B, un modèle dense multimodal avec une architecture unifiée sans encodeur fonctionnant localement sur des ordinateurs portables grand public avec 16 Go de RAM sous la licence Apache 2.0, avec prise en charge native de l'entrée audio et des capacités de flux de travail agentiques. La publication a étendu l'IA multimodale capable de fonctionner en périphérie au matériel grand public standard sans nécessiter de ressources GPU de classe centre de données.
- Mai 2026 : Cohere Inc. a publié Command A+, un modèle sparse de mélange d'experts de 218 milliards de paramètres avec 25 milliards de paramètres actifs par token, sous la licence Apache 2.0. Le modèle présentait une génération native de citations, une fenêtre de contexte de 128 000 tokens et une tarification API de 2,50 USD par million de tokens d'entrée, ciblant les cas d'usage d'entreprise nécessitant des sorties d'IA traçables.
Périmètre du rapport mondial sur le marché des modèles de langage de petite taille (SLMs)
Le marché des modèles de langage de petite taille (SLMs) comprend le développement, le déploiement et la commercialisation de modèles de langage compacts et efficaces sur le plan computationnel, ainsi que les frameworks et services associés qui permettent l'inférence d'IA et le traitement du langage naturel dans des environnements cloud, sur site et en périphérie. Les revenus du marché sont générés par la licence et l'abonnement aux frameworks SLM, les frais d'utilisation des API et d'inférence, les déploiements cloud et en périphérie, les services de personnalisation et d'optimisation des modèles, les services d'IA gérés et le support d'entreprise pour des applications telles que la génération de contenu, l'IA conversationnelle, la recherche sémantique, l'analyse des sentiments, la traduction et l'intelligence documentaire dans des secteurs incluant le BFSI, la santé, le commerce de détail, les télécommunications, les médias et la technologie.
Le rapport sur le marché des modèles de langage de petite taille (SLMs) est segmenté par offre (frameworks et services), mode de déploiement (cloud, sur site et appareils en périphérie), application (génération de contenu, analyse des sentiments, recherche sémantique et récupération d'informations, IA conversationnelle et autres applications (traduction et localisation, extraction de données et analyse de documents, etc.)), utilisateur final (BFSI, santé et sciences de la vie, commerce de détail et commerce électronique, fournisseurs de technologie et de logiciels, médias et divertissement, télécommunications et autres utilisateurs finaux) et géographie (Amérique du Nord, Amérique du Sud, Europe, Asie-Pacifique, Moyen-Orient et Afrique). Les prévisions du marché sont fournies en termes de valeur (USD).
| Frameworks |
| Services |
| Cloud |
| Sur site |
| Appareils en périphérie |
| Génération de contenu |
| Analyse des sentiments |
| Recherche sémantique et récupération d'informations |
| IA conversationnelle |
| Autres applications (traduction et localisation, extraction de données et analyse de documents, etc.) |
| BFSI |
| Santé et sciences de la vie |
| Commerce de détail et commerce électronique |
| Fournisseurs de technologie et de logiciels |
| Médias et divertissement |
| Télécommunications |
| Autres utilisateurs finaux |
| Amérique du Nord | États-Unis |
| Canada | |
| Amérique du Sud | Brésil |
| Reste de l'Amérique du Sud | |
| Europe | Allemagne |
| Royaume-Uni | |
| France | |
| Italie | |
| Espagne | |
| Pays nordiques | |
| Reste de l'Europe | |
| Asie-Pacifique | Chine |
| Inde | |
| Japon | |
| Corée du Sud | |
| Australie | |
| Asie du Sud-Est | |
| Reste de l'Asie-Pacifique | |
| Moyen-Orient | Turquie |
| Arabie saoudite | |
| Émirats arabes unis | |
| Reste du Moyen-Orient | |
| Afrique | Afrique du Sud |
| Reste de l'Afrique |
| Par offre | Frameworks | |
| Services | ||
| Par mode de déploiement | Cloud | |
| Sur site | ||
| Appareils en périphérie | ||
| Par application | Génération de contenu | |
| Analyse des sentiments | ||
| Recherche sémantique et récupération d'informations | ||
| IA conversationnelle | ||
| Autres applications (traduction et localisation, extraction de données et analyse de documents, etc.) | ||
| Par utilisateur final | BFSI | |
| Santé et sciences de la vie | ||
| Commerce de détail et commerce électronique | ||
| Fournisseurs de technologie et de logiciels | ||
| Médias et divertissement | ||
| Télécommunications | ||
| Autres utilisateurs finaux | ||
| Par géographie | Amérique du Nord | États-Unis |
| Canada | ||
| Amérique du Sud | Brésil | |
| Reste de l'Amérique du Sud | ||
| Europe | Allemagne | |
| Royaume-Uni | ||
| France | ||
| Italie | ||
| Espagne | ||
| Pays nordiques | ||
| Reste de l'Europe | ||
| Asie-Pacifique | Chine | |
| Inde | ||
| Japon | ||
| Corée du Sud | ||
| Australie | ||
| Asie du Sud-Est | ||
| Reste de l'Asie-Pacifique | ||
| Moyen-Orient | Turquie | |
| Arabie saoudite | ||
| Émirats arabes unis | ||
| Reste du Moyen-Orient | ||
| Afrique | Afrique du Sud | |
| Reste de l'Afrique | ||
Questions clés auxquelles le rapport répond
Quelle est la taille actuelle et prévisionnelle du marché des modèles de langage de petite taille ?
Le marché des modèles de langage de petite taille était évalué à 1,05 milliard USD en 2025, s'établissait à 1,37 milliard USD en 2026 et devrait atteindre 4,84 milliards USD d'ici 2031 à un CAGR de 28,71 %.
Quel mode de déploiement connaît la croissance la plus rapide ?
Les appareils en périphérie devraient se développer à un CAGR de 28,98 % jusqu'en 2031, soutenus par de meilleurs NPU, des besoins de latence plus faibles et un déploiement industriel plus large.
Quelle application mène actuellement la demande ?
L'IA conversationnelle a mené avec 34,26 % des revenus en 2025 car elle offre un retour sur investissement clair dans des interactions structurées et auditables.
Quel groupe d'utilisateurs finaux adopte ces modèles le plus rapidement ?
La santé et les sciences de la vie devraient croître à un CAGR de 28,12 % jusqu'en 2031 en raison des besoins en matière de confidentialité, du déploiement sur site et de l'ajustement de modèles spécifiques au domaine.
Pourquoi les entreprises choisissent-elles des modèles compacts plutôt que des API de pointe ?
La pression sur les coûts, la latence plus faible, un meilleur contrôle du traitement des données et un déploiement sur site ou en périphérie plus facile poussent les entreprises vers les modèles compacts.
Quelle région offre les meilleures perspectives de croissance jusqu'en 2031 ?
L'Asie-Pacifique devrait croître à un CAGR de 29,76 %, portée par l'automatisation de la fabrication, de solides écosystèmes locaux et des programmes de déploiement d'IA soutenus par les gouvernements.
Dernière mise à jour de la page le: