
Qu'est-ce que MUM et comment cela affecte la recherche par IA ?
Découvrez le Multitask Unified Model (MUM) de Google et son impact sur les résultats de recherche IA. Comprenez comment MUM traite des requêtes complexes à trav...

MUM (Modèle Unifié Multitâche) est le modèle d’IA multimodal avancé de Google qui traite simultanément le texte, les images, la vidéo et l’audio dans plus de 75 langues pour fournir des résultats de recherche plus complets et contextuels. Lancé en 2021, MUM est 1 000 fois plus puissant que BERT et représente un changement fondamental dans la manière dont les moteurs de recherche comprennent et répondent aux requêtes complexes des utilisateurs.
MUM (Modèle Unifié Multitâche) est le modèle d'IA multimodal avancé de Google qui traite simultanément le texte, les images, la vidéo et l'audio dans plus de 75 langues pour fournir des résultats de recherche plus complets et contextuels. Lancé en 2021, MUM est 1 000 fois plus puissant que BERT et représente un changement fondamental dans la manière dont les moteurs de recherche comprennent et répondent aux requêtes complexes des utilisateurs.
MUM (Modèle Unifié Multitâche) est le modèle d’intelligence artificielle multimodal avancé de Google conçu pour révolutionner la façon dont les moteurs de recherche comprennent et répondent aux requêtes complexes des utilisateurs. Annoncé en mai 2021 par Pandu Nayak, Fellow Google et Vice-président de la Recherche, MUM représente un changement fondamental dans la technologie de récupération d’informations. Construit sur le framework T5 texte-à-texte et comprenant environ 110 milliards de paramètres, MUM est 1 000 fois plus puissant que BERT, le précédent modèle révolutionnaire de traitement du langage naturel de Google. Contrairement aux algorithmes de recherche traditionnels qui traitent le texte de manière isolée, MUM traite simultanément le texte, les images, la vidéo et l’audio tout en comprenant les informations dans plus de 75 langues nativement. Cette capacité multimodale et multilingue permet à MUM de comprendre des requêtes complexes qui nécessitaient auparavant plusieurs recherches de la part des utilisateurs, transformant la recherche d’un simple exercice de correspondance de mots-clés en un système intelligent de récupération d’informations sensible au contexte. MUM non seulement comprend le langage mais le génère également, ce qui le rend capable de synthétiser des informations provenant de sources et de formats divers pour fournir des réponses complètes et nuancées qui répondent à l’ensemble de l’intention de l’utilisateur.
Le parcours de Google vers MUM représente des années d’innovation progressive dans le traitement du langage naturel et l’apprentissage automatique. L’évolution a commencé avec Hummingbird (2013), qui a introduit la compréhension sémantique pour interpréter le sens derrière les requêtes de recherche plutôt que de simplement faire correspondre des mots-clés. Cela a été suivi par RankBrain (2015), qui utilisait l’apprentissage automatique pour comprendre les mots-clés de longue traîne et les modèles de recherche novateurs. Neural Matching (2018) a fait progresser cela en utilisant des réseaux neuronaux pour faire correspondre les requêtes avec le contenu pertinent à un niveau sémantique plus profond. BERT (Représentations Encodées Bidirectionnelles à partir de Transformateurs), lancé en 2019, a marqué une étape majeure en comprenant le contexte au sein des phrases et des paragraphes, améliorant la capacité de Google à interpréter un langage nuancé. Cependant, BERT avait des limitations importantes — il ne traitait que le texte, avait un support multilingue limité et ne pouvait pas gérer la complexité des requêtes nécessitant une synthèse d’informations dans plusieurs formats. Selon les recherches de Google, les utilisateurs émettent en moyenne huit requêtes distinctes pour répondre à des questions complexes, comme comparer deux destinations de randonnée ou évaluer des options de produits. Cette statistique a mis en évidence une lacune critique dans la technologie de recherche que MUM a été spécifiquement conçu pour combler. La Mise à jour du Contenu Utile (2022) et le cadre E-E-A-T (2023) ont encore affiné la façon dont Google priorise les contenus autoritaires et dignes de confiance. MUM s’appuie sur toutes ces innovations tout en introduisant des capacités qui transcendent les limitations précédentes, représentant non pas une simple amélioration progressive mais un changement de paradigme dans la façon dont les moteurs de recherche traitent et délivrent l’information.
La base technique de MUM repose sur l’architecture Transformer, plus précisément le framework T5 (Transformateur de Transfert Texte-à-Texte) que Google a développé précédemment. Le framework T5 traite toutes les tâches de traitement du langage naturel comme des problèmes texte-à-texte, convertissant les entrées et sorties en représentations textuelles unifiées. MUM étend cette approche en intégrant des capacités de traitement multimodal, lui permettant de gérer simultanément le texte, les images, la vidéo et l’audio au sein d’un seul modèle unifié. Ce choix architectural est significatif car il permet à MUM de comprendre les relations et le contexte entre différents types de médias d’une manière que les modèles précédents ne pouvaient pas. Par exemple, lors du traitement d’une requête concernant la randonnée au Mont Fuji combinée à une image de chaussures de randonnée spécifiques, MUM n’analyse pas le texte et l’image séparément — il les traite ensemble, comprenant comment les caractéristiques de la chaussure se rapportent au contexte de la requête. Les 110 milliards de paramètres du modèle lui confèrent la capacité de stocker et de traiter d’immenses quantités de connaissances sur le langage, les concepts visuels et leurs relations. MUM est entraîné sur 75 langues différentes et de nombreuses tâches différentes simultanément, ce qui lui permet de développer une compréhension plus complète des informations et de la connaissance du monde que les modèles entraînés sur une seule langue ou des tâches uniques. Cette approche d’apprentissage multitâche signifie que MUM apprend à reconnaître des modèles et des relations qui se transfèrent entre les langues et les domaines, le rendant plus robuste et généralisable que les modèles précédents. Le traitement simultané de plusieurs langues pendant l’entraînement permet à MUM d’effectuer un transfert de connaissances entre les langues, ce qui signifie qu’il peut comprendre des informations écrites dans une langue et appliquer cette compréhension à des requêtes dans une autre langue, brisant ainsi efficacement les barrières linguistiques qui limitaient auparavant les résultats de recherche.
| Attribut | MUM (2021) | BERT (2019) | RankBrain (2015) | Framework T5 |
|---|---|---|---|---|
| Fonction principale | Compréhension et synthèse de réponses multimodales | Compréhension contextuelle textuelle | Interprétation de mots-clés de longue traîne | Apprentissage par transfert texte-à-texte |
| Modalités d’entrée | Texte, images, vidéo, audio | Texte uniquement | Texte uniquement | Texte uniquement |
| Support linguistique | 75+ langues nativement | Support multilingue limité | Principalement anglais | Principalement anglais |
| Paramètres du modèle | ~110 milliards | ~340 millions | Non divulgué | ~220 millions |
| Comparaison de puissance | 1 000x plus puissant que BERT | Référence de base | Prédécesseur de BERT | Fondation de MUM |
| Capacités | Compréhension + génération | Compréhension uniquement | Reconnaissance de motifs | Transformation de texte |
| Impact SERP | Résultats enrichis multi-format | Meilleurs extraits et contexte | Pertinence améliorée | Technologie fondamentale |
| Gestion de la complexité des requêtes | Requêtes complexes multi-étapes | Contexte de requête unique | Variations de longue traîne | Tâches de transformation de texte |
| Transfert de connaissances | Translinguistique et cross-modal | Intra-lingue uniquement | Transfert limité | Transfert inter-tâches |
| Application réelle | Google Search, AI Overviews | Classement Google Search | Classement Google Search | Fondation technique de MUM |
Le traitement des requêtes par MUM implique plusieurs étapes sophistiquées qui fonctionnent ensemble pour fournir des réponses complètes et contextuelles. Lorsqu’un utilisateur soumet une requête de recherche, MUM commence par effectuer un prétraitement indépendant de la langue, comprenant la requête dans l’une de ses 75+ langues prises en charge sans nécessiter de traduction. Cette compréhension native de la langue préserve les nuances linguistiques et le contexte régional qui pourraient être perdus dans la traduction. Ensuite, MUM emploie une correspondance séquence-à-séquence, analysant la requête entière comme une séquence de sens plutôt que comme des mots-clés isolés. Cette approche permet à MUM de comprendre les relations entre les concepts — par exemple, reconnaître qu’une requête sur « se préparer pour le Mont Fuji après avoir gravi le Mont Adams » implique une comparaison, une préparation et une adaptation contextuelle. Simultanément, MUM effectue une analyse d’entrée multimodale, traitant toutes les images, vidéos ou autres médias inclus avec la requête. Le modèle s’engage ensuite dans un traitement simultané des requêtes, évaluant plusieurs intentions utilisateur possibles en parallèle plutôt que de se limiter à une seule interprétation. Cela signifie que MUM peut reconnaître qu’une requête sur la randonnée au Mont Fuji pourrait concerner la préparation physique, le choix de l’équipement, les expériences culturelles ou la logistique de voyage — et il affiche des informations pertinentes pour toutes ces interprétations. La compréhension sémantique basée sur des vecteurs convertit la requête et le contenu indexé en vecteurs haute dimension représentant le sens sémantique, permettant une récupération basée sur la similarité conceptuelle plutôt que sur la correspondance de mots-clés. MUM applique ensuite un filtrage de contenu via le transfert de connaissances, utilisant l’apprentissage automatique entraîné sur les journaux de recherche, les données de navigation et les modèles de comportement des utilisateurs pour prioriser les sources de haute qualité et autoritaires. Enfin, MUM génère une composition SERP enrichie multimédia, combinant des extraits de texte, des images, des vidéos, des questions connexes et des éléments interactifs en une seule expérience de recherche visuellement superposée. Ce processus entier se déroule en quelques millisecondes, permettant à MUM de fournir des résultats qui répondent non seulement à la requête explicite mais aussi aux questions de suivi anticipées et aux besoins d’information connexes.
Les capacités multimodales de MUM représentent une rupture fondamentale avec les systèmes de recherche exclusivement textuels. Le modèle peut traiter et comprendre simultanément des informations provenant de texte, d’images, de vidéos et d’audio, extrayant le sens de chaque modalité et le synthétisant en réponses cohérentes. Cette capacité est particulièrement puissante pour les requêtes qui bénéficient d’un contexte visuel. Par exemple, si un utilisateur demande « Puis-je utiliser ces chaussures de randonnée pour le Mont Fuji ? » tout en montrant une image de ses chaussures, MUM comprend les caractéristiques de la chaussure à partir de l’image — matériau, motif de semelle, hauteur, couleur — et relie cette compréhension visuelle aux connaissances sur le terrain, le climat et les exigences de randonnée du Mont Fuji pour fournir une réponse contextuelle. La dimension multilingue de MUM est tout aussi transformatrice. Avec un support natif de 75+ langues, MUM peut effectuer un transfert de connaissances entre les langues, ce qui signifie qu’il apprend à partir de sources dans une langue et applique ces connaissances à des requêtes dans une autre. Cela brise une barrière significative qui limitait auparavant les résultats de recherche au contenu dans la langue maternelle de l’utilisateur. Si des informations complètes sur le Mont Fuji existent principalement dans des sources japonaises — incluant des guides de randonnée locaux, des tendances météorologiques saisonnières et des perspectives culturelles — MUM peut comprendre ce contenu en japonais et afficher des informations pertinentes aux utilisateurs anglophones. Selon les tests de Google, MUM a pu lister 800 variantes de vaccins COVID-19 dans plus de 50 langues en quelques secondes, démontrant l’ampleur et la rapidité de ses capacités de traitement multilingue. Cette compréhension multilingue est particulièrement précieuse pour les utilisateurs dans les marchés non anglophones et pour les requêtes sur des sujets riches en informations dans plusieurs langues. La combinaison du traitement multimodal et multilingue signifie que MUM peut afficher les informations les plus pertinentes, quel que soit le format dans lequel elles sont présentées ou la langue dans laquelle elles ont été publiées originalement, créant ainsi une expérience de recherche véritablement mondiale.
MUM transforme fondamentalement la façon dont les résultats de recherche sont affichés et vécus par les utilisateurs. Plutôt que la liste traditionnelle de liens bleus qui a dominé la recherche pendant des décennies, MUM crée des SERP enrichis et interactifs qui combinent plusieurs formats de contenu sur une seule page. Les utilisateurs peuvent désormais voir des extraits de texte, des images haute résolution, des carrousels de vidéos, des questions connexes et des éléments interactifs sans quitter la page des résultats de recherche. Ce changement a des implications profondes sur la façon dont les utilisateurs interagissent avec la recherche. Au lieu d’effectuer plusieurs recherches pour recueillir des informations sur un sujet complexe, les utilisateurs peuvent explorer différents angles et sous-thèmes directement dans le SERP. Par exemple, une requête sur « se préparer pour le Mont Fuji en automne » pourrait afficher des comparaisons d’altitude, des prévisions météorologiques, des recommandations d’équipement, des guides vidéo et des avis d’utilisateurs — le tout organisé contextuellement sur une seule page. L’intégration de Google Lens propulsée par MUM permet aux utilisateurs de rechercher à l’aide d’images plutôt que de mots-clés, transformant les éléments visuels dans les photos en outils de découverte interactifs. Les panneaux « Choses à savoir » décomposent les requêtes complexes en sous-thèmes digestes, guidant les utilisateurs à travers différents aspects d’un sujet avec des extraits pertinents pour chacun. Des images haute résolution zoomables apparaissent directement dans les résultats de recherche, permettant une comparaison visuelle et réduisant les frictions dans les premières étapes de prise de décision. La fonctionnalité « Affiner et élargir » suggère des concepts connexes pour aider les utilisateurs soit à approfondir des aspects spécifiques, soit à explorer des sujets adjacents. Ces changements représentent un passage de la recherche en tant que simple mécanisme de récupération à la recherche en tant qu’expérience interactive et exploratoire qui anticipe les besoins des utilisateurs et fournit des informations complètes dans l’interface de recherche elle-même. Les recherches indiquent que cette expérience SERP plus riche réduit le nombre moyen de recherches nécessaires pour répondre à des questions complexes, bien qu’elle signifie également que les utilisateurs peuvent consommer des informations directement dans les résultats de recherche plutôt que de cliquer vers des sites web.
Pour les organisations qui suivent leur présence dans les systèmes d’IA, MUM représente une évolution critique dans la manière dont les informations sont découvertes et mises en avant. Alors que MUM est de plus en plus intégré dans Google Search et influence d’autres systèmes d’IA, comprendre comment les marques et les domaines apparaissent dans les résultats propulsés par MUM devient essentiel pour maintenir la visibilité. Le traitement multimodal de MUM signifie que les marques doivent optimiser sur plusieurs formats de contenu, pas seulement le texte. Une marque qui se fiait auparavant au classement pour des mots-clés spécifiques doit désormais s’assurer que son contenu est découvrable via des images, des vidéos et des données structurées. La capacité du modèle à synthétiser des informations provenant de sources diverses signifie que la visibilité d’une marque dépend non seulement de son propre site web mais aussi de la façon dont ses informations apparaissent dans l’ensemble de l’écosystème web. Les capacités multilingues de MUM créent de nouvelles opportunités et de nouveaux défis pour les marques mondiales. Le contenu publié dans une langue peut désormais être découvert par des utilisateurs recherchant dans différentes langues, élargissant la portée potentielle. Cependant, cela signifie également que les marques doivent s’assurer que leurs informations sont exactes et cohérentes entre les langues, car MUM peut afficher des informations provenant de multiples sources linguistiques pour une seule requête. Pour les plateformes de surveillance IA comme AmICited, suivre l’impact de MUM est crucial car il représente la façon dont les systèmes d’IA modernes récupèrent et présentent les informations. Lors du suivi de l’endroit où une marque apparaît dans les réponses IA — que ce soit dans les AI Overviews de Google, Perplexity, ChatGPT ou Claude — comprendre la technologie sous-jacente de MUM aide à expliquer pourquoi certains contenus sont affichés et comment optimiser la visibilité. Le passage vers une recherche multimodale et multilingue signifie que les marques ont besoin d’une surveillance complète qui suit leur présence dans différents formats de contenu et langues, pas seulement les classements de mots-clés traditionnels. Les organisations qui comprennent les capacités de MUM peuvent mieux optimiser leur stratégie de contenu pour assurer leur visibilité dans ce nouveau paysage de recherche.
Bien que MUM représente une avancée significative, il introduit également de nouveaux défis et limitations que les organisations doivent naviguer. Des taux de clics plus faibles constituent une préoccupation majeure pour les éditeurs et les créateurs de contenu, car les utilisateurs peuvent désormais consommer des informations complètes directement dans les résultats de recherche sans cliquer vers les sites web. Ce changement signifie que les métriques de trafic traditionnelles deviennent des indicateurs moins fiables du succès du contenu. Des exigences techniques SEO accrues signifient que pour être correctement compris par MUM, le contenu doit être bien structuré avec un balisage de schéma approprié, un HTML sémantique et des relations d’entités claires. Le contenu qui manque de cette base technique peut ne pas être correctement indexé ou compris par le traitement multimodal de MUM. La saturation des SERP crée des défis pour la visibilité, car davantage de formats de contenu se disputent l’attention sur une seule page. Même un contenu de qualité peut obtenir moins de clics, voire aucun, si les utilisateurs trouvent suffisamment d’informations dans le SERP lui-même. Un potentiel de résultats trompeurs existe lorsque MUM affiche des informations provenant de multiples sources qui peuvent se contredire ou lorsque le contexte est perdu dans la synthèse. La dépendance aux données structurées signifie que le contenu non structuré ou mal formaté peut ne pas être correctement compris ou affiché par MUM. Des défis de nuances linguistiques et culturelles peuvent survenir lorsque MUM transfère des connaissances entre les langues, manquant potentiellement le contexte culturel ou les variations régionales de sens. Les exigences en ressources informatiques pour faire fonctionner MUM à grande échelle sont substantielles, bien que Google ait investi dans des améliorations d’efficacité pour réduire l’empreinte carbone. Les préoccupations concernant les biais et l’équité nécessitent une attention continue pour garantir que MUM ne perpétue pas les biais présents dans les données d’entraînement ou ne désavantage pas certaines perspectives ou communautés.
L’émergence de MUM nécessite des changements fondamentaux dans la façon dont les organisations abordent le SEO et la stratégie de contenu. L’optimisation traditionnelle axée sur les mots-clés devient moins efficace lorsque MUM peut comprendre l’intention et le contexte au-delà des correspondances exactes de mots-clés. La stratégie de contenu basée sur les sujets devient plus importante que la stratégie basée sur les mots-clés, les organisations devant créer des clusters de contenu complets qui abordent les sujets sous plusieurs angles. La création de contenu multimédia n’est plus optionnelle — les organisations doivent investir dans la création d’images, de vidéos et de contenu interactif de haute qualité qui complète le contenu textuel. La mise en œuvre de données structurées devient critique, car le balisage de schéma aide MUM à comprendre la structure et les relations du contenu. La construction d’entités et l’optimisation sémantique aident à établir l’autorité thématique et améliorent la façon dont MUM comprend les relations de contenu. La stratégie de contenu multilingue gagne en importance car les capacités de transfert linguistique de MUM signifient que le contenu peut être découvert sur différents marchés linguistiques. La cartographie de l’intention utilisateur devient plus sophistiquée, obligeant les organisations à comprendre non seulement l’intention principale mais aussi les questions connexes et les sous-thèmes que les utilisateurs pourraient explorer. La fraîcheur et l’exactitude du contenu deviennent plus importantes car MUM synthétise les informations provenant de multiples sources — le contenu obsolète ou inexact peut être dépriorisé. L’optimisation multiplateforme s’étend au-delà de Google Search pour inclure l’optimisation de la façon dont le contenu apparaît dans les systèmes d’IA comme les AI Overviews de Google, Perplexity et d’autres interfaces de recherche alimentées par l’IA. Les signaux E-E-A-T (Expérience, Expertise, Autorité, Fiabilité) deviennent de plus en plus importants car MUM priorise le contenu provenant de sources autoritaires. Les organisations qui adaptent leurs stratégies pour s’aligner sur les capacités de MUM — en se concentrant sur un contenu complet, multimodal, bien structuré qui démontre l’expertise et l’autorité — maintiendront leur visibilité dans ce paysage de recherche en évolution.
L’optimisation pour les résultats de recherche influencés par MUM nécessite une liste de vérification différente de l’optimisation traditionnelle par mots-clés, car MUM évalue le contenu à travers les formats et les langues plutôt que de faire correspondre des termes exacts. Premièrement, auditez votre contenu pour sa complétude multimédia — les pages qui reposent uniquement sur le texte passent à côté des signaux multimodaux que MUM utilise ; ajoutez des images pertinentes, des démonstrations vidéo ou des diagrammes là où ils apportent une réelle valeur ajoutée, car MUM traite ceux-ci en parallèle du texte plutôt que de classer les pages textuelles par défaut. Deuxièmement, implémentez les données structurées de manière exhaustive, en priorisant les types de schéma qui correspondent à la façon dont MUM décompose les requêtes en sous-thèmes, tels que les schémas FAQ, HowTo et Product, afin que le modèle puisse analyser les éléments distincts de votre contenu plutôt que de traiter la page comme un bloc indifférencié. Troisièmement, construisez des clusters de sujets au lieu de pages ciblant un seul mot-clé — parce que MUM évalue plusieurs sous-thèmes connexes au sein d’une seule requête, une page qui ne répond qu’au terme de recherche littéral tout en ignorant les questions de suivi étroitement liées perdra face à une page qui aborde le sujet dans son ensemble. Quatrièmement, vérifiez le texte alternatif des images et le nommage des fichiers car les fonctionnalités de recherche visuelle comme Google Lens dépendent de ces métadonnées pour relier les images à leur sujet. Cinquièmement, vérifiez que les traductions ou les versions localisées sont précises et complètes si vous opérez dans plusieurs langues, car le transfert de connaissances interlingue de MUM signifie que les lacunes de contenu dans une langue peuvent être comblées par le contenu d’un concurrent dans une autre langue. Enfin, surveillez lesquelles de vos pages déclenchent des panneaux extensibles de type « Choses à savoir » dans les résultats de recherche, et développez davantage ce contenu, car cela signale que MUM reconnaît déjà la page comme traitant bien un sous-thème spécifique.
Commencez à suivre comment les chatbots IA mentionnent votre marque sur ChatGPT, Perplexity et d'autres plateformes. Obtenez des informations exploitables pour améliorer votre présence IA.

Découvrez le Multitask Unified Model (MUM) de Google et son impact sur les résultats de recherche IA. Comprenez comment MUM traite des requêtes complexes à trav...

Discussion communautaire expliquant Google MUM et son impact sur la recherche IA. Des experts partagent comment ce modèle d’IA multimodal affecte l’optimisation...

Google Gemini est un modèle IA multimodal de Google DeepMind qui traite le texte, les images, l'audio et la vidéo. Découvrez son architecture, ses capacités et ...
Consentement aux Cookies
Nous utilisons des cookies pour améliorer votre expérience de navigation et analyser notre trafic. See our privacy policy.