Recherche vocale
La recherche vocale désigne l'interrogation d'un moteur de recherche ou d'un assistant par la parole plutôt qu'au clavier, la réponse étant lue à voix haute, affichée, ou les deux. Les requêtes vocales sont plus longues, formulées en langage naturel et souvent posées sous forme de question. Annoncée en 2018 comme la prochaine révolution du SEO, elle s'est concrétisée autrement : en 2026, l'Assistant Google a laissé place à Gemini, Siri et Alexa ont été rebâtis sur des modèles de langage, et la voix est devenue une modalité du mode IA de Google plutôt qu'un canal de recherche à part.
Définition détaillée de la recherche vocale
La recherche vocale repose sur trois briques successives : la reconnaissance de la parole, qui transcrit la voix en texte ; la compréhension de la requête, qui identifie l'intention et les entités mentionnées ; et la restitution, qui produit une réponse parlée, une liste de résultats à l'écran, ou une action (lancer un itinéraire, appeler un commerce, régler un minuteur). Selon l'appareil, la part de chaque brique varie : sur une enceinte sans écran, la réponse est nécessairement unique et orale ; sur un téléphone, elle peut se doubler d'une page de résultats classique.
La recherche vocale n'est donc pas un moteur distinct. Sur Google, une question dictée dans l'application ou dans Chrome interroge le même index et les mêmes systèmes de classement qu'une requête tapée ; ce qui change est la forme de la requête et, parfois, celle de la réponse. Sur un assistant, la question passe par une couche supplémentaire qui décide s'il faut répondre depuis une base de connaissances, depuis le web, depuis un service partenaire, ou en déclenchant une action.
Les assistants en 2026
De l'Assistant Google à Gemini
L'Assistant Google, lancé en 2016, était le principal support de la recherche vocale sur Android et sur les enceintes Google Home et Nest. Le 1er octobre 2025, Google a annoncé « Gemini for Home », en précisant que Gemini remplace l'Assistant Google sur les écrans et les enceintes connectés, avec des conversations plus naturelles et la compréhension de demandes complexes. Sur téléphone, l'application Gemini a pris le même rôle, avec un mode de conversation orale, Gemini Live, que Google continue d'enrichir en 2026.
Côté recherche, la voix s'est intégrée au mode IA. Le 18 juin 2025, Google a lancé aux États-Unis « Search Live », une conversation vocale continue avec la recherche, fondée sur une version de Gemini et sur la technique du query fan-out, qui décompose la question en sous-requêtes. Lors du lancement des AI Overviews et du mode IA en France, le 22 juillet 2026, Google a confirmé que Search Live est disponible dans le mode IA français, avec la possibilité de partager le flux de la caméra pour ajouter un contexte visuel. En 2026, « rechercher à la voix » sur Google signifie donc, de plus en plus, converser avec le mode IA.
Siri
Le 8 juin 2026, Apple a présenté « Siri AI », décrit comme une version entièrement nouvelle de Siri fondée sur Apple Intelligence : un assistant conversationnel capable de répondre à des questions à partir du web sur pratiquement n'importe quel sujet, de tenir compte du contexte personnel de l'utilisateur et de ce qui s'affiche à l'écran. Apple a toutefois annoncé le même jour que, faute d'accord avec les régulateurs européens sur l'application du Digital Markets Act, Siri AI ne serait pas disponible dans l'Union européenne sur iPhone et iPad avec iOS 27 et iPadOS 27, sans calendrier. Pour un site français, la recherche vocale via Siri sur mobile reste donc, à la rentrée 2026, celle de l'ancien Siri.
Alexa
Amazon a présenté le 26 février 2025 « Alexa+ », une nouvelle génération de son assistant fondée sur des grands modèles de langage : conversation naturelle, orchestration de services partenaires (réservations, musique, courses, livraison), et une architecture d'« experts » spécialisés par type de tâche. Amazon a mis à jour son annonce le 21 juillet 2026 pour élargir la disponibilité, avec un accès depuis le web et l'application mobile en plus des enceintes Echo.
D'où viennent les réponses vocales
Pour un référenceur, la question centrale est la source de la réponse lue. Elle dépend du type de demande.
- Les faits et les entités (une date, une capitale, une personne) viennent du Knowledge Graph et des bases de connaissances de l'assistant, sans passage par une page web.
- Les commerces et les lieux viennent des fiches locales : sur Google, la fiche d'établissement, ses horaires, son adresse et ses avis alimentent directement les réponses « ouvert jusqu'à quelle heure », « le plus proche », « appelle ».
- Les questions ouvertes viennent du web. Historiquement, l'Assistant lisait le featured snippet de la page de résultats, en citant la source. Avec Gemini et le mode IA, la réponse est générée à partir de plusieurs pages, avec des liens affichés à l'écran quand il y en a un : c'est le mécanisme des AI Overviews, appliqué à la voix.
- L'actualité sur les enceintes Google s'appuie sur les articles des éditeurs, avec un balisage dédié décrit ci-dessous.
- Les actions (commander, réserver, écouter) passent par des services intégrés à l'assistant, pas par les résultats de recherche.
Les données structurées speakable
La propriété speakable de Schema.org identifie, dans un article ou une page, les passages les mieux adaptés à une lecture par synthèse vocale. La documentation Search Central décrit son usage par l'Assistant Google pour répondre aux questions d'actualité sur les enceintes : l'assistant retourne jusqu'à trois articles, lit à voix haute les sections marquées, cite la source et envoie l'URL complète sur le téléphone de l'utilisateur. Le balisage se pose en JSON-LD sur un objet Article ou WebPage, avec une propriété SpeakableSpecification qui désigne les passages par sélecteur CSS ou par XPath. Google recommande de marquer des passages courts, de l'ordre de deux à trois phrases, avec des titres et des résumés compréhensibles à l'oreille, et d'éviter les légendes, les mentions de lieu et les attributions de source qui sonnent mal en lecture seule.
Deux limites sont écrites noir sur blanc dans cette documentation, toujours en vigueur en septembre 2026 : la fonctionnalité est en bêta, et elle ne fonctionne que pour les utilisateurs aux États-Unis, sur des appareils Google Home réglés en anglais, pour des éditeurs publiant en anglais. Google indique espérer l'étendre à d'autres pays et langues lorsque suffisamment d'éditeurs l'auront mise en place. Pour un site francophone, speakable n'a donc aujourd'hui aucun effet mesurable ; son coût est faible et le balisage reste propre, mais il ne doit pas être présenté comme un levier.
Les promesses de 2018 et l'état réel
Entre 2016 et 2018, la recherche vocale a été annoncée comme le prochain bouleversement du SEO : des prévisions circulaient sur une part majoritaire des requêtes passant par la voix, des conférences entières y étaient consacrées, et une « optimisation pour la recherche vocale » s'est vendue comme une spécialité. Aucun moteur n'a jamais publié de données confirmant cette bascule, et les prévisions de l'époque n'ont pas été vérifiées par leurs auteurs. John Mueller, Search Advocate chez Google, ironisait encore le 12 mars 2025 sur Bluesky : « Est-ce l'année de la recherche vocale (à nouveau) ? »
Ce qui s'est réellement passé tient en quatre points. La voix est devenue une modalité d'entrée banale, sur mobile surtout, sans créer d'index ni de classement distincts. Les usages vocaux se sont concentrés sur les actions et les faits (musique, minuteurs, météo, itinéraires, domotique), c'est-à-dire sur des réponses qui ne renvoient à aucune page web. Les assistants de première génération ont été remplacés par des assistants génératifs, qui répondent en synthétisant plusieurs sources au lieu de lire une seule page. Et la voix s'est fondue dans la recherche par IA : Search Live n'est pas un produit vocal, c'est le mode IA avec un micro.
La conséquence pour le SEO est nette : il n'existe pas d'optimisation propre à la voix. Les leviers qui comptaient pour les réponses vocales (réponses directes aux questions, fiches locales à jour, données structurées, pages rapides) sont exactement ceux qui comptent pour les featured snippets, le référencement local et, désormais, les AI Overviews et le mode IA. Le sujet a rejoint celui de la visibilité dans les réponses générées.
Ce qu'un site peut faire
- Répondre aux questions telles qu'elles se posent à l'oral. Les requêtes vocales sont des phrases complètes (« comment », « pourquoi », « quel est le meilleur », « près de moi ») : une page qui pose la question en intertitre et y répond en deux ou trois phrases, avant de détailler, est lisible par un assistant comme par un featured snippet ou un AI Overview.
- Tenir les fiches locales à jour. Horaires, adresse, téléphone, catégories et attributs de la fiche d'établissement Google sont la première source des réponses vocales locales ; la cohérence du NAP sur le web évite les réponses fausses.
- Baliser ce qui peut l'être. Les données structurées d'organisation, de commerce local, de FAQ, d'événement et de produit rendent les faits lisibles par les assistants ;
speakablese réserve aux éditeurs d'actualité qui visent le public américain anglophone. - Soigner la lisibilité orale. Phrases courtes, chiffres écrits sans ambiguïté, sigles explicités : ce qui se lit bien à voix haute se résume aussi mieux par un modèle de langage.
- Mesurer ce qui est mesurable. La Search Console ne distingue pas les requêtes vocales des requêtes tapées ; l'indicateur utile est la présence du site dans les réponses de l'IA générative, que le rapport dédié de la Search Console suit depuis juin 2026.
Sources :
- Speakable (BETA) structured data (Google Search Central)
- Lancement des Aperçus IA et du Mode IA dans la Recherche Google en France (Google France (The Keyword)), le 22 juillet 2026
- Gemini for Home: The helpful home gets an AI upgrade (Google (The Keyword)), le 1er octobre 2025
- Apple introduces Siri AI, a profoundly more capable and personal assistant (Apple Newsroom), le 8 juin 2026
- Introducing Alexa+, the next generation of Alexa (Amazon (About Amazon)), le 26 février 2025
FAQ
Existe-t-il un référencement spécifique à la recherche vocale ?
Non. Une requête vocale interroge le même index et les mêmes systèmes de classement qu'une requête tapée. Les leviers utiles (réponses directes aux questions, fiches locales à jour, données structurées, pages rapides) sont ceux du référencement classique, des featured snippets et, depuis 2025-2026, des AI Overviews et du mode IA.
D'où vient la réponse lue par un assistant ?
Cela dépend de la question. Un fait vient du Knowledge Graph ou de la base de l'assistant ; un commerce vient de sa fiche locale ; une question ouverte vient du web, historiquement d'un featured snippet et désormais d'une réponse générée à partir de plusieurs pages ; une action (musique, commande, réservation) passe par un service intégré, sans page web.
Faut-il ajouter le balisage speakable sur un site français ?
Il n'a aucun effet aujourd'hui. La documentation de Google indique que speakable est en bêta et réservé aux utilisateurs américains, sur des appareils Google Home en anglais, pour des contenus en anglais. Un éditeur francophone peut le poser à faible coût, mais ne doit rien en attendre tant que Google n'a pas annoncé d'extension.
Les requêtes vocales apparaissent-elles dans la Search Console ?
Elles y sont mélangées aux requêtes tapées, sans indicateur de provenance. On peut repérer des requêtes longues et interrogatives, mais rien ne permet de les attribuer à la voix. Le rapport de performance de l'IA générative dans la Search Console, disponible depuis juin 2026, donne une mesure plus utile de la présence dans les réponses conversationnelles.
Qu'est devenu l'Assistant Google ?
Google a annoncé le 1er octobre 2025 que Gemini remplace l'Assistant Google sur les enceintes et les écrans connectés (Gemini for Home), et l'application Gemini a pris le relais sur téléphone. Côté recherche, la conversation vocale passe par Search Live, intégré au mode IA, disponible en France depuis le 22 juillet 2026.
Siri AI est-il disponible en France ?
Pas sur iPhone ni iPad avec iOS 27 et iPadOS 27. Apple a annoncé le 8 juin 2026 que, faute d'accord avec les régulateurs européens sur le Digital Markets Act, Siri AI ne serait pas déployé dans l'Union européenne sur ces appareils, sans calendrier ; il reste annoncé sur macOS 27 et visionOS 27.
En résumé
- Recherche vocale : interroger un moteur ou un assistant par la parole ; même index et même classement que la recherche tapée, mais des requêtes plus longues, en langage naturel, et une réponse souvent unique.
- Assistants en 2026 : Gemini a remplacé l'Assistant Google (Gemini for Home, 1er octobre 2025) ; Search Live apporte la conversation vocale au mode IA, en France depuis le 22 juillet 2026 ; Siri AI (8 juin 2026) est retardé dans l'UE sur iPhone et iPad ; Alexa+ (26 février 2025) est fondé sur des LLM.
- Sources des réponses : Knowledge Graph pour les faits, fiches locales pour les commerces, web pour les questions ouvertes (featured snippet hier, réponse générée aujourd'hui), services intégrés pour les actions.
- Speakable : balisage Schema.org pour la lecture d'articles d'actualité par l'assistant ; en bêta, réservé aux États-Unis et à l'anglais, sans effet pour un site français.
- Promesses de 2018 : la bascule majoritaire vers la voix ne s'est pas produite ; la voix est devenue une modalité du mode IA, et l'optimisation « vocale » se confond avec celle des réponses générées et du référencement local.
Abondance c'est aussi des audits SEO, un service de contenus et des formations en e-learning !
Publié le Mis à jour le
Autres définitions :
Les outils SEO pour vous aider


