Comment fonctionne la dictée vocale : le guide complet
Vous appuyez sur une touche, vous parlez, et quelques secondes plus tard une phrase propre apparaît à l'écran. Entre les deux, il se passe beaucoup plus de choses qu'on ne l'imagine : une onde sonore devient une suite de nombres, ces nombres deviennent une image, cette image devient du texte, et ce texte devient enfin une phrase écrite correctement. Ce guide détaille chacune de ces étapes, sans jargon inutile mais sans rien simplifier à l'excès. À la fin, vous saurez pourquoi la dictée de votre téléphone vous oblige à dire « virgule » là où d'autres outils s'en chargent seuls, pourquoi le même modèle comprend parfaitement votre voisin et bute sur le nom de votre client, et où passe réellement votre voix pendant l'opération.
Au sommaire
- Les quatre étapes en un coup d'œil
- Étape 1 : votre voix devient des nombres
- Étape 2 : la transcription
- Étape 3 : le nettoyage par l'IA
- Étape 4 : l'insertion dans votre application
- Combien de temps tout cela prend-il ?
- Où tournent ces modèles ?
- Le vocabulaire, sans confusion
- Ce qui fait vraiment varier la qualité
- Ce que devient votre voix
- Ce qu'il faut retenir
Les quatre étapes en un coup d'œil
Toute dictée vocale moderne repose sur la même chaîne. Ce qui distingue les outils entre eux, ce n'est presque jamais la première étape : c'est le fait d'exécuter ou non la troisième.
| Étape | Ce qui entre | Ce qui sort |
|---|---|---|
| 1. Capture | Une onde sonore dans l'air | Une suite de nombres, puis un spectrogramme |
| 2. Transcription | Le spectrogramme | Du texte brut, mot à mot |
| 3. Nettoyage | Le texte brut | Un texte ponctué, corrigé, mis en forme |
| 4. Insertion | Le texte final | Des caractères à l'emplacement de votre curseur |
Les dictées intégrées aux systèmes d'exploitation et aux suites bureautiques s'arrêtent à l'étape 2. C'est le cas de la saisie vocale de Windows, de la dictée de macOS, de celle d'iOS, de la saisie vocale de Gboard sur Android et de la saisie vocale de Google Docs. Les outils dits « IA » ajoutent l'étape 3, et c'est toute la différence entre une transcription et un texte que vous pouvez envoyer tel quel. Nous avons détaillé le comportement de chacun dans nos guides consacrés à l'iPhone, à Android, à Word et à Google Docs.
Étape 1 : votre voix devient des nombres
L'échantillonnage
Quand vous parlez, vos cordes vocales font vibrer l'air. Cette vibration est une variation continue de pression. La membrane de votre micro suit ces variations et les convertit en tension électrique, puis la carte son mesure cette tension à intervalles réguliers. Chaque mesure s'appelle un échantillon.
Pour la parole, la fréquence d'échantillonnage standard est de 16 000 échantillons par seconde, soit 16 kHz. Une minute de dictée représente donc environ 960 000 nombres. Ce chiffre de 16 kHz n'est pas arbitraire : le théorème d'échantillonnage de Nyquist-Shannon impose de mesurer au moins deux fois plus vite que la fréquence la plus haute que l'on veut conserver. Comme l'essentiel de l'information qui distingue un « s » d'un « f » se situe sous 8 kHz, 16 kHz suffisent. C'est aussi pour cela que la dictée n'a aucun besoin de la qualité CD à 44,1 kHz : le surplus de données n'apporterait rien à la reconnaissance et ne ferait qu'alourdir le calcul et le transfert. Ce n'est pas une convention officieuse : le papier de recherche de Whisper précise que tout l'audio est ramené à 16 000 Hz avant traitement.
Le spectrogramme : l'image que « voit » le modèle
Une suite brute de 960 000 nombres est très difficile à exploiter directement. On la transforme donc en quelque chose de beaucoup plus lisible pour un réseau de neurones.
Le principe : on découpe l'enregistrement en petites fenêtres qui se chevauchent, de 25 millisecondes, avancées de 10 millisecondes à chaque fois. Pour chaque fenêtre, on calcule quelles fréquences sont présentes et avec quelle intensité, grâce à une transformée de Fourier. En empilant tous ces résultats côte à côte, on obtient une image : le spectrogramme. L'axe horizontal représente le temps, l'axe vertical les fréquences, et l'intensité lumineuse l'énergie présente à cette fréquence à cet instant. Ces valeurs de 25 et 10 millisecondes sont exactement celles employées par Whisper.
Le modèle n'« entend » pas votre voix. Il regarde une image, une sorte de partition thermique où chaque voyelle, chaque consonne et chaque silence forme un motif reconnaissable. Le problème « comprendre un son » a été transformé en problème « reconnaître des motifs sur une image », domaine où les réseaux de neurones sont redoutablement efficaces.
Une dernière subtilité : l'échelle des fréquences n'est pas linéaire, elle est compressée dans les aigus. On parle d'échelle des mels, calquée sur la perception humaine, qui distingue bien plus finement l'écart entre 200 et 300 Hz que celui entre 8 000 et 8 100 Hz. Concrètement, l'image finale ne comporte que quelques dizaines de bandes de fréquences : Whisper en utilise 80, et 128 sur sa version large-v3. C'est une réduction massive de l'information, mais elle conserve précisément ce qui permet de distinguer les sons de la parole.
Étape 2 : la transcription, de l'image au texte
Whisper, le standard de fait
Jusqu'en 2020, la reconnaissance vocale reposait sur des systèmes assemblant plusieurs composants séparés : un modèle acoustique, un dictionnaire de prononciation, un modèle de langage. Ils fonctionnaient, mais exigeaient un réglage minutieux par langue et se dégradaient vite dès que l'audio sortait des conditions prévues.
La bascule est venue des modèles de bout en bout, dont le plus connu est Whisper, publié en open source par OpenAI fin 2022. Son intérêt tient moins à son architecture qu'à son entraînement. La version d'origine a été entraînée sur 680 000 heures d'audio collecté sur le web avec les transcriptions correspondantes, dont 117 000 heures couvrant 96 langues autres que l'anglais, comme le détaille l'article de recherche associé. La génération suivante a encore changé d'échelle : la version large-v3 s'appuie sur un million d'heures d'audio faiblement annoté, complété par quatre millions d'heures transcrites automatiquement par le modèle précédent.
À cette échelle, le modèle a vu tellement de voix, d'accents, de micros médiocres et de bruits de fond qu'il reste robuste sur du son du quotidien, et pas seulement sur de l'audio de studio. Il couvre aujourd'hui une centaine de langues dans un seul et même modèle. C'est ce qui en a fait le standard sur lequel s'appuie une bonne partie des outils de dictée récents.
Encodeur, décodeur et tokens
Le modèle se compose de deux moitiés qui travaillent l'une après l'autre.
- L'encodeur lit le spectrogramme par tranches de 30 secondes et le condense en une représentation interne. Vous pouvez y voir un résumé numérique dense qui retient, pour chaque instant, ce qui compte du point de vue de la parole et jette le reste.
- Le décodeur produit le texte morceau par morceau. À chaque pas, il regarde à la fois ce résumé audio et tout ce qu'il a déjà écrit, puis prédit le fragment de texte suivant le plus probable.
Ces fragments s'appellent des tokens. Un token n'est pas un mot : c'est plutôt un morceau de mot, souvent de trois ou quatre caractères. Les mots très fréquents forment un seul token, tandis qu'un terme rare comme « anticonstitutionnellement » en occupe plusieurs. Ce découpage permet au modèle de traiter n'importe quelle langue et n'importe quel mot inédit avec un vocabulaire de taille raisonnable.
Pourquoi le contexte élimine les homophones
C'est ici que se joue l'essentiel du progrès des dix dernières années. Puisque le décodeur tient compte de ce qu'il a déjà écrit, il ne choisit pas ses mots uniquement sur le son. Prenez « sans », « cent », « sang » et « s'en » : ces quatre formes sont acoustiquement identiques en français. Aucun traitement du signal ne les départagera jamais. En revanche, un modèle qui a lu des millions de phrases sait que « cent euros » est bien plus probable que « sang euros ».
Le même mécanisme explique les erreurs. Le modèle ne cherche pas la vérité, il cherche la suite la plus probable. Face à un nom propre rare ou à un terme métier peu représenté dans ses données, il proposera un mot courant qui sonne pareil, avec une parfaite assurance. C'est pourquoi le vocabulaire personnalisé est un vrai sujet, traité à l'étape suivante plutôt qu'à celle-ci.
Comment on mesure la qualité : le WER
L'indicateur de référence est le WER, pour Word Error Rate, taux d'erreur sur les mots. On compare la transcription produite à une transcription de référence établie par un humain, on compte trois types d'erreurs, puis on rapporte le total au nombre de mots de la référence.
- Substitutions : un mot a été remplacé par un autre.
- Insertions : un mot a été ajouté alors qu'il n'a pas été prononcé.
- Suppressions : un mot prononcé a été omis.
Un WER de 5 % signifie qu'un mot sur vingt est faux. Une précaution s'impose toutefois : le WER n'a aucun sens dans l'absolu, il dépend entièrement du corpus de test. Le même modèle peut afficher 3 % sur des lectures de livres audio enregistrées au casque et 20 % sur une réunion à plusieurs voix dans une pièce résonnante. Deux chiffres de WER ne sont comparables que s'ils portent sur le même jeu d'évaluation, ce que les communications commerciales précisent rarement.
Étape 3 : le nettoyage par l'IA, ce qui sépare une transcription d'un texte
Supposons que l'étape 2 soit parfaite : chaque mot prononcé a été correctement reconnu. Vous n'avez toujours pas un texte utilisable, et pour une raison très simple : vous ne parlez pas comme vous écrivez. Une transcription fidèle restitue vos hésitations, vos reprises, vos « du coup » et vos phrases qui repartent en cours de route. Elle est fidèle, et c'est précisément le problème.
| Transcription brute (étape 2) | Après nettoyage IA (étape 3) |
|---|---|
| alors euh je voulais te dire que le dossier martin il est prêt enfin je crois qu'il est prêt du coup on peut l'envoyer demain matin si tu valides | Le dossier Martin est prêt. Nous pouvons l'envoyer demain matin si tu valides. |
Cette transformation est le travail d'un grand modèle de langage placé derrière la transcription. Concrètement, il prend en charge :
- La ponctuation et le découpage en phrases, que vous n'avez pas prononcés et qu'il faut donc déduire de la structure du propos.
- La suppression des hésitations et des faux départs, sans altérer le sens de ce que vous avez voulu dire.
- La grammaire et les accords, souvent approximatifs à l'oral, notamment sur les participes passés et les liaisons.
- La mise en forme attendue : un e-mail n'a pas la même allure qu'une note interne ou qu'un message court. Les outils les plus aboutis laissent définir ses propres règles de formatage, appliquées à chaque dictée.
- Le vocabulaire métier et les noms propres, à partir d'une liste fournie par l'utilisateur. C'est la parade au problème d'homophones évoqué plus haut, et elle est plus efficace qu'on ne le croit : le nom de votre client n'a pas besoin d'être connu du modèle de transcription, il suffit qu'il soit connu de l'étape de correction, qui rétablira l'orthographe exacte à partir d'une approximation phonétique.
Pourquoi tout le monde ne fait pas cette étape
Un modèle de nettoyage vraiment fiable est un grand modèle de langage, c'est-à-dire un objet lourd, bien plus lourd que le modèle de transcription. Le faire tourner suppose des serveurs équipés en conséquence. Sur un ordinateur personnel, les modèles assez petits pour tenir ignorent souvent les consignes et cassent la mise en forme, tandis que les modèles assez bons deviennent trop lents pour un usage en temps réel. C'est la raison pour laquelle les dictées intégrées aux systèmes d'exploitation, qui tournent en local, se contentent du mot à mot, et pourquoi elles vous demandent de prononcer « virgule » et « point » vous-même. C'est aussi ce qui explique l'écart de résultat que l'on constate en pratique dans Word ou Google Docs.
Étape 4 : l'insertion dans votre application
Étape la moins spectaculaire, et pourtant celle qui détermine si l'outil est utilisable au quotidien. Le texte final doit arriver là où vous écrivez, sans détour par un presse-papiers ou une fenêtre intermédiaire.
Deux familles d'outils s'opposent ici. Les dictées liées à une application donnée, comme celle de Word ou la saisie vocale de Google Docs, ne fonctionnent que dans cette application, parfois même seulement dans un navigateur précis. Les outils système, eux, s'installent comme une couche au-dessus de tout le reste : ils écoutent un raccourci clavier global, puis écrivent le résultat à l'emplacement du curseur, quelle que soit la fenêtre active. Un champ de recherche, un e-mail, un ticket, un terminal : tout ce qui accepte du texte accepte la dictée.
Techniquement, cette insertion passe soit par la simulation de frappes clavier, soit par les interfaces d'accessibilité du système d'exploitation. Cette différence, invisible à l'usage, explique qu'un outil fonctionne parfaitement dans un traitement de texte et échoue dans une application au rendu graphique particulier, comme certains jeux ou environnements distants.
Le déclenchement se décline généralement en deux modes : le push-to-talk, où l'on maintient la touche pendant qu'on parle, pratique pour une phrase, et le mode mains libres, où l'on appuie une fois pour démarrer et une fois pour arrêter, adapté aux longues dictées.
Combien de temps tout cela prend-il ?
Contrairement à une intuition répandue, le temps de traitement n'est pas proportionnel au ressenti d'attente, parce que les étapes ne se déroulent pas toutes après que vous avez fini de parler. La capture et la préparation du spectrogramme se font au fil de l'eau, pendant que vous parlez. Restent la transcription et le nettoyage, qui s'exécutent au relâchement du raccourci.
Trois facteurs dominent le résultat. D'abord la puissance de calcul disponible : les cartes graphiques de datacenter traitent un enregistrement de plusieurs minutes en une fraction du temps qu'y mettrait un ordinateur portable. Ensuite le nombre d'allers-retours réseau, qu'une chaîne bien conçue réduit au minimum en fusionnant transcription et nettoyage plutôt qu'en les enchaînant comme deux appels séparés. Enfin le découpage de l'audio : puisque le modèle raisonne par tranches de 30 secondes, un enregistrement long peut être traité par morceaux en parallèle plutôt que de façon strictement séquentielle.
Il en découle un point contre-intuitif : le temps d'attente ne croît pas proportionnellement à la durée de la dictée. Sur une chaîne bien conçue, doubler la longueur de votre dictée ne double pas le temps d'attente, ce qui rend les dictées longues nettement plus rentables que les phrases isolées.
Où tournent ces modèles : votre ordinateur ou un serveur ?
La chaîne décrite ici est la même partout. Ce qui change d'un outil à l'autre, c'est l'endroit où chaque étape s'exécute, et ce choix a des conséquences directes sur ce que vous obtenez.
- Tout en local. L'audio ne quitte jamais votre machine, ce qui est le maximum en matière de confidentialité et fonctionne hors ligne. En pratique, vous obtenez les étapes 1, 2 et 4, rarement la 3, faute de puissance disponible pour un grand modèle de nettoyage.
- Transcription et nettoyage sur serveur. Votre audio part sur une infrastructure conçue pour ces calculs, ce qui rend la chaîne complète possible sur n'importe quel ordinateur, même un portable léger sans carte graphique dédiée. En contrepartie, une connexion est nécessaire et vous dépendez des engagements du prestataire sur la conservation et la localisation des données.
Ce compromis mérite un traitement à part entière : nous l'avons détaillé dans dictée vocale en local vs cloud.
Le vocabulaire, sans confusion
Quatre termes sont régulièrement employés l'un pour l'autre alors qu'ils désignent des choses différentes.
| Terme | Ce que c'est |
|---|---|
| Reconnaissance vocale speech-to-text, ASR |
La technologie qui transforme de la parole en texte. C'est l'étape 2 de ce guide. |
| Dictée vocale saisie vocale |
L'usage de cette technologie pour écrire : un e-mail, un document, un message. C'est la chaîne complète, étapes 1 à 4. |
| Synthèse vocale text-to-speech, TTS |
L'opération inverse : un texte est lu à voix haute par une voix artificielle. Rien à voir avec la dictée, malgré la confusion fréquente. |
| Commande vocale | La reconnaissance sert à déclencher une action, pas à écrire. « Mets un minuteur de dix minutes » relève de la commande vocale. |
Ce qui fait vraiment varier la qualité
À modèle égal, le résultat peut aller de l'excellent au médiocre. Les facteurs qui pèsent le plus, dans l'ordre :
- Le rapport entre votre voix et le bruit ambiant. Ce n'est pas le volume du bruit qui compte, mais son écart avec votre voix. Un micro-casque ou les micros d'un ordinateur portable récent placé à bonne distance suffisent largement ; un micro à l'autre bout d'une grande pièce est le principal facteur de dégradation.
- La réverbération. Une pièce nue au plafond haut renvoie votre voix avec un décalage, ce qui brouille les motifs du spectrogramme bien plus qu'un bruit constant de ventilation.
- Le débit et l'articulation. Parler vite n'est pas un problème en soi, avaler les fins de mots en est un.
- Les noms propres et le jargon. Le point faible structurel, expliqué plus haut, et la raison d'être des listes de vocabulaire personnalisé.
- La langue et le mélange de langues. Les modèles sont nettement meilleurs en anglais qu'ailleurs, simplement parce que les données d'entraînement y sont plus abondantes. Alterner deux langues au sein d'une même phrase reste le cas le plus difficile.
- La longueur des passages. Un contexte plus long aide le modèle à trancher les ambiguïtés : une dictée de plusieurs phrases donne souvent un meilleur résultat que trois mots isolés.
Ce que devient votre voix pendant tout ça
Une fois la chaîne comprise, la question des données devient beaucoup plus concrète. Il ne s'agit pas de savoir si un outil est « sécurisé » dans l'abstrait, mais de savoir ce qui arrive à trois objets bien identifiés : l'enregistrement audio, la transcription brute et le texte final.
Trois questions suffisent à cadrer le sujet, et elles valent pour n'importe quel outil :
- Ces éléments sont-ils conservés après traitement, et si oui combien de temps ?
- Sont-ils réutilisés pour entraîner des modèles ? C'est un point distinct de la conservation, et il se traite dans les conditions d'utilisation.
- Sous quelle juridiction le traitement a-t-il lieu ? Un serveur physiquement situé en Europe mais opéré par une entité soumise au droit américain ne répond pas à la même question qu'un traitement opéré en France par une entité européenne.
Un enregistrement de voix est une donnée personnelle au sens du RGPD, et son contenu peut l'être bien davantage encore selon ce que vous dictez. Ces trois points sont détaillés dans notre guide dictée vocale et RGPD. Les professions soumises au secret professionnel trouveront des repères spécifiques dans les guides dédiés aux avocats et juristes et aux experts-comptables.
Ce qu'il faut retenir
La dictée vocale n'est pas une boîte noire. C'est une chaîne de quatre opérations bien identifiées, et presque toutes les questions que l'on se pose à son sujet se ramènent à une étape précise de cette chaîne.
- Un résultat décevant en environnement bruyant se joue à l'étape 1, et se corrige avec un meilleur micro plutôt qu'avec un meilleur logiciel.
- Une erreur sur un nom propre ou un terme métier se joue à l'étape 2, et se corrige avec une liste de vocabulaire.
- L'absence de ponctuation, les hésitations laissées telles quelles et le texte à retravailler se jouent à l'étape 3, qui est tout simplement absente de la plupart des outils intégrés.
- L'impossibilité de dicter dans telle ou telle application se joue à l'étape 4, et dépend de l'architecture de l'outil, pas de la qualité de sa reconnaissance.
Reste la question qui traverse toute la chaîne : l'arbitrage entre la puissance nécessaire aux étapes 2 et 3 et la confidentialité de ce que vous dictez. C'est le vrai sujet de fond, et il se décide au moment de choisir un outil, pas après.
Questions fréquentes
Comment fonctionne la dictée vocale ?
La dictée vocale enchaîne quatre étapes. Votre micro convertit d'abord l'onde sonore en une suite de nombres, généralement 16 000 mesures par seconde. Ces nombres sont transformés en spectrogramme, une image des fréquences dans le temps. Un modèle de reconnaissance vocale analyse cette image et produit du texte. Enfin, sur les outils modernes, un grand modèle de langage nettoie ce texte : ponctuation, suppression des hésitations, grammaire, mise en forme. Le résultat est inséré à l'endroit où se trouve votre curseur.
Quelle est la différence entre reconnaissance vocale et dictée vocale ?
La reconnaissance vocale est la technologie qui transforme la parole en texte. La dictée vocale est l'usage que l'on en fait pour écrire un document, un e-mail ou un message. À ne pas confondre avec la synthèse vocale, qui fait l'inverse en lisant un texte à voix haute, ni avec la commande vocale, qui déclenche une action au lieu d'écrire.
Qu'est-ce que Whisper et pourquoi en parle-t-on partout ?
Whisper est un modèle de reconnaissance vocale publié en open source par OpenAI fin 2022. Sa version d'origine a été entraînée sur 680 000 heures d'audio multilingue, et sa version large-v3 sur plusieurs millions d'heures. Il est devenu le standard de fait parce qu'il gère nativement une centaine de langues dans un seul modèle, résiste bien au bruit et aux accents, et peut être utilisé librement. La plupart des outils de dictée récents s'appuient dessus ou sur des modèles construits selon les mêmes principes.
Pourquoi la dictée vocale se trompe-t-elle sur les noms propres et le vocabulaire métier ?
Un modèle de reconnaissance vocale prédit la suite la plus probable au vu de ce qu'il a appris. Un nom de client rare ou un terme technique de niche apparaît très peu dans ses données d'entraînement : le modèle lui préfère un mot courant qui sonne pareil. La parade est de fournir à l'outil une liste de vocabulaire personnalisée, que l'étape de nettoyage applique après la transcription.
Pourquoi certaines dictées vocales ne mettent-elles pas la ponctuation ?
Parce qu'elles s'arrêtent à l'étape de transcription. Transcrire consiste à écrire ce qui a été prononcé, et vous ne prononcez pas les virgules. Ajouter une ponctuation correcte suppose de comprendre la structure des phrases, ce qui demande un grand modèle de langage en aval de la transcription. Les dictées intégrées aux systèmes d'exploitation n'ont généralement pas cette seconde étape et vous demandent donc de dicter « virgule » et « point » à voix haute.
La dictée vocale fonctionne-t-elle sans connexion Internet ?
Cela dépend de l'endroit où tournent les modèles. Une dictée 100 % locale fonctionne hors ligne, mais se limite en pratique à la transcription mot à mot, car faire tourner un grand modèle de nettoyage sur un ordinateur personnel reste impraticable. Une dictée cloud exige une connexion, et c'est ce qui lui permet d'exécuter la chaîne complète, transcription et nettoyage compris.
Aller plus loin
Comprendre les enjeux
Dictée vocale en local vs cloud : le comparatif complet
Confidentialité & RGPDDictée vocale et RGPD : où vont vraiment vos données ?
Dicter dans vos applications
Dictée vocale dans Word : pourquoi la dictée intégrée ne suffit pas
ProductivitéSaisie vocale Google Docs : le guide complet
ProductivitéDictée vocale email : dicter dans Gmail, Outlook et partout
ProductivitéDictée vocale pour Notion : capturer vos idées 3x plus vite
Sur mobile
Dictée vocale iPhone : l'activer et dicter dans toutes vos applications
MobileSaisie vocale Android : l'activer et dicter dans toutes vos apps
Mobile & ordinateurSaisie vocale Google : dicter sur téléphone et PC
Guide pratiqueDictée vocale gratuite : les meilleures options en 2026
Choisir un outil
Meilleure dictée vocale Windows 2026 : comparatif complet
ComparatifComparatif dictée vocale Mac 2026 : quelle solution choisir ?
Par métier & cas d'usage
Dictée vocale pour avocats : RGPD et secret professionnel
Expertise comptableDictée vocale pour experts-comptables : secret professionnel et RGPD
AccessibilitéDictée vocale pour dyslexique : le guide complet
IA & productivitéDicter ses prompts à Claude (et à ChatGPT)
DéveloppeursVibe Coding : dicter son code avec Fast Dictate et Cursor
Par Pierrick Michel · Mis à jour en août 2026