Sortie vocale
Tester une voix de synthèse en CAA : langue, prononciation, volume et hors ligne
Une procédure non clinique pour vérifier la voix réellement disponible sur un appareil, les mots difficiles, l’audibilité, la latence et le repli sans promettre une voix universelle ou hors ligne.
La voix fait partie du message, mais elle dépend du système
Une application de CAA peut composer un texte puis demander à l’appareil de le prononcer. Dans une application Web, la synthèse vocale est généralement fournie par le navigateur et le système d’exploitation. La liste des voix, leur langue, leur qualité, leur disponibilité et leur comportement sans réseau peuvent donc changer d’un appareil à l’autre, même lorsque l’interface de communication reste identique.
Le standard Web Speech distingue notamment le texte à lire, la langue demandée, la voix sélectionnée, le volume, le débit et la hauteur. Il expose aussi le fait qu’une voix soit annoncée comme locale ou distante. Ces informations aident au diagnostic technique, mais elles ne garantissent ni l’intelligibilité dans un lieu précis, ni la disponibilité future, ni l’adéquation de la voix à une personne.
Le résultat utilisateur attendu est simple : un message préparé doit pouvoir être entendu et compris dans la situation réelle, ou basculer immédiatement vers un autre moyen. Le test porte donc sur tout le parcours, pas seulement sur le bouton de lecture.
Parole synthétisée et message enregistré ne répondent pas au même besoin
L’ASHA distingue la parole synthétisée, produite électroniquement à partir d’un texte, de la parole numérisée, enregistrée puis rejouée. La synthèse permet de prononcer des messages nouveaux ; un enregistrement peut conserver une intonation naturelle, mais reste limité aux éléments enregistrés. Les deux approches peuvent se compléter dans certains systèmes.
PictoVoice utilise la synthèse vocale disponible sur l’appareil. Il ne fournit pas une banque de voix, ne promet pas une reproduction personnelle de la voix et ne garantit pas qu’une voix téléchargée sur un appareil existe sur un autre. Un export de tableau transporte le vocabulaire prévu par son format ; il ne doit pas être considéré comme une copie complète du moteur vocal du système.
Avant tout réglage, nommez donc la fonction testée : lire une phrase nouvelle, faire entendre un message urgent, prononcer un nom propre, parler une autre langue ou rester utilisable sans connexion. Une seule démonstration ne couvre pas ces usages.
| Sortie | Atout | Limite à vérifier |
|---|---|---|
| Synthèse vocale | Produit des messages nouveaux à partir du texte | Voix, langue et disponibilité dépendantes du système |
| Message enregistré | Conserve une voix et une intonation déterminées | Nombre de messages borné et fichier à protéger |
| Texte affiché | Reste lisible dans le bruit | Demande que le partenaire regarde et lise |
| Support papier ou gestuel | Ne dépend ni du haut-parleur ni de la batterie | Doit être connu et accessible |
Préparer un jeu d’essai court mais représentatif
Choisissez des messages réellement utiles sans recopier d’informations sensibles. Le jeu d’essai comprend une phrase courte, une phrase plus longue, une question, un refus, une demande d’aide, un nom propre ou un lieu difficile, un nombre, une heure et, si nécessaire, un passage dans une autre langue. Les mots qui posent problème sont testés dans une phrase complète, car une prononciation isolée peut changer avec le contexte.
Ajoutez un message permettant de réparer l’échange : « je vais vous montrer le texte », « ce n’est pas ce que je veux dire » ou « attendez, je recommence ». La voix n’est jamais le seul canal de correction. La phrase reste visible afin que la personne puisse vérifier ce qui sera prononcé et que le partenaire puisse lire si l’audio échoue.
Évitez d’utiliser une adresse, un diagnostic, un numéro administratif ou un contact personnel comme échantillon. Un nom fictif ou un lieu public suffit pour tester l’articulation. Les vrais éléments restent sur l’appareil sous le contrôle de la personne.
- Un message bref et fréquent.
- Une phrase longue avec ponctuation.
- Une question et un refus.
- Un nom propre ou un terme inhabituel.
- Un nombre, une date ou une heure.
- Une phrase dans chaque langue réellement utilisée.
- Un message de réparation et un affichage texte de secours.
Vérifier la langue avant de juger la qualité de la voix
Une voix est associée à une langue ou une variante linguistique. Une voix française tentant de lire un texte anglais, ou l’inverse, peut produire une prononciation très différente sans que le texte soit erroné. Vérifiez la langue du tableau, celle du message et celle annoncée par la voix. La voix par défaut de l’appareil peut changer après une mise à jour ou lorsque l’appareil est configuré dans une autre langue.
Pour une personne utilisant plusieurs langues, testez un message complet dans chacune. Un système peut proposer plusieurs voix sans basculer correctement au milieu d’une même phrase. Il peut aussi n’avoir téléchargé localement qu’une des langues. Ne généralisez jamais le succès du français à toutes les langues du vocabulaire.
Le choix d’une voix peut avoir une dimension d’identité, d’âge perçu, de langue ou de culture. Présentez les options disponibles à la personne lorsque c’est possible et conservez son choix. Une liste limitée sur un terminal décrit une limite technique, pas l’identité de la personne.
Traiter les noms propres, sigles et mots difficiles
Écoutez les noms, lieux, médicaments cités sans visée clinique, sigles, unités et mots empruntés à une autre langue. La ponctuation, les espaces ou une graphie phonétique locale peuvent parfois améliorer la prononciation, mais toute adaptation doit rester visible et compréhensible dans le texte affiché. Ne remplacez pas silencieusement le libellé exact par une approximation trompeuse.
Lorsqu’une application permet un libellé visuel distinct du texte prononcé, documentez les deux. Sinon, préférez une reformulation claire que la personne accepte. Pour un sigle, essayer les lettres séparées et la forme développée permet de choisir la version la plus intelligible. Pour un nombre important, une lecture en groupes peut réduire l’ambiguïté, mais le nombre écrit reste visible.
Faites confirmer par une personne qui connaît le mot ou le nom. Un moteur vocal qui semble fluide peut prononcer une information de façon incorrecte. La correction concerne ce message précis ; elle ne prouve pas que tous les mots de la même catégorie sont réglés.
Régler débit, hauteur et volume dans cet ordre
Commencez par le débit. Une lecture trop rapide réduit le temps de compréhension ; une lecture très lente peut casser la phrase et retarder l’échange. Testez d’abord la valeur habituelle, puis un seul changement. La spécification Web décrit le débit comme relatif à la voix et précise que les moteurs peuvent limiter les valeurs réellement produites : un même réglage numérique ne sonne donc pas nécessairement pareil partout.
La hauteur modifie la perception de la voix sans corriger une mauvaise langue ou une mauvaise prononciation. Elle n’est pas un réglage d’intelligibilité universel. Le volume de la synthèse s’ajoute au volume matériel, à la position du haut-parleur, à une éventuelle sortie Bluetooth et au bruit ambiant. Vérifiez qu’un réglage silencieux, un casque connecté ou une enceinte distante ne détourne pas le message.
Après chaque modification, rejouez la même phrase dans le même lieu. Notez le réglage choisi et le terminal concerné, pas une conclusion générale comme « débit idéal ». L’objectif est que la personne et ses partenaires comprennent le message sans effort excessif dans le contexte visé.
- Choisir une phrase de référence.
- Tester la voix et la langue avant les autres paramètres.
- Ajuster le débit par petites étapes.
- Modifier la hauteur seulement si elle apporte un bénéfice observé.
- Régler le volume matériel dans la posture réelle.
- Rejouer la phrase avec le bruit et la distance prévisibles.
- Conserver un texte visible et un support de secours.
Tester l’audibilité dans la situation réelle
Une voix claire dans une pièce calme peut être inaudible dans un hall, un véhicule ou une activité de groupe. Placez l’appareil comme pendant l’usage : sur son support, dans la main, sur une table ou près du corps. Le haut-parleur ne doit pas être masqué par une coque, un vêtement ou le support de montage.
Testez trois distances : la personne juste en face, un petit groupe et un interlocuteur derrière un guichet ou à côté. Vérifiez aussi la confidentialité. Une voix assez forte pour traverser une salle peut exposer un message personnel. Dans ce cas, l’affichage du texte, le rapprochement consenti ou un autre canal peut être préférable.
Le partenaire indique honnêtement s’il a compris et répète le contenu entendu pour confirmation. Il ne prétend pas avoir compris afin d’accélérer. Si la voix échoue, l’action prévue s’arrête le temps de passer au texte, au geste, au papier ou à un autre moyen connu.
Vérifier le hors ligne sans se fier au nom de la voix
Le Web Speech API peut signaler qu’une voix est fournie par un service local ou distant. Une voix locale est un indice utile, mais le fonctionnement complet dépend encore du navigateur, du système, des données installées et de l’état de l’appareil. PictoVoice ne promet donc pas une voix hors ligne sur tous les appareils.
Préparez le test lorsque la situation n’est pas urgente : ouvrez l’application, chargez le tableau, coupez réellement les connexions réseau, verrouillez puis rouvrez si cela correspond à l’usage, et prononcez plusieurs messages. Redémarrez ensuite l’appareil et recommencez. Un message déjà en cache ne prouve pas que toute la voix est disponible après redémarrage.
Android documente l’installation de données vocales et le choix d’un moteur, d’une langue, d’un débit et d’une hauteur. Apple documente des voix et variantes téléchargeables. Ces chemins changent selon les versions et les fabricants : utilisez la documentation du terminal actuel et contrôlez à nouveau après une mise à jour.
| État testé | Contrôle | Conclusion possible |
|---|---|---|
| En ligne | Plusieurs phrases et langues | Voix disponible dans cet état |
| Mode avion | Même jeu d’essai | Fonctionnement sans réseau pendant cet essai |
| Après redémarrage | Application et voix relancées | Données encore disponibles sur ce terminal |
| Après mise à jour | Réglages et voix revérifiés | Configuration courante requalifiée |
| Autre appareil | Nouveau test complet | Aucune capacité transférée par supposition |
Prévoir latence, interruption et échec
Une voix peut démarrer tard, s’interrompre, être indisponible ou rencontrer une erreur de langue, de moteur, de réseau ou de matériel audio. Pendant l’attente, l’interface doit montrer que le message existe et éviter de lancer plusieurs lectures concurrentes. La personne doit pouvoir arrêter et recommencer sans perdre la phrase composée.
Testez une lecture alors qu’un autre son joue, après une notification, pendant une connexion Bluetooth et juste après le réveil de l’appareil. Les comportements audio varient. Une enceinte qui se reconnecte dans une autre pièce peut rendre le message inaudible localement ; un casque oublié peut donner l’impression que la synthèse ne fonctionne plus.
Le plan de repli est immédiat : texte en grand, tableau papier, cartes, écriture, geste ou autre moyen déjà utilisé. Il ne dépend pas d’un export technique à restaurer pendant l’échange. Le partenaire sait où regarder et attend la reprise.
Cas pratique : préparer une phrase pour un accueil bruyant
Exemple non clinique : la personne veut dire « bonjour, j’ai un rendez-vous à quatorze heures ; laissez-moi le temps de répondre ». La phrase est testée sur le terminal réel. La langue française est confirmée, le nom du lieu est écouté séparément, puis la phrase complète est jouée au débit habituel.
Dans le hall, le volume reste insuffisant à travers la vitre. Le réglage matériel est augmenté sans modifier simultanément le débit. L’agent répète ce qu’il a compris ; la personne corrige l’heure depuis le texte visible. Le support papier contient aussi « je n’ai pas terminé », « montrez-moi », « répétez » et l’objet du rendez-vous sans adresse privée.
Le mode avion est ensuite essayé hors de la situation. La voix fonctionne après redémarrage sur ce terminal à cette date. La fiche de préparation note ce résultat borné ; elle ne promet pas qu’il sera identique sur un autre appareil ou après une mise à jour.
Checklist de qualification et place de PictoVoice
PictoVoice compose une phrase et demande sa lecture à la synthèse vocale du système. Il ne fournit pas lui-même toutes les voix et ne garantit ni leur identité, ni leur qualité, ni leur disponibilité hors ligne. La vérification appartient donc à chaque appareil et à chaque situation importante.
Ce guide organise un essai fonctionnel. Il ne prescrit pas une voix, ne mesure pas une capacité de communication, ne promet aucun bénéfice thérapeutique et ne remplace pas un accompagnement individualisé lorsqu’il est nécessaire.
- Voix, langue et variante identifiées sur le terminal réel.
- Messages courts, longs, interrogatifs et imprévus essayés.
- Noms propres, sigles, nombres et langues vérifiés.
- Débit, hauteur et volume modifiés un à un.
- Bruit, distance, posture et sortie audio testés.
- Mode avion et redémarrage essayés si le hors ligne est nécessaire.
- Latence, interruption et erreur simulées sans perdre le message.
- Texte visible et moyen de secours immédiatement accessibles.
- Résultat daté, borné à l’appareil et revu après mise à jour.
- Aucune donnée personnelle utilisée dans le jeu d’essai public.
Responsabilité éditoriale et révision
Dernière révision humaine : 20 septembre 2026. DOHM est responsable de cette page éditoriale. Les systèmes, navigateurs, voix et chemins de réglage peuvent évoluer ; les documents de l’appareil et les sources de référence doivent être vérifiés au moment de l’essai.
Pour demander une correction, indiquez l’URL, le passage concerné, le terminal et une source publique. Ne transmettez ni message personnel, ni export de vocabulaire, ni enregistrement vocal, ni information de santé.
Sources
- Augmentative and Alternative Communication (AAC) · American Speech-Language-Hearing Association · vérifié le 20 septembre 2026
- Web Speech API Specification · W3C Speech API Community Group · vérifié le 20 septembre 2026
- Using the Web Speech API · MDN Web Docs · vérifié le 20 septembre 2026
- Text-to-speech output · Google Android Accessibility Help · vérifié le 20 septembre 2026
- Adjust voice and speed for VoiceOver and Speak Screen · Apple Support · vérifié le 20 septembre 2026