Aller au contenu principal
MEWA STUDIO

Le son, la signature d'interaction que le web a laissée vide

Publié le 25 septembre 2026|14 min de lecture
designUXbranding

Depuis 2018, les navigateurs bloquent tout son avant le premier geste du visiteur. Le son reste pourtant le canal d'interface le moins occupé du web. L'article explique ce qu'il apporte, quand l'activer et comment ne pas agacer.

Onde sonore dorée faite de barres lumineuses verticales, enveloppée de fines courbes blanches ondulantes sur un fond brun cuivré

Depuis le 1er juillet 2021, une voiture électrique neuve vendue dans l'Union européenne n'a plus le droit d'être silencieuse. Le règlement 540/2014 (opens in a new tab) impose un système d'alerte sonore, actif jusqu'à 20 km/h et en marche arrière, avec un niveau minimal de 56 dB à 20 km/h, selon l'Union européenne des aveugles (opens in a new tab) qui a porté la mesure. Un objet silencieux privait les piétons d'une information que le moteur thermique donnait sans que personne y pense. Le législateur a fait rajouter le bruit.

Le web a pris la direction inverse. Entre juin 2017 et mars 2019, Safari, Chrome puis Firefox ont décidé qu'aucun site ne pourrait émettre un son avant que le visiteur ait cliqué ou touché la page. Cette règle a mis fin aux fonds musicaux et aux vidéos qui démarraient seules. Elle a aussi installé une convention plus large, celle d'un site web qui ne fait pas de bruit. Cette convention n'est pas une propriété du médium. Les systèmes d'exploitation, les consoles de jeu, les terminaux de paiement et les applications natives utilisent le son pour confirmer, prévenir et signer. Le design sonore d'interface, c'est-à-dire le choix des sons qu'un produit joue en réponse aux actions, y est une discipline établie. Le web est l'un des rares environnements interactifs où le silence est la norme. Ce canal y est donc presque inoccupé.

Comment le web est devenu muet

Le silence du web est une décision de trois navigateurs, prise en réponse à des abus précis. Le 8 juin 2017, WebKit, le moteur de Safari, annonce (opens in a new tab) que Safari sur macOS High Sierra bloque par défaut la lecture automatique des médias sonores sur la plupart des sites, avec un moteur d'inférence qui décide site par site. Le conseil donné aux développeurs est de considérer que toute lecture d'un élément audio ou vidéo exige un clic. En avril 2018, Chrome 66 applique sa propre politique de lecture automatique (opens in a new tab) aux éléments audio et vidéo. Google indique qu'elle bloque environ la moitié des lectures automatiques non désirées. Chrome 71, en décembre 2018, l'étend à la Web Audio API, l'interface de programmation qui permet de générer et de traiter du son dans une page. Firefox 66 suit (opens in a new tab) en mars 2019.

DateNavigateurRègle
Juin 2017Safari, macOS High SierraLes médias sonores ne démarrent plus seuls sur la plupart des sites. Un moteur d'inférence décide site par site
Avril 2018Chrome 66Les éléments audio et vidéo sonores exigent un geste du visiteur, sauf sur les sites où il consomme déjà des médias
Décembre 2018Chrome 71La Web Audio API démarre à l'état suspendu tant que le visiteur n'a pas interagi avec la page
Mars 2019Firefox 66Les contenus audio et vidéo sonores sont bloqués par défaut

Les décisions qui ont rendu le web silencieux par défaut

Chrome accorde une exception mesurée. Son indice d'engagement média calcule, site par site, si le visiteur y consomme régulièrement des médias de plus de sept secondes avec le son actif. Un site de vidéo ou de musique gagne ainsi le droit de démarrer seul. Un son d'interface, court par nature, ne remplit jamais cette condition. La spécification Web Audio (opens in a new tab) du W3C a ensuite inscrit la règle dans le standard. Un contexte audio est créé à l'état suspendu et le navigateur peut refuser de le passer à l'état actif tant que la page n'a pas reçu une activation de l'utilisateur, c'est-à-dire un clic, une touche ou une pression de touche.

Le second verrou est dans la poche du visiteur. En 2014, une étude de Martin Pielot et ses collègues, présentée à la conférence MobileHCI, a suivi 15 utilisateurs Android pendant une semaine. Ils recevaient 63,5 notifications par jour en moyenne (opens in a new tab) et seules 46,2 % arrivaient sur un téléphone en mode normal. Les autres tombaient sur un appareil en vibreur (41,5 %) ou en silencieux (12,2 %). En 2016, des éditeurs interrogés par Digiday estimaient que jusqu'à 85 % des vues (opens in a new tab) de leurs vidéos sur Facebook se faisaient sans le son. Ce chiffre n'a jamais été publié par Facebook, il vient des éditeurs eux-mêmes. Il a pourtant suffi à imposer les sous-titres incrustés sur toutes les vidéos sociales.

Ces deux verrous ont produit une convention de conception. Puisque le son ne peut pas partir avant un geste et qu'il sera souvent coupé à l'arrivée, les équipes ont cessé d'en concevoir. Le compteur d'usage de Chrome donne une mesure indirecte de cette absence. Le 23 septembre 2026, un contexte Web Audio était créé sur 5,1 % des chargements de page (opens in a new tab), contre 1,3 % début 2018. Ce compteur mesure la création d'un contexte, pas l'émission d'un son. Une bonne part de ces créations sert à identifier les appareils à des fins publicitaires. L'ordre de grandeur reste parlant. Le son est absent de l'immense majorité des pages et cette absence n'est ni technique ni réglementaire. Elle tient à une habitude de conception.

Ce que le son apporte qu'un pixel n'apporte pas

Le son arrive plus vite que l'image. Une étude de Jain et ses collègues, publiée en 2015 sur 120 étudiants en médecine (opens in a new tab), mesure un temps de réaction significativement plus court pour un stimulus sonore que pour un stimulus visuel, chez les hommes comme chez les femmes. Une mesure plus ancienne, sur 14 sujets, donnait 284 millisecondes en moyenne pour le son (opens in a new tab) contre 331 pour la lumière. L'écart tient en quelques dizaines de millisecondes. Sur une interface, il ne rend pas l'action plus rapide. Il rend la confirmation perceptible avant même que l'œil ait vérifié l'écran.

Le second apport est l'indépendance du regard. William Gaver, chercheur chez Apple dans les années 1980, l'a formulé le premier. Dans un article de 1986, il propose les icônes auditives (opens in a new tab), des caricatures de sons naturels qui renseignent sur la source d'un événement, comme un bruit de papier froissé pour un fichier jeté. En 1989, il en fait une démonstration sur Macintosh, le SonicFinder (opens in a new tab), avec l'argument que le son devrait servir dans un ordinateur comme il sert dans le monde, où il renseigne sur la nature de l'événement qui le produit. La même année, Meera Blattner et ses collègues définissent la famille concurrente, les earcons (opens in a new tab), des motifs sonores abstraits, une ou plusieurs notes, que l'on assemble en familles pour représenter des actions apparentées. Les sons d'un système d'exploitation moderne descendent presque tous de ces deux familles.

L'effet a été mesuré. En 2002, Stephen Brewster, de l'université de Glasgow, a publié une série d'expériences (opens in a new tab) sur un Palm III, l'assistant personnel de l'époque, dont l'écran était minuscule. Les participants saisissaient des codes à cinq chiffres sur des boutons de 16 pixels de côté puis de 4 pixels, en silence ou avec un son de confirmation à chaque pression. Avec le son enrichi, l'écart de codes saisis entre grands boutons silencieux et petits boutons sonores est tombé à trois sur quatorze minutes. Les deux traitements sonores ont réduit de façon significative la charge de travail mesurée par le questionnaire NASA-TLX et aucun effet significatif sur l'agacement n'a été relevé. Dans une seconde expérience menée en marchant dehors, les participants ont préféré les boutons sonores. La conclusion de l'auteur est qu'un petit bouton sonorisé devient aussi utilisable qu'un grand bouton muet.

Une précision s'impose sur ce que la littérature contient. Cette étude reste, à ce jour, le cas chiffré le plus solide sur le son d'interface. Les expériences souvent citées de 2008 sur les claviers tactiles, menées par Eve Hoggan et Stephen Brewster, portent sur le retour tactile (opens in a new tab), c'est-à-dire la vibration. Elles ne disent rien du son. Aucun test A/B publié ne montre qu'un son d'interface a changé le taux de conversion d'un site web. Le son ne se justifie donc pas par une promesse de conversion. Il se justifie par ce qu'il fait à la perception.

Sur ce point, la recherche est nette. En 2004, Massimiliano Zampini et Charles Spence, à Oxford, ont fait croquer des chips à des participants en modifiant en temps réel le son de leur propre mastication. En augmentant le volume ou en amplifiant seulement les hautes fréquences, entre 2 et 20 kHz, les chips étaient jugées plus croustillantes et plus fraîches (opens in a new tab), sans qu'elles aient changé. Le son modifie le jugement porté sur la matière d'un objet. C'est le mécanisme qu'exploite le son d'une portière ou d'un interrupteur et c'est celui qu'un site muet abandonne. Le visiteur y juge la matière d'un bouton sur sa seule apparence.

Le son, un actif de marque presque inoccupé

Ipsos a publié en février 2020 une méta-analyse de 2 015 publicités vidéo américaines (opens in a new tab) tirées de sa base de tests. Elle classe chaque publicité selon l'attention qu'elle obtient pour la marque, en trois tiers. Elle regarde ensuite quels actifs de marque y figurent. Les actifs visuels, logo, couleur ou slogan, apparaissent dans 92 % des cas. Les actifs sonores, signature sonore ou musique, apparaissent dans 8 % des cas. Les publicités qui utilisent un actif sonore ont 3,44 fois plus de chances d'être dans le tiers supérieur. Le rapport monte à 8,53 quand il s'agit d'une signature sonore. Pour les actifs visuels, le rapport est de 1,15. La métrique porte sur l'attention accordée à une marque dans une vidéo, pas sur la mémorisation d'une interface. Il serait abusif de transposer les coefficients. Ce que l'étude établit est plus simple. Le canal sonore est presque vide et, quand il est occupé, il pèse plus que le canal visuel saturé.

Les marques qui l'ont compris sortent le son de la publicité. En février 2019, Mastercard a présenté une identité sonore (opens in a new tab) conçue comme une architecture complète, des musiques aux sonneries jusqu'aux sons d'acceptation joués par les terminaux de paiement. Le communiqué ne chiffre aucun effet. Il montre où une entreprise place le son quand elle le prend au sérieux, sur le paiement validé, une interaction rare, décisive et répétée au fil des mois.

Apple va plus loin dans ses recommandations pour visionOS, le système de son casque. Ses guides d'interface indiquent (opens in a new tab) que les utilisateurs gardent en général le son actif en le portant et qu'une application qui ne joue aucun son, surtout dans un moment immersif, peut paraître sans vie et même sembler cassée. Le silence, dans un environnement où le son est attendu, se lit comme une panne. Sur le web, il se lit comme la norme, ce qui laisse à un site la possibilité de choisir. Les mises en page convergent (opens in a new tab), les mêmes composants et les mêmes polices se retrouvent partout. Un son de confirmation dessiné pour un site ne se retrouve nulle part ailleurs. Le visiteur qui l'entend n'a aucun autre site auquel le comparer.

Quand un son d'interface a sa place sur un site web

Les guides des systèmes d'exploitation ont déjà tranché la question de la fréquence. Le guide Material de Google hiérarchise les sons (opens in a new tab) en quatre niveaux. Les sons héroïques marquent un moment rare, une réussite ou une étape majeure. Les sons d'interface primaires accompagnent des actions fréquentes et doivent pouvoir être entendus souvent sans paraître agaçants ni redondants. En 2024, l'équipe son de Google résumait la règle (opens in a new tab) en une phrase. Plus une interaction est fréquente, moins son son doit s'imposer. L'abus prive de relief les moments que l'on voulait souligner.

NiveauFréquenceSur un site
HéroïqueRareLa commande validée, le rendez-vous confirmé, la fin d'une expérience immersive
PrimaireFréquentUn bouton principal, l'envoi d'un formulaire, un basculement d'état
SecondaireOccasionnelUne erreur de saisie, une notification dans l'interface
AmbiantContinu et décoratifLa texture sonore d'une scène 3D ou d'une page immersive, que le visiteur coupe d'un geste

Les quatre niveaux de son du guide Material et ce qu'ils deviennent sur un site

Le même guide consacre une section au silence, jugé aussi important que le son. Il écarte trois situations. Les interfaces qui demandent de la discrétion, les utilisateurs qui ont demandé à ne pas être interrompus et les actions accomplies très souvent n'ont pas besoin de son. Une navigation entre les pages, un survol de menu ou un défilement entrent dans la troisième catégorie. Apple formule la même idée par le comportement de l'interrupteur silencieux de l'iPhone. Quand il est basculé, seuls les sons explicitement demandés (opens in a new tab) continuent, comme une vidéo lancée ou une alarme. Les clics de clavier, les effets sonores et les retours d'interface sont coupés. L'étude de Pielot le confirme d'une autre manière. Ses données ne contiennent aucune preuve qu'un téléphone en silencieux ralentit la réponse aux notifications. Le son ne sert donc pas à déclencher l'action. Il sert à qualifier l'action une fois faite.

L'accessibilité fixe la dernière limite. Le critère 1.4.2 des WCAG (opens in a new tab), de niveau A, exige qu'un son qui démarre seul et dure plus de trois secondes puisse être mis en pause ou réglé indépendamment du volume du système. La raison est concrète. Une personne qui navigue avec un lecteur d'écran entend la page par la synthèse vocale et un fond sonore la couvre. Un son d'interface d'une fraction de seconde, déclenché par un geste, ne tombe pas sous cette règle. Un fond ambiant y tombe. Il reste une lacune que le web n'a pas comblée. CSS propose des requêtes de préférence pour le mouvement réduit, le contraste, la transparence ou les données (opens in a new tab), qu'un site peut lire pour s'adapter. Il n'en existe aucune pour le son et aucune proposition connue ne va en ce sens. Un site qui joue des sons doit donc offrir son propre réglage visible et s'en souvenir d'une visite à l'autre.

Ce que le navigateur impose et ce qu'il laisse choisir

Un contexte audio créé avant le premier geste du visiteur naît suspendu et la page doit le réveiller dans la foulée d'un clic ou d'une touche, un enchaînement que Chrome documente (opens in a new tab). Le premier son d'un site est donc au plus tôt une réponse au premier geste, jamais un accueil. Cette contrainte convient au son d'interface, qui répond par définition à une action.

Une subtilité de l'iPhone décide ensuite de ce qui est entendu. Sur Safari iOS, les sons produits par la Web Audio API passent par le canal de la sonnerie et l'interrupteur silencieux les coupe. Une vidéo ou un fichier audio lu par un élément de page passe par le canal des médias, que l'interrupteur ne touche pas. Un rapport ouvert en mars 2022 auprès de WebKit décrit ce comportement (opens in a new tab) et la réponse d'Apple. La session audio d'une page est par défaut de type ambiant. Elle est donc coupée quand le téléphone est en silencieux. Depuis iOS 17, une page peut se déclarer de type lecture pour passer outre. Cette déclaration fait l'objet d'une spécification du W3C (opens in a new tab), publiée en brouillon de travail le 13 novembre 2024. Pour un son d'interface, le bon choix est de ne pas passer outre. La doctrine d'Apple range les retours d'interface parmi les sons non essentiels que le mode silencieux doit couper. Un site qui contourne ce réglage joue un son que le visiteur a explicitement refusé.

Reste la facture du son lui-même. Le guide d'Apple recommande de faire varier légèrement la hauteur et le volume d'un même fichier à chaque lecture plutôt que de multiplier les fichiers, ce qui évite la répétition mécanique d'un son identique. Le principe des earcons de Blattner complète cette règle. Les sons d'un même site forment une famille, où le son d'une erreur et celui d'une réussite partagent un timbre et se distinguent par le motif. Le visiteur reconnaît alors la voix du site avant de reconnaître le message.

Un canal vide dans un web qui se ressemble

Le silence du web est une réponse à des abus, décidée par trois navigateurs entre 2017 et 2019 avant d'être inscrite dans la spécification. Elle protège le visiteur et elle fixe le cadre. Ce cadre interdit tout son avant le premier geste, tout son qui passe outre le mode silencieux et tout fond qui couvre un lecteur d'écran sans commande pour l'arrêter. Dans ce cadre, un site garde la possibilité de répondre à une action par un son, sur les moments rares que les guides de Google et d'Apple réservent à cet usage, une commande validée, un rendez-vous confirmé ou la fin d'un parcours.

Les sites convergent vers les mêmes mises en page et les mêmes composants. Le canal sonore y est resté vide par habitude plutôt que par contrainte. Un site qui y place une signature courte, rare et que le visiteur peut couper d'un geste occupe une dimension de l'expérience que la quasi-totalité des sites laisse inoccupée.