Mean Opinion Score (MOS) : ce que c’est et comment le SBC maintient la qualité vocale

Tôt ou tard, tout opérateur vocal doit répondre à une question directe : quelle est la qualité de l’audio, en un chiffre ? Le Mean Opinion Score (MOS) est ce chiffre. Quand un client dit qu’un appel « sonnait mal », le MOS est ce qui permet de transformer cette impression en quelque chose de mesurable, de traçable et de défendable auprès d’un transporteur.
Dans cet article, nous allons expliquer ce que signifie MOS et ce que l’échelle représente, d’où vient le score à l’origine, les trois façons différentes dont il est mesuré aujourd’hui, ce qui constitue un bon score, et où le Session Border Controller (SBC) intervient dans sa production. Si vous gérez une infrastructure vocale et traitez des tickets de qualité d’appel, le MOS est le langage commun qui relie ce qu’un auditeur entend à ce que votre réseau fait.
Que signifie MOS et que représente l’échelle
MOS signifie Mean Opinion Score. C’est l’évaluation standard de la qualité vocale perçue, exprimée sur une échelle à cinq points définie par l’ITU-T : 5 est excellent, 4 est bon, 3 est acceptable, 2 est médiocre et 1 est mauvais. En pratique, un score est rarement un nombre entier, et on voit généralement des valeurs comme 4.2 ou 3.6.
Le chiffre de référence pour la plupart des opérateurs est 4.0. Un MOS égal ou supérieur à 4.0 est considéré comme une qualité téléphonique (toll quality), le standard d’un appel téléphonique traditionnel clair, et c’est l’objectif de tout service vocal de qualité professionnelle. Les scores entre 3.5 et 4.0 sont acceptables mais notablement compressés ou affectés par le réseau. En dessous d’environ 3.5, les utilisateurs commencent à se plaindre, et en dessous de 3.0 un appel devient difficile à maintenir.
Le fait que le MOS soit un score perceptuel, plutôt qu’une mesure purement technique, est important pour tout ce qui suit. Il est conçu pour capturer ce qu’un humain entend réellement, c’est précisément pourquoi le score a commencé sa vie comme un test d’écoute.
D’où vient le MOS : les tests subjectifs P.800
Le MOS original est une mesure subjective, définie dans la recommandation ITU-T P.800. Un panel d’auditeurs écoute un ensemble d’échantillons audio dans des conditions contrôlées et évalue chacun de 1 à 5 selon la méthode Absolute Category Rating. Le score publié est la moyenne arithmétique de ces opinions individuelles, ce qui explique littéralement le nom : la moyenne des scores d’opinion des auditeurs.
Cette méthode est la référence absolue parce qu’elle mesure la perception directement. Aucun algorithme n’a à deviner ce qu’une personne penserait, puisque de vraies personnes ont fait l’évaluation. Sa faiblesse est d’ordre pratique. Réunir un panel d’écoute est lent et coûteux, et il ne peut évaluer que des échantillons enregistrés après coup. On ne peut pas lancer un test P.800 sur l’appel en cours dont un client se plaint en ce moment. C’est cet écart qui a poussé l’industrie vers la mesure du MOS par machine.
Du subjectif à l’objectif : PESQ et POLQA
Pour approximer un panel d’écoute sans les personnes, l’ITU-T a standardisé des algorithmes de notation objectifs. PESQ (Perceptual Evaluation of Speech Quality, ITU-T P.862) et son successeur POLQA (Perceptual Objective Listening Quality Analysis, ITU-T P.863) fonctionnent tous deux par comparaison : on fournit à l’algorithme un échantillon de référence propre et l’échantillon dégradé sorti de l’autre côté du réseau, et il modélise comment une oreille et un cerveau humains percevraient la différence, produisant un score de type MOS.
Ce sont des méthodes intrusives à référence complète. « Référence complète » signifie qu’elles ont besoin du signal original non dégradé pour la comparaison, et « intrusif » signifie qu’elles injectent un signal de test connu dans le chemin plutôt que d’écouter le trafic en direct. Cela les rend excellentes pour les tests en laboratoire, l’évaluation des codecs et les sondes actives programmées, où vous contrôlez les deux extrémités. Cela signifie aussi qu’elles ne sont pas l’outil pour évaluer passivement chaque appel en direct, car les vrais appels ne sont pas accompagnés d’une copie de référence.
Estimer le MOS en production : le E-Model et le R-Factor
La méthode qui évalue les appels en direct est le E-model, défini dans ITU-T G.107. Au lieu de comparer des échantillons audio, il calcule la qualité à partir des paramètres du réseau et du codec de l’appel lui-même. Le E-model produit un facteur de notation de transmission, le R-factor, sur une échelle d’environ 0 à 100, puis convertit cette valeur R en un MOS estimé.
Le R-factor est construit à partir des dégradations qui affectent un appel : le codec utilisé, la perte de paquets, la gigue (qui devient une perte effective lorsque les paquets arrivent trop tard pour être reproduits) et le délai unidirectionnel. Chacun de ces facteurs est un sujet en soi, et la perte de paquets en particulier est l’un des plus grands contributeurs à une baisse de score. Si vous souhaitez approfondir le diagnostic de ces dégradations, le guide de dépannage VoIP détaille comment chacune se manifeste lors d’un appel. Pour le MOS, l’essentiel est que le E-model les intègre toutes en un seul chiffre estimé.
L’avantage est décisif pour les opérateurs : le E-model est passif et ne nécessite aucun signal de référence, il peut donc produire une estimation continue de la qualité pour chaque appel en cours. C’est pourquoi le MOS que vous voyez sur un tableau de bord de surveillance est presque toujours une estimation du E-model, pas un score de panel.
Plafonds des codecs : pourquoi un appel ne peut jamais dépasser son codec
Chaque codec établit un MOS maximum qu’un appel l’utilisant peut atteindre. La compression et l’encodage appliqués par le codec fixent un plafond, et tout ce que le réseau fait ensuite ne peut que le réduire. Un réseau parfait ne peut pas pousser un appel au-delà du plafond de son codec.
Les valeurs de référence couramment citées placent le G.711 bande étroite dans les 4 bas à moyens, le G.729 bande étroite autour de 4.0 (plus bas, car il compresse davantage), et les codecs large bande comme G.722 et Opus encore plus haut, puisqu’ils transportent une plage audio plus large que les auditeurs évaluent comme plus claire. Les chiffres exacts varient selon les tests, mais le classement est constant et la leçon est pratique : le codec que vous négociez fixe le plafond, et la gestion du réseau protège la marge en dessous. La comparaison G.711 vs G.729 détaille les compromis qui établissent ces plafonds.
Le même score de 1 à 5 est produit de trois façons différentes. Seule l’estimation passive du E-model est couramment utilisée par appel en production, calculée à partir des statistiques réseau et média en direct. Cliquez pour agrandir.
Comment un SBC mesure et maintient le MOS
Un Session Border Controller trouve sa place ici parce que, lorsque l’ancrage média est activé, il peut observer le média directement et collecter des informations de qualité par appel. Le RTP transporte l’audio, et son protocole compagnon RTCP transporte des statistiques de qualité à travers l’appel. Le format de rapport étendu, RTCP-XR défini dans la RFC 3611, ajoute un bloc de rapport de métriques VoIP qui peut transporter un MOS estimé avec les chiffres de perte et de délai, de sorte que les données de qualité voyagent avec l’appel plutôt que d’être reconstruites après coup.
Parce qu’un SBC fonctionne comme un back-to-back user agent, terminant complètement le média de chaque côté, il peut observer la qualité par appel et maintenir des références par codec, et il peut identifier sur quel segment de l’appel se situe un problème. Localiser une baisse de qualité sur un segment réseau spécifique est au cœur du dépannage de qualité d’appel, et la pratique plus large du suivi conjoint du MOS, de la gigue, de la latence et de la perte de paquets est couverte dans le guide des bonnes pratiques de surveillance VoIP.
ProSBC expose cela directement. Il produit des scores MOS par appel accompagnés de mesures de gigue et de perte de paquets, et les rend disponibles via SNMP et l’export CDR, afin que les données s’intègrent à la plateforme de surveillance que vous utilisez déjà. Pour une inspection approfondie, ProSBC prend aussi en charge la capture de paquets en direct et la trace complète SIP et RTP, permettant à un ingénieur d’extraire les paquets réels derrière un score faible. TelcoBridges possède plus de vingt ans d’expérience en déploiement SIP et média derrière cette capacité, et ProSBC gère le média à l’échelle opérateur.
Un avertissement honnête : un SBC estime et localise la qualité, il ne la fabrique pas. Il ne peut pas créer de la bande passante qui n’existe pas ou récupérer de l’audio qu’un réseau tiers a déjà perdu. Ce qu’il vous donne, c’est un MOS précis par appel et les preuves pour désigner le segment responsable, ce qui constitue l’essentiel de ce que la résolution d’un ticket de qualité nécessite réellement.
Questions fréquentes
Que signifie MOS ?
MOS signifie Mean Opinion Score, l’évaluation standard de 1 à 5 de la qualité vocale perçue définie par l’ITU-T, où 5 est excellent et 1 est mauvais.
Quel est un bon score MOS pour la VoIP ?
Un MOS de 4.0 ou plus est considéré comme une qualité téléphonique et constitue l’objectif pour la voix professionnelle. Entre 3.5 et 4.0 est acceptable mais notablement affecté, et en dessous d’environ 3.5 les utilisateurs commencent à se plaindre.
Le MOS est-il évalué par une vraie personne ou par un algorithme ?
Les deux, selon la méthode. Le score P.800 original provient d’un panel d’auditeurs humains. PESQ et POLQA sont des algorithmes qui approximent un panel en comparant une référence à un échantillon dégradé, et le E-model estime le MOS à partir de paramètres réseau sans aucune écoute.
Quelle est la différence entre MOS, PESQ et POLQA ?
Le MOS est le score lui-même. PESQ (ITU-T P.862) et POLQA (ITU-T P.863) sont deux algorithmes objectifs qui produisent une valeur de type MOS en comparant un signal de référence connu à la sortie dégradée, POLQA étant le standard le plus récent qui gère aussi l’audio large bande.
Un SBC peut-il améliorer le MOS ?
Un SBC ne peut pas améliorer la qualité d’un audio qu’un réseau tiers a déjà dégradé. Il mesure le MOS par appel, localise un problème sur un segment spécifique et aide à prévenir l’auto-dégradation, c’est ainsi qu’il protège le score que vous avez plutôt que d’en inventer un meilleur.
Conclusion
Le MOS est un chiffre unique représentant un jugement humain, et sa crédibilité repose entièrement sur la méthodologie qui le sous-tend. Un score de panel selon P.800, un score algorithmique à référence complète de PESQ ou POLQA, et une estimation passive du E-model sont tous appelés MOS, mais ils sont produits de façons très différentes, et savoir lequel vous regardez vous indique à quel point lui faire confiance et comment agir. Pour les opérations en direct, l’estimation du E-model transportée par RTCP est le chiffre qui compte, et l’obtenir avec précision, par appel, c’est là que la périphérie du réseau fait son travail.
Maintenez et prouvez la qualité vocale avec ProSBC
Quand une plainte de qualité d’appel arrive sur votre bureau, un MOS par appel mesuré dans le chemin média est ce qui transforme « ça sonnait mal » en un fait exploitable. ProSBC produit des scores MOS par appel accompagnés de mesures de gigue et de perte de paquets et les expose via SNMP et CDR, afin qu’ils s’intègrent à la plateforme de surveillance que vous utilisez déjà. En tant que back-to-back user agent complet, il observe la qualité média sur chaque segment indépendamment, et il prend en charge la capture de paquets en direct et la trace complète SIP et RTP quand vous avez besoin d’inspecter les paquets derrière un score.
ProSBC supporte jusqu’à 60 000 sessions par serveur à partir de seulement 1,40 $ par session par an, et vous pouvez tout vérifier par vous-même dans le ProSBC Lab gratuit et permanent, une licence libre-service de trois sessions qui prend environ vingt minutes à configurer. Si vous préférez que vos tableaux de bord soient surveillés pour vous, le Monitoring as a Service s’appuie sur les mêmes données par appel. Pour une vue d’ensemble, le guide du Session Border Controller couvre tout ce qu’un SBC fait à la périphérie du réseau.
Vous préférez évaluer par vous-même d’abord ? Commencez votre essai gratuit de 30 jours.