Mean Opinion Score (MOS): qué es y cómo el SBC mantiene la calidad de voz

Tarde o temprano, todo operador de voz tiene que responder una pregunta directa: ¿qué tan bueno es el audio, en un número? Mean Opinion Score es ese número. Cuando un cliente dice que una llamada “se escuchó mal”, MOS es la forma de convertir eso en algo que se puede medir, rastrear y discutir con un operador.
En este artículo explicaremos qué significa MOS y qué representa la escala, de dónde proviene originalmente la puntuación, las tres formas diferentes en que se mide hoy, qué se considera una buena puntuación y dónde encaja un session border controller (SBC) en su obtención. Si usted administra infraestructura de voz y atiende tickets de calidad de llamadas, MOS es el lenguaje común que conecta lo que un oyente escucha con lo que su red está haciendo.
![]()
Qué significa MOS y qué representa la escala
MOS significa Mean Opinion Score. Es la calificación estándar de calidad de voz percibida, expresada en una escala de cinco puntos definida por la ITU-T: 5 es excelente, 4 es buena, 3 es aceptable, 2 es deficiente y 1 es mala. En la práctica, una puntuación rara vez es un número entero, por lo que normalmente se ven valores como 4.2 o 3.6.
El número en el que la mayoría de los operadores se anclan es 4.0. Un MOS igual o superior a 4.0 se considera calidad de línea fija (toll quality), el estándar de una llamada telefónica tradicional limpia, y es el objetivo de todo servicio de voz de grado empresarial. Las puntuaciones entre 3.5 y 4.0 son aceptables pero presentan compresión o efectos de red perceptibles. Por debajo de aproximadamente 3.5, los usuarios comienzan a quejarse, y por debajo de 3.0 una llamada es difícil de mantener.
La razón por la que MOS es una puntuación perceptual, y no una medición de ingeniería pura, importa para todo lo que sigue. Su propósito es capturar lo que un ser humano realmente escucha, que es exactamente la razón por la cual la puntuación nació como una prueba de escucha.
De dónde proviene MOS: pruebas subjetivas P.800
El MOS original es una medición subjetiva, definida en la Recomendación P.800 de la ITU-T. Un panel de oyentes escucha un conjunto de muestras de audio en condiciones controladas y califica cada una de 1 a 5 utilizando el método de calificación por categoría absoluta (Absolute Category Rating). La puntuación publicada es la media aritmética de esas opiniones individuales, que es de donde proviene literalmente el nombre: la media de las puntuaciones de opinión de los oyentes.
Este método es el estándar de oro porque mide la percepción directamente. Ningún algoritmo tiene que adivinar lo que pensaría una persona, porque personas reales hicieron la calificación. Su debilidad es la practicidad. Reunir un panel de escucha es lento y costoso, y solo puede calificar muestras grabadas después del hecho. No se puede ejecutar una prueba P.800 sobre la llamada en vivo de la que un cliente se está quejando en este momento. Esa limitación es lo que empujó a la industria hacia la medición de MOS por máquina.
De subjetivo a objetivo: PESQ y POLQA
Para aproximar un panel de escucha sin las personas, la ITU-T estandarizó algoritmos de puntuación objetiva. PESQ (Perceptual Evaluation of Speech Quality, ITU-T P.862) y su sucesor POLQA (Perceptual Objective Listening Quality Analysis, ITU-T P.863) funcionan por comparación: se alimenta al algoritmo con una muestra de referencia limpia y la muestra degradada que salió del otro extremo de la red, y este modela cómo un oído y cerebro humanos percibirían la diferencia, produciendo una puntuación similar al MOS.
Estos son métodos intrusivos de referencia completa. “Referencia completa” significa que necesitan la señal original sin degradar para comparar, e “intrusivo” significa que inyectan una señal de prueba conocida en la ruta en lugar de escuchar el tráfico en vivo. Eso los hace excelentes para pruebas de laboratorio, evaluación de codec y sondas activas programadas, donde se controlan ambos extremos. También significa que no son la herramienta para calificar pasivamente cada llamada en vivo a medida que ocurre, porque las llamadas reales no vienen con una copia de referencia adjunta.
Estimación de MOS en producción: el modelo E y el factor R
El método que sí califica llamadas en vivo es el modelo E, definido en ITU-T G.107. En lugar de comparar muestras de audio, calcula la calidad a partir de los parámetros de red y codec de la propia llamada. El modelo E produce un factor de calificación de transmisión, el factor R, en una escala de aproximadamente 0 a 100, y luego convierte ese valor R en un MOS estimado.
El factor R se construye a partir de las degradaciones que afectan una llamada: el codec en uso, la pérdida de paquetes, el jitter (que se convierte en pérdida efectiva cuando los paquetes llegan demasiado tarde para ser reproducidos) y el retardo unidireccional. Cada uno de estos es un tema en sí mismo, y la pérdida de paquetes en particular es una de las mayores entradas individuales para una puntuación en descenso. Si desea el lado diagnóstico de esas degradaciones, la guía de resolución de problemas VoIP explica cómo cada una se manifiesta en una llamada. Para MOS, el punto es que el modelo E las integra todas en un solo número estimado.
La ventaja es decisiva para los operadores: el modelo E es pasivo y no necesita señal de referencia, por lo que puede producir una estimación continua de calidad para cada llamada en curso. Por eso el MOS que se ve en un panel de monitoreo es casi siempre una estimación del modelo E, no una puntuación de panel.
Techos de codec: por qué una llamada nunca puede superar su codec
Cada codec establece un MOS máximo que una llamada que lo utilice puede alcanzar. La compresión y codificación que aplica el codec establece un techo, y todo lo que la red hace a partir de ahí solo puede restar. Una red impecable no puede llevar una llamada por encima del techo de su codec.
Las cifras de referencia comúnmente citadas ubican a G.711 de banda estrecha en los 4 bajos a medios, a G.729 de banda estrecha alrededor de 4.0 (más bajo, porque comprime más agresivamente), y a los codec de banda ancha como G.722 y Opus más arriba aún, ya que transportan un rango de audio más amplio que los oyentes califican como más claro. Los números exactos varían según la prueba, pero el orden es consistente y la lección es práctica: el codec que se negocia establece el techo, y gestionar la red protege el margen debajo de él. La comparación entre G.711 y G.729 detalla las compensaciones que establecen esos techos.
La misma puntuación de 1 a 5 se produce de tres formas diferentes. Solo la estimación pasiva del modelo E se utiliza comúnmente por llamada en producción, donde se calcula a partir de estadísticas de red y medios en vivo. Haga clic para ampliar.
Cómo un SBC mide y ayuda a mantener el MOS
Un session border controller se gana su lugar aquí porque, cuando el anclaje de medios está habilitado, puede observar los medios directamente y recopilar información de calidad por llamada. RTP transporta el audio, y su protocolo complementario RTCP transporta estadísticas de calidad de vuelta a través de la llamada. El formato de informe extendido, RTCP-XR definido en RFC 3611, agrega un bloque de informe de métricas VoIP que puede transportar un MOS estimado junto con cifras de pérdida y retardo, de modo que los datos de calidad viajan con la llamada en lugar de reconstruirse después.
Dado que un SBC opera como un back-to-back user agent, terminando completamente los medios en cada lado, puede observar la calidad por llamada y mantener líneas base por codec, y puede identificar en qué tramo de la llamada se encuentra un problema. Localizar una caída de calidad en un segmento de red específico es el núcleo de la resolución de problemas de calidad de llamadas, y la práctica más amplia de rastrear MOS, jitter, latencia y pérdida de paquetes en conjunto se cubre en la guía de mejores prácticas de monitoreo VoIP.
ProSBC expone esto directamente. Produce puntuaciones MOS por llamada junto con cifras de jitter y pérdida de paquetes, y las hace disponibles a través de SNMP y salida CDR, de modo que los datos fluyen hacia cualquier plataforma de monitoreo que usted ya utilice. Para inspección detallada, ProSBC también admite captura de paquetes en vivo y traza de llamada completa de SIP y RTP, lo que permite a un ingeniero extraer los paquetes reales detrás de una puntuación baja. TelcoBridges cuenta con más de veinte años de experiencia en despliegues SIP y de medios detrás de esta capacidad, y ProSBC maneja medios a escala de operador.
Una advertencia honesta: un SBC estima y localiza la calidad, no la fabrica. No puede crear ancho de banda que no existe ni recuperar audio que una red de terceros ya degradó. Lo que le brinda es un MOS preciso por llamada y la evidencia para señalar el segmento responsable, que es la mayor parte de lo que realmente se requiere para resolver un ticket de calidad.
Preguntas frecuentes
¿Qué significa MOS?
MOS significa Mean Opinion Score, la calificación estándar de 1 a 5 de la calidad de voz percibida definida por la ITU-T, donde 5 es excelente y 1 es mala.
¿Qué es una buena puntuación MOS para VoIP?
Un MOS de 4.0 o superior se considera calidad de línea fija (toll quality) y es el objetivo para voz de grado empresarial. Entre 3.5 y 4.0 es aceptable pero perceptiblemente afectada, y por debajo de aproximadamente 3.5 los usuarios comienzan a quejarse.
¿El MOS lo califica una persona real o un algoritmo?
Ambos, dependiendo del método. La puntuación original P.800 proviene de un panel de oyentes humanos. PESQ y POLQA son algoritmos que aproximan un panel comparando una referencia con una muestra degradada, y el modelo E estima el MOS a partir de parámetros de red sin ninguna escucha.
¿Cuál es la diferencia entre MOS, PESQ y POLQA?
MOS es la puntuación en sí. PESQ (ITU-T P.862) y POLQA (ITU-T P.863) son dos algoritmos objetivos que producen un valor similar al MOS comparando una señal de referencia conocida con la salida degradada, siendo POLQA el estándar más reciente que también maneja audio de banda ancha.
¿Puede un SBC mejorar el MOS?
Un SBC no puede elevar la calidad del audio que una red de terceros ya degradó. Mide el MOS por llamada, localiza un problema en un tramo específico y ayuda a prevenir la degradación autoinfligida, que es la forma en que protege la puntuación que usted tiene en lugar de inventar una más alta.
Conclusión
MOS es un solo número que representa un juicio humano, y su credibilidad proviene enteramente de la metodología detrás de él. Una puntuación de panel bajo P.800, una puntuación de algoritmo de referencia completa de PESQ o POLQA, y una estimación pasiva del modelo E, todas se denominan MOS, pero se producen de formas muy diferentes, y saber cuál está observando le indica cuánto confiar en ella y cómo actuar en consecuencia. Para operaciones en vivo, la estimación del modelo E que viaja sobre RTCP es el número que importa, y obtenerlo con precisión, por llamada, es donde el borde de la red cumple su función.
Mantenga y demuestre la calidad de voz con ProSBC
Cuando un reclamo de calidad de llamada llega a su escritorio, un MOS por llamada medido en la ruta de medios es lo que convierte “se escuchó mal” en un hecho sobre el cual actuar. ProSBC produce puntuaciones MOS por llamada junto con cifras de jitter y pérdida de paquetes y las expone a través de SNMP y CDR, de modo que fluyen hacia la plataforma de monitoreo que usted ya utiliza. Como un back-to-back user agent completo, observa la calidad de medios en cada tramo de forma independiente, y admite captura de paquetes en vivo y traza de llamada completa de SIP y RTP cuando necesita inspeccionar los paquetes detrás de una puntuación.
ProSBC escala hasta 60,000 sesiones por servidor a partir de tan solo $1.40 por sesión por año, y usted puede comprobarlo todo en el ProSBC Lab gratuito y permanente, una licencia de autoservicio de tres sesiones que tarda aproximadamente veinte minutos en configurarse. Si prefiere que los paneles de monitoreo sean supervisados por usted, Monitoring as a Service se basa en los mismos datos por llamada. Para una visión más amplia, la guía de session border controller cubre todo lo que un SBC hace en el borde de la red.
¿Prefiere evaluar por su cuenta primero? Inicie su prueba gratuita de 30 días.