Definición
El tiempo total desde que se envía una petición a un sistema hasta que el sistema completa y devuelve el resultado de esa petición o transacción específica.

Principio

Principio
El tiempo de respuesta comprende el tiempo de cola/espera, el tiempo de procesamiento/servicio y la latencia de comunicación; puede medirse por petición, en promedio o mediante percentiles de cola — la elección de la métrica afecta la interpretación respecto a experiencia de usuario y cumplimiento de SLA.

Demostración

Demostración
Una API HTTP que recibe un POST, pone la tarea en cola durante 5 ms, la procesa en 50 ms y devuelve respuesta con 20 ms de ida y vuelta de red tiene un tiempo de respuesta observado de ~75 ms; medir el percentil 99 sobre peticiones revela si peticiones lentas raras afectan la experiencia del usuario.

Aplicación incorrecta

Aplicación incorrecta
Usar solo el tiempo de respuesta medio para juzgar rendimiento e ignorar la latencia en cola o confundir tiempo de respuesta con throughput; por ejemplo, un sistema con baja latencia media pero percentil 99.9 muy alto puede dar malas experiencias bajo carga.

Consecuencia

Consecuencia
Controlar el tiempo de respuesta mejora la percepción de rendimiento, cumple SLAs y puede reducir el abandono de usuarios; optimizar puede requerir reducir colas, paralelizar trabajo o priorizar peticiones críticas.

Inversión

Inversión
Si se invierte el foco hacia throughput únicamente, el sistema puede maximizar peticiones/s a costa de altos tiempos de respuesta y mala interactividad; a la inversa, minimizar tiempo de respuesta para todas las peticiones puede resultar excesivamente costoso.

Límite

Límite
El tiempo de respuesta aplica a una petición o transacción individual y excluye operaciones asíncronas en segundo plano de consistencia eventual salvo que afecten la finalización observable; la medición debe especificar método de muestreo, origen temporal (cliente vs servidor) y alcance.

Tensión semántica

Tensión semántica
A menudo se usa intercambiablemente con latencia, pero latencia puede denotar retraso de red unidireccional mientras que tiempo de respuesta incluye procesamiento del servidor; existe tensión con throughput (peticiones/s) donde hay compensaciones entre menor latencia y mayor throughput.

Síntesis

Síntesis
El tiempo de respuesta es la duración de extremo a extremo experimentada por una petición, compuesta por espera, procesamiento y demoras de comunicación; una evaluación significativa requiere análisis de percentiles y definiciones claras de medición vinculadas al impacto en el usuario o métricas SLA.