Définition
Le temps total depuis la soumission d'une requête à un système jusqu'à ce que le système achève et renvoie le résultat pour cette requête ou transaction spécifique.

Principe

Principe
Le temps de réponse comprend le temps d'attente en file, le temps de traitement/prestation et la latence de communication ; il peut être mesuré par requête, moyenné ou analysé en percentiles de queue — le choix de mesure influence l'interprétation pour l'expérience utilisateur et la conformité aux SLA.

Démonstration

Démonstration
Une API HTTP qui reçoit un POST, place la tâche en file pendant 5 ms, la traite en 50 ms et renvoie une réponse avec 20 ms de latence réseau a un temps de réponse observé d'environ 75 ms ; mesurer le 99e percentile des requêtes révèle si des requêtes lentes rares nuisent à l'expérience utilisateur.

Mauvaise application

Mauvaise application
Se fier uniquement au temps de réponse moyen pour juger des performances tout en ignorant la latence en queue ou confondre temps de réponse et débit ; par exemple, un système avec une latence moyenne faible mais un 99,9e percentile très élevé peut produire une mauvaise expérience sous charge.

Conséquence

Conséquence
Maîtriser le temps de réponse améliore la perception de performance, respecte les SLA et peut réduire l'abandon utilisateur ; l'optimisation peut nécessiter la réduction de l'attente en file, la parallélisation du travail ou la priorisation des requêtes critiques.

Inversion

Inversion
Si l'on inverse l'objectif — ne se concentrer que sur le débit — le système peut maximiser les requêtes/s au prix de temps de réponse élevés et d'une mauvaise interactivité ; à l'inverse, minimiser le temps de réponse pour toutes les requêtes peut devenir très coûteux.

Limite

Limite
Le temps de réponse concerne une requête ou transaction individuelle et exclut les opérations asynchrones en arrière‑plan à cohérence éventuelle sauf si elles affectent la complétion observable ; la mesure doit préciser la méthode d'échantillonnage, l'origine temporelle (client vs serveur) et le périmètre.

Tension sémantique

Tension sémantique
Souvent utilisé comme synonyme de latence, alors que la latence peut désigner le délai réseau unidirectionnel tandis que le temps de réponse inclut le traitement serveur ; tension également avec le débit (requêtes/s) où existent des compromis entre latence et débit.

Synthèse

Synthèse
Le temps de réponse est la durée de bout en bout vécue pour une requête, composée d'attente, de traitement et de délais de communication ; une évaluation pertinente exige l'analyse des percentiles et des définitions de mesure claires liées à l'impact utilisateur ou aux SLA.