Définition
Processus d'encodage de l'information en utilisant moins de bits qu'une représentation originale en supprimant la redondance ou en exploitant des régularités statistiques ou structurelles, produisant des représentations récupérables (sans perte) ou approximatives (avec perte).
Principe
Principe
Modéliser la source ou la structure des données pour identifier les parties prévisibles ou redondantes, puis mapper les séquences en mots‑code dont la longueur reflète la surprisal (entropie). Les schémas sans perte conservent la récupération exacte ; les schémas avec perte échangent fidélité contre un meilleur taux en supprimant l'information jugée non pertinente perceptuellement ou pour la tâche.
Démonstration
Démonstration
Un fichier texte avec mots répétés est encodé par codage de Huffman (ou méthodes dictionnaire comme LZW) : les tokens fréquents reçoivent des mots‑code plus courts, produisant un flux binaire plus court reconstruit exactement (sans perte). Une image est transformée et quantifiée en JPEG : de petits coefficients sont éliminés pour réduire la taille avec une perte visuelle acceptable (avec perte).
Mauvaise application
Mauvaise application
Tenter de compresser des données déjà proches du maximum d'entropie (par ex. données chiffrées ou aléatoires) donne peu ou pas de réduction et peut augmenter la taille. Employer une compression avec perte lorsque la reconstruction bit‑par‑bit est requise (par ex. dossiers légaux) provoque des pertes inacceptables.
Conséquence
Conséquence
Réduit les coûts de stockage et de transmission et permet de nouveaux usages (streaming, archivage). La compression introduit des compromis : coût de calcul, latence, perte éventuelle de qualité et sensibilité à un mauvais ajustement du modèle ; des bornes inférieures strictes existent (entropie) qui empêchent une compression arbitraire.
Inversion
Inversion
Expansion des données ou chiffrement qui produit des sorties à haute entropie : sans exploiter la redondance, les représentations sont plus longues ou intentionnellement indiscernables du hasard, empêchant la réduction de taille et compliquant l'analyse ultérieure.
Limite
Limite
S'applique aux représentations d'information (texte, images, audio, données structurées). L'efficacité dépend des statistiques de la source et de la mesure de distorsion choisie ; des limites fondamentales sont fixées par la théorie de l'information (entropie) et par les exigences de fidélité. La compression se distingue du chiffrement (visant la confidentialité) bien que les sorties puissent paraître similaires.
Tension sémantique
Tension sémantique
Tension entre objectifs sans perte et avec perte : le sans perte préserve chaque bit mais offre des taux de compression plus faibles ; le avec perte obtient des taux supérieurs au prix de la fidélité. Tension aussi entre compresseurs universels (sans modèle) et compresseurs basés sur modèle (plus efficaces si le modèle est adapté).
Synthèse
Synthèse
La compression de données construit une représentation compacte en exploitant la structure prévisible ou redondante des données — choisissant des encodages réversibles pour tout préserver ou des approximations irréversibles pour échanger fidélité contre réduction de taille — conformément aux limites théoriques d'entropie et aux contraintes pratiques de fidélité.