Definición
El proceso de codificar información usando menos bits que una representación original mediante la eliminación de redundancia o la explotación de regularidades estadísticas o estructurales, produciendo representaciones recuperables (sin pérdida) o aproximadas (con pérdida).

Principio

Principio
Modelar la fuente o la estructura de los datos para identificar partes predecibles o redundantes, y mapear secuencias a palabras‑código cuya longitud refleje la sorpresa (entropía). Los esquemas sin pérdida permiten recuperación exacta; los esquemas con pérdida intercambian fidelidad por mayor compresión al descartar información considerada irrelevante perceptual o para la tarea.

Demostración

Demostración
Un archivo de texto con palabras repetidas se codifica con Huffman (o métodos de diccionario como LZW): los tokens frecuentes reciben palabras‑código más cortas, produciendo una secuencia de bits más corta que puede reconstruirse exactamente (sin pérdida). Una imagen se transforma y cuantiza en JPEG: se eliminan coeficientes pequeños para reducir tamaño con pérdida visual aceptable (con pérdida).

Aplicación incorrecta

Aplicación incorrecta
Intentar comprimir datos que ya están cerca de la entropía máxima (p. ej. datos cifrados o aleatorios) produce poca o ninguna reducción e incluso puede aumentar el tamaño. Usar compresión con pérdida cuando se requiere reconstrucción bit‑exacta (p. ej. registros legales) causa pérdidas de datos inaceptables.

Consecuencia

Consecuencia
Reduce costes de almacenamiento y transmisión y puede habilitar nuevos usos (transmisión en streaming, archivado). La compresión introduce compensaciones: coste computacional, latencia, posible pérdida de calidad y sensibilidad a un mal ajuste del modelo; existen límites inferiores estrictos (entropía) que impiden la compresión arbitraria.

Inversión

Inversión
Expansión de datos o cifrado que produce salidas de alta entropía: sin explotar redundancia, las representaciones son más largas o intencionalmente indistinguibles del azar, lo que impide la reducción de tamaño y complica análisis posteriores.

Límite

Límite
Se aplica a representaciones de información (texto, imágenes, audio, datos estructurados). La eficacia depende de las estadísticas de la fuente y de la medida de distorsión elegida; los límites fundamentales están fijados por la teoría de la información (entropía) y por requisitos específicos de fidelidad. La compresión se distingue del cifrado (que busca confidencialidad) aunque las salidas puedan parecer similares.

Tensión semántica

Tensión semántica
Tensión entre objetivos sin pérdida y con pérdida: lo sin pérdida preserva cada bit pero logra menores ratios de compresión; lo con pérdida alcanza ratios mayores a costa de fidelidad. También tensión entre compresores universales (sin modelo) y compresores basados en modelos (más eficientes si el modelo encaja).

Síntesis

Síntesis
La compresión de datos construye una representación compacta explotando la estructura predecible o redundante de los datos: eligiendo codificaciones reversibles para preservar toda la información o aproximaciones irreversibles para intercambiar fidelidad por menor tamaño, conforme a los límites teóricos de entropía y a las restricciones prácticas de fidelidad.