Definición
Un método estadístico no paramétrico que aproxima la distribución muestral de un estimador mediante el muestreo repetido con reemplazo del conjunto de datos observado y recalculando el estimador en cada remuestreo.
Principio
Principio
Tratar la muestra observada como un proxy de la distribución poblacional y usar remuestreo con reemplazo para generar estimaciones de variabilidad de estadísticas sin depender de supuestos paramétricos.
Demostración
Demostración
Dado n puntos de datos observados, extraer B muestras bootstrap (cada una de tamaño n con reemplazo), calcular la mediana muestral para cada remuestreo y usar la distribución empírica de estas medianas para construir intervalos de confianza y estimar sesgo.
Aplicación incorrecta
Aplicación incorrecta
Usar el bootstrap simple en series temporales con fuerte dependencia o en muestras muy pequeñas e interpretar los intervalos bootstrap como exactos cuando fallan las condiciones de intercambiabilidad o representatividad.
Consecuencia
Consecuencia
Permite inferencia aproximada (errores estándar, intervalos de confianza, corrección de sesgo) para estimadores complejos cuya distribución muestral analítica es inaccesible o intratable.
Inversión
Inversión
La inferencia paramétrica analítica obtiene propiedades muestrales a partir de modelos de distribución asumidos y fórmulas cerradas, en lugar de aproximarlas remuestreando los datos observados.
Límite
Límite
Asume que la muestra observada es representativa y que las observaciones son intercambiables o que la dependencia se modela (p. ej., bootstrap por bloques); excluye la aplicación ingenua a datos no intercambiables sin ajuste.
Tensión semántica
Tensión semántica
Compite con métodos bayesianos y paramétricos asintóticos: el bootstrap ofrece cuantificación de incertidumbre frequentista basada en los datos, mientras que el bayesiano incorpora información a priori y estructura de modelo.
Síntesis
Síntesis
El remuestreo bootstrap aproxima la variabilidad muestral de estimadores al extraer repetidamente con reemplazo de los datos observados, produciendo distribuciones empíricas utilizadas para cuantificar la incertidumbre sin un modelo paramétrico fuerte.