Nadie encuesta a 47 millones de personas: se pregunta a mil y se estima el resto. Esta lección explica por qué eso funciona y con qué margen de error.
El resultado clave
Si se toman muestras de tamaño n de una población de media μ y desviación σ, las medias muestrales se reparten así:
x̄ ~ N(μ, σ : √n)
Se llama teorema central del límite, y lo notable es que vale aunque la población original no sea normal, con tal de que la muestra sea grande.
El error típico
σx̄ = σ : √n
Aquí está el detalle que decide el presupuesto de una encuesta: como divide entre la raíz de n, para reducir el error a la mitad hay que cuadruplicar la muestra. Pasar de 1 000 a 2 000 encuestados apenas mejora nada; hay que llegar a 4 000.
Población con σ = 10, muestras de n = 100
- σx̄ = 10 : √100 = 10 : 10 = 1.
- Las medias muestrales se agrupan con desviación 1 alrededor de la media real.
- Con n = 400: 10 : 20 = 0,5. Cuadruplicando la muestra el error se ha reducido a la mitad.
Qué muestra vale
Todo esto exige que la muestra sea aleatoria y representativa. Una muestra grande pero sesgada —preguntar solo por teléfono fijo, o solo a quien contesta— no se arregla con más tamaño: el sesgo no se diluye.
Creer que doblar la muestra reduce el error a la mitad. Divide entre √n, así que doblar la muestra reduce el error solo un 29 %.
De 1 000 a 2 000 encuestados, la mitad de errorPara la mitad de error hacen falta 4 000Es la raíz de n, no n.