| 19 | 20 | 18 | 19 | 18 |
| 18 | 22 | 21 | 20 | 19 |
| 18 | 19 | 21 | 19 | 19 |
| 21 | 21 | 20 | 19 | 18 |
| 20 | 19 | 19 | 20 | 19 |
Versión PDF
II-1123 Estadística para Ingeniería Industrial II
10 de agosto de 2026
Preguntas generadoras
Introducción
Distribuciones muestrales
Ley de los grandes números
Teorema del límite central (TLC)
Resultados importantes
¿Por qué es necesario muestrear?
¿Qué es el sesgo estadístico y cómo evitarlo?
¿Cuáles métodos de selección de muestra existen y cuándo se usan?
¿Qué es el error de muestreo y qué consecuencias prácticas tiene?
¿Qué es una distribución muestral?
¿Para qué es útil el TLC?
¿Qué ventajas y desventajas tiene el TLC?
¿Por qué muestrear?
Los métodos estadísticos que son usados para tomar decisiones y arribar a conclusiones acerca de las poblaciones son generalmente conocidos como inferencia estadística.
En esta técnica se usa la información de una muestra para inferir dichas conclusiones.

La inferencia estadística se divide en dos grandes áreas:
Estimación de parámetros
Pruebas de hipótesis.
Ambas nociones serán abordadas en otras lecciones, aunque la primera es una vieja conocida en esta área de conocimiento. Por ejemplo, el estimador:
Los estadísticos como \bar{X}, S y \hat{P} (así como otros: \hat{\Theta}) son variables aleatorias.
Estas son variables aleatorias porque dependen de la muestreos que también son o deben ser aleatorios.
A la inferencia estadística le corresponde la toma de decisiones acerca de una población, basada en la información contenida en una muestra aleatoria de esa población.
Supóngase que estamos interesados en la edad promedio (en años) de los estudiantes de este curso, pues ese dato es relevante para la toma de decisiones respecto a las actividades por planear.
Los siguientes datos corresponden a la edad de las personas presentes en la primera sesión de laboratorio del curso en el I-S 2025 grupo 003 de RRF.
| 19 | 20 | 18 | 19 | 18 |
| 18 | 22 | 21 | 20 | 19 |
| 18 | 19 | 21 | 19 | 19 |
| 21 | 21 | 20 | 19 | 18 |
| 20 | 19 | 19 | 20 | 19 |
Nótese cómo la población NO se parece a una distribución normal, por el contrario, se parece más a una lognormal.
Tome en cuenta esto para el desarrollo del resto de la sección.
Cada valor numérico en los datos (en este caso la edad) es el valor observado de una variable aleatoria.
Al subconjunto de valores numéricos se le conoce como muestra aleatoria.
El propósito de las muestras aleatorias es obtener información acerca de los parámetros desconocidos de la población.
La media de la población, por ejemplo, se puede estimar a partir de una muestra aleatoria.
Por tanto \bar{X} es una función de los valores observados en la muestra aleatoria.
Entonces \bar{X} es un valor que variaría de muestra a muestra, lo que lo convierte en una variable aleatoria (como las que estudiamos antes).
Esta variable aleatoria se llama estadístico
Ya hemos trabajado con estadísticos antes, por ejemplo, en el tema de descripción de datos.
Entonces:
Se van a extraer, aleatoriamente, 20 muestras de tamaño 4 y se van a calcular los estadísticos \bar{X} y S.
Cada uno de ellos, como variable aleatoria, va a seguir una distribución particular que vamos a averiguar paso a paso.
Como acabamos de ver, tanto \bar{X} como S son variables aleatorias en función del muestreo.
Es decir, son distribuciones muestrales de la media y de la desviación respectivamente.
Las distribuciones muestrales suelen ser muy útiles para hacer inferencia estadística cuando:
La población es demasiado grande, no es viable obtenerla toda.
La distribución que siguen los datos originales, no es una distribución normal.
La componen teoremas que describen el comportamiento de las medias de muestras de variables aleatorias. Asegura que en una sucesión de variables aleatorias independientes idénticamente distribuidas con varianza finita, al aumentar el número de ensayos, el promedio de estas converge a la esperanza (media teórica) de las variables involucradas.
En otras palabras, este permite explicar también como a medida que aumenta el tamaño de la muestra, la media muestral \bar{X} se aproxima a la media poblacional \mu.
Se divide en dos:
Establece que se puede encontrar un tamaño de muestra n que garantice con una probabilidad tan cercana a uno como se quiera, que el promedio que se obtendría en esa muestra no difiera del promedio poblacional en menos de una cantidad tan pequeña como se desee \varepsilon.
\lim_{n \to \infty} P\left(\vert{}\bar{X}_n - \mu\vert{} < \varepsilon\right) = 1
Usando la desigualdad de Chebyshev, podemos acotar esta probabilidad:
P\left(|\bar{X}_n - \mu| \ge \varepsilon\right) \le \frac{\sigma^2}{n \varepsilon^2}
Para una población con media desconocida y \sigma=2, determine el tamaño de muestra n que garantice una probabilidad de al menos 0.95 de que la media muestral no se aleje de \mu en más de 0.5 (\varepsilon = 0.5).
Aplicando la cota de Chebyshev:
Despejando n:
Es uno de los teoremas más útiles en el campo de la estadística.
La distribución normal se puede usar frecuentemente para aproximar las distribuciones de otras variables aleatorias, como consecuencia del Teorema del Límite Central (TLC).
El TLC dice, de manera simplificada, que la distribución de las medias muestrales (aleatorias e independientes) sigue una distribución normal, siempre que el tamaño de las muestras sea lo suficientemente grande.
¿Qué es suficientemente grande? Muchos libros de texto enuncian que siempre que n \ge 30, no obstante, estudios relativamente “recientes” (de más de 15 años) dicen que n depende de, entre otras cosas, de la asimetría de la distribución que siguen los datos de la población. En resumen, a mayor asimetría, mayor tamaño de muestra es requerido.
Consulte esta infografía para desmontar el mito del n \ge 30.
El siguiente enlace contiene una serie de demostraciones computacionales que demuestran la dependencia del TLC de la asimetría. La línea rosada en los gráficos representa a partir de donde se considera que los datos siguen la distribución normal.
Note cómo a mayor asimetría, mayor tamaño de muestra se necesita para que se siga la distribución normal.
En resumen, tamaño de muestra pequeños (n=4 o n=5) funcionan bien en la mayoría de los casos, particularmente cuando la población es continua, unimodal y simétrica.
Tamaños de muestra grandes son requeridos en otras situaciones, dependiendo de la forma de la población.
Entonces, n \ge 30 es una recomendación si no se conoce la forma de la población, pues con este tamaño de muestra se cumpliría satisfactoriamente la aproximación a la normal en una gran mayoría de los casos.
Observe la siguiente simulación
Cambie el tamaño muestral y note cómo la variabilidad de la distribución teórica varía, entre más grande, menos variabilidad

En teoría, esa distribución muestral estará definida por la misma media que la poblacional y con una desviación estándar igual al cociente entre la desviación estándar poblacional dividida por la raíz cuadrada del tamaño de muestra (\sigma / \sqrt{n}).
Note de la fórmula que a mayor n, menor será la desviación de esta distribución normal
\bar{X} \sim N\left(\mu, \frac{\sigma}{\sqrt{n}}\right)
Gracias al TLC, podemos acercarnos a conocer las características de la población, mediante la toma de muestras.
Por ejemplo, la estimación de la media es directa.
Para obtener la desviación se despeja la fórmula anterior.
Finalmente
Formalmente:
Si X_1, X_2, \dots, X_n son variables aleatorias independientes e idénticamente distribuidas (i.i.d.) con media \mu y varianza finita \sigma^2, entonces la distribución de la variable estandarizada Z converge a una normal estándar N(0,1) conforme n \to \infty:
Z = \frac{\bar{X} - \mu}{\sigma / \sqrt{n}} \xrightarrow{d} N(0,1)
Mientras más grande el valor de n, mejor es la aproximación.
Repase esto con la simulación del muestreo de las edades.
A partir de los datos de una muestra, se puede aproximar razonablemente el comportamiento de la población.
\bar{X} \sim N\left(\mu, \frac{\sigma}{\sqrt{n}}\right)
| Estadístico | Distribución muestral esperada |
|---|---|
| \bar{X} |
Si la población es normal o la muestra suficientemente grande Distribución normal \bar{X} \sim N\left(\mu, \frac{\sigma}{\sqrt{n}}\right) |
| Estadístico | Distribución muestral esperada |
|---|---|
| S^2 |
Si la población es normal Si es una varianza \frac{(n-1)S^2}{\sigma^2} \sim \chi^2_{n-1} Si son dos varianzas (bajo el supuesto de igualdad) \frac{S_1^2 / \sigma_1^2}{S_2^2 / \sigma_2^2} \sim F_{(n_1-1, n_2-1)} |
| Estadístico | Distribución muestral esperada |
|---|---|
| \hat{P} |
Siempre que n \cdot p \ge 5 y n \cdot (1-p) \ge 5 \hat{P} \sim N\left(p, \sqrt{\frac{p(1-p)}{n}}\right) |