| i | \(x_i\) | \(y_i\) | \(x-\bar{x}\) | \(y-\bar{y}\) | \((x-\bar{x}) \cdot (y-\bar{y}\)) |
|---|---|---|---|---|---|
| 1 | 2 | 4 | |||
| 2 | 4 | 2 | |||
| 3 | 6 | 4 | |||
| 4 | 8 | 6 |
Versión PDF
II-1120 Estadística para Ingeniería Industrial I
3 de agosto de 2026
La estadística es una herramienta poderosa, pero su verdadero valor se obtiene cuando se aplica de manera adecuada y se interpreta dentro de un contexto específico.
Sin contexto, los datos y los análisis estadísticos carecen de significado y utilidad práctica.
It’s easy to lie with statistics, but it’s hard to tell the truth without them - Andrejs Dunkels
Para Babbie (2000), una teoría es una explicación sistemática de los hechos y leyes observadas que se relacionan con un aspecto específico de la vida.
Organizan las observaciones y les asignan un sentido. A menudo, las expectativas comprenden la idea de causalidad (Dado un evento A -> Ocurre un evento B).
Las teorías no deben confundirse con una opinión



En este curso, hemos trabajado múltiples veces con la idea de causalidad.
Por ejemplo, en estadística descriptiva establecíamos relaciones como:
En probabilidad:
Como pueden ver, es tema conocido, en esta clase se formaliza el concepto.
La causalidad se refiere a una relación de causa y efecto entre dos variables, donde un cambio en una variable (la causa) provoca un cambio en otra (el efecto).
Para que exista causalidad:
Una variable confusora (o confounding variable) es una tercera variable que distorsiona la relación entre dos variables que se están estudiando.
Puede hacer parecer que hay una relación causal entre ellas cuando en realidad esa relación es espuria o exagerada.
En ciencia e ingeniería a menudo las personas recolectan datos para determinar la relación que existe entre dos variables.
Correlación: Indica que dos variables están relacionadas (se mueven juntas), pero no implica necesariamente que una cause a la otra.
Causalidad: Implica una dirección clara del efecto. Si A causa B, entonces al intervenir en A, esperaríamos un cambio en B.
Se pueden presentar relaciones espurias entre variables.
Relación espuria: relación matemática de dos acontecimientos que NO tienen conexión lógica, aunque puede implicar que la tienen debido a un tercer factor no considerado aún.


El sesgo del superviviente es uno muy famoso. Quizá algún día haya visto esta imagen.
Es una falacia lógica que consiste en centrarse en aquellos que han logrado sobrevivir a un proceso, ignorando a aquellos que no lo lograron.
En esa imagen, las partes dañadas de los aviones que regresan de la batalla muestran los lugares en los que pueden sufrir daños y aun así volver a casa; los que son alcanzados en los lugares no señalados no sobreviven. Centrarse en reforzar las partes dañadas de los aviones supervivientes es un sesgo de supervivencia.

Tomado de @picanumeros
En 2020 se llevó a cabo un estudio para medir la evolución de la salud mental de la población estadounidense durante la pandemia de COVID-19.
Dicho estudio se basaba en una encuesta longitudinal con cuatro oleadas (en abril, mayo, junio y septiembre de ese año).
Sin embargo, un análisis de los datos en bruto nos daría un resultado sorprendente: que la salud mental mejoró durante el transcurso del estudio, a pesar de seguir en lo más duro de la pandemia.

La paradoja de Simpson sucede cuando al analizar los datos desagregados por grupos resulta que las conclusiones estadísticas obtenidas entre las variables son opuestas.
En esta falacia estadística cayeron muchas personas en la época de pandemia por COVID – 19. Sobre todo por parte de negacionistas.
Hay que tener cuidado con los análisis estadísticos cuando hay en juego variables ocultas.


Tomado de @picanumeros


Los datos se clasifican por niveles de medición. El nivel de medición y el tipo de variable determinan los cálculos que se llevan a cabo con el fin de resumir y presentar los datos.
Es decir, que no todos los tipos de datos se analizan igual.
En visualización de datos, estudiamos el gráfico de dispersión, ese en el que puede observar la relación entre dos variables al graficar una variable en el eje X y otra en el eje Y.
Al realizar este tipo de análisis conviene en primer lugar graficar los datos.
Por ejemplo, en el gráfico de la derecha puede encontrar la relación que existe entre el salario promedio mensual y la edad de las personas, clasificadas por género y en general.

Toda causalidad implica asociación, pero no toda asociación implica causalidad.
La covarianza mide cómo varían conjuntamente dos variables cuantitativas. Indica si al aumentar una, la otra tiende a aumentar o disminuir.
Como la covarianza NO está normalizada, se dificulta su interpretación, por eso se prefiere la correlación.
No obstante, esta tiene múltiples aplicaciones y técnicas como el AFE (que se estudia en psicometría) prefieren el uso de la matriz varianza-covarianza sobre las correlaciones.
Cov(X, Y) = E[(X-\mu_X)(Y-\mu_Y)]
S_{XY} = \frac{1}{n-1} \sum_{i=1}^{n}(x_i-\bar{x})(y_i-\bar{y})
Cov(X,Y) > 0: tienden a aumentar o disminuir juntos linealmente (X y Y)
Cov(X,Y) < 0: si una aumenta, la otra disminuye, linealmente (X y Y)
Cov(X,Y) = 0: no hay relación lineal aparente (X y Y)
Recuerde que, como no está normalizada, no es sencillo decir si la relación es fuerte o débil.
| i | \(x_i\) | \(y_i\) | \(x-\bar{x}\) | \(y-\bar{y}\) | \((x-\bar{x}) \cdot (y-\bar{y}\)) |
|---|---|---|---|---|---|
| 1 | 2 | 4 | |||
| 2 | 4 | 2 | |||
| 3 | 6 | 4 | |||
| 4 | 8 | 6 |
Los promedios son:
\bar{x} = 5 \\ \bar{y} = 4
Y por tanto la covarianza es:
S_{XY} = \frac{0 + 2 + 0 + 6}{4-1} = 2.67
r = \frac{Cov(X, Y)}{S_X \cdot S_Y}
Su valor está siempre entre -1 y 1
Para aplicar la correlación de Pearson se asume un comportamiento normal entre ambas variables. Es importante no perder de vista este requisito, aún cuando en este curso no se aborda formalmente la distribución normal.
Calcule e interprete la correlación de Pearson a partir de los resultados del Ejemplo 01.
Cov(X, Y) = 2.67
S_X=2.58
S_Y = 1.63
r = \frac{2.67}{2.58\cdot 1.63}=0.63
\rho = 1 - \frac{6 \sum D^2}{N(N^2-1)}
Se deben numerar los datos según su orden de menor a mayor para la primera (i) y segunda columna (t).
La diferencia al cuadrado de los órdenes es D^2.
La interpretación es la misma que para Pearson, con la diferencia de que Spearman no evalúa la relación lineal, sino la relación monótona entre dos variables continuas o discretas.
En una relación monótona, las variables tienden a cambiar al mismo tiempo, pero no necesariamente a un ritmo constante.
Calcule el coeficiente de correlación de Spearman entre el Coeficiente intelectual (CI), que se va a denotar por i y las horas de TV a la semana (t).
Como parte de un ejercicio académico calcule también el coeficiente de correlación de Pearson, aunque no sea lo correcto.
| i | t |
|---|---|
| 106 | 7 |
| 86 | 0 |
| 100 | 28 |
| 100 | 50 |
| 99 | 28 |
| 103 | 28 |
| 97 | 20 |
| 113 | 12 |
| 113 | 7 |
| 110 | 17 |
Observe el gráfico, ¿hay alguna relación lineal?

| \(i\) | \(t\) | \(Orden_i\) | \(Orden_t\) | \(D^2\) |
|---|---|---|---|---|
| 106 | 7 | 7.0 | 2.5 | |
| 86 | 0 | 1.0 | 1.0 | |
| 100 | 28 | 4.5 | 8.0 | |
| 100 | 50 | 4.5 | 10.0 | |
| 99 | 28 | 3.0 | 8.0 | |
| 103 | 28 | 6.0 | 8.0 | |
| 97 | 20 | 2.0 | 6.0 | |
| 113 | 12 | 9.5 | 4.0 | |
| 113 | 7 | 9.5 | 2.5 | |
| 110 | 17 | 8.0 | 5.0 |
\rho = 1 - \frac{6\cdot 196}{10(10^2-1)} = -0.188
r = -0.071
Es una alternativa a Spearman, que se dice que es más robusto, pues es menos sensible a valores atípicos y se comporta mejor con muestras pequeñas.
Tanto Kendall como Spearman se pueden usar sin mayor inconveniente con datos continuos, pero siendo consciente que esos datos continuos se transforman a rangos.
\tau = \frac{n_c -n_d}{\frac{1}{2} \cdot n \cdot(n-1)}
Siendo n_c el número de pares concordantes y n_d el número de pares discordantes. Desde luego n es el número total de observaciones.
Se realiza el mismo ejercicio que en el ejemplo 03, pero se resuelve con \tau de Kendall.
Por su complejidad de cálculo, se recomienda realizar la correlación de Kendall con software estadístico.
En el caso particular de R puede usar este código cor(x, y, method = "kendall").
\tau = -0.167
r_pb= \frac{\bar{X_1}-\bar{X_0}}{S_X} \cdot \sqrt{\frac{n_1 \cdot n_0}{n \cdot (n-1)}}
Esta correlación también se conoce como índice de discriminación, que es un concepto muy usado en encuestas.
El tiempo de secado al que se expone una unión de dos dispositivos médicos se cree está relacionado con la producción de piezas buenas (0) y malas (1).
Se toman los datos que se muestran a la derecha. Calcule e interprete.
| Tiempo | Pieza |
|---|---|
| 2 | 0 |
| 3 | 1 |
| 16 | 0 |
| 17 | 1 |
| 5 | 1 |
| 6 | 1 |
| 17 | 0 |
| 7 | 1 |
| 15 | 1 |
| 8 | 0 |
| 9 | 1 |
| 10 | 1 |
| 11 | 0 |
| 12 | 0 |
| 13 | 0 |
| Medida | Valor |
|---|---|
| \(X_1\) | 9.00 |
| \(X_0\) | 11.29 |
| \(S_X\) | 4.93 |
| \(n_1\) | 8.00 |
| \(n_0\) | 7.00 |
| \(n\) | 15.00 |
r_pb=\frac{9-11.29}{4.93}\sqrt{\frac{8\cdot 7}{15 \cdot (15-1)}}=-0.239
r_b = \frac{\bar{X_1} - \bar{X_0}}{s_x} \cdot \frac{p \cdot q}{y}
Donde y es un factor de corrección calculado como:
y=\frac{1}{\sqrt{2\pi}}e^{-z^2/2}
con z asociado al punto de corte q entre ambas categorías. La estimación de z se aborda en otros cursos.
Suponga la variable Pieza del Ejemplo 05 es construida de forma artificial. Si no soporta una presión de 500 psi, es defectuosa. Resuelva el Ejemplo 05 con la correlación biserial.
Utilice esta calculadora para obtener el valor de z.
Calculadora de z
Ingrese q:
\(z = \) —-
Complete los valores faltantes.
| Medida | Valor |
|---|---|
| \(X_1\) | 9.000 |
| \(X_0\) | 11.290 |
| \(S_X\) | 4.930 |
| \(p\) | 0.533 |
| \(q\) | 0.467 |
| \(z\) | |
| \(y\) |
El resultado es:
r_b = -0.291
La interpretación es equivalente a la punto-biserial.
Es una medida estadística para determinar la relación que existe entre dos variables dicotómicas naturales. Se basa en tablas de contingencia.
\phi = \frac{a\cdot d - b \cdot c}{\sqrt{(a+b)\cdot(c+d)\cdot(a+c)\cdot(b+d)}}
| Y=1 | Y=0 | |
|---|---|---|
| X=1 | a | b |
| X=0 | c | d |
En el proceso de envasado y etiquetado de una planta de producción de ungüentos y cremas se cree que si la etiqueta está “torcida” (1) aumenta el chance de que el marcado de la fecha de vencimiento resulte ilegible (1).
| Ilegible=1 | Legible=0 | |
|---|---|---|
| Torcida=1 | a=4 | b=1 |
| Recta=0 | c=1 | d=4 |
\phi = \frac{4\cdot 4 - 1 \cdot 1}{\sqrt{(4+1)\cdot(1+4)\cdot(4+1)\cdot(1+4)}} \\ \phi = 0.6
La tetracórica es un caso especial de esta correlación, y por ende, en esta tampoco se recomienda su cálculo a mano.
Para ambos casos se le provee de código en R para solventar estos ejercicios de ser necesario.
Además, cuenta con otros ejemplos en Excel para todas las correlaciones a excepción de estas.
Existe un conjunto de datos famoso, conocido como el Datasaurus, donde una serie de pares de puntos representando algunas formas (círculos, elipses y cruces, entre otros).
Todos ellos muestran patrones diferentes pero las principales características numéricas son las mismas.

| Nombre de la correlación | Tipo de variables involucradas | Supuestos |
|---|---|---|
| Pearson | Continua + Continua | Linealidad, normalidad, métrica |
| Spearman | Ordinal + Ordinal o Continua no normal | Basada en rangos (no paramétrica) |
| Point-Biserial | Continua + Dicotómica natural | La dicotómica representa una categoría real |
| Biserial | Continua + Dicotómica artificial | Se asume variable continua subyacente, distribución normal |
| Phi (ϕ) | Dicotómica + Dicotómica naturales | Ambas categorías reales (no transformadas) |
| Tetracórica | Dicotómica + Dicotómica artificiales | Ambas variables reflejan continuas latentes normales |
| Policórica | Ordinal + Ordinal | Ambas reflejan variables continuas latentes, categorías ordenadas |
Las fuentes consultadas para esta sesión son muy variadas y profundizan en exceso en temas que no competen enteramente a este curso. Razón por la cual se omite voluntariamente.
Fuentes específicas fueron señaladas a los largo de la presentación.