La estadística bidimensional se ocupa de estudiar poblaciones en las que a cada individuo le corresponden dos valores de las variables \(X\) e \(Y\).
En este tema se desarrollarán conceptos y herramientas que permitirán determinar la relación que existe entre las variables \(X\) e \(Y\) de una distribución bidimensional.
Variable estadística bidimensional:
En una población en la que se estudian dos caracteres, una variable estadística bidimensional es un par de variables estadísticas \((X,Y)\) correspondientes a los caracteres observados conjuntamente para cada individuo de la población.
Distribución bidimensional:
Una distribución bidimensional es un conjunto de valores \((x,y)\) correspondientes a los valores observados de la variable estadística \((X,Y)\), junto con sus correspondientes frecuencias.
Los datos pueden organizarse en forma de tabla:
- Tabla de entrada simple (datos apareados):
Si tenemos \(N\) datos formados por \(k\) pares de valores son distintos \((x_1,y_1)\), \((x_2,y_2)\), \(\dots\),\((x_k,y_k)\) que pueden repetirse:
| \(x_i\) | \(y_i\) | \(f_i\) |
| \(x_1\) | \(y_1\) | \(f_1\) |
| \(x_2\) | \(y_2\) | \(f_2\) |
| \(\vdots\) | \(\vdots\) | \(\vdots\) |
| \(x_k\) | \(y_k\) | \(f_k\) |
| \(\sum f_i=N\) |
Las \(f_i\) son las frecuencias absolutas de cada par de valores \((x_i,y_i)\).
- Tabla de doble entrada:
Si la variable \(X\) puede tomar \(m\) valores distintos \(x_1\), \(x_2\), \(\dots\), \(x_m\) y la variable \(Y\), \(n\) valores distintos \(y_1\), \(y_2\), \(\dots\), \(y_n\):
|
\(X\setminus Y\) |
\(y_1\) | \(y_2\) | \(\dots\) | \(y_n\) | Total |
| \(x_1\) | \(f_{11}\) | \(f_{12}\) | \(\dots\) | \(f_{1n}\) | \(\sum f_{1j}\) |
| \(x_2\) | \(f_{21}\) | \(f_{22}\) | \(\dots\) | \(f_{2n}\) | \(\sum f_{2j}\) |
| \(\vdots\) | \(\vdots\) | \(\vdots\) | \(\ddots\) | \(\vdots\) | \(\vdots\) |
| \(x_m\) | \(f_{m1}\) | \(f_{m2}\) | \(\dots\) | \(f_{mn}\) | \(\sum f_{mj}\) |
| Total | \(\sum f_{j1}\) | \(\sum f_{j2}\) | \(\dots\) | \(\sum f_{jn}\) | \(N\) |
Las \(f_{ij}\) son las frecuencias absolutas de cada par \((x_i,y_j)\).
Ejemplo: La siguiente tabla muestra los datos correspondientes a la talla de pantalón y al número de zapato de un grupo de personas:
| Talla de pantalón | \(28\) | \(28\) | \(30\) | \(30\) | \(32\) | \(32\) | \(34\) | \(34\) | \(34\) | \(36\) | \(36\) |
| Número de zapato | \(38\) | \(40\) | \(39\) | \(40\) | \(41\) | \(42\) | \(41\) | \(41\) | \(43\) | \(43\) | \(44\) |
Organiza los datos en una tabla de entrada simple y en una tabla de doble entrada.
Solución
Sean \(X=\)"Talla de pantalón" e \(Y=\)"Número de zapato".
Tabla de entrada simple:
| \(x_i\) | \(y_i\) | \(f_i\) |
| \(28\) | \(38\) | \(1\) |
| \(28\) | \(40\) | \(1\) |
| \(30\) | \(39\) | \(1\) |
| \(30\) | \(40\) | \(1\) |
| \(32\) | \(41\) | \(1\) |
| \(32\) | \(42\) | \(1\) |
| \(34\) | \(41\) | \(2\) |
| \(34\) | \(43\) | \(1\) |
| \(36\) | \(43\) | \(1\) |
| \(36\) | \(44\) | \(1\) |
| \(11\) |
Tabla de doble entrada:
|
\(X\setminus Y\) |
\(38\) | \(39\) | \(40\) | \(41\) |
\(42\) |
\(43\) |
\(44\) |
Total |
| \(28\) | \(1\) | \(0\) | \(1\) | \(0\) | \(0\) | \(0\) | \(0\) | \(2\) |
| \(30\) | \(0\) | \(1\) | \(1\) | \(0\) | \(0\) | \(0\) | \(0\) | \(2\) |
| \(32\) | \(0\) | \(0\) | \(0\) | \(1\) | \(1\) | \(0\) | \(0\) | \(2\) |
| \(34\) | \(0\) | \(0\) | \(0\) | \(2\) | \(0\) | \(1\) | \(0\) | \(3\) |
| \(36\) | \(0\) | \(0\) | \(0\) | \(0\) | \(0\) | \(1\) | \(1\) | \(2\) |
| Total | \(1\) | \(1\) | \(2\) | \(3\) | \(1\) | \(2\) | \(1\) | \(11\) |
Distribuciones marginales
- La primera y la última columna de la tabla de doble entrada corresponden a la distribución unidimensional de la variable \(X\) y recibe el nombre de distribución marginal de \(X\).
- La primera y la última fila de la tabla de doble entrada corresponden a la distribución unidimensional de la variable \(Y\), que recibe el nombre de distribución marginal de \(Y\).
Ejemplo (continuación 1): Haz las tablas de frecuencia marginales de \(X\) e \(Y\) .
Solución
Tabla marginal de \(X\):
| \(\ x_i \ \) | \(\ f_i \ \) |
| \(28\) | \(2\) |
| \(30\) | \(2\) |
| \(32\) | \(2\) |
| \(34\) | \(3\) |
| \(36\) | \(2\) |
| \(11\) |
Tabla marginal de \(Y\):
| \(\ y_i \ \) | \(\ f_i \ \) |
| \(38\) | \(1\) |
| \(39\) | \(1\) |
| \(40\) | \(2\) |
| \(41\) | \(3\) |
| \(42\) | \(1\) |
| \(43\) | \(2\) |
| \(44\) | \(1\) |
| \(11\) |
Observación
En las tablas de entrada simple, cuando cada par de valores \((x_i,y_i)\) es único, es decir, las frecuencias \(f_i\) son todas igual a \(1\), o cuando los datos se escriben repetidos tantas veces como aparecen, la columna de las \(f_i\) suele omitirse, ya que no aporta información adicional.
| \(\ x_i \ \) | \(\ y_i \ \) |
| \(x_1\) | \(y_1\) |
| \(x_2\) | \(y_2\) |
| \(\vdots\) | \(\vdots\) |
| \(x_N\) | \(y_N\) |
Distribuciones condicionadas
- La primera columna y la columna correspondiente al valor \(Y=y_j\) de la tabla de doble entrada forman una distribución unidimensional denominada distribución condicionada de \(X\) para \(Y=y_j\).
- La primera fila y la fila correspondiente al valor \(X=x_j\) de la tabla de doble entrada forman una distribución unidimensional denominada distribución condicionada de \(Y\) para \(X=x_j\).
Ejemplo (continuación 2): Escribe las tablas de frecuencia condicionadas de \(X\) para \(Y=41\) y de \(Y\) para \(X=30\).
Solución
Tabla condicionada de \(X\) para \(Y=41\):
| \(\ x_i \ \) | \(\ f_i \ \) |
| \(32\) | \(1\) |
| \(34\) | \(2\) |
| \(3\) |
Tabla marginal de \(Y\) para \(X=30\):
| \(\ y_i \ \) | \(\ f_i \ \) |
| \(39\) | \(1\) |
| \(40\) | \(1\) |
| \(2\) |
Nube de puntos o diagrama de dispersión:
Es la representación en el plano de los puntos \((x,y)\) de la distribución.
Diagrama de dispersión del ejemplo anterior:

Correlación
La correlación es un término que se utiliza para indicar que existe relación entre las dos variables de una distribución bidimensional.
Si los puntos del diagrama de dispersión se sitúan próximos a la gráfica de una determinada función se considera que las variables están correlacionadas. El caso más habitual es el de correlación lineal, es decir, aquel en el que la nube de puntos se aproxima a una línea recta y, por tanto, los incrementos de una de las variables se reflejan proporcionalmente en los incrementos de la otra variable.
- La correlación es directa o positiva si al aumentar los valores de una variable, los valores de la otra variable también aumentan.
- La correlación es inversa o negativa si al aumentar los valores de una variable, los valores de la otra disminuyen.
- La correlación es más fuerte (débil) cuando más próxima (lejos) esté la nube de puntos de una línea recta.
- Si la nube de puntos se sitúa exactamente sobre una línea recta, la correlación es perfecta y se de dice entonces que existe dependencia funcional entre las variables.
En el próximo punto se presentarán los parámetros de una distribución bidimensional y se utilizarán para determinar cuantitativamente el grado de correlación entre las variables.