Estadística

1. Población, muestra y variables

La estadística recoge, organiza e interpreta datos. La población es el conjunto de todos los individuos que se quiere estudiar y la muestra es un subconjunto de ella. Para que la muestra sea representativa debe elegirse al azar y ser suficientemente grande.

Una variable es la característica que se estudia:

Tipo Valores Ejemplos
Cualitativa cualidades color de ojos, deporte favorito
Cuantitativa discreta números aislados número de hermanos, nota
Cuantitativa continua cualquier valor de un intervalo estatura, peso, tiempo
NotaSesgo

Si preguntamos por el deporte favorito solo en un club de fútbol, la muestra está sesgada y no representa a toda la población.

2. Tablas de frecuencias

  • Frecuencia absoluta \(f_i\): veces que aparece el valor \(x_i\). Su suma es \(N\) (tamaño de la muestra).
  • Frecuencia relativa \(h_i=\dfrac{f_i}{N}\). Su suma es \(1\).
  • Porcentaje \(=100\cdot h_i\).
  • Frecuencias acumuladas \(F_i\) y \(H_i\): suman las anteriores hasta la actual.

Ejemplo: número de hermanos de \(20\) alumnos: \(0,1,1,2,1,0,3,2,1,4,2,0,1,2,2,1,3,1,0,2\).

\(x_i\) \(f_i\) \(h_i\) \(F_i\) %
0 4 0,20 4 20
1 7 0,35 11 35
2 6 0,30 17 30
3 2 0,10 19 10
4 1 0,05 20 5
20 1 100

Cuando hay muchos valores distintos o la variable es continua, se agrupan en intervalos (clases), cada uno representado por su marca de clase (el punto medio).

3. Gráficos estadísticos

  • Diagrama de barras: variables cualitativas o discretas; la altura es la frecuencia.
  • Polígono de frecuencias: une los extremos de las barras.
  • Histograma: variable continua agrupada; barras pegadas, con altura proporcional a la frecuencia.
  • Diagrama de sectores: reparte un círculo; el ángulo de cada sector es \(360^\circ\cdot h_i\).
  • Diagrama de cajas y bigotes: resume mínimo, cuartiles y máximo.

Ejemplo: el \(35\,\%\) de los alumnos con un hermano se representa con un sector de \(360^\circ\cdot0{,}35=126^\circ\).

Un diagrama de barras con las frecuencias cuatro, siete, seis, dos y uno, y un diagrama de sectores con las mismas categorías

Número de hermanos de los 20 alumnos en un diagrama de barras y en un diagrama de sectores.
AdvertenciaGráficos que engañan

Una escala que no empieza en cero, ejes sin rotular o dibujos en 3D pueden exagerar las diferencias. Mira siempre los ejes.

4. Medidas de centralización

Resumen en un solo número lo “típico” de los datos.

  • Moda (\(Mo\)): valor con mayor frecuencia (puede haber varias o ninguna).
  • Mediana (\(Me\)): valor central cuando se ordenan los datos. Con \(N\) par, es la media de los dos centrales.
  • Media \(\bar{x}\): \(\ \bar{x}=\dfrac{\sum x_i\,f_i}{N}\).

Con los datos de los \(20\) alumnos del apartado anterior: \(\bar{x}=\dfrac{0\cdot4+1\cdot7+2\cdot6+3\cdot2+4\cdot1}{20}=\dfrac{29}{20}=1{,}45\) hermanos, \(Me=1\) y \(Mo=1\).

Con datos agrupados en intervalos se usa la marca de clase como \(x_i\) y se obtiene una media aproximada: para \([150,160)\) con frecuencia \(4\) se toma \(x_i=155\).

La media es sensible a los valores atípicos; la mediana, no. En los salarios de una empresa donde casi todos cobran \(1\,500\) € y el director \(30\,000\) €, la mediana describe mejor lo típico.

Cuartiles

Los cuartiles \(Q_1,\ Q_2=Me,\ Q_3\) dividen los datos ordenados en cuatro partes con el mismo número de datos. El \(25\,\%\) queda por debajo de \(Q_1\) y el \(75\,\%\) por debajo de \(Q_3\).

Para calcularlos: \(Q_2\) es la mediana; \(Q_1\) es la mediana de la mitad inferior y \(Q_3\) la de la mitad superior (si hay un número impar de datos, la mediana no se incluye en ninguna mitad). Ejemplo: \(2,\ 3,\ 5,\ 6,\ 7,\ 9,\ 10,\ 12\) tiene \(Q_2=6{,}5\), \(Q_1=\frac{3+5}{2}=4\) y \(Q_3=\frac{9+10}{2}=9{,}5\).

Un dato se considera atípico si queda por debajo de \(Q_1-1{,}5\,(Q_3-Q_1)\) o por encima de \(Q_3+1{,}5\,(Q_3-Q_1)\).

5. Medidas de dispersión

Indican cuánto se alejan los datos del centro.

  • Rango: \(\ R=\text{máx}-\text{mín}\).
  • Recorrido intercuartílico: \(\ Q_3-Q_1\).
  • Varianza: \(\ \sigma^2=\dfrac{\sum f_i\,(x_i-\bar{x})^2}{N}=\dfrac{\sum f_i\,x_i^2}{N}-\bar{x}^2\).
  • Desviación típica: \(\ \sigma=\sqrt{\sigma^2}\), con las mismas unidades que los datos.
  • Coeficiente de variación: \(\ CV=\dfrac{\sigma}{\bar{x}}\) (en %), para comparar conjuntos con unidades o medias distintas.

Con los mismos datos: \(\sum f_ix_i^2=0+7+24+18+16=65\), luego \(\sigma^2=\dfrac{65}{20}-1{,}45^2=3{,}25-2{,}1025=1{,}1475\) y \(\sigma\approx1{,}07\) hermanos.

Comparar dos conjuntos. Dos clases tienen la misma nota media, \(6\), pero la clase A tiene \(\sigma=0{,}5\) y la B tiene \(\sigma=2\). En A las notas son muy parecidas; en B hay mucha diferencia entre alumnos. Una dispersión pequeña indica que la media es representativa y que los datos son más fiables como conjunto.

NotaHoja de cálculo

En una hoja de cálculo introduce los datos en una columna y usa =PROMEDIO(A1:A20), =MEDIANA(A1:A20), =MODA(A1:A20) y =DESVEST.P(A1:A20) para la media, la mediana, la moda y la desviación típica. También puedes crear gráficos de barras, sectores e histogramas con el asistente de gráficos.

TipResumen rápido
  • Tabla: \(f_i\), \(h_i=f_i/N\), \(F_i\).
  • Media \(\frac{\sum x_if_i}{N}\), mediana (centro), moda (más repetido).
  • Dispersión: rango, \(Q_3-Q_1\), varianza \(\sigma^2\) y desviación típica \(\sigma\).
  • Comparar conjuntos: mira a la vez el centro y la dispersión.

Debes saber hacer

  • Distinguir población y muestra, y tipos de variables.
  • Construir tablas de frecuencias y representarlas en gráficos adecuados.
  • Calcular e interpretar media, mediana, moda y cuartiles.
  • Calcular el rango, la varianza y la desviación típica, y comparar dos conjuntos de datos.
  • Detectar gráficos y muestras engañosos.

Saberes de la Orden de 30 de mayo de 2023 (BOJA nº 104) que se trabajan en este tema: MAT.3.E.1.1, MAT.3.E.1.2, MAT.3.E.1.3, MAT.3.E.1.4, MAT.3.E.1.5, MAT.3.E.1.6, MAT.3.E.1.7, MAT.3.E.3.