Skip to content

Resumen de Estadística descriptiva

Updated: at 12:15 AM

Conceptos estadísticos básicos

Video de ésta sección: https://youtu.be/45V4GQMG75c

Medidas de tendencia central

https://youtu.be/45V4GQMG75c

Promedio Aritmético

El promedio de una muestra:

X=i=1nXin\overline X = \frac{\sum_{i=1}^n X_i}{n} (sobre la muestra n<Nn < N )

Lo que significa sumar los valores de la muestra y dividir sobre el tamaño de la muestra.

El promedio en una población:

μ=i=1NXiN\mu = \frac{\sum_{i=1}^N X_i}{N} (sobre la población )

Ejemplo: Generemos los datos de manera seudoaleatoria:

  datos = ran.choices(opciones,k=10)
  datos = np.array(datos)

Eso genera el siguiente arreglo:

  array([1, 2, 2, 2, 2, 1, 1, 3, 1, 1])

En Python básico

Podemos averiguar su suma como:

  suma = sum(datos)

Lo que nos dá el número 16. Averiguamos su longitud como:

  longitud = len(datos)

Lo que nos dá el valor 10. Luego el promedio sería

  sum(datos)/len(datos)

Con Numpy

Ya trae una función, mean:

  np.mean(datos)

Mediana

X~\widetilde{X}: Aproximadamente la mitad de las observaciones son mayores a la mediana.

X~={X(n+12) n impar X(n2)+X(n2+1)2 n par \widetilde{X} = \begin{cases} X_{\left(\frac{n+1}{2}\right)} & \text{ n impar } \\ \frac{X_{\left(\frac{n}{2}\right)} + X_{\left(\frac{n}{2} + 1\right)}}{2} & \text{ n par } \\ \end{cases}

En Python

Primero ordenamos la serie:

   datos.sort()

Ahora la imprimimos:

   print(datos)

Cómo la longitud es par, tenemos que promediar la posición 5 y la 6. Que corresponderían a los índices 4 y 5, luego la mediana será:

   (datos[4]+datos[5])/2

Lo que resulta en 1.5

En Numpy

Se usa el comando np.median

   np.median(datos)

Moda

Es el dato que se repite más veces en una muestra.

Medidas de variabilidad

Videos de ésta sección en: https://youtu.be/TnChXWqAQN0

Varianza

Varianza de la población:

σ2=1Ni=1N(xiμ)2\sigma^2 = \frac{1}{N} \sum_{i=1}^N (x_i - \mu)^2

Varianza de la muestra:

S2=1n1i=1n(xix)2S^2 = \frac{1}{n-1} \sum_{i=1}^n (x_i - \overline x)^2

En Python básico

Lo hacemos paso a paso. Primero restamos el promedio de los datos. Esto se puede hacer así:

   datos-datos.mean()

Luego eso lo elevamos al cuadrado. Se puede hacer así:

   (datos-datos.mean())**2

Luego lo sumamos

   sum((datos-datos.mean())**2)

Si se trata de una población, dividimos por el tamaño.

   (sum((datos-datos.mean())**2))/len(datos)

Obtenemos 0.44. Si fuera una muestra sería dividir entre el tamaño menos 1.

   (sum((datos-datos.mean())**2))/(len(datos)-1)

Sería 0.4888…

En Numpy

Se usa el comando np.var. Para la poblacional no es necesario ningún parámetro.

   	  np.var(datos)

Para la muestral se usa el parámetro ddof=1.

   	  np.var(datos,ddof=1)

Desviación estándar

Desviación estándar de la población

σ=σ2\sigma = \sqrt{\sigma^2}

Desviación estándar de la muestra

S=S2S= \sqrt{S^2}

Python

Tomamos el valor de la varianza y sacamos raíz

   ((sum((datos-datos.mean())**2))/len(datos))**0.5

Numpy

Se usa el comando np.std. Para la poblacional no es necesario ningún parámetro.

   	  np.std(datos)

Para la muestral se usa el parámetro ddof=1.

   	  np.std(datos,ddof=1)

Coeficiente de variación

Tamaño de la dispersión relacionada con el tamaño del promedio.

CV=SX100CV = \frac{S}{\overline X} \cdot 100

Ejercicio

Usando los datos de la Tabla 2.6 de Contento 2019, calcule las medidas de tendencia central y variabilidad y reproduzca los resultados de la Tabla 2.7.

The KaTeX stylesheet is not loaded! KaTeX stylesheet version:

Next Post
Librerías: pandas, matplotlib, random