Skip to content

Resumen de Estadística descriptiva

Published: at 12:15 AM

Conceptos estadísticos básicos

Video de ésta sección: https://youtu.be/45V4GQMG75c

Medidas de tendencia central

La presentación de ésta sección está en línea en: https://youtu.be/45V4GQMG75c

Promedio Aritmético

El promedio de una muestra:

X=i=1nXin\overline X = \frac{\sum_{i=1}^n X_i}{n} (sobre la muestra n<Nn < N )

Lo que significa sumar los valores de la muestra y dividir sobre el tamaño de la muestra.

El promedio en una población:

μ=i=1NXiN\mu = \frac{\sum_{i=1}^N X_i}{N} (sobre la población )

Ejemplo. Supongamos que tenemos los siguientes datos:

   datos=np.array([2, 4, 3, 4, 4, 1, 1, 6, 2, 2, 6, 3, 6, 3, 4, 1, 4, 6, 4, 5, 5, 1,
   5, 4, 2, 1, 6, 3, 5, 6, 5, 6, 3, 5, 3, 6, 6, 1, 1, 2, 6, 3, 4, 2,
   4, 3, 3, 4, 4, 6])

Podemos averiguar su suma como:

  sum(datos)

Lo que nos dá el número 186. Como son 50 datos, el promedio sería:

  186/50

Lo que da el número 3.72. (más en la nota a pié1)

Si tomamos una muestra, digamos de los valores:

  muestra=np.array([1,5,6,6,6,3,6,1])

El promedio sería la suma de esos valores dividio en el tamaño de la muestra. Hágalo! Nos da X=4.25\overline{X} = 4.25.

Mediana

X~\widetilde{X}: Aproximadamente la mitad de las observaciones son mayores a la mediana.

X~={X(n+12) n impar X(n2)+X(n2+1)2 n par \widetilde{X} = \begin{cases} X_{\left(\frac{n+1}{2}\right)} & \text{ n impar } \\ \frac{X_{\left(\frac{n}{2}\right)} + X_{\left(\frac{n}{2} + 1\right)}}{2} & \text{ n par } \\ \end{cases}

Organizamos los datos:

   datosordenados=np.array([1, 1, 1, 1, 1, 1, 1, 2, 2, 2, 2, 2, 2, 3,
   3, 3, 3, 3, 3, 3, 3, 3,4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 5, 5, 5, 
   5, 5, 5, 6, 6, 6, 6, 6,6, 6, 6, 6, 6, 6])

Como el tamaño es par, se toma el promedio de “los dos valores de la mitad”. En este caso sería el que está en la posición 25 y el que está en la posición 26. Como ambos son 4, la cuenta es (4+4)/2=4(4+4)/2 = 4. También se puede hacer en el software 2.

Moda

Es el dato que se repite más veces en una muestra.

Medidas de variabilidad

Videos de ésta sección en: https://youtu.be/TnChXWqAQN0

Varianza

Varianza de la población:

σ2=1Ni=1N(xiμ)2\sigma^2 = \frac{1}{N} \sum_{i=1}^N (x_i - \mu)^2

Varianza de la muestra:

S2=1n1i=1n(xix)2S^2 = \frac{1}{n-1} \sum_{i=1}^n (x_i - \overline x)^2

En una hoja de cálculo.

Calculamos primero la resta de cada variable con el promedio y el cuadrado de ese valor:

XiX_i(XiX)(X_i-\overline{X})(XiX)2(X_i-\overline{X})^2
1-3.2510.5625
50.750.525
61.753.0625
61.753.0625
61.753.0625
3-1.251.5625
61.753.0625
1-3.2510.5625

La suma de la tercera columna da 35.5, y al dividir entre 7 obtenemos una varianza de 5.0714.

También lo hacemos en el software3.

Ejercicio

Construya una hoja de cálculo en la que haga estos cálculos para la muestra que tiene valores: [1,1,3,5,6,6,6,30]

Desviación estándar

Desviación estándar de la población

σ=σ2\sigma = \sqrt{\sigma^2}

Desviación estándar de la muestra

S=S2S= \sqrt{S^2}

Python

Tomamos el valor de la varianza y sacamos raíz

   ((sum((datos-datos.mean())**2))/len(datos))**0.5

Numpy

Se usa el comando np.std. Para la poblacional no es necesario ningún parámetro.

   	  np.std(datos)

Para la muestral se usa el parámetro ddof=1.

   	  np.std(datos,ddof=1)

Coeficiente de variación

Tamaño de la dispersión relacionada con el tamaño del promedio.

CV=SX100CV = \frac{S}{\overline X} \cdot 100

Medidas de variabilidad

Videos de ésta sección en: https://youtu.be/TnChXWqAQN0

También se puede calcular en software4.

Ejercicios

Tarea: Khan Academy

Esta tarea consiste en realizar los siguientes ejercicios de la plataforma Khan Academy. No cuenta como evaluación del curso.

Contento 2019

Usando los datos de la Tabla 2.6 de Contento 2019, calcule las medidas de tendencia central y variabilidad y reproduzca los resultados de la Tabla 2.7.

Notas a Pie

Footnotes

  1. Usualmente esto se puede hacer en los computadores con una sóla función, que se llama mean. Específicamente en Python sería: np.mean(datos)

  2. Se usa el comando median. En Python: np.median(datos)

  3. Se usa la función var. En Python se diferencia de la muestral, en la que se usa el parámetro ddof=1, así: np.var(datos,ddof=1); de la poblacional, en la que no se usaría ese parámetro.

  4. Se usa la función std. En Python se diferencia de la muestral, en la que se usa el parámetro ddof=1, así: np.std(datos,ddof=1); de la poblacional, en la que no se usaría ese parámetro.


Previous Post
0. Distribuciones de Probabilidad
Next Post
Resumen de Estadística descriptiva