Conceptos estadísticos básicos
Video de ésta sección: https://youtu.be/45V4GQMG75c
-
Universo: Conjunto de ‘Individuos’ Objeto de Investigación. Ejemplos:
- Ríos en una vertiente
- Habitantes de una zona.
- Registros de datos de una entidad
-
Población: Conjunto de mediciones de una variable en cada ‘individuo’. Su tamaño es . Ejemplos:
- Caudal en punto medio. Longitud de los tramos navegables. Número de especies aprovechables
- Último grado cursado. Lugar de vivienda. Edad.
- Fecha y hora. Longitud en palabras. Tipo de solicitud.
-
Observaciones: Cada uno de los valores de la variable que se registra para uno de los individuos. Se representa por:
-
Muestra: Subconjunto representativo de la población. Sus características son similares a las de la población. Su tamaño es .
-
Parámetro: Característica de la población de referencia. Ejemplos:
- promedio
- proporción
- total
- varianza
- distribucionalidad.
Usualmente son desconocidos, por lo tanto son objeto de investigación.
-
Estadística (estadígrafo): Cálculos sobre los datos de la muestra, que estiman los parámetros de la población. Ejemplos:
- promedio muestral
- varianza muestral
- proporción muestral .
Medidas de tendencia central
La presentación de ésta sección está en línea en: https://youtu.be/45V4GQMG75c
Promedio Aritmético
El promedio de una muestra:
(sobre la muestra )
Lo que significa sumar los valores de la muestra y dividir sobre el tamaño de la muestra.
El promedio en una población:
(sobre la población )
Ejemplo. Supongamos que tenemos los siguientes datos:
datos=np.array([2, 4, 3, 4, 4, 1, 1, 6, 2, 2, 6, 3, 6, 3, 4, 1, 4, 6, 4, 5, 5, 1,
5, 4, 2, 1, 6, 3, 5, 6, 5, 6, 3, 5, 3, 6, 6, 1, 1, 2, 6, 3, 4, 2,
4, 3, 3, 4, 4, 6])
Podemos averiguar su suma como:
sum(datos)
Lo que nos dá el número 186. Como son 50 datos, el promedio sería:
186/50
Lo que da el número 3.72. (más en la nota a pié1)
Si tomamos una muestra, digamos de los valores:
muestra=np.array([1,5,6,6,6,3,6,1])
El promedio sería la suma de esos valores dividio en el tamaño de la muestra. Hágalo! Nos da .
Mediana
: Aproximadamente la mitad de las observaciones son mayores a la mediana.
Organizamos los datos:
datosordenados=np.array([1, 1, 1, 1, 1, 1, 1, 2, 2, 2, 2, 2, 2, 3,
3, 3, 3, 3, 3, 3, 3, 3,4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 4, 5, 5, 5,
5, 5, 5, 6, 6, 6, 6, 6,6, 6, 6, 6, 6, 6])
Como el tamaño es par, se toma el promedio de “los dos valores de la mitad”. En este caso sería el que está en la posición 25 y el que está en la posición 26. Como ambos son 4, la cuenta es . También se puede hacer en el software 2.
Moda
Es el dato que se repite más veces en una muestra.
Medidas de variabilidad
Videos de ésta sección en: https://youtu.be/TnChXWqAQN0
Varianza
Varianza de la población:
Varianza de la muestra:
En una hoja de cálculo.
Calculamos primero la resta de cada variable con el promedio y el cuadrado de ese valor:
| 1 | -3.25 | 10.5625 |
| 5 | 0.75 | 0.525 |
| 6 | 1.75 | 3.0625 |
| 6 | 1.75 | 3.0625 |
| 6 | 1.75 | 3.0625 |
| 3 | -1.25 | 1.5625 |
| 6 | 1.75 | 3.0625 |
| 1 | -3.25 | 10.5625 |
La suma de la tercera columna da 35.5, y al dividir entre 7 obtenemos una varianza de 5.0714.
También lo hacemos en el software3.
Ejercicio
Construya una hoja de cálculo en la que haga estos cálculos para la muestra que tiene valores: [1,1,3,5,6,6,6,30]
Desviación estándar
Desviación estándar de la población
Desviación estándar de la muestra
Python
Tomamos el valor de la varianza y sacamos raíz
((sum((datos-datos.mean())**2))/len(datos))**0.5
Numpy
Se usa el comando np.std. Para la poblacional no es necesario ningún parámetro.
np.std(datos)
Para la muestral se usa el parámetro ddof=1.
np.std(datos,ddof=1)
Coeficiente de variación
Tamaño de la dispersión relacionada con el tamaño del promedio.
Medidas de variabilidad
Videos de ésta sección en: https://youtu.be/TnChXWqAQN0
-
Varianza
-
Varianza de la población:
-
Varianza de la muestra:
-
-
Desviación estándar
-
Desviación estándar de la población
-
Desviación estándar de la muestra
-
Coeficiente de variación: Tamaño de la dispersión relacionada con el tamaño del promedio.
-
También se puede calcular en software4.
Ejercicios
Tarea: Khan Academy
Esta tarea consiste en realizar los siguientes ejercicios de la plataforma Khan Academy. No cuenta como evaluación del curso.
- Identificar la población y la muestra
- Calcular la media
- Calcular la mediana
- Desviación estándar de la muestra
- La varianza
- Estimar la Media y la Mediana en Visualizaciones de Datos
Contento 2019
Usando los datos de la Tabla 2.6 de Contento 2019, calcule las medidas de tendencia central y variabilidad y reproduzca los resultados de la Tabla 2.7.
Notas a Pie
Footnotes
-
Usualmente esto se puede hacer en los computadores con una sóla función, que se llama mean. Específicamente en Python sería: np.mean(datos) ↩
-
Se usa el comando median. En Python: np.median(datos) ↩
-
Se usa la función var. En Python se diferencia de la muestral, en la que se usa el parámetro ddof=1, así: np.var(datos,ddof=1); de la poblacional, en la que no se usaría ese parámetro. ↩
-
Se usa la función std. En Python se diferencia de la muestral, en la que se usa el parámetro ddof=1, así: np.std(datos,ddof=1); de la poblacional, en la que no se usaría ese parámetro. ↩