Conceptos estadísticos básicos
Video de ésta sección: https://youtu.be/45V4GQMG75c
-
Universo: Conjunto de ‘Individuos’ Objeto de Investigación. Ejemplos:
- Ríos en una vertiente
- Habitantes de una zona.
- Registros de datos de una entidad
-
Observaciones: Cada uno de los valores de la variable que se registra para uno de los individuos. Se representa por:
-
Población: Conjunto de mediciones de una variable en cada ‘individuo’. Su tamaño es . Ejemplos:
- Caudal en punto medio. Longitud de los tramos navegables. Número de especies aprovechables
- Último grado cursado. Lugar de vivienda. Edad.
- Fecha y hora. Longitud en palabras. Tipo de solicitud.
-
Muestra: Subconjunto representativo de la población. Sus características son similares a las de la población. Su tamaño es .
-
Parámetro: Característica de la población de referencia. Ej. promedio , proporción , total, varianza , distribucionalidad. Usualmente son desconocidos, obj. de investigación.
-
Estadística (estadígrafo): Cálculos sobre los datos de la muestra, que estiman los parámetros de la población. Ej. promedio muestral , varianza muestral , y proporción muestral ).
Medidas de tendencia central
Promedio Aritmético
El promedio de una muestra:
(sobre la muestra )
Lo que significa sumar los valores de la muestra y dividir sobre el tamaño de la muestra.
El promedio en una población:
(sobre la población )
Ejemplo: Generemos los datos de manera seudoaleatoria:
datos = ran.choices(opciones,k=10)
datos = np.array(datos)
Eso genera el siguiente arreglo:
array([1, 2, 2, 2, 2, 1, 1, 3, 1, 1])
En Python básico
Podemos averiguar su suma como:
suma = sum(datos)
Lo que nos dá el número 16. Averiguamos su longitud como:
longitud = len(datos)
Lo que nos dá el valor 10. Luego el promedio sería
sum(datos)/len(datos)
Con Numpy
Ya trae una función, mean:
np.mean(datos)
Mediana
: Aproximadamente la mitad de las observaciones son mayores a la mediana.
En Python
Primero ordenamos la serie:
datos.sort()
Ahora la imprimimos:
print(datos)
Cómo la longitud es par, tenemos que promediar la posición 5 y la 6. Que corresponderían a los índices 4 y 5, luego la mediana será:
(datos[4]+datos[5])/2
Lo que resulta en 1.5
En Numpy
Se usa el comando np.median
np.median(datos)
Moda
Es el dato que se repite más veces en una muestra.
Medidas de variabilidad
Videos de ésta sección en: https://youtu.be/TnChXWqAQN0
Varianza
Varianza de la población:
Varianza de la muestra:
En Python básico
Lo hacemos paso a paso. Primero restamos el promedio de los datos. Esto se puede hacer así:
datos-datos.mean()
Luego eso lo elevamos al cuadrado. Se puede hacer así:
(datos-datos.mean())**2
Luego lo sumamos
sum((datos-datos.mean())**2)
Si se trata de una población, dividimos por el tamaño.
(sum((datos-datos.mean())**2))/len(datos)
Obtenemos 0.44. Si fuera una muestra sería dividir entre el tamaño menos 1.
(sum((datos-datos.mean())**2))/(len(datos)-1)
Sería 0.4888…
En Numpy
Se usa el comando np.var. Para la poblacional no es necesario ningún parámetro.
np.var(datos)
Para la muestral se usa el parámetro ddof=1.
np.var(datos,ddof=1)
Desviación estándar
Desviación estándar de la población
Desviación estándar de la muestra
Python
Tomamos el valor de la varianza y sacamos raíz
((sum((datos-datos.mean())**2))/len(datos))**0.5
Numpy
Se usa el comando np.std. Para la poblacional no es necesario ningún parámetro.
np.std(datos)
Para la muestral se usa el parámetro ddof=1.
np.std(datos,ddof=1)
Coeficiente de variación
Tamaño de la dispersión relacionada con el tamaño del promedio.
Ejercicio
Usando los datos de la Tabla 2.6 de Contento 2019, calcule las medidas de tendencia central y variabilidad y reproduzca los resultados de la Tabla 2.7.
The KaTeX stylesheet is not loaded! KaTeX stylesheet version: