Skip to content

Distribución Gaussiana (Normal)

Published: at 12:00 AM

Table of Contents

Open Table of Contents

Distribuciones continuas de probabilidad

Anteriormente habíamos hablado de probabilidad de variables discretas. En ese caso la variable aleatorio tiene un número entero de opciones. Por ejemplo el número de personas que acceden a un servicio al día es una variable aleatoria discreta.

Es posible que la variable aleatoria no sea discreta (contable) si no continua. Por ejemplo el peso de las personas que están en un bus, o la estatura de una persona, o la cantidad de electricidad que consume un hogar, son todas variables continuas.

Aquí comparamos la probabilidad discreta y la continua:

Probabilidad DiscretaProbabilidad Continua
Es un número entre 0 y 1Es un número entre 0 y 1
Las opciones son contables nnLas opciones son todos los números en un rango
Si un evento AA tiene una sóla opción, la probabilidad de AA es 1n\frac{1}{n}Los eventos se definen como rangos, la probabilidad representa la posibilidad de que la variable tome un valor en el rango
(por ejemplo, en un dado de 6 caras la probabilidad de 3 es 1/6)(en el ejemplo de la estatura hablaríamos de la probabilidad de que una persona al azar tenga una estatura entre 1.5 y 1.6 m)
Se define como P(B)=limnnBnP(B) = \lim\limits_{n\to \infty} \frac{n_B}{n} Se define con una función ff, densidad de probabilidad, como P(aXb)=abf(x)dxP(a \leq X \leq b) = \int_a^b f(x) dx
Las opciones se llaman “espacio muestral”, y se representa por Ω\OmegaLas opciones en teoría pueden ser todos los números reales, en la práctica son subconjuntos.
(por ejemplo, en un dado de seis caras tenemos Ω={1,2,3,4,5,6}\Omega = \{1,2,3,4,5,6\})(por ejemplo, la estatura mínima de una persona son algunos centímetros y la máxima un par de metros, luego varía en el intervalo (0.3, 2) )
La probabilidad de que la variable aleatoria tome alguna de las opciones es 1La probabilidad de que la variable aleatoria tome alguna de las opciones es 1
P(Ω)=1P(\Omega)=1f(x)dx=1\int_{-\infty}^{\infty} f(x) dx = 1

La segunda característica, integral igual a 1, se ve en la figura abajo izquierda. La segunda, probabilidad igual a área bajo la curva, en la figura de la derecha.

Diagrama que representa dos de las características explicadas atrás. A la izquierda se ve una distribución con forma de campana. Debajo de la curva está sombreado, y dice "área=1". A la derecha hay otra gráfica. Aquí la función es una línea recta. Lo que aparece sombreado es el área que va debajo de la curva, pero entre los valores 1 y 3 de x. El eje x varía desde 0 a 5 y el eje vertical desde 0 a 0.6.

Distribución Gausiana

Una buena explicación de la distribución normal está en éste video del profesor Leandro González: https://youtu.be/-fD8KmtsI1M

Un grán número de variables del mundo real resultan tener una distribución normal. Por ejemplo:

Características de la distribución normal

Cálculo con el computador (en Python)

Se importa la librería statsde scipy:

import scipy.stats as st

Se usa la función st.norm.cdf, que con las opciones loc para el promedio y scale para la desviación estándar, da la probabilidad de que la variable XX sea menor a un valor X0X_0 dado.

Por ejemplo, supongamos que queremos encontrar la probabilidad de que una variable continua XX, que tiene promedio de μ=10\mu = 10 y desviación estándar de σ=2\sigma=2 tenga un valor menor a 5.95.9. Es decir, queremos P(X5.9)P(X \leq 5.9). Se calcularía como:

st.norm.cdf(5.9,loc=10,scale=2)

Lo que da el valor: 0.020182215405704394, se puede aproximar a cuatro decimales en 0.0202.

Ejercicio,

Si el promedio es μ=10\mu =10, la desviación estándar es σ=2\sigma=2, cuál es la probabilidad de que X tome un valor inferior a 14?

En este caso X0=14X_0 = 14, queremos calcular P(X \leq 14). Entonces tenemos:

st.norm.cdf(14,loc=10,scale=2)

lo que da 0.97724986805182080.9772498680518208, que aproximamos a 0.9227.

Ejercicio,

Si el promedio es μ=10\mu =10, la desviación estándar es σ=2\sigma=2, cuál es la probabilidad de que X tome un valor superior a 14?

Queremos

P(X14)P(X \geq 14)

Pero como el software calcula la probabilidad a cola izquierda, lo hacemos así:

P(X14)=1P(X14)P(X \geq 14) = 1- P(X \leq 14)

Luego calcularíamos:

1-st.norm.cdf(14,loc=10,scale=2)

Se obtiene 0.02275013194817921 o aproximando a cuatro decimales 0.0227.

🤓 Estandarización

Es un proceso para comparar distribuciones que tienen diferentes parámetros, pero que tienen la misma forma. Recordemos que la forma funcional de la gaussiana es f(x)=12πσe12(xμσ)2,f(x) = \frac{1}{\sqrt{2 \pi \sigma}}e^{-\frac{1}{2} \left( \frac{x - \mu}{\sigma}\right)^2},; fíjese que la variable XX aparece acompañada de μ\mu y σ\sigma de la forma xμσ\frac{x - \mu}{\sigma}. La estandarización consiste en definir una nueva variable ZZ:

Z=xμσZ = \frac{x - \mu}{\sigma}

El valor ZZ determina la distancia, medida en desviaciones estándar, desde el promedio. Es positiva si está a la derecha del promedio y negativa si está a su izquierda.

Por la forma que tiene la distribución gaussiana, Z usualmente varía entre -3 hasta 3; es decir de 3 desviaciones estándar a la izquierda hasta 3 desviaciones estándar a la derecha.

🤓 Ejemplo, comparando resultados de dos exámenes

(fuente: Diez, D. M., Barr, C. D., & Cetinkaya-Rundel, M. (2012). OpenIntro statistics, página 134)

Supongamos que tenemos dos poblaciones a las que se les hacen exámenes diferentes, pero que tratan de medir lo mismo. Pueden ser exámenes saber 11 de dos años diferentes, que tratan de evaluar lo mismo pero resultan que en la práctica uno es más difícil que el otro. ¿cómo se pueden comparar los resultados personas que hicieron diferentes examenes?

Cómo se puede comparar el puntaje de Ana con el de Juan?

La gráfica muestra distribución del grupo de Ana, en naranja; y la distribución del grupo de Juan, en azul.

Dos distrubuciones gausianas. En naranja una que va de 300 a 400 en x, y un valor máximo en y de 0.007. Otra azul, que va de 350 a 380, pero con un máximo de 0.032

Aunque ambos tuvieron el mismo puntaje sin estandarizar, hay una mayor variabilidad en el grupo de Ana que en el grupo de Juan. Para compararlos usamos el valor ZZ.

ZAna=37035020=2020=1Z_{Ana} = \frac{370-350}{20} = \frac{20}{20} = 1

ZJuan=3703605=105=2Z_{Juan} = \frac{370-360}{5} = \frac{10}{5} = 2

Ambos están a la derecha del promedio, pero Ana está sólo a una desviación estándar del promedio; mientras que Juan está a dos desviaciones estándar del promedio. En comparación a sus grupos, es decir a las situaciones que les correspondió a cada uno, por ejemplo en términos de que tan difícil fue su examen, Juan tiene una mejor valoración que Ana.

🤓 Tabla Gaussiana Estandar

Reporta las probabilidades acumuladas hasta un z0z_0 dado. Es decir, calcula P(Zz0)=z012πσe12z2dzP(Z\leq z_0) = \int_{-\infty}^{z_0} \frac{1}{2\pi \sigma} e^{\frac{-1}{2}z^2} dz. Es el área de la siguiente gráfica.

Distribución gaussiana, en negro. En el eje horizontal hay un valor z0, a la derecha del promedio. El área bajo la curva, y que está a la izquierda de z0, está marcada con color. A la derecha no. La gráfica representa la integral bajo una curva.

Ejemplo

Supongamos que queremos encontrar la probabilidad de que la variable ZZ tenga un valor menor a 2.05-2.05. Eso equivale a encontrar el área bajo la curva desde -\infty hasta 2.05-2.05. Esa área correspondería gráficamente a la siguiente área marcada con violeta:

Distribución gaussiana, en negro. En el eje horizontal hay un valor z=-2.05, a la izquierda de 0. El área bajo la curva, y que está a la izquierda de z0, está marcada con color. A la derecha no.

Para encontrar esta probabilidad con el software se usa la tabla. Se buscan las unidades y el primer decimal en la primera columna y el segundo decimal en la primera fila, así:

Tabla de probabilidad, en la columna correspondiente al valor z=-2.0 y la fila correspondiente a 0.05 está la casilla marcada con 0.0202. Luego esta es la probabilidad acumulada hasta allí.

🤓 Probabilidad a cola derecha

La probabilidad a cola derecha corresponde al área acumulada a partir de un valor. Por ejemplo, la siguiente figura representa la probabilidad P(Z2.0)P(Z\geq 2.0):

La gráfica muestra una normal estándar. En el eje horizontal, a la
derecha, está el valor 2. El área marcada está a la derecha de 2, en
color púrpura.

Ahora, en las tablas está la probabilidad a cola izquierda. Luego lo que se hace es buscar el evento complementario A\overline{A}, y calcular su probabilidad. El complemento del evento A:Z>2.0A:Z>2.0 es el evento: A:Z2.0\overline{A}:Z\leq 2.0

Luego:

P(A)=1P(A) P(A) = 1- P(\overline{A})

P(Z>2.0)=1P(Z2.0)=0.0228 P(Z>2.0) = 1- P(Z \leq 2.0)=0.0228

🤓 Normal Estándar en Python

Se importa la librería statsde scipy:

import scipy.stats as st

Por ejemplo, para la probabilidad acumulada P(Z2.05)P(Z \leq -2.05), se haría:

st.norm.cdf(-2.05)

Lo que da el valor: 0.020182215405704394, se puede aproximar a cuatro decimales en 0.0202.

Para P(Z>2)P(Z>2):

1-st.norm.cdf(2)

Se obtiene 0.02275013194817921 o aproximando a cuatro decimales 0.0227.

Recursos:

En Khan Academy

Dejaremos como evaluación tres actividades. Luego le tienen que aparecer en su página de Khan Academy en la sección de “tareas”.

Relación normal - binomial (Máquina de Galton) 🤓

Distribución uniforme continua 🤓

(Contento, pg. 196)

Dada una variable XX, que puede tomar valores en el intervalo [a,b][a,b], entonces la densidad uniforme contínua es:

f(x)=1ba  ;  axbf(x) = \frac{1}{b-a}\ \ ; \ \ a \leq x \leq b

La notación XUc(a,b)X \sim U_c(a,b) se lee: x se distribuye uniforme contínua en el in tervalo a,b

Valor esperado y varianza de la distribución uniforme continua

μ=b+a2\mu = \frac{b+a}{2}

σ2=(ba)212\sigma^2 = \frac{(b-a)^2}{12}

Ejemplo (Contento, pg. 188)

La concentración de cierto contaminante está distribuida de manera uniforme en el intervalo 00 a 2020 ppm. Si se considera tóxica una concentración de 88 o más, responda las preguntas:

Footnotes

  1. Tenemos que XUc(0,20)X \sim U_c(0,20), entonces f(x)=1/20  0x20f(x) = 1/20\ \ 0 \leq x \leq 20 . Una muesra toxica implica concentración mayor a 8, luego P(X8)=820120dx=120820dx=120x820=120(208)=12/20=0.6P(X \geq 8) = \int_8^{20} \frac{1}{20}dx = \frac{1}{20} \int_8^{20} dx = \frac{1}{20}\left.x\right|_8^{20} = \frac{1}{20} \left(20-8\right) = 12/20 = 0.6

  2. μ=20+02=10\mu = \frac{20+0}{2} = 10 σ=(200)212=400/12=33.3\sigma = \frac{(20-0)^2}{12} = 400/12 = 33.\overline{3}


Previous Post
Estadística inferencial
Next Post
2024 S2 B.2 Distribuciones de Probabilidad