Skip to content

Variables aleatorias continuas y distribución normal

Tesis del tema: Una variable aleatoria continua toma valores en un intervalo, y su probabilidad se mide como área bajo una curva. La distribución normal (campana de Gauss) describe innumerables fenomenos biologicos y psicologicos. Sus parámetros son la media mu y la desviación estándar sigma. El teorema central del limite garantiza que las medias muestrales tienden a la normalidad.

En una frase: la campana de Gauss describe como se distribuyen naturalmente los datos.

1. Variables aleatorias continuas

Una variable aleatoria continua toma valores en un intervalo de la recta real. A diferencia de las variables discretas, que enumeran valores aislados (0, 1, 2, 3...), las variables continuas pueden tomar un valor dentro de un rango, incluidos los decimales.

Ejemplos en psicologia: el tiempo de reacción de un participante ante un estimulo, la puntuación total en una escala de ansiedad, el coeficiente intelectual, el peso corporal, la presión arterial. En los cinco casos medimos cantidades que admiten valores fraccionarios y que, teoricamente, pueden tomar infinitos valores dentro de su intervalo.

1.1. La paradoja de la probabilidad cero

Con variables continuas surge una caracteristica contraintuitiva: la probabilidad de que la variable tome un valor exacto, como por ejemplo P(X = 120.00000...), es cero. Esto se debe a que hay infinitos valores posibles en un intervalo, por pequeño que sea. En su lugar, se trabaja con intervalos: la probabilidad de que X caiga entre dos valores a y b.

Definicion clave: para una variable continua, la probabilidad de un valor puntual exacto es cero. Las probabilidades se calculan sobre intervalos: P(a menor o igual que X menor o igual que b) es el área bajo la curva entre a y b.

2. Funcion de densidad de probabilidad

La función de densidad de probabilidad, escrita f(x), es la curva que describe como se distribuyen las probabilidades de una variable continua. La probabilidad de un intervalo es el área bajo la curva entre los dos puntos que delimitan ese intervalo.

Propiedades fundamentales de la función de densidad:

  1. La función f(x) es mayor o igual que cero para cada valor de x. La densidad no puede ser negativa.
  2. El área total bajo la curva es 1. Esto significa que la probabilidad de que X tome algun valor es la certeza: el 100 por ciento.
  3. Las probabilidades se calculan como áreas. La probabilidad de que X caiga en un intervalo es el área bajo la curva entre los limites de ese intervalo.
  4. Cuanto más alta sea la curva en una zona, más probable es que X tome valores ahi. Las zonas donde la curva es plana y baja corresponden a valores poco probables.
Analogia util: imagina que la densidad es una montana de arena. El área total de la arena es 1. Si preguntas "que probabilidad hay de que X caiga entre 90 y 110", recoges la arena que hay entre esas dos marcas y la pesas. El peso respecto al total es la probabilidad.

3. La distribución normal: la campana de Gauss

La distribución normal, también llamada campana de Gauss, es la distribución continua más importante de la estadística. Carl Friedrich Gauss la estudio a comienzos del siglo XIX en el contexto de errores de medición astronomicos, aunque Abraham de Moivre ya habia descrito la curva en 1733 como aproximación a la binomial.

Su importancia radica en que describe la distribución de muchisimos fenomenos naturales y psicologicos: la estatura de una población, los tiempos de reacción, las puntuaciones de inteligencia, los errores de medición. Cuando un fenomeno resulta de la suma de muchos factores independientes pequeños, tiende a seguir una distribución normal.

Definicion: X sigue una distribución normal de parámetros mu y sigma si su densidad es una curva en forma de campana, simetrica respecto a la media mu, con desviación estándar sigma. Se escribe X aproximadamente normal(mu, sigma al cuadrado).

3.1. Propiedades de la curva normal

La campana de Gauss tiene cinco propiedades que conviene memorizar para el parcial:

  1. Forma de campana: la curva tiene una forma de campana, con un solo pico en el centro y colas que descienden simetricamente hacia ambos lados.
  2. Simetria: la curva es simetrica respecto a la media. La parte izquierda es el reflejo de la parte derecha. Esto implica que la media, la mediana y la moda coinciden en un mismo valor.
  3. Media igual a mediana igual a moda: en una distribución normal, el promedio (media), el valor central (mediana) y el valor más frecuente (moda) son el mismo número: el centro de la campana.
  4. Parametros mu y sigma: la media mu determina donde se situa el centro de la campana. La desviación estándar sigma determina que tan ancha o estrecha es. Una sigma grande genera una campana aplastada y ancha; una sigma pequeña genera una campana alta y estrecha.
  5. Las colas se acercan al eje: las colas de la campana se acercan al eje horizontal sin llegar a tocarlo. Esto significa que, en teoria, la variable puede tomar valores muy extremos, aunque con probabilidad muy baja.
Trampa de parcial: confundir los efectos de mu y sigma sobre la campana. Mu mueve la campana a izquierda o derecha (cambia la ubicación). Sigma la ensancha o la estrecha (cambia la dispersión). Un cambio en mu NO altera la forma; un cambio en sigma SI altera la forma.

4. La regla 68-95-99.7

Esta regla empírica, también llamada regla de los tres sigma, describe que porcentaje de los datos caen dentro de 1, 2 y 3 desviaciones estándar respecto a la media en una distribución normal.

IntervaloPorcentaje de datos incluidosInterpretacion
Entre mu menos 1 sigma y mu más 1 sigma68 por cientoAproximadamente dos tercios de los datos caen a una desviación de la media
Entre mu menos 2 sigma y mu más 2 sigma95 por cientoLa gran mayoria de los datos caen a dos desviaciones de la media
Entre mu menos 3 sigma y mu más 3 sigma99.7 por cientoCasi la totalidad de los datos caen a tres desviaciones de la media
Truco de memoria: recuerda la secuencia 68, 95, 99.7 para 1, 2, 3 sigma. El primer salto es grande (de 68 a 95, casi 27 puntos), el segundo es pequeño (de 95 a 99.7, apenas 5 puntos). A partir de 3 sigma quedan solo 3 de cada 1000 datos en las colas.
1 sigma: 68% 2 sigma: 95% 3 sigma: 99.7%

5. Puntuaciones z y la normal estándar

La normal estándar es una distribución normal con media 0 y desviación estándar 1. Es la versión universal de la campana de Gauss, y las normales se pueden convertir a ella mediante las puntuaciones z.

Definicion clave: la puntuación z de un valor x en una normal(mu, sigma) se calcula como z = (x menos mu) dividido entre sigma. Indica cuantas desviaciones estándar separan al valor x de la media mu.

Si un estudiante obtiene en un test de inteligencia una puntuación de 130, y el test tiene media 100 y desviación estándar 15, su puntuación z es (130 menos 100) dividido entre 15 = 2.0. Ese estudiante esta dos desviaciones estándar por encima de la media. Segun la regla 68-95-99.7, solo el 2.5 por ciento de la población obtiene una puntuación mayor.

5.1. Como convertir una normal a la normal estándar

La conversión se realiza en tres pasos numerados:

  1. Restar la media mu al valor observado x. Se obtiene la diferencia respecto al centro.
  2. Dividir esa diferencia entre la desviación estándar sigma. El resultado es la puntuación z.
  3. Buscar la probabilidad asociada a z en la tabla de la normal estándar.

Este procedimiento convierte un problema de distribución normal en un problema de la normal estándar, para el que existe una tabla universal.

6. La tabla de la normal estándar

La tabla de la normal estándar proporciona el área bajo la curva a la izquierda de cada valor z. Como el área total es 1, esa área coincide con la probabilidad acumulada P(Z menor o igual que z).

zArea a la izquierdaInterpretacion
0.000.5000El 50 por ciento de los datos estan por debajo de la media
1.000.8413El 84 por ciento estan a la izquierda de una desviación sobre la media
1.640.9495El 95 por ciento estan por debajo de este valor
1.960.9750El 97.5 por ciento estan por debajo de este valor (clave para intervalos de confianza)
2.000.9772El 97.7 por ciento estan por debajo de dos desviaciones sobre la media
3.000.9987El 99.9 por ciento estan por debajo de tres desviaciones sobre la media

Para valores negativos de z, se aprovecha la simetria de la curva. El área a la izquierda de un z negativo es igual a 1 menos el área a la izquierda del valor z positivo correspondiente. Por ejemplo, el área a la izquierda de z = menos 1.00 es 1 menos 0.8413 = 0.1587.

Trampa de parcial: confundir "área a la izquierda" con "área a la derecha". La tabla estándar suele dar el área acumulada desde menos infinito hasta z. Si el problema pide el área por encima de z, hay que restar el valor de la tabla a 1.
Truco de memoria: los valores z que más aparecen en los parciales son 1.64 (90 por ciento bilateral, 95 por ciento unilateral), 1.96 (95 por ciento bilateral) y 2.58 (99 por ciento bilateral). Memorizalos: ahorran tiempo en el examen.
z=1.64 z=1.96 z=2.58

7. El teorema central del limite

El teorema central del limite es uno de los resultados más importantes de la estadística. Afirma que, a medida que aumenta el tamano de la muestra, la distribución de las medias muestrales se acerca a una distribución normal, sin importar cual sea la forma de la distribución original de los datos.

Enunciado del teorema: si se extraen muestras aleatorias de tamano N de una población con media mu y desviación estándar sigma, entonces para N suficientemente grande, la distribución de las medias muestrales se aproxima a una normal con media mu y desviación estándar sigma dividido entre la raiz cuadrada de N. Esta última se llama error estándar de la media.

El teorema tiene tres implicaciones practicas fundamentales:

  1. No importa si la distribución original es asimetrica, bimodal o caotica. Si el tamano muestral es suficientemente grande, las medias muestrales se distribuyen de forma aproximadamente normal.
  2. La media de las medias muestrales coincide con la media poblacional mu. No hay sesgo: las medias muestrales no se desplazan sistemáticamente respecto a la media poblacional.
  3. La dispersión de las medias muestrales disminuye a medida que aumenta el tamano muestral. Concretamente, la desviación estándar de las medias muestrales es sigma dividido entre la raiz cuadrada de N: muestras más grandes dan medias más estables.
Analogia util: imagina que mides la estatura de personas individuales. La distribución puede ser algo asimetrica. Pero si en vez de personas individuales calculas la estatura promedio de grupos de 50 personas, esos promedios forman una campana casi perfecta. El promedio suaviza las irregularidades.

7.1. Por que el teorema central del limite es clave en inferencia

El teorema central del limite justifica que la mayoria de los procedimientos de inferencia estadística (intervalos de confianza, contrastes de hipotesis sobre medias) asuman normalidad de las medias muestrales. Sin este teorema, no podriamos usar la tabla de la normal para construir intervalos de confianza ni para evaluar hipotesis sobre medias, a menos que la población original fuese normal.

La regla práctica para decidir si N es suficientemente grande:

  1. Si la población original ya es normal, un N modesto sirve, incluso muestras pequeñas.
  2. Si la población no es normal pero es moderadamente simetrica, N = 30 suele ser suficiente.
  3. Si la población es muy asimetrica o tiene valores extremos, se necesitan muestras más grandes (a veces N = 50 o más).
Definicion clave: el error estándar de la media es la desviación estándar de las medias muestrales. Se calcula como sigma dividido entre la raiz cuadrada de N. No hay que confundirlo con la desviación estándar de los datos individuales, que es sigma.
Trampa de parcial: confundir desviación estándar de la población (sigma) con error estándar de la media (sigma sobre raiz de N). La desviación estándar describe la dispersión de los datos individuales. El error estándar describe la dispersión de las medias muestrales, y es menor porque los promedios varian menos que los individuos.

8. Linea de tiempo

AñoAutorAporte
1733Abraham de MoivrePrimera descripción de la curva normal como aproximación a la binomial
1809Carl Friedrich GaussFormalizacion de la distribución normal en el contexto de errores de medición
1810Pierre-Simon LaplaceDemostracion del teorema central del limite en su forma clásica
1901Alexander LyapunovGeneralizacion del teorema central del limite bajo condiciones más amplias

9. Errores frecuentes en el parcial

1. Calcular z con la fórmula invertida. La fórmula es z = (x menos mu) dividido entre sigma, NO (mu menos x) dividido entre sigma. Invertir el orden cambia el signo de z y produce la respuesta complementaria.
2. Usar sigma en lugar del error estándar. Cuando se trabaja con medias muestrales, la desviación a usar es sigma sobre raiz de N, no sigma directo. Confundir ambos lleva a estimaciones de probabilidad incorrectas.
3. Olvidar que la tabla da área a la izquierda. La mayoria de las tablas de la normal dan el área acumulada desde menos infinito hasta z. Si el problema pide el área a la derecha de z, hay que restar de 1 el valor de la tabla.

10. Para el parcial

Lo que con probabilidad te van a preguntar:
  • Definir variable aleatoria continua y explicar por que la probabilidad de un valor puntual es cero.
  • Enunciar las propiedades de la curva normal: simetria, coincidencia de media-mediana-moda, parámetros mu y sigma.
  • Aplicar la regla 68-95-99.7 para calcular porcentajes en un intervalo dado.
  • Calcular puntuaciones z y usar la tabla de la normal estándar para encontrar probabilidades.
  • Enunciar el teorema central del limite y explicar su importancia para la inferencia estadística.
Repaso en 30 segundos:
  • Continua: valores en intervalos, probabilidad como área bajo la curva.
  • Normal: campana simetrica, media igual a mediana igual a moda, parámetros mu y sigma.
  • Regla 68-95-99.7: porcentajes dentro de 1, 2 y 3 desviaciones estándar.
  • Puntuacion z: (x menos mu) dividido entre sigma. Cuantas desviaciones respecto a la media.
  • Normal estándar: media 0, desviación 1. Tabla universal de áreas acumuladas.
  • Teorema central del limite: las medias muestrales tienden a la normal sin importar la distribución original.
  • Error estándar de la media: sigma dividido entre raiz cuadrada de N.

11. Preguntas de autoevaluación

1. Por que la probabilidad de que una variable continua tome un valor exacto es cero?

Porque hay infinitos valores posibles en un intervalo. La probabilidad se reparte entre infinitos puntos, de modo que la correspondiente a un solo punto es cero. Por eso se trabaja con intervalos y áreas bajo la curva.

2. Que significa que una puntuación z sea 1.5?

Que el valor observado esta 1.5 desviaciones estándar por encima de la media. Si la media es 100 y la desviación estándar es 15, el valor correspondiente es 100 más 1.5 por 15 = 122.5.

3. En una normal(100, 15), que porcentaje de datos está por encima de 130?

Primero calculas z = (130 menos 100) dividido entre 15 = 2.0. En la tabla, el área a la izquierda de z = 2.0 es 0.9772. El área a la derecha es 1 menos 0.9772 = 0.0228. Es decir, el 2.28 por ciento de los datos está por encima de 130.

4. Que dice el teorema central del limite?

Que para un tamano muestral suficientemente grande, la distribución de las medias muestrales se aproxima a una normal con media mu y desviación estándar sigma dividido entre raiz de N, sin importar la forma de la distribución original de los datos.

5. Cual es la diferencia entre desviación estándar y error estándar de la media?

La desviación estándar sigma mide la dispersión de los datos individuales en la población. El error estándar de la media, sigma dividido entre raiz cuadrada de N, mide la dispersión de las medias muestrales. El error estándar disminuye a medida que aumenta el tamano muestral; la desviación estándar, no.

Estudia esta materia jugando en la Escuela PsiqueAcadémica — la sesión 1 es gratis. O comprueba lo que sabes en la Arena de preguntas.

PsiqueAcadémica · Cuaderno de Estadística Inferencial

Fuentes verificadas: de Moivre, A. (1733, Approximatio ad summam terminorum binomii); Gauss, C. F. (1809, Theoria motus corporum coelestium); Laplace, P.-S. (1810, Memoire sur les approximations des formules qui sont fonctions de tres grands nombres); Lyapunov, A. M. (1901, Nouvelle forme du theoreme sur la limite de probabilite); Kolmogorov, A. N. (1933, Grundbegriffe der Wahrscheinlichkeitsrechnung).

🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →

Ponlo en práctica

Test de conocimiento: Procesos Psicológicos

Pon a prueba lo que sabes de este tema: 12 preguntas reales, tu nivel al final y los temas exactos a reforzar.

x2 monedas

Esta semana tu cuenta vale el doble — entra antes del 15 de octubre

El Club Psiqueacadémica premia a quienes llegan primero: doble de Psique Coins semanales durante la fase de lanzamiento.

Me uno antes del 15 de octubre

Doble de monedas las primeras semanas