En una frase: la campana de Gauss describe como se distribuyen naturalmente los datos.
1. Variables aleatorias continuas
Una variable aleatoria continua toma valores en un intervalo de la recta real. A diferencia de las variables discretas, que enumeran valores aislados (0, 1, 2, 3...), las variables continuas pueden tomar un valor dentro de un rango, incluidos los decimales.
Ejemplos en psicologia: el tiempo de reacción de un participante ante un estimulo, la puntuación total en una escala de ansiedad, el coeficiente intelectual, el peso corporal, la presión arterial. En los cinco casos medimos cantidades que admiten valores fraccionarios y que, teoricamente, pueden tomar infinitos valores dentro de su intervalo.
1.1. La paradoja de la probabilidad cero
Con variables continuas surge una caracteristica contraintuitiva: la probabilidad de que la variable tome un valor exacto, como por ejemplo P(X = 120.00000...), es cero. Esto se debe a que hay infinitos valores posibles en un intervalo, por pequeño que sea. En su lugar, se trabaja con intervalos: la probabilidad de que X caiga entre dos valores a y b.
2. Funcion de densidad de probabilidad
La función de densidad de probabilidad, escrita f(x), es la curva que describe como se distribuyen las probabilidades de una variable continua. La probabilidad de un intervalo es el área bajo la curva entre los dos puntos que delimitan ese intervalo.
Propiedades fundamentales de la función de densidad:
- La función f(x) es mayor o igual que cero para cada valor de x. La densidad no puede ser negativa.
- El área total bajo la curva es 1. Esto significa que la probabilidad de que X tome algun valor es la certeza: el 100 por ciento.
- Las probabilidades se calculan como áreas. La probabilidad de que X caiga en un intervalo es el área bajo la curva entre los limites de ese intervalo.
- Cuanto más alta sea la curva en una zona, más probable es que X tome valores ahi. Las zonas donde la curva es plana y baja corresponden a valores poco probables.
3. La distribución normal: la campana de Gauss
La distribución normal, también llamada campana de Gauss, es la distribución continua más importante de la estadística. Carl Friedrich Gauss la estudio a comienzos del siglo XIX en el contexto de errores de medición astronomicos, aunque Abraham de Moivre ya habia descrito la curva en 1733 como aproximación a la binomial.
Su importancia radica en que describe la distribución de muchisimos fenomenos naturales y psicologicos: la estatura de una población, los tiempos de reacción, las puntuaciones de inteligencia, los errores de medición. Cuando un fenomeno resulta de la suma de muchos factores independientes pequeños, tiende a seguir una distribución normal.
3.1. Propiedades de la curva normal
La campana de Gauss tiene cinco propiedades que conviene memorizar para el parcial:
- Forma de campana: la curva tiene una forma de campana, con un solo pico en el centro y colas que descienden simetricamente hacia ambos lados.
- Simetria: la curva es simetrica respecto a la media. La parte izquierda es el reflejo de la parte derecha. Esto implica que la media, la mediana y la moda coinciden en un mismo valor.
- Media igual a mediana igual a moda: en una distribución normal, el promedio (media), el valor central (mediana) y el valor más frecuente (moda) son el mismo número: el centro de la campana.
- Parametros mu y sigma: la media mu determina donde se situa el centro de la campana. La desviación estándar sigma determina que tan ancha o estrecha es. Una sigma grande genera una campana aplastada y ancha; una sigma pequeña genera una campana alta y estrecha.
- Las colas se acercan al eje: las colas de la campana se acercan al eje horizontal sin llegar a tocarlo. Esto significa que, en teoria, la variable puede tomar valores muy extremos, aunque con probabilidad muy baja.
4. La regla 68-95-99.7
Esta regla empírica, también llamada regla de los tres sigma, describe que porcentaje de los datos caen dentro de 1, 2 y 3 desviaciones estándar respecto a la media en una distribución normal.
| Intervalo | Porcentaje de datos incluidos | Interpretacion |
|---|---|---|
| Entre mu menos 1 sigma y mu más 1 sigma | 68 por ciento | Aproximadamente dos tercios de los datos caen a una desviación de la media |
| Entre mu menos 2 sigma y mu más 2 sigma | 95 por ciento | La gran mayoria de los datos caen a dos desviaciones de la media |
| Entre mu menos 3 sigma y mu más 3 sigma | 99.7 por ciento | Casi la totalidad de los datos caen a tres desviaciones de la media |
1 sigma: 68% 2 sigma: 95% 3 sigma: 99.7%
5. Puntuaciones z y la normal estándar
La normal estándar es una distribución normal con media 0 y desviación estándar 1. Es la versión universal de la campana de Gauss, y las normales se pueden convertir a ella mediante las puntuaciones z.
Si un estudiante obtiene en un test de inteligencia una puntuación de 130, y el test tiene media 100 y desviación estándar 15, su puntuación z es (130 menos 100) dividido entre 15 = 2.0. Ese estudiante esta dos desviaciones estándar por encima de la media. Segun la regla 68-95-99.7, solo el 2.5 por ciento de la población obtiene una puntuación mayor.
5.1. Como convertir una normal a la normal estándar
La conversión se realiza en tres pasos numerados:
- Restar la media mu al valor observado x. Se obtiene la diferencia respecto al centro.
- Dividir esa diferencia entre la desviación estándar sigma. El resultado es la puntuación z.
- Buscar la probabilidad asociada a z en la tabla de la normal estándar.
Este procedimiento convierte un problema de distribución normal en un problema de la normal estándar, para el que existe una tabla universal.
6. La tabla de la normal estándar
La tabla de la normal estándar proporciona el área bajo la curva a la izquierda de cada valor z. Como el área total es 1, esa área coincide con la probabilidad acumulada P(Z menor o igual que z).
| z | Area a la izquierda | Interpretacion |
|---|---|---|
| 0.00 | 0.5000 | El 50 por ciento de los datos estan por debajo de la media |
| 1.00 | 0.8413 | El 84 por ciento estan a la izquierda de una desviación sobre la media |
| 1.64 | 0.9495 | El 95 por ciento estan por debajo de este valor |
| 1.96 | 0.9750 | El 97.5 por ciento estan por debajo de este valor (clave para intervalos de confianza) |
| 2.00 | 0.9772 | El 97.7 por ciento estan por debajo de dos desviaciones sobre la media |
| 3.00 | 0.9987 | El 99.9 por ciento estan por debajo de tres desviaciones sobre la media |
Para valores negativos de z, se aprovecha la simetria de la curva. El área a la izquierda de un z negativo es igual a 1 menos el área a la izquierda del valor z positivo correspondiente. Por ejemplo, el área a la izquierda de z = menos 1.00 es 1 menos 0.8413 = 0.1587.
z=1.64 z=1.96 z=2.58
7. El teorema central del limite
El teorema central del limite es uno de los resultados más importantes de la estadística. Afirma que, a medida que aumenta el tamano de la muestra, la distribución de las medias muestrales se acerca a una distribución normal, sin importar cual sea la forma de la distribución original de los datos.
El teorema tiene tres implicaciones practicas fundamentales:
- No importa si la distribución original es asimetrica, bimodal o caotica. Si el tamano muestral es suficientemente grande, las medias muestrales se distribuyen de forma aproximadamente normal.
- La media de las medias muestrales coincide con la media poblacional mu. No hay sesgo: las medias muestrales no se desplazan sistemáticamente respecto a la media poblacional.
- La dispersión de las medias muestrales disminuye a medida que aumenta el tamano muestral. Concretamente, la desviación estándar de las medias muestrales es sigma dividido entre la raiz cuadrada de N: muestras más grandes dan medias más estables.
7.1. Por que el teorema central del limite es clave en inferencia
El teorema central del limite justifica que la mayoria de los procedimientos de inferencia estadística (intervalos de confianza, contrastes de hipotesis sobre medias) asuman normalidad de las medias muestrales. Sin este teorema, no podriamos usar la tabla de la normal para construir intervalos de confianza ni para evaluar hipotesis sobre medias, a menos que la población original fuese normal.
La regla práctica para decidir si N es suficientemente grande:
- Si la población original ya es normal, un N modesto sirve, incluso muestras pequeñas.
- Si la población no es normal pero es moderadamente simetrica, N = 30 suele ser suficiente.
- Si la población es muy asimetrica o tiene valores extremos, se necesitan muestras más grandes (a veces N = 50 o más).
8. Linea de tiempo
| Año | Autor | Aporte |
|---|---|---|
| 1733 | Abraham de Moivre | Primera descripción de la curva normal como aproximación a la binomial |
| 1809 | Carl Friedrich Gauss | Formalizacion de la distribución normal en el contexto de errores de medición |
| 1810 | Pierre-Simon Laplace | Demostracion del teorema central del limite en su forma clásica |
| 1901 | Alexander Lyapunov | Generalizacion del teorema central del limite bajo condiciones más amplias |
9. Errores frecuentes en el parcial
10. Para el parcial
- Definir variable aleatoria continua y explicar por que la probabilidad de un valor puntual es cero.
- Enunciar las propiedades de la curva normal: simetria, coincidencia de media-mediana-moda, parámetros mu y sigma.
- Aplicar la regla 68-95-99.7 para calcular porcentajes en un intervalo dado.
- Calcular puntuaciones z y usar la tabla de la normal estándar para encontrar probabilidades.
- Enunciar el teorema central del limite y explicar su importancia para la inferencia estadística.
- Continua: valores en intervalos, probabilidad como área bajo la curva.
- Normal: campana simetrica, media igual a mediana igual a moda, parámetros mu y sigma.
- Regla 68-95-99.7: porcentajes dentro de 1, 2 y 3 desviaciones estándar.
- Puntuacion z: (x menos mu) dividido entre sigma. Cuantas desviaciones respecto a la media.
- Normal estándar: media 0, desviación 1. Tabla universal de áreas acumuladas.
- Teorema central del limite: las medias muestrales tienden a la normal sin importar la distribución original.
- Error estándar de la media: sigma dividido entre raiz cuadrada de N.
11. Preguntas de autoevaluación
1. Por que la probabilidad de que una variable continua tome un valor exacto es cero?
Porque hay infinitos valores posibles en un intervalo. La probabilidad se reparte entre infinitos puntos, de modo que la correspondiente a un solo punto es cero. Por eso se trabaja con intervalos y áreas bajo la curva.
2. Que significa que una puntuación z sea 1.5?
Que el valor observado esta 1.5 desviaciones estándar por encima de la media. Si la media es 100 y la desviación estándar es 15, el valor correspondiente es 100 más 1.5 por 15 = 122.5.
3. En una normal(100, 15), que porcentaje de datos está por encima de 130?
Primero calculas z = (130 menos 100) dividido entre 15 = 2.0. En la tabla, el área a la izquierda de z = 2.0 es 0.9772. El área a la derecha es 1 menos 0.9772 = 0.0228. Es decir, el 2.28 por ciento de los datos está por encima de 130.
4. Que dice el teorema central del limite?
Que para un tamano muestral suficientemente grande, la distribución de las medias muestrales se aproxima a una normal con media mu y desviación estándar sigma dividido entre raiz de N, sin importar la forma de la distribución original de los datos.
5. Cual es la diferencia entre desviación estándar y error estándar de la media?
La desviación estándar sigma mide la dispersión de los datos individuales en la población. El error estándar de la media, sigma dividido entre raiz cuadrada de N, mide la dispersión de las medias muestrales. El error estándar disminuye a medida que aumenta el tamano muestral; la desviación estándar, no.
Estudia esta materia jugando en la Escuela PsiqueAcadémica — la sesión 1 es gratis. O comprueba lo que sabes en la Arena de preguntas.
🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →
Ponlo en práctica
Test de conocimiento: Procesos Psicológicos
Pon a prueba lo que sabes de este tema: 12 preguntas reales, tu nivel al final y los temas exactos a reforzar.