Correlación y regresión inferencial
En una frase: r asocia dos variables; la regresión predice una a partir de otra.
1. Prueba de significancia para el coeficiente de correlación de Pearson
El coeficiente de correlación de Pearson (r) mide la fuerza y la dirección de la relación lineal entre dos variables cuantitativas. Sus valores van de menos uno a más uno. En inferencia, la pregunta no es solo cuánto vale r en la muestra, sino si ese valor permite afirmar que la correlación en la población (simbolizada con la letra griega rho) es distinta de cero.
1.1. Planteamiento de hipótesis
- Hipotesis nula (H0): rho es igual a cero. Las variables no presentan correlación lineal poblacional.
- Hipotesis alternativa (H1): rho es distinto de cero (bilateral) o bien rho es mayor que cero / menor que cero (unilateral).
1.2. Estadístico de prueba
El estadístico de prueba es una transformación de r a la distribución t de Student, con N menos dos grados de libertad. La fórmula es t igual a r multiplicado por la raíz cuadrada de (N menos dos), dividido entre la raíz cuadrada de (uno menos r al cuadrado). Cuanto mayor sea el valor de r sin signo y mayor el tamaño muestral, mayor será el estadístico t y más fácil rechazar la hipótesis nula.
1.3. Factores que influyen en la significancia
- Magnitud del coeficiente: valores de r cercanos a más uno o menos uno producen t más grandes.
- Tamaño muestral: con N grande, correlaciones modestas se vuelven estadísticamente significativas.
- Nivel de significación: el umbral habitual es 0.05; valores más exigentes (0.01) reducen la potencia.
2. Intervalo de confianza para r
El coeficiente r es un estimador puntual: un solo número que resume la muestra. El intervalo de confianza aporta un rango de valores plausibles para la correlación poblacional. Para construirlo no se usa la distribución t directamente, porque la distribución muestral de r es sesgada, sobre todo cuando rho se aleja de cero. La solución clásica es la transformación de Fisher.
2.1. Transformacion de Fisher
El procedimiento, propuesto por Fisher en 1921, convierte r en un valor z que se aproxima a una distribución normal, independientemente del valor de rho. Los pasos son:
- Transformar r en z mediante la fórmula z igual a un medio del logaritmo natural de (uno más r) dividido entre (uno menos r). Este cociente se llama arco tangente hiperbolica de r.
- Calcular el error estándar de z: uno dividido entre la raíz cuadrada de (N menos tres).
- Construir el intervalo en la escala z: z más menos el valor crítico de la normal multiplicado por el error estándar.
- Volver a la escala original invirtiendo la transformación.
3. Regresión lineal simple: el modelo inferencial
La regresión lineal simple ajusta una ecuación de la forma Y igual a beta cero más beta uno por X más epsilon, donde Y es la variable dependiente, X es la independiente, beta cero es la ordenada al origen, beta uno es la pendiente y epsilon es el error. Los valores estimados en la muestra se escriben b cero y b uno. La inferencia pone a prueba estos coeficientes y el modelo completo.
3.1. Prueba de la pendiente
La hipótesis nula es que la pendiente poblacional beta uno vale cero, es decir, que X no predice linealmente a Y. El estadístico de prueba es t igual a b uno dividido entre su error estándar, con N menos dos grados de libertad. Si el valor p asociado es menor que el nivel de significación, se rechaza la hipótesis nula y se concluye que la pendiente es distinta de cero.
3.2. Prueba del modelo (tabla ANOVA de la regresión)
Ademas de la prueba individual de la pendiente, la regresión admite un contraste global mediante una tabla ANOVA. En regresión lineal simple con un solo predictor, la prueba de la pendiente y la del modelo dan el mismo valor p; pero la tabla ANOVA se vuelve indispensable en regresión multiple, donde cada predictor se evalua por separado y el modelo completo se evalua en conjunto.
| Fuente de variación | Suma de cuadrados (SC) | Grados de libertad (gl) | Cuadrado medio (CM) | F |
|---|---|---|---|---|
| Regresion | variabilidad explicada por el modelo (diferencia entre Y predicho y la media de Y) | número de predictores (k) | SC regresión / k | CM regresión / CM residuo |
| Residuo | variabilidad no explicada (diferencia entre Y observado y Y predicho) | N menos k menos uno | SC residuo / gl residuo | — |
| Total | variabilidad total de Y respecto de su media | N menos uno | — | — |
3.3. Coeficiente de determinación (R-cuadrado)
El R-cuadrado mide la proporción de varianza de Y que el modelo explica. Su fórmula directa es SC regresión dividido entre SC total. En regresión lineal simple, R-cuadrado coincide con el cuadrado del coeficiente de correlación de Pearson entre X e Y. Por eso, un r de 0.60 implica un R-cuadrado de 0.36: el predictor explica el 36 por ciento de la varianza de la variable dependiente.
4. Supuestos de la regresión lineal
La regresión lineal por minimos cuadrados ordinarios descansa sobre cuatro supuestos clásicos. Si se violan, los estimadores pierden eficiencia o los valores p dejan de ser confiables.
- Linealidad: la relación entre X e Y es lineal. Si el patron es curvilineo, el modelo subestima la predicción. Se revisa con un diagrama de dispersión.
- Independencia: los residuos son independientes entre si. En series temporales o datos anidados, este supuesto suele romperse. Se evalua con la prueba de Durbin-Watson.
- Homocedasticidad: la varianza de los residuos es constante a lo largo de los valores de X. Si la dispersión crece o se reduce, hay heterocedasticidad. Se revisa con un grafico de residuos contra valores predichos.
- Normalidad de los residuos: los errores siguen una distribución normal con media cero. No se exige normalidad de las variables, sino de los residuos. Se evalua con un grafico cuantil-cuantil (Q-Q plot) o con pruebas como Shapiro-Wilk.
5. Diagnóstico de residuos
El diagnóstico de residuos verifica visualmente los supuestos. Tres graficos son estándar:
- Grafico de residuos contra valores predichos: si los puntos se esparcen al azar alrededor de cero, sin patron, la linealidad y la homocedasticidad se sostienen. Si hay una curva o un embudo, algun supuesto falla.
- Q-Q plot de residuos: compara los cuantiles de los residuos con los de una distribución normal. Si los puntos se alinean sobre la diagonal, la normalidad es razonable. Desviaciones sistematicas (curva en S) indican asimetria o colas pesadas.
- Grafico de residuos contra cada predictor: util en regresión multiple, detecta patrones no lineales que el grafico global podría enmascarar.
6. Regresión múltiple
La regresión multiple extiende el modelo simple a dos o más predictores. La ecuación pasa a ser Y igual a beta cero más beta uno por X uno más beta dos por X dos, y así sucesivamente, más el error. Cada coeficiente beta indica cuánto cambia Y por cada unidad de aumento en ese predictor, manteniendo los demas constantes.
6.1. R-cuadrado ajustado
Al agregar predictores, el R-cuadrado ordinario nunca baja: cualquier variable, aunque sea ruido, infla el indicador. Para corregir ese sesgo se usa el R-cuadrado ajustado, que penaliza la inclusión de predictores que no aportan. La fórmula del R-cuadrado ajustado incorpora el número de predictores y el tamaño muestral, y puede disminuir cuando se agregan variables irrelevantes.
6.2. Multicolinealidad
Cuando los predictores están altamente correlacionados entre si, se produce multicolinealidad. Esto infla los errores estándar de los coeficientes, los vuelve inestables y dificulta interpretar el aporte individual de cada predictor. Se diagnostica con dos indicadores:
- Factor de inflación de la varianza (VIF): valores por encima de 5 (o de 10, según el criterio) señalan multicolinealidad problematica.
- Tolerancia: el inverso del VIF. Valores por debajo de 0.10 indican colinealidad severa.
7. Diferencias entre correlación y regresión
| Aspecto | Correlacion de Pearson | Regresion lineal |
|---|---|---|
| Objetivo | Medir la fuerza y la dirección de una asociación lineal simetrica | Estimar una ecuación para predecir Y a partir de X |
| Simetria | r(X,Y) es igual a r(Y,X); no distingue variable dependiente de independiente | La ecuación cambia si se invierten X e Y: la pendiente no es simetrica |
| Escala | Adimensional: va de menos uno a más uno | La pendiente se expresa en unidades de Y por unidad de X |
| Inferencia | Prueba t sobre r (gl = N menos 2); intervalo via Fisher | Prueba t sobre la pendiente; tabla ANOVA del modelo |
8. Línea de tiempo
9. Errores frecuentes en el parcial
10. Para el parcial
- La prueba de significancia de Pearson: hipótesis nula rho = 0, estadístico t con N menos 2 grados de libertad.
- La transformación de Fisher: para que sirve (estabilizar la varianza de r) y cuando se usa (intervalos de confianza para r).
- La tabla ANOVA de la regresión: fuentes, grados de libertad y como se obtiene F.
- Los cuatro supuestos: linealidad, independencia, homocedasticidad, normalidad de residuos.
- El R-cuadrado ajustado y por que se prefiere al R-cuadrado ordinario en regresión multiple.
- La multicolinealidad: diagnóstico con VIF y tolerancia, y su impacto en los coeficientes.
LIHN4 supuestos3 graficos
- Pearson: r mide asociación lineal; H0 dice rho = 0; estadístico t con gl = N menos 2.
- Intervalo de r: transformación de Fisher al espacio z, no t directo.
- Regresion simple: prueba de la pendiente (t), prueba del modelo (ANOVA), R-cuadrado.
- Supuestos: LIHN (linealidad, independencia, homocedasticidad, normalidad de residuos).
- Regresion multiple: R-cuadrado ajustado, VIF y tolerancia para detectar multicolinealidad.
11. Preguntas de autoevaluación
1. ¿Qué dice la hipótesis nula en la prueba de significancia de Pearson?
Que la correlación poblacional rho es igual a cero. Es decir, que la asociación lineal observada en la muestra podría deberse al azar. El estadístico t contrasta r contra esa hipótesis con N menos 2 grados de libertad.
2. ¿Para qué sirve la transformación de Fisher?
Para estabilizar la varianza de r y volver su distribución aproximadamente normal. Eso permite construir intervalos de confianza y comparar dos correlaciones. Es necesaria porque la distribución muestral de r es asimétrica, sobre todo cuando rho se aleja de cero.
3. ¿Qué diferencia hay entre la prueba de la pendiente y la prueba del modelo en regresión simple?
En regresión simple con un solo predictor, ambas pruebas producen el mismo valor p, porque evaluar si la pendiente es cero equivale a evaluar si el modelo aporta algo. En regresión multiple se separan: la prueba del modelo evalua el ajuste global, y la prueba de cada pendiente evalua el aporte individual de cada predictor.
4. ¿Qué es la multicolinealidad y cómo se diagnostica?
Es la correlación elevada entre dos o más predictores dentro de un modelo de regresión multiple. Infla los errores estándar de los coeficientes y los hace inestables. Se diagnostica con el factor de inflación de la varianza (VIF mayor que 5 o 10 según criterio) y con la tolerancia (inverso del VIF, menor que 0.10 como umbral de severidad).
5. ¿Por qué se reporta el R-cuadrado ajustado en regresión multiple?
Porque el R-cuadrado ordinario sube de forma artificial cada vez que se agrega un predictor, incluso si es ruido. El R-cuadrado ajustado penaliza la inclusión de predictores que no aportan, por lo que ofrece una estimación más honesta del ajuste del modelo.
Estudia esta materia jugando en la Escuela PsiqueAcadémica — la sesión 1 es gratis. O comprueba lo que sabes en la Arena de preguntas.
🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →
Ponlo en práctica
Test de conocimiento: Procesos Psicológicos
Pon a prueba lo que sabes de este tema: 12 preguntas reales, tu nivel al final y los temas exactos a reforzar.