Skip to content

Correlación y regresión inferencial

Correlación y regresión inferencial
PsiqueAcadémica · Cuaderno de Estadística Inferencial

Correlación y regresión inferencial

De la asociación entre dos variables a la predicción con varios predictores
Apunte de clase · Estadística Inferencial
Tesis del tema: La correlación de Pearson describe la asociación lineal entre dos variables, pero la inferencia sobre esa asociación exige decidir si el coeficiente observado es compatible con la hipótesis nula de que la correlación poblacional es cero. La regresión lineal da un paso más: estima una ecuación de predicción y permite poner a prueba tanto la pendiente como el modelo completo mediante una tabla ANOVA. La extensión a varios predictores es la regresión múltiple, con su propio indicador de ajuste: el R-cuadrado ajustado.

En una frase: r asocia dos variables; la regresión predice una a partir de otra.

1. Prueba de significancia para el coeficiente de correlación de Pearson

El coeficiente de correlación de Pearson (r) mide la fuerza y la dirección de la relación lineal entre dos variables cuantitativas. Sus valores van de menos uno a más uno. En inferencia, la pregunta no es solo cuánto vale r en la muestra, sino si ese valor permite afirmar que la correlación en la población (simbolizada con la letra griega rho) es distinta de cero.

1.1. Planteamiento de hipótesis

  1. Hipotesis nula (H0): rho es igual a cero. Las variables no presentan correlación lineal poblacional.
  2. Hipotesis alternativa (H1): rho es distinto de cero (bilateral) o bien rho es mayor que cero / menor que cero (unilateral).

1.2. Estadístico de prueba

El estadístico de prueba es una transformación de r a la distribución t de Student, con N menos dos grados de libertad. La fórmula es t igual a r multiplicado por la raíz cuadrada de (N menos dos), dividido entre la raíz cuadrada de (uno menos r al cuadrado). Cuanto mayor sea el valor de r sin signo y mayor el tamaño muestral, mayor será el estadístico t y más fácil rechazar la hipótesis nula.

Definición clave: el estadístico t de Pearson contrasta el r observado contra la hipótesis nula de que rho = 0. Los grados de libertad son N menos 2, donde N es el número de pares de observaciones.

1.3. Factores que influyen en la significancia

  1. Magnitud del coeficiente: valores de r cercanos a más uno o menos uno producen t más grandes.
  2. Tamaño muestral: con N grande, correlaciones modestas se vuelven estadísticamente significativas.
  3. Nivel de significación: el umbral habitual es 0.05; valores más exigentes (0.01) reducen la potencia.
Trampa de parcial: un r significativo no prueba causalidad. La correlación mide asociación, no que una variable cause la otra. Para inferir causalidad se necesita un diseño experimental con asignación al azar y control de variables.

2. Intervalo de confianza para r

El coeficiente r es un estimador puntual: un solo número que resume la muestra. El intervalo de confianza aporta un rango de valores plausibles para la correlación poblacional. Para construirlo no se usa la distribución t directamente, porque la distribución muestral de r es sesgada, sobre todo cuando rho se aleja de cero. La solución clásica es la transformación de Fisher.

2.1. Transformacion de Fisher

El procedimiento, propuesto por Fisher en 1921, convierte r en un valor z que se aproxima a una distribución normal, independientemente del valor de rho. Los pasos son:

  1. Transformar r en z mediante la fórmula z igual a un medio del logaritmo natural de (uno más r) dividido entre (uno menos r). Este cociente se llama arco tangente hiperbolica de r.
  2. Calcular el error estándar de z: uno dividido entre la raíz cuadrada de (N menos tres).
  3. Construir el intervalo en la escala z: z más menos el valor crítico de la normal multiplicado por el error estándar.
  4. Volver a la escala original invirtiendo la transformación.
Definición clave: la transformación de Fisher estabiliza la varianza de r y lo hace aproximadamente normal, lo que permite construir intervalos de confianza y comparar correlaciones entre si. Es imprescindible cuando rho se aleja de cero.
Trampa de parcial: no se puede construir el intervalo de confianza de r aplicando directamente la distribución t como si fuera una media. La distribución muestral de r es asimétrica, sobre todo con rho cercano a más uno o menos uno. La transformación de Fisher es el camino correcto.

3. Regresión lineal simple: el modelo inferencial

La regresión lineal simple ajusta una ecuación de la forma Y igual a beta cero más beta uno por X más epsilon, donde Y es la variable dependiente, X es la independiente, beta cero es la ordenada al origen, beta uno es la pendiente y epsilon es el error. Los valores estimados en la muestra se escriben b cero y b uno. La inferencia pone a prueba estos coeficientes y el modelo completo.

3.1. Prueba de la pendiente

La hipótesis nula es que la pendiente poblacional beta uno vale cero, es decir, que X no predice linealmente a Y. El estadístico de prueba es t igual a b uno dividido entre su error estándar, con N menos dos grados de libertad. Si el valor p asociado es menor que el nivel de significación, se rechaza la hipótesis nula y se concluye que la pendiente es distinta de cero.

3.2. Prueba del modelo (tabla ANOVA de la regresión)

Ademas de la prueba individual de la pendiente, la regresión admite un contraste global mediante una tabla ANOVA. En regresión lineal simple con un solo predictor, la prueba de la pendiente y la del modelo dan el mismo valor p; pero la tabla ANOVA se vuelve indispensable en regresión multiple, donde cada predictor se evalua por separado y el modelo completo se evalua en conjunto.

Fuente de variaciónSuma de cuadrados (SC)Grados de libertad (gl)Cuadrado medio (CM)F
Regresionvariabilidad explicada por el modelo (diferencia entre Y predicho y la media de Y)número de predictores (k)SC regresión / kCM regresión / CM residuo
Residuovariabilidad no explicada (diferencia entre Y observado y Y predicho)N menos k menos unoSC residuo / gl residuo
Totalvariabilidad total de Y respecto de su mediaN menos uno

3.3. Coeficiente de determinación (R-cuadrado)

El R-cuadrado mide la proporción de varianza de Y que el modelo explica. Su fórmula directa es SC regresión dividido entre SC total. En regresión lineal simple, R-cuadrado coincide con el cuadrado del coeficiente de correlación de Pearson entre X e Y. Por eso, un r de 0.60 implica un R-cuadrado de 0.36: el predictor explica el 36 por ciento de la varianza de la variable dependiente.

Definición clave: en regresión simple, R-cuadrado igual a r al cuadrado. El R-cuadrado indica la proporción de varianza de Y explicada por el modelo; el restante porcentaje corresponde al error o varianza no explicada.

4. Supuestos de la regresión lineal

La regresión lineal por minimos cuadrados ordinarios descansa sobre cuatro supuestos clásicos. Si se violan, los estimadores pierden eficiencia o los valores p dejan de ser confiables.

  1. Linealidad: la relación entre X e Y es lineal. Si el patron es curvilineo, el modelo subestima la predicción. Se revisa con un diagrama de dispersión.
  2. Independencia: los residuos son independientes entre si. En series temporales o datos anidados, este supuesto suele romperse. Se evalua con la prueba de Durbin-Watson.
  3. Homocedasticidad: la varianza de los residuos es constante a lo largo de los valores de X. Si la dispersión crece o se reduce, hay heterocedasticidad. Se revisa con un grafico de residuos contra valores predichos.
  4. Normalidad de los residuos: los errores siguen una distribución normal con media cero. No se exige normalidad de las variables, sino de los residuos. Se evalua con un grafico cuantil-cuantil (Q-Q plot) o con pruebas como Shapiro-Wilk.
Trampa de parcial: el supuesto de normalidad se aplica a los residuos, no a las variables X e Y originales. Confundir uno con otro es un error clásico. Las variables pueden no ser normales y aun así los residuos cumplir el supuesto.

5. Diagnóstico de residuos

El diagnóstico de residuos verifica visualmente los supuestos. Tres graficos son estándar:

  1. Grafico de residuos contra valores predichos: si los puntos se esparcen al azar alrededor de cero, sin patron, la linealidad y la homocedasticidad se sostienen. Si hay una curva o un embudo, algun supuesto falla.
  2. Q-Q plot de residuos: compara los cuantiles de los residuos con los de una distribución normal. Si los puntos se alinean sobre la diagonal, la normalidad es razonable. Desviaciones sistematicas (curva en S) indican asimetria o colas pesadas.
  3. Grafico de residuos contra cada predictor: util en regresión multiple, detecta patrones no lineales que el grafico global podría enmascarar.
Analogía útil: el grafico de residuos es como la placa de rayos X del modelo: por fuera (en el R-cuadrado) todo parece bien, pero la placa revela si hay una fractura oculta en los supuestos.

6. Regresión múltiple

La regresión multiple extiende el modelo simple a dos o más predictores. La ecuación pasa a ser Y igual a beta cero más beta uno por X uno más beta dos por X dos, y así sucesivamente, más el error. Cada coeficiente beta indica cuánto cambia Y por cada unidad de aumento en ese predictor, manteniendo los demas constantes.

6.1. R-cuadrado ajustado

Al agregar predictores, el R-cuadrado ordinario nunca baja: cualquier variable, aunque sea ruido, infla el indicador. Para corregir ese sesgo se usa el R-cuadrado ajustado, que penaliza la inclusión de predictores que no aportan. La fórmula del R-cuadrado ajustado incorpora el número de predictores y el tamaño muestral, y puede disminuir cuando se agregan variables irrelevantes.

Definición clave: el R-cuadrado ajustado es un indicador de ajuste que corrige la inflación artificial del R-cuadrado al agregar predictores. Es el indicador que se reporta en regresión multiple.

6.2. Multicolinealidad

Cuando los predictores están altamente correlacionados entre si, se produce multicolinealidad. Esto infla los errores estándar de los coeficientes, los vuelve inestables y dificulta interpretar el aporte individual de cada predictor. Se diagnostica con dos indicadores:

  1. Factor de inflación de la varianza (VIF): valores por encima de 5 (o de 10, según el criterio) señalan multicolinealidad problematica.
  2. Tolerancia: el inverso del VIF. Valores por debajo de 0.10 indican colinealidad severa.
Trampa de parcial: la multicolinealidad no viola el supuesto de linealidad ni invalida la predicción del modelo, pero degrada la interpretación de los coeficientes individuales. Un coeficiente puede dejar de ser significativo no porque el predictor no importe, sino porque su varianza esta inflada por la colinealidad.

7. Diferencias entre correlación y regresión

AspectoCorrelacion de PearsonRegresion lineal
ObjetivoMedir la fuerza y la dirección de una asociación lineal simetricaEstimar una ecuación para predecir Y a partir de X
Simetriar(X,Y) es igual a r(Y,X); no distingue variable dependiente de independienteLa ecuación cambia si se invierten X e Y: la pendiente no es simetrica
EscalaAdimensional: va de menos uno a más unoLa pendiente se expresa en unidades de Y por unidad de X
InferenciaPrueba t sobre r (gl = N menos 2); intervalo via FisherPrueba t sobre la pendiente; tabla ANOVA del modelo

8. Línea de tiempo

1896 Pearson formaliza el coeficiente de correlación lineal a partir de los trabajos previos de Galton sobre regresión.
1921 Fisher introduce la transformación z para estabilizar la varianza de r y construir intervalos de confianza.
1925 Fisher publica Statistical Methods for Research Workers, donde sistematiza la tabla ANOVA aplicada a la regresión.
1904 Spearman propone el coeficiente de correlación por rangos como alternativa no paramétrica.

9. Errores frecuentes en el parcial

1. Confundir correlación significativa con causalidad. Un r significativo indica asociación lineal, no que una variable cause la otra. La causalidad requiere diseño experimental y control de terceras variables.
2. Aplicar la distribución t directamente para el intervalo de r. La distribución muestral de r es asimétrica. El camino correcto es la transformación de Fisher al espacio z, construir alli el intervalo y deshacer la transformación.
3. Creer que el supuesto de normalidad se aplica a las variables. Se aplica a los residuos del modelo. Las variables X e Y pueden no ser normales y aun así los residuos cumplir el supuesto.
4. Reportar el R-cuadrado ordinario en regresión multiple. En regresión multiple se reporta el R-cuadrado ajustado, porque el ordinario se infl artificialmente al agregar predictores.

10. Para el parcial

Lo que con probabilidad te van a preguntar:
  • La prueba de significancia de Pearson: hipótesis nula rho = 0, estadístico t con N menos 2 grados de libertad.
  • La transformación de Fisher: para que sirve (estabilizar la varianza de r) y cuando se usa (intervalos de confianza para r).
  • La tabla ANOVA de la regresión: fuentes, grados de libertad y como se obtiene F.
  • Los cuatro supuestos: linealidad, independencia, homocedasticidad, normalidad de residuos.
  • El R-cuadrado ajustado y por que se prefiere al R-cuadrado ordinario en regresión multiple.
  • La multicolinealidad: diagnóstico con VIF y tolerancia, y su impacto en los coeficientes.
Truco de memoria: los cuatro supuestos se acuerdan con la sigla LIHN: Linealidad, Independencia, Homocedasticidad, Normalidad de residuos. Y el diagnóstico se hace con tres graficos: residuos contra predichos, Q-Q plot y residuos contra cada predictor.
LIHN4 supuestos3 graficos
Repaso en 30 segundos:
  • Pearson: r mide asociación lineal; H0 dice rho = 0; estadístico t con gl = N menos 2.
  • Intervalo de r: transformación de Fisher al espacio z, no t directo.
  • Regresion simple: prueba de la pendiente (t), prueba del modelo (ANOVA), R-cuadrado.
  • Supuestos: LIHN (linealidad, independencia, homocedasticidad, normalidad de residuos).
  • Regresion multiple: R-cuadrado ajustado, VIF y tolerancia para detectar multicolinealidad.

11. Preguntas de autoevaluación

1. ¿Qué dice la hipótesis nula en la prueba de significancia de Pearson?

Que la correlación poblacional rho es igual a cero. Es decir, que la asociación lineal observada en la muestra podría deberse al azar. El estadístico t contrasta r contra esa hipótesis con N menos 2 grados de libertad.

2. ¿Para qué sirve la transformación de Fisher?

Para estabilizar la varianza de r y volver su distribución aproximadamente normal. Eso permite construir intervalos de confianza y comparar dos correlaciones. Es necesaria porque la distribución muestral de r es asimétrica, sobre todo cuando rho se aleja de cero.

3. ¿Qué diferencia hay entre la prueba de la pendiente y la prueba del modelo en regresión simple?

En regresión simple con un solo predictor, ambas pruebas producen el mismo valor p, porque evaluar si la pendiente es cero equivale a evaluar si el modelo aporta algo. En regresión multiple se separan: la prueba del modelo evalua el ajuste global, y la prueba de cada pendiente evalua el aporte individual de cada predictor.

4. ¿Qué es la multicolinealidad y cómo se diagnostica?

Es la correlación elevada entre dos o más predictores dentro de un modelo de regresión multiple. Infla los errores estándar de los coeficientes y los hace inestables. Se diagnostica con el factor de inflación de la varianza (VIF mayor que 5 o 10 según criterio) y con la tolerancia (inverso del VIF, menor que 0.10 como umbral de severidad).

5. ¿Por qué se reporta el R-cuadrado ajustado en regresión multiple?

Porque el R-cuadrado ordinario sube de forma artificial cada vez que se agrega un predictor, incluso si es ruido. El R-cuadrado ajustado penaliza la inclusión de predictores que no aportan, por lo que ofrece una estimación más honesta del ajuste del modelo.

Estudia esta materia jugando en la Escuela PsiqueAcadémica — la sesión 1 es gratis. O comprueba lo que sabes en la Arena de preguntas.

PsiqueAcadémica · Cuaderno de Estadística Inferencial

Fuentes verificadas: Pearson, K. (1896, Philosophical Transactions of the Royal Society of London, 187, 253-318); Fisher, R. A. (1921, Metron, 1(4), 3-32); Fisher, R. A. (1925, Statistical Methods for Research Workers, Oliver and Boyd); Spearman, C. (1904, The American Journal of Psychology, 15(1), 72-101); Cohen, J., Cohen, P., West, S. G. y Aiken, L. S. (2003, Applied Multiple Regression/Correlation Analysis for the Behavioral Sciences, 3.ª ed., Lawrence Erlbaum); Field, A. (2018, Discovering Statistics Using IBM SPSS Statistics, 5.ª ed., Sage); APA (2020, Publication Manual of the American Psychological Association, 7.ª ed.).

🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →

Ponlo en práctica

Test de conocimiento: Procesos Psicológicos

Pon a prueba lo que sabes de este tema: 12 preguntas reales, tu nivel al final y los temas exactos a reforzar.

x2 monedas

Esta semana tu cuenta vale el doble — entra antes del 15 de octubre

El Club Psiqueacadémica premia a quienes llegan primero: doble de Psique Coins semanales durante la fase de lanzamiento.

Me uno antes del 15 de octubre

Doble de monedas las primeras semanas