Skip to content

Regresión lineal múltiple y predicción

Lectura rápida. Una regresión lineal múltiple estima una variable cuantitativa a partir de dos o más predictores. Su aporte central está en separar la asociación de cada predictor mientras los demás permanecen constantes, y en convertir ese diagnóstico en una predicción accompanied by medidas de incertidumbre. Aquí el foco está en varios predictores, su ingreso al modelo, la colinealidad, los residuos, la influencia de observaciones y el reporte interpretable.

Nota de alcance. El modelo resume relaciones lineales condicionales dentro de una muestra. No demuestra por sí solo que un predictor cause el resultado. Para causalidad,requiere un diseño y supuestos que respalden esa interpretación. La predicción puede ser útil aunque la explicación causal permanezca abierta.

1. El modelo de regresión lineal múltiple

Partimos de una variable de resultado Y y un conjunto de predictores X1, X2 y así sucesivamente. La forma básica es Y = a + b1X1 + b2X2 + … + e. a representa el intercepto; b1 y b2 son coeficientes; e reúne la parte de Y que el modelo no reproduce. La elipsis señala que la lista de predictores puede continuar según la pregunta.

El coeficiente b indica el cambio asociado en Y por cada unidad de Xi cuando los otros predictores de la ecuación se mantienen constantes. “Sosteniendo el resto” describe una comparación estadística condicional. Por ejemplo, si las horas de estudio conservan el promedio previo y la ansiedad, su coeficiente expresa la asociación entre horas y rendimiento dentro de valores comparables de esas variables. La frase no afirma que las horas puedan separarse experimentalmente de los demás factores.

En la planeación,Tú eliges las variables con una razón teórica o práctica, defines sus escalas y anticipas la dirección esperada. Después verificas que cada predictor tenga suficientes observaciones, que la unidad de medida sea estable y que los datos describan a la poblaciónmeta. En un estudio sobre rendimiento en una universidad colombiana, el resultado podría ser la nota final y los predictores serían ansiedad, horas semanales de estudio y promedio previo.

Coeficiente sin estandarizar frente a coeficiente estandarizado. El coeficiente b usa la unidad original de Xi y de Y. La beta estandarizada expresa la relación en términos de desviaciones típicas y permite comparar predictores medidos en escalas distintas, cuando la muestra, el modelo y las escalas tengan sentido comparable. La beta no reemplaza el coeficiente sin estandarizar:, necesitas ambos para conocer la magnitud práctica y la posición relativa.

Una interpretación correcta juga con el escenario. Si ansiedad tiene b = -0,24, la lectura provisoria es: por cada punto adicional de ansiedad, el rendimiento predicho disminuye 0,24 unidades al fijar las horas de estudio y el promedio previo. Antes de presentar esa frase se revisan intervalo de confianza, valor p, diagnósticos y alcance de la muestra. El signo muestra dirección de asociación bajo el modelo ajustado; la magnitud depende de cómo fue medida la ansiedad.

Analogía: una mesa con varias patas. Una mesa con una sola pata puede explicar poco de su estabilidad. Agregar una segunda o tercera variable amplía la representación del fenómeno, pero una pata corta o repetida no aporta la misma información. Los coeficientes se calculan en conjunto: el valor de una pendiente cambia cuando otra variable entra, sale o se redefine. Del mismo modo, ansiedad, horas de estudio y promedio previo representan dimensiones que se relacionan de manera simultánea.
  1. Definir: plantea Y, predictores, unidad de análisis, dirección esperada y horizonte de predicción.
  2. Preparar: limpiar datos faltantes, codificar categorías sin convertirlas en ordinales sin una razón y documentar transformaciones.
  3. Estimar: introduce predictores según la estrategia elegida y revisa el ajuste global.
  4. Diagnosticar: examina colinealidad, residuos, leverage, Cook y DFBeta.
  5. Reportar: comunica el modelo, los coeficientes, su incertidumbre, las limitaciones y el uso predictivo.

2. Procedimientos de entrada de predictores: jerárquica y stepwise

El orden de entrada importa porque cada coeficiente depende de las variables que ya están en la ecuación. En una entrada jerárquica, la persona investigadora decide el orden con apoyo teórico. Un primer bloque puede contener promedio previo; un segundo añade ansiedad; un tercero incorpora horas de estudio. Este orden permite formular qué proporción de variabilidad se asocia con antecedentes y qué cantidad adicional aparece al incluir factores psicosociales. La comparación entre bloques exige indicar de antemano qué cambio se juzga relevante.

En la entrada jerárquica, la posición de cada predictor tiene una justificación sustantiva. Si la teoría ubica el promedio previo antes que la ansiedad, ese bloque se estima primero. La interrogante puede formularse así: ¿qué añade la ansiedad después de considerar el historial académico? El resultado no debe interpretarse como prueba de secuencia temporal causal; el orden estadístico es una estrategia de comparación.

La estrategia stepwise deja que un algoritmo introduzca o retirar predictores según valores p u otros criterios. Distintos paquetes usan variantes, tolerancias y reglas de inclusión. La selección automática busca optimizar un resumen numérico dentro de esa muestra. Field y Tabachnick y Fidell desaconsejan tratarla como procedimiento teórico, pues el proceso capitaliza azar: un predictor puede entrar por una fluctuación muestral, obtener un p bajo y modificar el resultado. La selección repetida en datos de entrenamiento tampoco garantiza estabilidad en datos nuevos.

Jerárquica

Decisión: la persona investigadora fija el orden.

Pregunta: ¿qué capacidad predictiva añade cada bloque?

Ventaja: conecta la secuencia del modelo con teoría, antecedentes o etapas del estudio.

Riesgo: elegir el orden después de mirar resultados puede convertir la estrategia en un resumen opportunistic.

Stepwise

Decisión: reglas estadísticas incorporan y retiran variables.

Pregunta: ¿qué conjunto produce el criterio usado por el programa?

Ventaja: puede servir para explorar una base con muchas variables.

Riesgo: inestabilidad, sobreajuste y apariencia de objetividad sin teoría.

Criterios para elegir una estrategia de entrada
CriterioJerárquicaStepwise
OrdenSe declara a partir de teoría, antecedentes y preguntas.Se deriva de reglas algorítmicas.
Cambio de R cuadradoSe interpreta por bloque, con su F y significación.Puede registrarse, pero el algoritmo ya selecciona variables.
EstabilidadDepende de la coherencia de los predictores elegidos.Suele variar entre muestras y semillas de selección.
Uso recomendadoCuando existe una razón clara para la secuencia.Como exploración, con validación y reporte de reglas.
InterpretaciónCada bloque responde una pregunta definida.La lista final exige cautela por selección automática.
Trampa parcial: llamar “modelo más adecuado” al resultado stepwise. Un programa puede entregar una ecuación distinta con una muestra equivalente. La selección automática tampoco define por sí sola la relevancia teórica, la dirección causal ni el comportamiento con nuevos estudiantes.
¿Cuántos predictores puedo incluir?

No existe una regla general. El tamaño de muestra se relaciona con el número de coeficientes, la variabilidad, la distribución de Y, la cantidad de predictores categóricos y la complejidad de las interacciones. Como orientación práctica, un modelo con muchos predictores y n pequeño tiene alta variabilidad, intervalos anchos y dificultad para detectar patrones. Calcula precisión, revisa poder de manera sustantiva y reduce variables por una razón previa, no para obtener un p favorable.

¿Cómo manejo datos faltantes?

Primero identifica el mecanismo y la cantidad de faltantes. Puedes realizar análisis con los datos observados si la pérdida es pequeña y la razón se relaciona, pero esa decisión debe declararse. También puedes usar imputación múltiple cuando sea apropiada, conservar el predictor en la muestra disponible o aplicar procedimientos del programa. Comparar tamaños muestrales y distribuciones ayuda a detectar sensibles cambios. La imputación no inventa valores; incorpora incertidumbre mediante varias estimaciones.

Pregunta y orden definidos
Estimación de cada bloque
Comparación y estabilidad

3. Multicolinealidad y diagnóstico

La multicolinealidad aparece cuando dos o más predictores mantienen una correlación muy alta. En una ecuación múltiple, esa redundancia impide separar con precisión sus aportes. Un coeficiente puede cambiar de signo,inflarse o presentar un intervalo de confianza amplio cuando ansiedad y horas de estudio transmiten información semejante. La multicolinealidad viola la idea de aislamiento intuitivo entre predictores, aunque no exige que el modelo carezca de utilidad predictiva.

El factor de inflación de la varianza, llamado VIF, cuantifica cuánto se multiplica la varianza de un coeficiente por la correlación del predictor con los demás. La tolerancia es su recíproco: tolerancia = 1/VIF. Una regla práctica frecuente señala VIF mayor que 10 como alerta; algunos equipos usan el umbral de 5. El umbral no reemplaza el contexto: una variable de control correlacionada puede conservar un valor predictivo importante.

Qué te ayuda a decidir. Examina magnitud del VIF, tolerancia, correlaciones bivariadas, matriz de predictors y estabilidad del coeficiente al cambiar la especificación. Reporta el diagnóstico y la decisión tomada. Si dos variables Duplican información, considera una de ellas por razones teóricas, o conserva ambas si representan dimensiones distintas.
Qué no a decidir. Un VIF moderado no significa que el coeficiente sea inútil. Un VIF bajo tampoco demuestra causalidad. La colinealidad se interpreta con el diseño, la escala, el objetivo de predicción y el resto de diagnósticos.

En el caso colombiano, el promedio previo puede relacionarse con horas de estudio y ansiedad. Si VIF supera el umbral, interprétalo como una señal para revisar si las variables representan el mismo aspecto. Puedes comparar el modelo con y sin una variable redundante, informar ambos ajustes y evitar afirmar cuál “produce” el cambio. La selección debe responder a la pregunta: si el promedio previo ya está en el modelo, ¿la ansiedad añade información predictiva medible?

  • VIF y tolerancia: describen inflación de varianza; no miden la calidad del resultado.
  • Índice de condición: puede complementar el análisis cuando existen varias correlaciones.
  • Matriz de correlaciones: ayuda a localizar pares muy ligados, sin ser un diagnóstico suficiente.
  • Regresiones auxiliares: muestran qué variable puede predecirse con las demás.
  • Estabilidad: comparar coeficientes en submuestras o especificaciones razonadas revela sensibilidad.
Nota taquigráfica: VIF alto = señal de separación deficiente. Antes de retirar una variable, pregúntate si su significado teórico y su papel en la predicción justifican conservarla. Un intervalo ancho puede ser el mensaje estadístico más importante.
¿La multicolinealidad desaparece al centrar las variables?

Centrar ayuda a interpretar interceptos y puede reducir problemas numéricos, pero la colinealidad entre pendientes proviene de la relación lineal entre predictores y no desaparece por cambiar su origen. Si X1 y X2 son copias casi exactas, su VIF seguirá alto. La transformación puede facilitar la interpretación del intercepto, no garantiza la separación causal de los coeficientes.

¿Qué hago si los predictores categóricos tienen categorías poco frecuentes?

Categorías con pocas observaciones producen coeficientes inestables y errores estándar grandes. Agrupa categorías por una razón conceptual, define categorías de referencia con anticipación, o reduce el número de predictores. Documenta el procedimiento y revisa si el cambio modifica el objetivo del estudio. No uses el valor p como orientación exclusiva para agrupar.

4. Análisis de residuos y casos influyentes

Los residuos son la diferencia entre el valor observado y el valor predicho. Su examen responde tres preguntas: la relación funcional parece lineal, la dispersión de errores es razonablemente estable y la distribución de residuos tiene una forma compatible con el uso de inferencia. Linealidad se puede revisar con gráficos de residuos contra valores predichos y contra cada predictor. Homocedasticidad significa que la varianza del error no cambia de forma marcada según el nivel de Y. Normalidad se concentra en la distribución de los residuos; los procedimientos lineales son bastante robustos ante desviaciones moderadas, sobre todo cuando n es grande, pero los valores extremos siguen importando.

Un gráfico de residuos no se interpreta como una prueba mecánica. Busca patrones, abanicos, curvas, grupos y valores alejados. Si la dispersión aumenta con el rendimiento predicho, una transformación de Y, errores estándar Robust o un modelo con relación distinta pueden serconsiderar. La selección depende de la pregunta. Registrar el patrón y su efecto en coeficientes es más útil que que “los supuestos no se cumplen” por una cifra aislada.

Los casos influyentes pueden modificar la pendiente, el intercepto o el ajuste. El leverage mide qué tan alejada está una observación respecto de los valores de los predictores. La distancia de Cook resume cuánto cambian los coeficientes cuando se excluye un caso. DFBeta indica el cambio aproximado de un coeficiente específico. Conviene revisar las tres ideas juntas, porque un punto extremo en X puede tener leverage alto, aunque su residuo sea pequeño.

Lectura prudente

Examina gráficos de residuos y listado de métricas. Busca el patrón general antes de concentrarte en una sola cifra. Contrasta el modelo con y sin el caso y verifica si la decisión cambia la conclusión sustantiva.

Lectura riesgosa

Borrar un outlier porque “molesta el p” altera la muestra, oculta variabilidad y puede introducir un resultado favorable. Un valor extremo merece verificación de captura, codificación y plausibilidad, además de análisis de sensibilidad.

Para el caso de rendimiento académico, revisa si una estudiante con promedio previo bajo, ansiedad elevada y horas altas cambia la pendiente de ansiedad. Primero confirma que los valores pertenecen a la misma población meta. Después estima el modelo sin esa observación y compara b, intervalos, R cuadrado ajustado y conclusiones. Si el cambio es grande, reporta ambas especificaciones. Si el caso fue excluido por un error de digitación, corrige el dato y conserva la observación en el análisis.

Analogía: el prisma y la tarjeta de calibración. Una observación influyente funciona como una tarjeta de calibración que, alquitarla, cambia la lectura del aparato. No vas a romper el prisma por obtener una imagen incómoda. Primero verificas la tarjeta, después observas cómo se mueve la medición y finalmente decides si el cambio revela una limitación del instrumento o un dato que debe conservarse.
Qué puede mostrar el diagnóstico de un caso
MedidaLecturaAcción razonable
ResiduoDiferencia entre observado y predicho.Revisar patrón, escala, linealidad y transformación posible.
LeverageDistancia de la observación en el espacio de X.Verificar valores de predictores y su procedencia.
CookImpacto conjunto sobre coeficientes y ajuste.Comparar el ajuste al excluir el caso de forma temporal.
DFBetaCambio de un coeficiente al excluir el caso.Localizar qué pendiente resulta sensible y revisar supuestos.
Secuencia de control. 1) verifica captura; 2) examina residuos; 3) localiza leverage; 4) estima influencia; 5) repite sin el caso; 6) informa el análisis de sensibilidad. La decisión debe seguir la integridad de los datos y la pregunta, no un deseo de ver una pendiente distinta.
¿Un residuo grande indica un caso influyente?

No. Un residuo puede ser grande porque Y se apreda mal, mientras que su leverage puede ser bajo. Un punto con leverage alto puede tener residuo pequeño y todavía influir en coeficientes. Por eso se combinan residuo, leverage, Cook y DFBeta, y se interpreta su conjunta evidencia.

¿Cuándo conviene transformar Y?

Considera una transformación cuando el patrón de residuos muestra una curva o una dispersión que cambia de forma marcada, cuando la escala exige relaciones multiplicativas o cuando las diferencias se interpretan con mayor claridad en otra métrica. Registra cómo cambia la interpretación de b y compara predicciones. Una transformación no elimina automáticamente un punto extremo ni prueba causalidad.

5. Interpretación y reporte del modelo

El reporte de una regresión múltiple une una mirada global con una lectura de cada predictor. Para el modelo de rendimiento, la sección Procedimientos debe decir qué variables entraron, el orden, el tipo de muestra, el manejo de faltantes, el software y la forma de comprobar supuestos. La sección Resultados debe incluir n, R cuadrado, R cuadrado ajustado, F del modelo, grados de libertad, b con intervalo de confianza, beta, valor p y tamaño del efecto. La Interpretación traduce esas cifras al contexto universitario.

R cuadrado expresa la proporción de variabilidad de Y asociada con los predictores del modelo dentro de la muestra. R cuadrado ajustado penaliza la incorporación de variables y suele ser más informativo cuando se comparan modelos con distinto número de predictores. Una cifra elevada no vuelve verdadera la ecuación: también puede reflejar sobreajuste, variables muy ligadas al resultado, muestra peculiar o una relación espuria.

La F del modelo evalúa si el conjunto de predictores aporta capacidad explicativa bajo el ajuste global. Después, cada b responde por separado dentro de la ecuación. Reporta el intervalo de confianza, pues el valor p no muestra con claridad la magnitud de incertidumbre. La beta ordenada permite comparar la fuerza relativa de predictores, pero su lectura depende de la distribución, la escala y la colinealidad.

Trampa parcial: concluir que R cuadrado alto demuestra que el modelo es verdadero. La bondad de ajuste resume reproducción de patrones en Y; no identifica el mecanismo que los generó. Una muestra de universitarios colombianos puede tener buen ajuste por azar, selección o inclusión de variables proxies. La capacidad predictiva externa requiere datos nuevos o validación.

Predicción no equivale a explicación causal. Una ecuación puede predecir notas finales con ansiedad, horas y promedio previo. Eso puede servir para identificar estudiantes que necesitan apoyo, orientar una conversación o diseñar un servicio. La misma ecuación no demuestra que cambiar la ansiedad produzca una modificación de la nota. Para hablar de efecto causal necesitas un diseño que controle variables de confusión, comprobaciones de asignación, secuencia temporal y sensibilidad a violaciones.

Antes de usar el modelo con nuevas personas, separa datos de entrenamiento y validación, o usa validación cruzada cuando el tamaño lo permita. Compara predicciones con observaciones independientes, calcula error de predicción y revisa intervalos. El rendimiento dentro de la muestra suele ser más optimista que el comportamiento ante datos nuevos. Informa el origen de la muestra, el período, la institución y las condiciones de aplicación.

Tarjeta mnemotecnia: PRE

Pregunta y población; Resultado global y residuos; Efectos de cada predictor con incertidumbre.

Antes de presentar: escribe n; escribe R cuadrado y R cuadrado ajustado; escribe F del modelo; escribe b con IC; escribe beta y p; escribe el tamaño del efecto; escribe el diagnóstico de colinealidad, residuos e influencia; escribe la limitación causal.

Esquema de reporte para el caso de rendimiento académico
ApartadoInformaciónEjemplo de formulación
Muestran, institución, periodo, criterios de inclusión y faltantes.“Se analizaron n estudiantes de la universidad durante el periodo X”.
AjusteR cuadrado, R cuadrado ajustado y F con sus grados de libertad.“El modelo explicó el porcentaje indicado; el cambio conjunto fue evaluado con F”.
Predictoresb, IC, beta, p y tamaño del efecto.“Ansiedad se relacionó con b = …, IC …, beta …, p …”.
DiagnósticoVIF, tolerancia, gráficos, leverage, Cook y DFBeta.“Se revisaron…”; incluir sensibilidad si hubo casos extremos.
UsoPredicción, apoyo, alcance y límites causales.“Las estimaciones apoyan una conversación preventiva, no una conclusión causal”.
Plantilla de párrafo interpretativo: “Con n = [valor], el modelo incluyó [variables] en [orden]. Ajustó R cuadrado = [valor] y R cuadrado ajustado = [valor], con F([gl1], [gl2]) = [valor], p = [valor]. Ansiedad mostró b = [valor], IC del 95 % [límites], beta = [valor] y p = [valor]. Horas de estudio mostró b = [valor]… El VIF máximo fue [valor]. Los gráficos de residuos no mostraron [hallazgo], aunque [limitación]. Estos coeficientes describen asociaciones condicionales y sostienen predicciones dentro de [población y periodo]”.

La redacción debe evitar presentar una correlación como mecanismo. En este caso, ansiedad podría acompañar menor rendimiento por estrés, sueño, recursos o factores institucionales. Un predictor significativo puede operar como marcador de una situación y no como causa directa. Por eso el informe combina coeficientes, intervalos, antecedentes, diseño y comprobaciones. La utilidad predictiva se evalúa con datos nuevos; la explicación requiere una estrategia de identificación.

Lista de cierre para una entrega defendible. 1) Describe la muestra y el orden de entrada. 2) Presenta el ajuste global con R cuadrado y R cuadrado ajustado. 3) Reporta F del modelo. 4) Detalla b, IC, beta, p y tamaño del efecto. 5) Añade VIF y tolerancia. 6) Examina residuos, leverage, Cook y DFBeta. 7) Compara sensibilidad. 8) Separa predicción de explicación causal.
1. Especificar
2. Estimar
3. Diagnosticar
4. Reportar
Fuente inline. Field; Tabachnick y Fidell; Pardo y Ruiz; APA 7. Las decisiones sobre entrada jerárquica, selección stepwise, multicolinealidad, residuos, leverage, Cook y DFBeta se presentan conforme a esas referencias. La norma APA 7 orienta la presentación de tablas, resultados, intervalos y precisión; la referencia bibliográfica final debe contener datos reales de la edición consultada, sin DOI inventado.

Para finalizar, piensa en la ecuación como una herramienta de síntesis condicional. La fuerza de un predictor se interpreta junto con los demás, se diagnostica su incertidumbre y se contrasta con nuevos datos. En la universidad colombiana, la ansiedad, las horas de estudio y el promedio previo pueden ofrecer una predicción útil para priorizar apoyo académico. El informe debe dejar visible qué funcionó, qué parte permanece incierta y qué tipo de decisión responsable puede tomar una institución.