Skip to content

Análisis factorial confirmatorio avanzado

Tesis del tema: el analisis factorial confirmatorio (AFC) parte de una hipotesis sobre la estructura (que items forman que factores) y la pone a prueba con indices de ajuste. A diferencia del exploratorio, aqui tu decides la estructura y los datos te dicen si encaja. El AFC bien hecho verifica validez convergente (AVE alto), validez discriminante (factores distintos) y ajuste aceptable.

En una frase: en el AFE descubres, en el AFC confirmas.

1. AFE vs AFC: la diferencia que cae siempre

El analisis factorial exploratorio (AFE) te deja todos los items cargando en todos los factores y deja que los datos te muestren la estructura. El confirmatorio (AFC) hace lo opuesto: tu dices "estos cinco items miden ansiedad y estos otros cinco miden depresion", restringes las cargas cruzadas a cero, y miras si el modelo encaja.

CaracteristicaAFE (exploratorio)AFC (confirmatorio)
OrientacionGenera hipotesisPrueba hipotesis
Cargas cruzadasPermite todasSe fijan en cero
Quien define la estructuraLos datosEl investigador (teoria)
Correlacion entre factoresDepende (ortogonal u oblicua)Se especifica
Indices de ajusteNo hay ajuste global clasicoChi-cuadrado, CFI, RMSEA, SRMR
Cuando se usaDesarrollo inicial de escalaValidacion de escala existente
Analogia util: el AFE es como abrir la nevera y ver que puedes cocinar con lo que hay. El AFC es como llevar una receta a la nevera y verificar que tienes todos los ingredientes. En el AFE dejas que los ingredientes se combinen solos; en el AFC ya traes la receta escrita.
Cuidado en el parcial: el error clasico es pensar que el AFC es "mas avanzado" en el sentido de que reemplaza al AFE. No. Son etapas distintas. Primero desarrollas la escala con AFE (varias muestras), luego la validas con AFC en una muestra nueva. Saltarse el AFE y hacer AFC sobre los mismos datos se llama sobreajuste a la muestra.

2. Especificacion del modelo

En el AFC, cada item tiene una carga factorial fija o libre. Por convencion:

  1. Cargas libres: el item carga en su factor (se estima su valor).
  2. Cargas fijas: se ponen en cero (el item no carga en otros factores).
  3. Escalado del factor: se fija la primera carga de cada factor en 1 (o se fija la varianza del factor en 1) para dar unidad de medida al factor latente.
  4. Errores no correlacionados por defecto: no se permiten a menos que haya justificacion teorica o metodologica.
Definicion clave: la carga factorial es cuanto pesa un item en la construccion del factor. Una carga de 0.70 significa que el item contribuye de forma sustancial. Por debajo de 0.40, el item es debil.

3. Los indices de ajuste (y como acordarse)

Aqui vienen los numeros que te preguntan en el parcial. Cada indice tiene un corte y un truco para no olvidarlo.

IndiceCorte aceptableCorte estrictoMide
Chi-cuadradono significativo (p mayor a .05)Ajuste exacto (sensible a N)
CFImayor a .90mayor a .95Ajuste comparativo
TLImayor a .90mayor a .95Ajuste comparativo penalizado
RMSEAmenor a .08menor a .06Error de aproximacion
SRMRmenor a .08menor a .08Residuo estandarizado
Truco de memoria para los cortes estrictos:
  • CFI mayor a .95 = "Casi 1": el CFI mide cuanto mejora tu modelo respecto al nulo, y .95 esta "casi en 1".
  • RMSEA menor a .06 = "Rumanias Menores a Seis" (RMSEA Menor Seis): si el numero empieza por cero coma cero seis o menos, el modelo esta bien.
  • SRMR menor a .08 = "Sobra Menos de Ocho": los residuos estandarizados son chiquitos.
Casi 1RMSEA Menor SeisSobra Menos Ocho

Los cortes clasicos son de Hu y Bentler (1999). Publicaron los umbrales que hoy se citan en casi todo articulo de validacion de escala. CFI mayor a .95 y RMSEA menor a .06 juntos indican un buen ajuste.

Cuidado en el parcial: el chi-cuadrado casi siempre sale significativo con muestras grandes (N mayor a 300). Un chi-cuadrado significativo NO significa automaticamente que el modelo sea malo. Por eso se miran ademas CFI, RMSEA y SRMR. Decir "el chi-cuadrado salio significativo, rechazo el modelo" es una respuesta a medias.

4. Modification indices y re-especificacion

Cuando el ajuste no llega, el software te sugiere caminos: los modification indices (MI) indican cuanto mejoraria el chi-cuadrado si liberas un parametro que habias fijado.

  1. MI alto en una carga cruzada: liberar el item para que cargue en otro factor.
  2. MI alto en una correlacion de errores: permitir que dos items compartan varianza mas alla del factor.
  3. MI alto en una carga cruzada con contenido similar: los items miden cosas cercanas.
Analogia util: los modification indices son como el mecanico que escanea tu carro y te dice "si aflojas este tornillo, el ruido baja". Pero aflojar tornillos al azar no es reparar: cada modificacion debe tener justificacion teorica. Si no puedes explicar por que dos errores correlacionan, no lo hagas.
Cuidado en el parcial: liberar parametros guiandose solo por los MI produce sobreajuste (overfit). El modelo encaja en esta muestra pero no se replica en otra. La regla de oro: toda re-especificacion debe tener sentido teorico o metodologico (items con solapamiento semantico, efecto de metodo).

5. Validez convergente y discriminante

Un buen modelo factorial no solo encaja: muestra que los items efectivamente miden su factor (validez convergente) y que los factores son distintos entre si (validez discriminante).

5.1. Validez convergente

IndicadorCorteQue mide
Carga factorial estandarizadamayor a .70El item contribuye a su factor
AVE (varianza media extraida)mayor a .50El factor explica mas de la mitad de la varianza de sus items
Confiabilidad compuesta (CR)mayor a .70Consistencia interna del factor
Truco de memoria:
  • AVE mayor a .50 = "Average Variance Extracted, mas de la mitad": el factor captura al menos la mitad de la varianza de sus items.
  • Cargas mayor a .70 = "Setenta o Sobre": por debajo de 0.70 el item es debil y se considera para eliminacion.

5.2. Validez discriminante

Dos formas clasicas de comprobar que tus factores son distintos:

  1. Fornell-Larcker (1981): la raiz cuadrada del AVE de cada factor debe ser mayor que la correlacion entre ese factor y cualquier otro. En palabras simples: un factor explica mas de sus propios items que lo que comparte con otro factor.
  2. HTMT (Henseler, Ringle y Sarstedt, 2015): ratio mas moderno. HTMT menor a .85 (o .90 en casos liberales) indica validez discriminante. Mas sensible que Fornell-Larcker.
MetodoCriterioProblema clasico
Fornell-LarckerRaiz de AVE mayor a correlacion entre factoresFalla cuando correlaciones son altas
HTMTMenor a .85 (o .90)Necesita correlaciones mono-trait y hetero-trait
Cuidado en el parcial: confundir validez convergente con discriminante es clasico. Convergente = "los items miden LO MISMO dentro de un factor". Discriminante = "los factores miden COSAS DISTINTAS entre si". No son opuestos: una escala puede tener buena convergente y mala discriminante (factores que se solapan demasiado).

6. Problemas comunes

6.1. Heywood cases (soluciones impropias)

Un Heywood case ocurre cuando una varianza de error estimada sale negativa o una carga factorial sale mayor a 1. Matematicamente imposible como varianza, indica problema.

  1. Varianza de error negativa (caso Haywood).
  2. Carga factorial mayor a 1 (o cercana a 1 con varianza de error en cero).
  3. Causas: pocos items por factor (menos de 3), muestra pequeña, items con baja varianza, modelo mal especificado.
  4. Solucion: revisar el modelo, aumentar items por factor, o fijar la varianza problemática en un valor pequeño positivo.

6.2. No convergencia

El algoritmo de estimacion (maxima verosimilitud) no llega a una solucion estable. Causas frecuentes: multicolinealidad entre items, muestra pequeña, modelo sub-identificado.

6.3. Sobreajuste

Como ya dijimos: liberar parametros siguiendo solo los MI produce un modelo que encaja en esta muestra pero no se replica. La solucion: validar el modelo re-especificado en una muestra nueva.

7. Ejemplos con escalas psicologicas

  1. Escala de Depresion de Beck (BDI-II): el AFC ha confirmado una estructura de tres factores (cognitivo-afectivo, somatico-vegetativo, perdida de placer) en multiples muestras.
  2. Escalas del Big Five (NEO-PI-R): cada uno de los cinco grandes se confirma con AFC. La estructura jerarquica (cinco dominios, seis facetas cada uno) se prueba con modelos de segundo orden.
  3. Escala de Ansiedad Generalizada (GAD-7): un solo factor de ansiedad, siete items. Modelo simple, buen ejemplo de AFC unifactorial.
  4. Escala de Estres Percibido (PSS-10): AFC confirma dos factores correlacionados (estres percibido, autoeficacia percibida) en vez de un factor general.
Cuidado en el parcial: un AFC que muestra "buen ajuste" no significa que la escala sea valida en sentido amplio. El buen ajuste solo habla de validez de constructo factorial. Falta validez de contenido (jueces), validez de criterio (correlacion con un patron oro) y validez teorica.

8. Para el parcial

Lo que con probabilidad te van a preguntar:
  • Diferencia AFE vs AFC (descubrir vs confirmar; cargas libres vs fijas).
  • Los cortes: CFI mayor a .95, RMSEA menor a .06, SRMR menor a .08 (Hu y Bentler, 1999).
  • Validez convergente: AVE mayor a .50, cargas mayor a .70.
  • Validez discriminante: Fornell-Larcker (raiz de AVE mayor a correlacion) y HTMT menor a .85.
  • Heywood case: varianza de error negativa, solucion impropia.
  • Modification indices: para que sirven y el peligro de sobreajuste.
Repaso en 30 segundos:
  • AFC = confirmas una estructura que ya tenias en mente.
  • Cortes estrictos: CFI "Casi 1" (mayor .95), RMSEA "Menor Seis" (menor .06), SRMR "Menos Ocho" (menor .08).
  • Convergente: AVE "mas de la mitad" (mayor .50), cargas "Setenta o Sobre".
  • Discriminante: raiz de AVE mayor que la correlacion (Fornell-Larcker); HTMT menor a .85.
  • Cuidado con Heywood (varianza negativa) y sobreajuste (no abuses de los MI).

9. Preguntas de autoevaluacion

1. Cual es la diferencia fundamental entre AFE y AFC?

El AFE permite que todos los items carguen en todos los factores y deja que los datos revelen la estructura. El AFC parte de una estructura teorica predefinida: el investigador fija que items cargan en que factores y pone las cargas cruzadas en cero, luego pone a prueba si ese modelo encaja con los datos.

2. Que valores de CFI y RMSEA indican buen ajuste segun Hu y Bentler (1999)?

CFI mayor a .95 y RMSEA menor a .06, de forma conjunta, indican un buen ajuste. SRMR menor a .08 acompania. Estos cortes son los mas citados en la literatura de validacion de escalas.

3. Como se evalua la validez convergente?

Con dos indicadores: (1) cargas factoriales estandarizadas mayor a .70 para cada item, y (2) AVE (Average Variance Extracted) mayor a .50 para cada factor. El AVE indica que el factor explica al menos la mitad de la varianza de sus items.

4. Que es un Heywood case y como se maneja?

Un Heywood case es una solucion impropia donde una varianza de error estimada sale negativa o una carga factorial supera 1. Causas: pocos items por factor, muestra pequeña, modelo mal especificado. Soluciones: revisar la especificacion, aumentar items por factor o fijar la varianza en un valor pequeño positivo.

5. Que es el HTMT y en que se diferencia de Fornell-Larcker?

El HTMT (Henseler, Ringle y Sarstedt, 2015) es un ratio moderno para validez discriminante: valores menor a .85 indican discriminancia. Es mas sensible que Fornell-Larcker, especialmente cuando las correlaciones entre factores son altas. Fornell-Larcker (1981) pide que la raiz cuadrada del AVE de cada factor supere la correlacion con los demas factores.

6. Por que no se debe abusar de los modification indices?

Porque cada parametro liberado mejora el ajuste en esa muestra especifica, pero puede no replicarse en otra (sobreajuste). Toda re-especificacion debe tener justificacion teorica o metodologica (items con solapamiento semantico, efecto de metodo). Un modelo sobreajustado pierde capacidad de generalizacion.

Estudia esta materia jugando en la Escuela PsiqueAcadémica — la sesion 1 es gratis. O comprueba lo que sabes en la Arena de preguntas.

PsiqueAcadémica · Cuaderno de Psicometría II

Fuentes verificadas: Brown, T. A. (2015), Confirmatory Factor Analysis for Applied Research, 2a ed., Guilford. Byrne, B. M. (2016), Structural Equation Modeling with AMOS, 4a ed., Routledge. Hu, L., y Bentler, P. M. (1999), "Cutoff criteria for fit indexes in covariance structure analysis", Structural Equation Modeling, 6(1), 1-55. Fornell, C., y Larcker, D. F. (1981), "Evaluating structural equation models with unobservable variables and measurement error", Journal of Marketing Research, 18(1), 39-50. Henseler, J., Ringle, C. M., y Sarstedt, M. (2015), "A new criterion for assessing discriminant validity", Journal of the Academy of Marketing Science, 43(1), 115-135. Kline, R. B. (2023), Principles and Practice of Structural Equation Modeling, 5a ed., Guilford.

🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →

Ponlo en práctica

Test de afrontamiento del estrés

Identifica tu estilo de afrontamiento en 2 minutos — útil para lo que acabas de leer.

x2 monedas

Esta semana tu cuenta vale el doble — entra antes del 15 de octubre

El Club Psiqueacadémica premia a quienes llegan primero: doble de Psique Coins semanales durante la fase de lanzamiento.

Me uno antes del 15 de octubre

Doble de monedas las primeras semanas