Skip to content

Invarianza de medida entre grupos

Psicometría profunda II · comparación entre grupos

Invarianza de medida entre grupos

Comparar el promedio de ansiedad entre mujeres y hombres, o entre dos paises, solo es licito si el instrumento mide el mismo constructo, con la misma escala, en ambos grupos. Sin esa evidencia, la diferencia puede ser de la regla, no del rasgo. Este apunte sube la escalera: configural, metrica, escalar, residual.

Tesis. La invarianza entre grupos es una escalera. Cada peldaño autoriza una comparacion distinta. Saltar al promedio sin los peldaños de abajo es el error que el parcial pesca.
  • Por que comparar medias exige invarianza
  • Configural: misma estructura
  • Metrica: mismas cargas
  • Escalar y residual
  • Trampa: publicar la diferencia de grupo sin la escalera
1

Por que comparar medias exige invarianza

El hermano Invarianza de medicion ya dejo la tesis: sin invarianza, la diferencia entre grupos puede ser de la escala, no del constructo. Este apunte no la reescribe. Aqui el oficio es la escalera de niveles y lo que cada peldaño autoriza cuando comparas sexo, pais o edad.

William Meredith (1993) formalizo la invarianza factorial en Psychometrika: configural, weak (metrica), strong (escalar) y strict (residual). Vandenberg y Lance (2000) sintetizaron la literatura aplicada y pidieron un orden de pruebas, no un salto al promedio. Esas dos citas bastan para el oral. No inventes un tercer nivel con nombre de moda.

Invarianza de medida entre grupos: evidencia de que el mismo instrumento representa el mismo constructo, con parametros comparables, en dos o mas poblaciones. Sin ella, restar medias es mezclar reglas.
Analogia. Comparar la temperatura de Bogota y de Mexico con un termometro que en una ciudad marca en Celsius y en la otra en una escala corrida es el mismo error: el numero se mueve, el rasgo no se dejo ver.

Taquigrafia: diferencia de medias = ?constructo + ?sesgo de escala. La escalera sirve para ir tachando el segundo termino.

El DIF mira el item. El AFC avanzado mira el modelo. La invarianza entre grupos usa el AFC multigrupo para decidir si el modelo entero se sostiene igual en A y en B. No fusiones las tres lecturas en una sola frase de examen.

2

Configural: misma estructura

El primer peldaño pregunta si el patron de factores es el mismo. Mismos items cargan en los mismos factores, mismo numero de factores, mismas restricciones de ceros. Si en un grupo el item 7 carga en depresion y en el otro carga en ansiedad, no hay ni siquiera el mismo mapa. Ahí se acaba la comparacion: no hay constructo compartido que restar.

En la practica se estima un AFC configural (parametros libres entre grupos, misma forma). Indices de ajuste del modelo configural son la base. Si ese modelo ya no cabe, no subas. Publicar "las mujeres puntuan mas" cuando el configural fallo es firmar una diferencia de un rasgo que no se midio igual.

C Configural: mismo mapa de factores.
M Metrica: mismas pendientes (cargas).
E Escalar: mismos interceptos.
R Residual: mismos errores.

Tarjeta de memoria: C.M.E.R. Configural, Metrica, Escalar, Residual. El orden no se inventa en el oral. Meredith 1993 lo dejo como nested constraints. Vandenberg y Lance 2000 lo tradujeron a la rutina de papers de organizaciones y educacion.

Trampa de parcial. Llamar "invarianza" a un alfa de Cronbach parecido en los dos grupos. El alfa no prueba estructura. Un alfa de 0.82 aqui y 0.84 alla cabe con mapas distintos. Pide el configural.
3

Metrica: mismas cargas

Si el mapa es el mismo, el segundo peldaño pregunta si las cargas factoriales son iguales. Una carga es la pendiente: cuanto sube el item cuando sube el rasgo. Si en mujeres el item "lloro con facilidad" carga 0.80 y en hombres carga 0.30, un punto de rasgo no produce el mismo movimiento en el item. Comparar puntuaciones factoriales entre grupos, en ese caso, mezcla unidades.

La prueba metrica (weak invariance) iguala las cargas y mira si el ajuste se sostiene respecto del configural. Delta de CFI, RMSEA o chi-cuadrado anidado: el parcial pide el criterio, no un umbral de revista que no hayas leido. Vandenberg y Lance recuerdan que el salto de configural a metrica es el que autoriza comparar relaciones (correlaciones, betas) entre grupos. Todavia no autoriza restar medias.

Metrica autoriza comparar asociaciones. No autoriza comparar promedios.
  1. Configural sostiene: mismo mapa.
  2. Metrica sostiene: mismas pendientes. Puedes comparar correlaciones o regresiones del constructo entre grupos.
  3. Si la metrica cae: busca cargas parciales (invarianza parcial) y documenta cuales items no viajan. No inventes que "casi" alcanza.

La adaptacion transcultural llega hasta aqui cuando traduces un test: si las cargas no se sostienen, el pais B no esta midiendo con la misma regla. ITC pide evidencia de equivalencia; este peldaño es una de esas evidencias, no un adorno de resultados.

4

Escalar y residual

El peldaño escalar (strong invariance) iguala interceptos de los items. El intercepto es el valor esperado del item cuando el rasgo vale cero. Si un item es "mas facil" de endosar en un grupo aunque el rasgo sea el mismo, restar medias del factor atribuye al constructo lo que es umbral del item. Sin invarianza escalar no se comparan medias latentes. Esa frase es la del parcial.

El peldaño residual (strict) iguala varianzas de error. Sirve para comparar varianzas observadas o para ciertas aplicaciones de puntuaciones. En psicologia aplicada suele ser el mas exigente y el que mas papers saltan. Meredith lo incluye. Vandenberg y Lance advierten que muchos estudios se detienen en escalar y aun asi hablan de "invarianza completa". En el oral, nombra el peldaño que si se probo.

PeldañoQue se igualaQue comparacion autoriza
ConfiguralForma del modeloHablar del mismo mapa, no de numeros entre grupos
MetricaCargasCorrelaciones y betas del constructo
EscalarCargas e interceptosMedias latentes entre grupos
ResidualCargas, interceptos y erroresVarianzas observadas con mas rigor
ConfiguralMetricaEscalarResidual
Analogia. Configural es que las dos reglas midan longitud. Metrica es que ambas esten en centimetros. Escalar es que el cero coincida. Residual es que el ruido de medicion sea el mismo. Restar sin el cero alineado es restar metros con una cinta que empieza en 3.

Invarianza parcial: algunos items no viajan y se dejan libres. Es licito si se documenta cuales y por que. No es un permiso para publicar la media y esconder el pie de pagina. El lector tiene que poder saber que parte de la escala se comparo de verdad.

Un segundo caso de aula. Comparas burnout entre residentes de primer año y de tercer año. El configural sostiene. La metrica sostiene. La escalar cae en tres items de cinismo que los de tercer año endosan con menos umbral aunque el rasgo sea el mismo. Si igualas esos interceptos a la fuerza, inventas una "mejora" que es umbral. Si los dejas libres y lo dices, puedes comparar el resto de la escala. El parcial quiere esa honestidad, no un asterisco escondido.

Relacion con edad y con pais. Edad: un item de "uso de redes" no viaja igual a los 18 y a los 70; el constructo soledad puede ser el mismo y el item no. Pais: un item de "hablar con el jefe" no viaja igual en una cultura jerarquica y en una horizontal. La escalera no niega la diferencia cultural: la obliga a mostrarse en el modelo, no en el promedio crudo.

Invarianza parcial se documenta item por item. No se usa como permiso para esconder el umbral.

Cuando el paper dice "invarianza establecida" y solo muestra un CFI del modelo libre, falta la nested sequence. Pide delta respecto del peldaño anterior. Un CFI de 0.95 en el modelo libre no prueba metrica ni escalar. Esa es la frase que cierra el oral si te dan una tabla de ajuste de una sola linea.

5

Trampa: publicar la diferencia de grupo sin la escalera

El paper de aula tipico dice: "las mujeres puntuan mas en ansiedad social (p menor que 0.05)". Si el metodo no nombra configural, metrica y escalar, esa frase no esta autorizada como diferencia de constructo. Puede ser diferencia de umbral de items, de traduccion, de formato de respuesta o de un factor extra en un grupo.

Trampa de parcial. Confundir invarianza escalar con DIF de un item. El DIF mira un reactivo. La escalar mira interceptos del set, en el modelo factorial. Puedes tener DIF en dos items y aun asi discutir invarianza parcial. No uses las palabras como sinonimos.

Caso de oral. Un equipo traduce una escala de burnout de EE.UU. a Colombia, compara medias y concluye que "en Colombia hay mas agotamiento". Preguntas:

  1. ¿Hubo AFC configural en ambos paises?
  2. ¿Se igualaron cargas (metrica)?
  3. ¿Se igualaron interceptos (escalar) antes de restar?
  4. ¿Que items se dejaron libres, si hubo parcial?
  5. ¿El reporte cita Meredith o Vandenberg, o solo el p-valor de la t?

Si las respuestas son vacio, el hallazgo no se sostiene como diferencia de rasgo. Puede sostenerse como diferencia de puntuacion observada, con la salvedad de que la regla pudo cambiar. Esa salvedad es lo que el parcial quiere oir.

Para el parcial: C.M.E.R. en orden; metrica autoriza asociaciones; escalar autoriza medias; sin escalar no publiques la diferencia de grupo como si fuera el constructo; DIF y AFC se enlazan, no se fusionan; el hermano 2342 ya dijo la tesis, aqui subes la escalera.

Un tercer caso, ahora de sexo. Una escala de depresion se aplica a mujeres y a hombres universitarios. El configural sostiene (mismo numero de factores, mismos items). La metrica sostiene (cargas iguales). La escalar cae en dos items de llanto y de irritabilidad: las mujeres endosan el llanto con menos umbral; los hombres endosan la irritabilidad con menos umbral, a igual rasgo. Si el equipo iguala esos interceptos y publica "las mujeres puntuan 0.4 desviaciones mas", esta atribuyendo al constructo lo que es umbral de item. Si deja esos dos items libres, documenta la parcial y compara el resto, el hallazgo sobre el factor comun se puede defender. El parcial distingue esas dos escrituras.

¿Y si el configural ya fallo? Entonces no hay mapa compartido. Puede haber un factor extra en un grupo (un item de somatizacion que en un pais carga en depresion y en el otro en ansiedad). Seguir adelante con medias es firmar una resta de dos reglas distintas. La salida honesta es: (a) revisar traduccion y formato; (b) soltar items que no viajan y reestimar; (c) declarar que no se comparan medias de ese instrumento entre esos grupos. Vandenberg y Lance insisten en no "arreglar" el configural con un asterisco de resultados.

Si el configural cae, la comparacion de medias no se discute. Se discute el instrumento.

Como se reporta en un articulo de tesis, en cinco lineas que un tribunal puede auditar:

  1. Modelo configural: factores, items, ajuste (CFI, RMSEA, SRMR) por grupo y conjunto.
  2. Metrica: cargas igualadas; delta de ajuste respecto del configural.
  3. Escalar: interceptos igualadas; delta respecto de la metrica.
  4. Items libres, si hay parcial, con justificacion (traduccion, umbral cultural, edad).
  5. Recien entonces la diferencia de medias latentes, con intervalo, no solo el p-valor.

Esa lista es mas corta que un metodo de diez paginas y mas honesta que una tabla de t-tests. Si tu tesis compara paises o sexos con un test traducido, esa lista es el minimo. La adaptacion transcultural te trajo hasta el instrumento; este apunte te pide no gastar esa evidencia en un promedio crudo.

Que no promete este apunte. No te enseña a correr lavaan ni Mplus. No te da umbrales magicos de delta-CFI (las revistas discuten 0.01 y 0.002; el parcial pide el criterio de tu cátedra, no un numero de blog). No sustituye el AFC avanzado ni el DIF. Te deja una pregunta de lector: cuando veas "las mujeres puntuan mas", ¿en que peldaño se detuvo el metodo?

Un ultimo caso, ahora de edad. Una escala de soledad se aplica a universitarios y a adultos mayores. El configural sostiene. La metrica cae en un item de "uso de redes sociales": en los jovenes carga fuerte en soledad; en los mayores casi no carga. Si igualas esa carga, inventas que el item mide lo mismo. Si la dejas libre, el factor comun todavia puede compararse en asociaciones, no en medias, hasta que la escalar del resto se sostenga. Edad es un laboratorio de items que envejecen mal, no un grupo demografico menor.

Como se estudia esto la noche antes. Dibuja C.M.E.R. en un margen. Al lado de cada letra, una autorizacion: mapa, pendientes, ceros, ruido. Debajo, tres prohibiciones: no alfa como prueba; no t-test como prueba; no "invarianza establecida" con un solo CFI. Si el oral te da un abstract que compara dos paises, tu primera pregunta es el peldaño, no el tamaño del efecto.

Cierre operativo para el cuaderno. Si te dan un paper de dos grupos, lee el metodo en este orden: (1) ¿hay AFC por grupo o solo una t sobre el sumatorio; (2) ¿nombran configural; (3) ¿nombran metrica y con que delta; (4) ¿nombran escalar antes de la media; (5) ¿hay items libres. Cinco sietes te dejan un veredicto de lector, no un resumen de resultados. Esa es la diferencia entre repetir "invarianza" y usarla.

Trampa de parcial 3. Tratar la invarianza residual como requisito para publicar una diferencia de medias. Meredith la incluye. En psicologia aplicada, muchos papers se detienen en escalar y aun asi comparan medias latentes. El error apunta a no decirlo, no a detenerse. Nombra el peldaño alcanzado.

Una analogia mas, ahora de cocina de laboratorio: dos balanzas. Si una esta calibrada en gramos y la otra tiene el cero corrido, puedes comparar correlaciones de peso con talla (metrica) y aun asi no restar medias de peso (escalar). El laboratorio que publica "el grupo B pesa mas" sin alinear el cero esta vendiendo un umbral como si fuera masa. Meredith 1993 es esa calibracion escrita en algebra factorial. Vandenberg y Lance 2000 es el protocolo de quien ya se quemo publicando sin la escalera.

Autoevaluacion

1. ¿Que autoriza la invarianza metrica que la configural todavia no?

Comparar asociaciones del constructo entre grupos (correlaciones, betas). La configural solo sostiene que el mapa de factores es el mismo. Las pendientes (cargas) todavia pueden diferir. Vandenberg y Lance 2000 marcan ese corte.

2. Un equipo compara medias de depresion entre dos paises sin reportar interceptos. ¿Que falta?

El peldaño escalar. Sin interceptos iguales, la diferencia de medias latentes puede ser umbral de items, no rasgo. Meredith 1993 llama strong invariance a ese peldaño. La t de Student sobre la puntuacion observada no lo sustituye.

3. ¿El alfa parecido en dos grupos prueba invarianza?

No. El alfa no examina estructura ni cargas ni interceptos. Dos alfas de 0.80 caben con mapas distintos. Pide el AFC multigrupo, empezando por el configural.

4. ¿Como se distingue este apunte de 2342?

2342 enuncia la tesis (sin invarianza no comparas). Este apunte opera la escalera C.M.E.R. y la comparacion entre grupos (sexo, pais, edad), con la trampa de publicar la media sin peldaños. Enlaza DIF y AFC; no los reescribe.

Cierre de cuaderno

Invarianza entre grupos es una escalera, no un adjetivo. Configural sostiene el mapa. Metrica sostiene las pendientes y autoriza asociaciones. Escalar sostiene los ceros y autoriza medias. Residual exige mas y pocos papers lo muestran. Si el parcial te da una diferencia de grupo, pregunta por el peldaño, no por el p-valor.

PsiqueAcadémica · Cuaderno de Psicometría profunda II