Skip to content

Funcionamiento diferencial del ítem (DIF) y sesgo

Tesis del tema: El funcionamiento diferencial del item (DIF) ocurre cuando personas de distinto grupo (por genero, cultura, region) con el mismo nivel de habilidad tienen distinta probabilidad de responder bien. DIF no es lo mismo que impacto: el impacto refleja una diferencia real de habilidad; el DIF, un sesgo del item.

En una frase: mismo nivel de habilidad, distinta probabilidad de acierto.

1. Que es el DIF: definicion operativa

En psicometria, un item presenta funcionamiento diferencial cuando, despues de igualar a las personas por su nivel en el rasgo que mide el test, la probabilidad de dar la respuesta correcta (o de elegir una categoria) varia segun el grupo de pertenencia. El grupo de referencia suele ser el mayoritario o el que sirvio para construir el test; el grupo focal es el que se evalua en busca de sesgo.

Definicion clave: DIF es la diferencia de probabilidad de acierto entre dos grupos al mismo nivel de habilidad. La frase clave es "al mismo nivel de habilidad": sin ella, cualquier diferencia seria impacto, no DIF.
  1. Se compara un grupo de referencia (frecuentemente el grupo mayoritario o de estandarizacion) con un grupo focal.
  2. La comparacion se hace condicionada al puntaje total del test, que funciona como estimacion de la habilidad.
  3. Si a igual puntaje los grupos responden distinto, el item se senala como posible DIF.
  4. DIF no implica automaticamente sesgo injusto: requiere revisar el contenido para confirmarlo.
Trampa de parcial: confundir DIF con impacto. El impacto es una diferencia observada en el promedio entre grupos (por ejemplo, que un grupo saque menor puntaje total). El DIF es un sesgo del item que aparece despues de igualar por habilidad. Un item puede mostrar impacto sin DIF, y DIF sin impacto global.

2. Tipos de DIF: uniforme y no uniforme

El DIF se clasifica segun como varia la diferencia entre grupos a lo largo de la escala de habilidad. Hay dos tipos principales.

CaracteristicaDIF uniformeDIF no uniforme
Direccion de la diferenciaConstante a lo largo de la habilidadCambia de direccion segun el nivel de habilidad
Forma tipicaUn grupo responde con mayor probabilidad de acierto de forma constanteUn grupo acierta mas en habilidad baja y menos en alta, o viceversa
DeteccionMantel-Haenszel, regresion logistica simpleRegresion logistica con interaccion, lordif
FrecuenciaMas comun en la practicaMenos frecuente, pero facil de pasar por alto

2.1. DIF uniforme

En el DIF uniforme, la ventaja o desventaja de un grupo es constante a lo largo de toda la escala de habilidad. Si el grupo focal tiene una probabilidad menor de acertar a habilidad baja, tambien la tiene a habilidad alta. Es el tipo mas estudiado y el que detectan con mayor facilidad los metodos clasicos.

2.2. DIF no uniforme

El DIF no uniforme aparece cuando la diferencia entre grupos cambia de signo segun el nivel de habilidad. Por ejemplo, el grupo focal podria tener ventaja en habilidad baja y desventaja en habilidad alta. Este patron es mas sutil: exige metodos que modelen la interaccion entre grupo y habilidad, como la regresion logistica con termino de interaccion o el paquete lordif basado en TRI.

Definicion clave: el DIF no uniforme refleja una interaccion entre habilidad y grupo. No basta con mirar promedios: hay que ver si la curva del item cambia de forma entre grupos, no solo de posicion.

3. Metodos de deteccion del DIF

Existen varios metodos para detectar DIF. Cada uno tiene un origen, una logica y un nivel de complejidad distintos. Lo habitual en un analisis serio es combinar dos o mas.

3.1. Mantel-Haenszel

Es el metodo clasico, descrito por Holland y Thayer en 1988. Compara las probabilidades de acierto entre grupos en cada estrato de puntaje total y combina los resultados en un estadistico comun. Es simple, robusto y funciona muy bien para detectar DIF uniforme. Su limitacion es que no detecta bien el DIF no uniforme.

3.2. Regresion logistica

Propuesta por Swaminathan y Rogers en 1990. Modela la probabilidad de acierto como funcion de la habilidad (puntaje total), del grupo y de su interaccion. En tres pasos anida los terminos: primero la habilidad, luego el grupo, despues la interaccion. Si el grupo aporta de forma significativa, hay DIF uniforme; si la interaccion aporta, hay DIF no uniforme.

3.3. SIBTEST

El procedimiento SIBTEST (Simulation Based Item Bias Test), descrito por Shealy y Stout en 1993, evalua el sesgo del item con una estimacion de la habilidad basada en un subconjunto valido de items. Su virtud es que corrige la contaminacion que produce incluir el item bajo analisis en el puntaje total. Existe una variante llamada poly-SIBTEST para items politomicos.

3.4. lordif

El paquete lordif (Choi, Gibbons y Crane, 2011) aplica la TRI para detectar DIF. Compara las curvas caracteristicas del item entre grupos usando un modelo de 1, 2 o 3 parametros. Es sensible tanto al DIF uniforme como al no uniforme, porque compara curvas completas, no solo promedios. Su nombre viene de "Lord's framework for DIF".

MetodoAutor y anoTipo de DIF que detectaBase estadistica
Mantel-HaenszelHolland y Thayer (1988)UniformeTablas de contingencia estratificadas
Regresion logisticaSwaminathan y Rogers (1990)Uniforme y no uniformeModelo logit con interaccion
SIBTESTShealy y Stout (1993)UniformeEstimacion basada en subconjunto valido
lordifChoi, Gibbons y Crane (2011)Uniforme y no uniformeComparacion de curvas TRI
Truco de memoria para los cuatro metodos: "MSRL" piensa en las siglas de un periódico: Mantel-Haenszel, SIBTEST, Regresion logistica, Lordif. De menos a mas complejo: M y S detectan uniforme; R y L detectan ambos.
M - Mantel-HaenszelS - SIBTESTR - Regresion logisticaL - lordif
Trampa de parcial: creer que Mantel-Haenszel basta para todo. No. Es excelente para DIF uniforme, pero pierde sensibilidad ante DIF no uniforme. Si se sospecha interaccion entre habilidad y grupo, conviene complementar con regresion logistica o lordif.

4. DIF frente a impacto: la distincion etica

La diferencia entre DIF e impacto es central para no etiquetar como sesgo lo que es una diferencia real, ni ignorar el sesgo disfrazandolo de diferencia.

  1. Impacto: diferencia genuina en el rasgo medido. Por ejemplo, un grupo podria tener un promedio menor en un test de matematicas por brechas educativas reales. Esa diferencia es impacto, no sesgo del item.
  2. DIF: diferencia en la probabilidad de acierto al mismo nivel de habilidad. Refleja que el item mide algo distinto para un grupo, o que su redaccion favorece a un grupo por razones ajenas al constructo.
  3. Sesgo: cuando el DIF se explica por una fuente ajena al constructo (contenido cultural, genero, lenguaje). Es decir, DIF confirmado como problema de equidad.
Definicion clave: el DIF es un hallazgo estadistico; el sesgo es su interpretacion sustantiva. No todo DIF es sesgo, pero todo sesgo que se refleja en un item produce DIF.

El ejemplo clasico lo ofrecen los items con referencias culturales locales: un item que menciona un deporte propio de un pais puede ser facil para quien lo conoce y dificil para quien no, sin que esa diferencia tenga que ver con el constructo (por ejemplo, razonamiento verbal). El analisis de DIF detecta el patron; la revision de contenido confirma el sesgo.

5. Impacto del DIF en la equidad del test

Un item con DIF no corregido contamina la medicion: introduce una fuente de varianza ajena al constructo y distorsiona las comparaciones entre grupos. Si varios items presentan DIF en la misma direccion, el efecto se acumula y puede sesgar el puntaje total.

  1. Distorsion del puntaje: la habilidad estimada se desvía del valor real para el grupo afectado.
  2. Perdida de validez: el test deja de medir lo mismo para ambos grupos.
  3. Problemas legales y eticos: en contextos de seleccion (educacion, empleo), el DIF no detectado puede dar lugar a discriminacion.
  4. Dano a la reputacion del instrumento: un test con DIF conocido y no tratado pierde credibilidad.
Principio operativo: el DIF se analiza a nivel del item, pero sus consecuencias se evaluan a nivel del test. Un solo item con DIF leve puede ser tolerable; una acumulacion de items con DIF en la misma direccion senala un problema sistematico.

6. Pasos para una revision de DIF en un test estandarizado

Una revision de DIF en un test formal sigue una secuencia ordenada. Los pasos estan pensados para no senalar falsos positivos y para confirmar el sesgo con criterio sustantivo, no solo estadistico.

  1. Definir grupos: seleccionar grupo de referencia y grupo focal segun el criterio de interes (genero, idioma, region, nivel socioeconomico).
  2. Elegir el criterio de igualacion: por lo general el puntaje total del test, que sirve como estimacion de la habilidad.
  3. Aplicar al menos dos metodos de deteccion: por ejemplo, Mantel-Haenszel para DIF uniforme y regresion logistica o lordif para DIF no uniforme.
  4. Clasificar la magnitud del DIF: segun las reglas de la Educational Testing Service (ETS), en categorias A (sin DIF), B (DIF leve), C (DIF grave). La categoria C obliga a revisar o descartar el item.
  5. Revision de contenido: un comite de expertos examina el item para encontrar la razon del sesgo (lenguaje, contenido cultural, formato).
  6. Decision sobre el item: descartar, reescribir o mantener con justificacion. Si se mantiene, se documenta.
  7. Reanalizar el test: tras descartar o reescribir items, repetir el analisis para confirmar que el DIF se redujo.
Truco de memoria para los siete pasos: "DEGAM CRD". Definir grupos, Elegir criterio de igualacion, Guardar dos metodos (aplicarlos), Asignar categoria de magnitud (ETS: A, B, C), Mirar el contenido, CR D: Confirmar decision y Reanalizar. Si te queda largo, recuerda la columna vertebral: definir, detectar, clasificar, revisar, decidir, reanalizar.
DefinirDetectarClasificarRevisarDecidirReanalizar

7. Ejemplos reales de items con DIF

La literatura documenta multiples casos de DIF. Estos ejemplos ayudan a entender por que un item aparentemente neutro puede sesgarse.

7.1. DIF cultural

Un caso frecuente son los items que mencionan objetos, deportes o practicas propias de una region. En pruebas de razonamiento verbal o lectura, un texto sobre un deporte local puede favorecer al grupo familiarizado con ese contexto. Zumbo (2007) senala que el DIF cultural suele aparecer en items que mezclan el constructo con conocimiento previo especifico de una cultura.

7.2. DIF por genero

Algunos items de matematicas o ciencias han mostrado DIF por genero cuando el enunciado apela a un contexto estereotipadamente asociado a un genero (por ejemplo, problemas sobre deportes tradicionalmente masculinos o sobre actividades domesticas). La diferencia no esta en la habilidad matematica, sino en la familiaridad o motivacion que genera el contexto del enunciado.

7.3. DIF por idioma o region

En tests adaptados a varios paises de habla hispana, un item puede usar una palabra con significado distinto entre regiones. Lo que en un pais es un termino corriente, en otro puede ser desconocido o tener connotaciones distintas. Esto genera DIF por idioma o variante regional incluso dentro del mismo idioma.

Trampa de parcial: asumir que un item sin DIF estadistico es "neutro" en sentido estricto. El DIF se evalua respecto a los grupos definidos. Un item sin DIF por genero podria tenerlo por region o por nivel socioeconomico. El analisis depende de la variable de agrupacion que se elija.

8. Linea de tiempo del DIF

1968 Lord y Novick publican Statistical Theories of Mental Test Scores, marco de la TRI que sustenta metodos posteriores como lordif.
1988 Holland y Thayer describen el metodo Mantel-Haenszel aplicado a deteccion de DIF.
1990 Swaminathan y Rogers proponen la regresion logistica para detectar DIF uniforme y no uniforme.
1993 Shealy y Stout presentan SIBTEST.
2007 Zumbo publica trabajos sobre la naturaleza del DIF y su relacion con la validez.
2011 Choi, Gibbons y Crane publican lordif, basado en TRI.

9. Errores frecuentes en el parcial

1. Confundir DIF e impacto. El impacto es diferencia real de habilidad; el DIF es diferencia en la probabilidad de acierto a igual habilidad. La frase "al mismo nivel de habilidad" es la que separa uno del otro.
2. Creer que Mantel-Haenszel detecta DIF no uniforme. No. Es optimo para DIF uniforme. Para DIF no uniforme hay que usar regresion logistica con interaccion o lordif.
3. Asumir que todo DIF es sesgo. El DIF es estadistico; el sesgo es la interpretacion sustantiva. Hay DIF sin sesgo (por artefactos) y la confirmacion exige revision de contenido.
4. Ignorar la acumulacion de DIF. Un item con DIF leve puede tolerarse, pero varios items con DIF en la misma direccion senalan un problema sistematico del test.

10. Para el parcial

Lo que suelen preguntar:
  • Definir DIF y subrayar la frase "al mismo nivel de habilidad".
  • Diferenciar DIF uniforme de no uniforme con un ejemplo.
  • Vincular cada metodo (Mantel-Haenszel, regresion logistica, SIBTEST, lordif) con su autor y su tipo de DIF.
  • Explicar la diferencia entre DIF, impacto y sesgo.
  • Enumerar los pasos de una revision de DIF en orden.
  • Citar las categorias ETS (A, B, C) para clasificar la magnitud del DIF.
Repaso en 30 segundos:
  • DIF: mismo nivel de habilidad, distinta probabilidad de acierto.
  • DIF uniforme: constante; DIF no uniforme: cambia segun la habilidad.
  • Metodos: Mantel-Haenszel (Holland y Thayer, 1988), regresion logistica (Swaminathan y Rogers, 1990), SIBTEST (Shealy y Stout, 1993), lordif (Choi y cols., 2011).
  • Impacto: diferencia real. Sesgo: DIF confirmado por contenido.
  • Pasos: definir grupos, detectar, clasificar (ETS A/B/C), revisar contenido, decidir, reanalizar.

11. Preguntas de autoevaluacion

1. ¿Que condicion debe cumplirse para que una diferencia entre grupos se considere DIF?

Que la diferencia en la probabilidad de acierto aparezca al comparar personas con el mismo nivel de habilidad, estimado por el puntaje total del test.

2. ¿En que se diferencian DIF uniforme y DIF no uniforme?

En el DIF uniforme la ventaja de un grupo es constante a lo largo de la habilidad; en el no uniforme cambia de direccion segun el nivel de habilidad.

3. ¿Que metodo es el mas adecuado para detectar DIF no uniforme y por que?

La regresion logistica con termino de interaccion o lordif, porque permiten modelar como cambia el efecto del grupo segun el nivel de habilidad.

4. ¿Que significa que un item tenga DIF de categoria C segun la clasificacion ETS?

Categoria C indica DIF grave. Segun las reglas ETS obliga a revisar o descartar el item, salvo que haya una razon sustantiva documentada para mantenerlo.

5. Explica con un ejemplo la diferencia entre impacto y sesgo.

Impacto: un grupo saca menor puntaje en matematicas por una brecha educativa real. Sesgo: un item deportivo favorece a quienes conocen ese deporte al margen de su habilidad verbal o matematica. El impacto refleja habilidad; el sesgo, una fuente ajena al constructo.

Estudia esta materia jugando en la Escuela PsiqueAcademica — la sesion 1 es gratis. O comprueba lo que sabes en la Arena de preguntas.

Fuentes verificadas: Lord y Novick, Statistical Theories of Mental Test Scores (1968); Holland y Thayer, "Differential item performance based on the characteristics of test items" en Wainer y Braun (eds.), Test Validity (1988); Swaminathan y Rogers, "Detecting differential item functioning using logistic regression procedures" en Journal of Educational Measurement (1990, vol. 27, num. 4, pp. 363-370); Shealy y Stout, "A model-based standardization approach that separates true bias/DIF from group ability differences" en Journal of Educational and Behavioral Statistics (1993, vol. 18, num. 3); Zumbo, "Three generations of DIF analyses" en D. B. Davar (ed.), Considering Validity, Assessment, and Fairness (2007); Choi, Gibbons y Crane, "lordif: An R package for detecting differential item functioning using iterative hybrid ordinal logistic regression/item response theory and Monte Carlo simulations" en Journal of Statistical Software (2011, vol. 39, num. 8, pp. 1-30).

PsiqueAcademica · RDK

🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →

Ponlo en práctica

Test de conocimiento: Procesos Psicológicos

Pon a prueba lo que sabes de este tema: 12 preguntas reales, tu nivel al final y los temas exactos a reforzar.

Doble de coins

Activa tu cuenta en el Club y multiplica tus Psique Coins

Accede a recursos exclusivos, desbloquea rutas avanzadas y acumula monedas dobles cada semana hasta el 15 de octubre.

Activo mi cuenta ahora

Monedas dobles hasta el 15-oct · Gratis