Skip to content

Validez en Psicometría

Validez en Psicometría

La validez responde la pregunta única: ¿este puntaje me autoriza a tomar esta decisión sobre esta persona? Sin evidencias suficientes de validez, ni la mejor confiabilidad protege al usuario ni al evaluado de conclusiones sin respaldo.

Idea central del apunte: validez NO es una propiedad del test aislado; es una propiedad de la inferencia que el usuario hace con el puntaje. Un inventario puede ser válido para una inferencia y no serlo para otra, aunque usemos el mismo puntaje bruto.

1. La pregunta que organiza todo

Este artículo tiene guía de estudio descargable — llévatela gratis

En términos operativos, la validez responde una cadena de preguntas encadenadas:

  1. ¿Qué estoy midiendo? (constructo)
  2. ¿Cómo lo sé? (evidencias que respaldan la inferencia)
  3. ¿Para quién aplica? (población y contexto)
  4. ¿Qué decisión me autoriza tomar? (uso previsto)

Si alguna de las cuatro no se responde con evidencia, la inferencia es especulación.

2. La evolución histórica: del «tipos» a la «evidencia integrada»

Hasta los años 50 del siglo XX se hablaba de «tres tipos» de validez (de contenido, de criterio y de constructo). En 1955, el comité técnico de la APA formalizó los tres tipos; en 1989, el Standards for Educational and Psychological Testing los reorganizó como «una sola validez» con múltiples fuentes de evidencia.

La lectura contemporánea (Standards 2014, AERA/APA/NCME) sostiene que validez es el grado en que la evidencia sostiene la inferencia. Los antiguos «tipos» pasan a ser categorías de evidencia al servicio de la misma pregunta.

Evidencias sobre el contenido + Evidencias sobre procesos de respuesta + Evidencias sobre la estructura interna + Evidencias sobre relaciones con otras variables + Evidencias sobre consecuencias del uso = validez integrada

3. Las cinco categorías de evidencia

3.1 Evidencia basada en el contenido

¿Los ítems representan adecuadamente el dominio del constructo? El método clásico es el juicio de expertos:

  • Se define operacionalmente el constructo y su alcance.
  • Se elabora una tabla de especificaciones (blueprint) con pesos por tema y por nivel cognitivo.
  • Expertos independientes revisan y califican cada ítem en relevancia y claridad.
  • Se calcula el índice de validez de contenido (IVC): proporción de expertos que califican al ítem como relevante.
Criterio IVC: IVC ≥ 0.80 (con 5 o más expertos) suele ser la cota mínima para retener un ítem. Con menos expertos se interpreta con cautela estadística.

3.2 Evidencia basada en procesos de respuesta

¿Las personas procesan los ítems como predice la teoría? Incluye entrevistas cognitivas (que el respondedor piense en voz alta) y análisis de tiempos de reacción. Un ítem sobre «ansiedad rasgo» debería procesarse igual de bien en personas con alta y baja ansiedad; un tiempo de respuesta mayor en ansiosos sugiere que ese ítem está midiendo algo distinto.

3.3 Evidencia basada en la estructura interna

¿Cómo se relacionan los ítems entre sí? El análisis más usado es el análisis factorial (exploratorio EFA o confirmatorio CFA), que busca:

  • Cantidad de dimensiones coherentes con la teoría.
  • Que cada ítem cargue substancialmente (≥ 0.40) en su dimensión.
  • Que las cargas cruzadas sean bajas (los ítems no miden varias dimensiones a la vez).
Modelo bifactor y S-1: cuando un test tiene un factor general fuerte y sub-factores, el modelo bifactor evalúa cuánto pesa cada ítem en la dimensión general versus las sub-escalas. El índice S-1 (correlación entre el puntaje total y el puntaje ponderado por el factor general) indica cuánto se pierde interpretando el puntaje total como unídimensional.

3.4 Evidencia basada en relaciones con otras variables

El test debería covariar con variables con las que la teoría predice covariación (validez convergente) y NO covariar con variables con las que la teoría predice independencia (validez discriminante). El procedimiento clásico es la matriz multitrait-multimethod (MTMM) de Campbell y Fiske.

Tipo de evidenciaPredicción teóricaMétodo
Convergente Correlación alta entre medidas del mismo constructo (mismo rasgo) Correlación Pearson entre test y criterio
Discriminante Correlación baja entre medidas de constructos diferentes Correlación entre test nuevo y test de constructo distinto
Nomológica Las relaciones siguen el patrón que predice la red nomológica del constructo Patrón convergente/divergente a varias medidas
Reglas de decisión útiles:
  • Convergente: r ≥ 0.50 con medidas similares
  • Discriminante: |r| ≤ 0.30 con medidas de constructos distintos
  • La matriz MTMM exige que las correlaciones heterotrait-heteromethod sean menores que las monotrait-heteromethod (la misma inferencia debe sostenerse en métodos distintos).

3.5 Evidencia basada en consecuencias del uso

¿Qué pasa cuando el test se usa para tomar decisiones? Esta es la categoría más reciente y la que más debate genera. Implica auditar el impacto social del test:

  • ¿Las tasas de selección difieren entre grupos demográficos?
  • ¿El test identifica correctamente a quien necesita intervención sin etiquetar en exceso?
  • ¿El feedback del test produce daño iatrogénico?

Un test puede tener «alta validez» en las cuatro categorías previas y aun así fallar la de consecuencias — por ejemplo, un screening que identifica correctamente casos pero cuya etiqueta produce estigma social.

4. Validez cruzada: el test en poblaciones distintas

Un test validado en una población NO transfiere automáticamente su validez a otra. El procedimiento estándar compara la estructura del test entre grupos:

  1. Invarianza configuracional: el modelo factorial tiene el mismo número y tipo de factores en cada grupo.
  2. Invarianza métrica: las cargas factoriales son equivalentes (las personas procesan los ítems de la misma forma).
  3. Invarianza escalar: también los interceptos son equivalentes (los ítems tienen el mismo nivel de dificultad conceptual).
  4. Invarianza estricta: errores de medición equivalentes.
Trampa habitual: comparar puntajes directos entre grupos cuando solo se cumple invarianza configuracional. Las diferencias en puntajes pueden ser artefacto, no diferencia real.

5. Validez de criterio: predictiva y concurrente

Se calcula la correlación entre el test y un criterio externo:

ModalidadMomento del criterioUso típico
Predictiva El criterio se mide después de aplicar el test Selección de personal, admisión universitaria
Concurrente El criterio se mide al mismo tiempo que el test Diagnóstico clínico actual, validación inicial

Un test de selección con validez predictiva r = 0.30 mejora la decisión un poco respecto al azar, pero NO la asegura. La validez de criterio es modestamente predictiva en muchos contextos psicológicos — la razón por la que la decisión humana siempre interviene.

6. Validez de constructo: el más ambicioso

La validez de constructo es la integración de todas las evidencias en una teoría coherente. No es suficiente correlacionar con otro test: hay que demostrar que el test se comporta como predice la teoría del constructo. Cronbach lo resume así:

«Validar un test es investigar cuál es su función en una teoría psicológica»

Implica acumular evidencia durante años, en múltiples muestras, con múltiples métodos. Cuando el cuerpo de evidencias contradice la teoría, hay que revisar la teoría o el test, no ajustar las evidencias.

7. Validez vs. utilidad

Parecidos peligrosos:
  • Un test puede ser válido y inútil: alta correlación con un criterio irrelevante.
  • Un test puede ser útil y mal validado: las decisiones funcionan pero por razones distintas a las predichas.
  • Un test puede ser accesible y poco válido: la facilidad de administración NO confiere validez.
La utilidad práctica nunca reemplaza la evidencia de validez.

8. Errores frecuentes en la práctica

  1. Reportar «validez» como un solo número (no existe; es una integración).
  2. Confundir validez con confiabilidad: alta confiabilidad NO implica validez.
  3. Asumir invarianza sin demostrarla: aplicar baremos sin verificar invarianza es un error grave.
  4. Usar el test para una decisión distinta a la validada: cada decisión requiere sus propias evidencias.
  5. Olvidar la categoría de consecuencias: ¿el test realmente ayuda o genera daño social?
  6. Tomar «el test» como válido por estar publicado: la calidad de un test depende del cuerpo de evidencia publicado, no del editorial.

9. Procedimiento recomendado de construcción de evidencias

  1. Definir el constructo y la inferencia objetivo con claridad teórica.
  2. Especificar la población y el contexto de uso.
  3. Construir los ítems a partir de la tabla de especificaciones.
  4. Recoger evidencias de contenido (juicio de expertos, IVC).
  5. Hacer piloto y recoger evidencias de estructura interna (EFA).
  6. Validar con CFA en una muestra independiente.
  7. Recoger evidencias de relación con otras variables (convergente/discriminante).
  8. Evaluar invarianza en subpoblaciones críticas.
  9. Recoger evidencias de consecuencias: impacto diferencial, false positives.
  10. Reportar todas las evidencias juntas: la validez es integrada, no fragmentada.

10. Síntesis operativa

Para recordar en el parcial

  • Validez NO es sinónimo de «el test es bueno»; es el grado en que la evidencia respalda una inferencia específica en una población específica.
  • Las cinco categorías de evidencia (contenido, procesos de respuesta, estructura interna, relaciones con otras variables, consecuencias) NO son tipos diferentes de validez: son caras distintas de una sola pregunta.
  • La validez predictiva rara vez supera 0.50 en contextos reales; esperar más es desconocer la complejidad humana.
  • Sin invarianza demostrada, la comparación entre grupos es arriesgada.
  • La categoría de consecuencias es la más reciente y la más ignorada: sin ella, un test puede ser dañino aun siendo «válido» en las otras categorías.

Errores comunes en informe

  • Decir «validez=0.85» (eso es confiabilidad, no validez).
  • Citar validez de contenido como si fuera la única evidencia válida.
  • Olvidar reportar la población en la que se estableció la validez.
  • Reportar el test como «validado» sin fechado de las evidencias (la validez caduca).

🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →

Siguiente paso de estudio

Guía gratuita de estudio DSM-5-TR

20 cuadros clínicos para ubicar sin diagnosticar

Mapa educativo para estudiantes: señales orientativas, diferenciales frecuentes y alertas éticas. No incluye dosis ni indicaciones médicas.

Material educativo. No diagnostica, no sustituye evaluación clínica ni reemplaza el manual DSM-5-TR.

Ver qué incluye esta guía