
Confiabilidad en Psicometría
La confiabilidad es la proporción de varianza de los puntajes que se atribuye a diferencias verdaderas entre las personas. Sin un mínimo de confiabilidad, cualquier inferencia sobre un individuo — selección, diagnóstico, seguimiento — se vuelve insostenible.
Ponlo en práctica
Test de conocimiento: Procesos Psicológicos
Pon a prueba lo que sabes de este tema: 12 preguntas reales, tu nivel al final y los temas exactos a reforzar.
1. Definición formal y por qué importa
Partiendo de la fórmula clásica X = V + E, la confiabilidad se define como:
rxx = Var(V) / Var(X) = 1 − Var(E)/Var(X)
La proporción de varianza atribuible a la puntuación verdadera. Si la varianza del error es chica respecto a la varianza total, rxx se acerca a 1.
La confiabilidad varía entre 0 y 1. Un coeficiente de 0.80 indica que el 80% de la varianza es varianza verdadera y el 20% restante es ruido de medición. No existe un corte único universal: la vara depende de la decisión:
| Uso del test | Confiabilidad mínima sugerida |
|---|---|
| Investigación de grupo (comparar promedios) | 0.70 |
| Decisiones individuales (clínica, selección) | 0.80 – 0.85 |
| Decisiones de alto impacto (cirugía, ascenso) | 0.90 o más |
2. Las cuatro familias de evidencias de confiabilidad
El coeficiente NO es un número único: existen múltiples formas de operacionalizar la misma idea. Las tres grandes familias clásicas son estabilidad temporal, equivalencia de formas y consistencia interna. Más adelante se añadió una cuarta dimensión (consistencia entre ítems en el tiempo).
2.1 Estabilidad temporal (test-retest)
Se aplica el mismo test dos veces a las mismas personas, separadas por un intervalo definido. El coeficiente es la correlación entre los puntajes de ambas aplicaciones.
- Ventaja: estima cuál es la estabilidad del constructo en el tiempo (atributos estables como inteligencia dan test-retest más altos que estados fluctuantes como el estado de ánimo).
- Cuidado: si el intervalo es muy largo, la persona puede haber cambiado (desarrollo, aprendizaje, terapia); si es muy corto, hay efectos de memoria (recordaría respuestas).
La guía operativa habitual usa intervalos entre 2 semanas y 3 meses para constructos estables; intervalos más cortos para estados agudos.
2.2 Equivalencia de formas (formas paralelas)
Se construyen dos versiones del test con el mismo contenido, ítems redactados independientemente y dificultad comparable. Se aplican ambas formas a las mismas personas y se correlacionan los puntajes.
- Ventaja: controla el efecto de memoria del test-retest.
- Cuidado: las formas «paralelas» rara vez lo son; suelen diferir en dificultad o contenido. La correlación entre formas informa de la calidad del emparejamiento.
2.3 Consistencia interna (alfa de Cronbach y compañías)
Es la forma más usada en la práctica contemporánea porque requiere una sola administración. La idea: si los ítems miden el mismo constructo, deberían covariar. La fórmula clásica para k ítems es:
alfa = [k / (k − 1)] · [1 − (Σ Var(Xi) / Var(X))]
alfa crece con más ítems y con covarianzas grandes entre ítems. Su cota superior es la correlación media entre ítems.
Interpretación clave: alfa es la cota inferior de la confiabilidad del test, no un valor exacto. Supone que los ítems tienen igual varianza y que son tau-equivalentes (miden el constructo con pesos iguales), supuestos que rara vez se cumplen.
2.4 Confiabilidad compuesta y coeficiente omega
Las críticas a alfa llevaron al coeficiente omega (McDonald, 1999), que estima la confiabilidad a partir del modelo de análisis factorial:
- omega total: cuánta varianza del puntaje total se atribuye al factor común (incluyendo sus índices con sus propios pesos).
- omega jerárquico: cuánta varianza se atribuye al factor general cuando hay sub-factores.
Omega se prefiere cuando los ítems NO son tau-equivalentes (la mayoría de los casos reales).
3. Factores que afectan la confiabilidad
- Longitud del test: agregar ítems que covaríen con el resto sube la confiabilidad. La relación se rige por la fórmula de Spearman-Brown.
- Heterogeneidad de la muestra: muestras con poca variabilidad (todas las personas con nivel parecido) producen coeficientes más bajos que muestras dispersas. La confiabilidad NO es propiedad del test aislado: es propiedad del test en esa muestra.
- Tipo de ítem: los ítems dicotómicos (acierto/error) suelen rendir menos alfa que los de escala Likert, porque extraen menos varianza por ítem.
- Condiciones de administración: ruido, tiempo limitado, instrucciones confusas — todo aumenta la varianza del error.
4. Confiabilidad vs. error estándar de medición
Confiabilidad es descriptiva del instrumento; el error estándar de medición (e.m.) es descriptivo de la persona evaluada. La relación operativa:
e.m. = Sx · √(1 − rxx)
Donde Sx es la desviación estándar de los puntajes en la muestra. Con e.m. en mano se construyen intervalos de confianza para el puntaje verdadero de una persona:
X − 1.96 · e.m. ≤ V ≤ X + 1.96 · e.m. (intervalo del 95%)
5. Procedimiento general de estimación
- Definir el constructo y la población objetivo: la confiabilidad cambia con la población y con el constructo.
- Administrar el test a una muestra representativa (mínimo sugerido por Streiner: 200 personas para análisis de ítems; 100+ para alfa).
- Calcular el coeficiente apropiado (alfa, omega, test-retest, formas paralelas).
- Reportar el coeficiente con su intervalo de confianza del 95%. Sin IC, el coeficiente por sí solo no dice nada sobre precisión de la estimación.
- Calcular el e.m. y construir los intervalos de confianza del puntaje verdadero para cada persona que reciba el test.
6. Lo que NO cubre la confiabilidad
- Que el test mida lo que dice medir (eso es validez, otro terreno).
- Que los ítems sean justos para subgrupos (eso es DIF / invarianza).
- Que la decisión basada en el test sea ética (eso es validez de consecuencias).
- Que el baremo aplique a la persona evaluada (eso es baremación, no confiabilidad).
Confiabilidad es condición necesaria pero no suficiente. Un test puede ser altamente confiable (puntajes consistentes) y totalmente irrelevante (medir algo distinto al constructo). Por eso siempre se reporta junto con evidencias de validez.
7. Mnemotecnia operativa
| Letra | Forma | Qué requiere |
|---|---|---|
| E | Estabilidad temporal (test-retest) | Dos aplicaciones separadas |
| E | Equivalencia (formas paralelas) | Dos versiones equivalentes |
| E | Consistencia entre jueces | Dos evaluadores independientes |
| O | Consistencia interna (omega / alfa) | Una sola aplicación |
| M | Medición del error estándar | Derivado de la confiabilidad |
Cada letra codifica una fuente de evidencia; un coeficiente único NO basta — un buen informe psicométrico presenta al menos dos evidencias convergentes.
8. Síntesis operativa
Para recordar en el parcial
- Confiabilidad NO es «validez» ni es «precisión del ítem individual»; es la proporción de varianza verdadera en los puntajes del test.
- Existen al menos cuatro familias de evidencias: estabilidad temporal, equivalencia de formas, consistencia entre jueces y consistencia interna (alfa u omega).
- El error estándar de medición (e.m.) traduce la confiabilidad en incertidumbre aplicable a un puntaje individual.
- La confiabilidad es propiedad del test en una población; cambia si la población cambia. Siempre se reporta IC del 95%.
- Sin confiabilidad suficiente, no hay inferencia psicológica defendible.
Errores comunes al reportar
- Reportar alfa sin IC.
- Asumir alfa = confiabilidad verdadera sin chequear supuestos de tau-equivalencia.
- Decir que el test «es confiable» sin especificar la muestra y el uso previsto.
- Olvidar el e.m. y tomar diferencias de pocos puntos como significativas.
🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →