En una frase: construir una escala es como hacerse un traje a medida: primero el patron, luego cortar, luego probar.
1. La analogía del sastre (para ubicarte de una)
2. Los pasos de construcción
Devellis y Nunnally y Bernstein dejaron una secuencia que se ha vuelto el estándar. El truco para no olvidarla es el acrónimo D-G-J-P-A-A-C-B, que suena raro pero funciona: Definir, Generar, Juicio, Piloto, AFE, AFC, Consistencia, Baremación.
DefinirGenerarJuicioPilotoAFEAFCConsistenciaBaremo
Veamos cada paso por separado.
2.1. Definir el constructo
Antes de escribir una sola pregunta necesitas saber qué es lo que mides. Constructo es la variable latente: no se observa directamente, se infiere de las respuestas. Hay que definirlo en un enunciado claro y delimitar qué queda dentro y qué queda fuera.
Ejemplo: si vas a medir "ansiedad social", tienes que decidir si incluyes solo la ansiedad ante la interacción (conversar, conocer gente) o también la ansiedad ante la actuación (hablar en público, tocar un instrumento). Esa delimitación cambia qué ítems entran al pozo.
2.2. Generar el pozo de ítems
Se escriben muchos mas ítems de los que va a tener la escala final. La regla práctica es generar entre tres y cuatro veces el número de ítems definitivos: si quieres una escala de 15 ítems, escribes entre 45 y 60. La razon es que el filtro (expertos, piloto, factorial) va a ir descartando.
2.3. Juicio de expertos
Tres a cinco jueces con experiencia en el área revisan cada ítem. Califican claridad, pertinencia y coherencia con el constructo. Se calcula el coeficiente V de Aiken para decidir qué ítems se quedan y cuáles se tiran. Un V de Aiken alto indica acuerdo entre los jueces sobre que el ítem mide lo que debe medir.
2.4. Piloto
Aplicar la escala a una muestra pequeña (entre 100 y 200 personas) representativa de la población objetivo. Sirve para detectar ítems con varianza casi nula (cada examinado responde lo mismo), ítems con media extrema o redacciones que confunden.
2.5. AFE: análisis factorial exploratorio
Con los datos del piloto se corre un AFE para ver cómo se agrupan los ítems. Lo esperable es que los ítems que miden el mismo sub-constructo carguen en un mismo factor. Si un ítem no carga en ningún factor o carga en dos, es candidato a salir.
Reglas de retención: cargas factoriales superiores a 0.40 (Hair recomienda 0.50 en muestras pequeñas), comunalidades por encima de 0.40, y ausencia de cargas cruzadas altas.
2.6. AFC: análisis factorial confirmatorio
Con una muestra nueva se corre un AFC para probar la estructura que salió del AFE. Aquí ya no exploras: confirmas. Los índices de corte mas usados son los de Hu y Bentler: CFI mayor o igual a 0.95, RMSEA menor o igual a 0.06, SRMR menor o igual a 0.08.
2.7. Consistencia interna
Se estima con alfa de Cronbach (clásico, asume equivalencia de los ítems) y con omega de McDonald (no asume tau-equivalencia y es mas robusto cuando las cargas factoriales difieren). Valores entre 0.70 y 0.90 se consideran adecuados. Por encima de 0.95 empieza a indicar redundancia entre ítems.
2.8. Baremación
Por último se calculan normas interpretativas (percentiles, rangos, puntos de corte) con una muestra grande y representativa. Sirve para traducir la puntuación directa en una interpretación clínica.
3. Tipos de escalamiento: cómo se responde
No cada ítem se responde de la misma forma. La elección del escalamiento define cómo se suma y se interpreta la escala.
| Tipo | Cómo funciona | Ejemplo |
|---|---|---|
| Likert | Grado de acuerdo o frecuencia en 5 o 7 puntos. Se suman los valores. | "Me pongo nervioso al hablar en público": 1 (rara vez) a 5 (con frecuencia) |
| Guttman | Ítems acumulativos: si el examinado aprueba uno, aprueba los anteriores. Escala jerarquica. | Ítems ordenados por dificultad creciente de ansiedad social |
| Thurstone | Los ítems tienen un valor preasignado por jueces. El examinado marca los que esta de acuerdo. | Frases sobre ansiedad social con valores asignados por expertos |
| Diferencial semántico | Escalas bipolares de adjetivos (7 puntos entre dos opuestos). | "Hablar en público es": relajado (1) a tenso (7) |
4. Redacción de ítems: las reglas de oro
- Unidimensionalidad: cada ítem mide una sola cosa. Si una pregunta mezcla dos ideas ("Me pongo nervioso y tiemblo cuando hablo en público"), no sabras qué esta midiendo.
- Claridad: una sola idea por ítem, redacción simple, sin doble negación ni palabras ambiguas.
- Ítems positivos y negativos: se mezclan ítems redactados en sentido directo ("estar con gente me relaja") y en sentido inverso ("estar con gente me incomoda") para controlar sesgo de aquiescencia. Los negativos se recodifican al sumar.
- Evitar sesgos: sin lenguaje tecnico innecesario, sin preguntas que induzcan la respuesta, sin dobles barriles.
5. Tamaño muestral para análisis factorial
Esta es una pregunta frecuente en parciales. Hay varias reglas, ninguna universal:
| Regla | Recomendación | Origen |
|---|---|---|
| N mínima indiscutible | 100 a 200 casos | Comrey y Lee (1992) |
| Ratio casos por ítem | 10 a 20 casos por cada ítem del análisis | Nunnally (1978) |
| Kaiser-Meyer-Olkin (KMO) | KMO mayor o igual a 0.60 como mínimo, ideal 0.80 o mas | Kaiser (1974) |
| Reglas derivadas de simulación | Depende de las cargas factoriales esperadas: con cargas altas (mayor o igual a 0.80) basta con menos casos | MacCallum y cols. (1999) |
Lo práctico: una escala de 20 ítems pide entre 200 y 400 casos para un AFE confiable. Con menos, las cargas factoriales son inestables.
6. Las tres valideces
Cronbach y Meehl (1955) propusieron clasificar la validez en tres grandes familias. La distinción sigue siendo util para ordenar las pruebas que hace una escala para defenderse.
| Tipo de validez | Qué responde | Ejemplo con ansiedad social |
|---|---|---|
| De contenido | ¿Los ítems cubren el dominio completo del constructo? | Juicio de expertos confirma que hay ítems de interacción, actuación y observación |
| De criterio | ¿La escala predice un criterio externo? | Correlaciona con una escala de ansiedad social validada (concurrente) o con evitar dar un discurso (predictiva) |
| De constructo | ¿La escala mide realmente el constructo teórico? | Estructura factorial esperada, correlaciones con constructos relacionados (convergente) y no relacionados (discriminante) |
7. Ejemplo guiado: escala de ansiedad social
Imagina que construyes una escala de ansiedad social para universitarios. Asi se verian los pasos:
- Definir: "ansiedad ante situaciones sociales evaluativas, tanto de interacción como de actuación".
- Generar: escribes 50 ítems tipo Likert de 5 puntos.
- Juicio de expertos: cuatro psicólogos clínicos revisan. Calculas V de Aiken. Se caen 12 ítems.
- Piloto: aplicas los 38 restantes a 200 universitarios. Detectas 3 ítems con varianza casi nula (cada examinado responde "1").
- AFE: con los 35 restantes, el AFE sugiere tres factores: interacción, actuación, observación. Se caen 5 ítems mas por cargas bajas.
- AFC: con una muestra nueva de 300, el modelo de tres factores ajusta (CFI 0.96, RMSEA 0.05).
- Consistencia: alfa de Cronbach 0.88 en total; entre 0.76 y 0.84 por subescala. Omega 0.89.
- Baremación: percentiles con 800 universitarios. Defines punto de corte clínico en el percentil 85.
- Los pasos de construcción en orden (Definir, Generar, Juicio, Piloto, AFE, AFC, Consistencia, Baremación).
- Diferencia entre AFE y AFC (exploratorio vs confirmatorio, muestras distintas).
- Los tres tipos de escalamiento (Likert, Guttman, Thurstone, diferencial semántico).
- Reglas de redacción de ítems (unidimensionalidad, claridad, positivos y negativos).
- Diferencia entre validez de contenido, de criterio y de constructo.
- Tamaño muestral para análisis factorial: 10 a 20 casos por ítem.
- Alfa de Cronbach vs omega de McDonald (el segundo no asume tau-equivalencia).
- Construir una escala son 8 pasos: DGJPAACB.
- AFE explora, AFC confirma. Nunca con la misma muestra.
- Escalamiento: Likert, Guttman (acumulativo), Thurstone (jueces), diferencial semántico.
- Ítems: una idea por pregunta, positivos y negativos mezclados.
- Validez: contenido (expertos), criterio (predicción), constructo (factorial).
- Muestra factorial: 10 a 20 casos por ítem. Alfa entre 0.70 y 0.90.
8. Preguntas de autoevaluación
1. ¿Cuáles son los pasos de construcción de una escala psicológica?
Definir el constructo, generar el pozo de ítems (3 a 4 veces el definitivo), juicio de expertos (V de Aiken), aplicación piloto, análisis factorial exploratorio, análisis factorial confirmatorio con muestra nueva, estimación de consistencia interna (alfa y omega) y baremación.
2. ¿Qué diferencia el AFE del AFC?
El AFE es exploratorio: dejas que los datos revelen la estructura factorial. El AFC es confirmatorio: especificas una estructura previa y verificas si los datos la sostienen mediante índices de ajuste (CFI, RMSEA, SRMR). Cada análisis se corre con una muestra distinta.
3. ¿Por qué se mezclan ítems positivos y negativos en una escala?
Para controlar el sesgo de aquiescencia, la tendencia a responder de acuerdo sin importar el contenido. Los ítems negativos se recodifican antes de sumar para que cada pregunta apunte en el mismo sentido del constructo.
4. ¿Qué regla de tamaño muestral se usa para análisis factorial?
La regla clásica de Nunnally: entre 10 y 20 casos por cada ítem del análisis. Comrey y Lee sugieren un mínimo indiscutible de 100 a 200 casos. El KMO debe ser mayor o igual a 0.60 para que sea aceptable.
5. ¿En qué se diferencian alfa de Cronbach y omega de McDonald?
Alfa de Cronbach asume que los ítems son tau-equivalentes (cargas factoriales iguales). Omega de McDonald no requiere ese supuesto y por eso es mas preciso cuando las cargas difieren. Valores adecuados en ambos van de 0.70 a 0.90.
Estudia esta materia jugando en la Escuela PsiqueAcadémica — la sesión 1 es gratis. O comprueba lo que sabes en la Arena de preguntas.
🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →
Ponlo en práctica
Test de conocimiento: Procesos Psicológicos
Pon a prueba lo que sabes de este tema: 12 preguntas reales, tu nivel al final y los temas exactos a reforzar.