Skip to content

Construcción de escalas psicológicas desde cero

Tesis del tema: una escala psicológica no se arma escribiendo preguntas y viendo si funcionan. Se construye en un orden estricto: definir el constructo, generar un pozo de ítems, filtrar con expertos y piloto, y luego demostrar empíricamente que mide lo que dice medir. Saltarse pasos produce un cuestionario bonito que no mide nada.

En una frase: construir una escala es como hacerse un traje a medida: primero el patron, luego cortar, luego probar.

1. La analogía del sastre (para ubicarte de una)

Analogía útil: hacer una escala es como hacer un traje a medida. Primero defines para quién es y para qué occasión (el constructo). Después cortas muchas piezas (el pozo de ítems). Luego un sastre experto revisa que cada pieza corresponda al patron (juicio de expertos). Lo pruebas en una persona y ajustas (piloto). Y al final certificas que el traje te queda bien desde varios ángulos (validez de constructo con AFE y AFC). Si te saltas el patron, terminas con un traje que no le queda a nadie.

2. Los pasos de construcción

Devellis y Nunnally y Bernstein dejaron una secuencia que se ha vuelto el estándar. El truco para no olvidarla es el acrónimo D-G-J-P-A-A-C-B, que suena raro pero funciona: Definir, Generar, Juicio, Piloto, AFE, AFC, Consistencia, Baremación.

Mnemotecnia: DGJPAACB — Definir el constructo, Generar el pozo de ítems, Juicio de expertos, Piloto, Análisis factorial exploratorio, Análisis factorial confirmatorio, Consistencia interna, Baremación.
DefinirGenerarJuicioPilotoAFEAFCConsistenciaBaremo

Veamos cada paso por separado.

2.1. Definir el constructo

Antes de escribir una sola pregunta necesitas saber qué es lo que mides. Constructo es la variable latente: no se observa directamente, se infiere de las respuestas. Hay que definirlo en un enunciado claro y delimitar qué queda dentro y qué queda fuera.

Ejemplo: si vas a medir "ansiedad social", tienes que decidir si incluyes solo la ansiedad ante la interacción (conversar, conocer gente) o también la ansiedad ante la actuación (hablar en público, tocar un instrumento). Esa delimitación cambia qué ítems entran al pozo.

Definición clave: el constructo es lo que la escala pretende medir. Si no lo defines antes de generar ítems, cada ítem termina apuntando a una idea distinta y el análisis factorial te lo cobra: sale una sopa de factores sin sentido.

2.2. Generar el pozo de ítems

Se escriben muchos mas ítems de los que va a tener la escala final. La regla práctica es generar entre tres y cuatro veces el número de ítems definitivos: si quieres una escala de 15 ítems, escribes entre 45 y 60. La razon es que el filtro (expertos, piloto, factorial) va a ir descartando.

2.3. Juicio de expertos

Tres a cinco jueces con experiencia en el área revisan cada ítem. Califican claridad, pertinencia y coherencia con el constructo. Se calcula el coeficiente V de Aiken para decidir qué ítems se quedan y cuáles se tiran. Un V de Aiken alto indica acuerdo entre los jueces sobre que el ítem mide lo que debe medir.

2.4. Piloto

Aplicar la escala a una muestra pequeña (entre 100 y 200 personas) representativa de la población objetivo. Sirve para detectar ítems con varianza casi nula (cada examinado responde lo mismo), ítems con media extrema o redacciones que confunden.

2.5. AFE: análisis factorial exploratorio

Con los datos del piloto se corre un AFE para ver cómo se agrupan los ítems. Lo esperable es que los ítems que miden el mismo sub-constructo carguen en un mismo factor. Si un ítem no carga en ningún factor o carga en dos, es candidato a salir.

Reglas de retención: cargas factoriales superiores a 0.40 (Hair recomienda 0.50 en muestras pequeñas), comunalidades por encima de 0.40, y ausencia de cargas cruzadas altas.

2.6. AFC: análisis factorial confirmatorio

Con una muestra nueva se corre un AFC para probar la estructura que salió del AFE. Aquí ya no exploras: confirmas. Los índices de corte mas usados son los de Hu y Bentler: CFI mayor o igual a 0.95, RMSEA menor o igual a 0.06, SRMR menor o igual a 0.08.

2.7. Consistencia interna

Se estima con alfa de Cronbach (clásico, asume equivalencia de los ítems) y con omega de McDonald (no asume tau-equivalencia y es mas robusto cuando las cargas factoriales difieren). Valores entre 0.70 y 0.90 se consideran adecuados. Por encima de 0.95 empieza a indicar redundancia entre ítems.

2.8. Baremación

Por último se calculan normas interpretativas (percentiles, rangos, puntos de corte) con una muestra grande y representativa. Sirve para traducir la puntuación directa en una interpretación clínica.

Trampa de parcial: confundir el AFE con el AFC. El AFE es exploratorio: dejas que los datos te muestren la estructura. El AFC es confirmatorio: impones una estructura y verificas si los datos la sostienen. Usar AFE y AFC sobre la misma muestra es un error metodológico frecuente en el parcial: cada uno requiere su propia muestra.

3. Tipos de escalamiento: cómo se responde

No cada ítem se responde de la misma forma. La elección del escalamiento define cómo se suma y se interpreta la escala.

TipoCómo funcionaEjemplo
LikertGrado de acuerdo o frecuencia en 5 o 7 puntos. Se suman los valores."Me pongo nervioso al hablar en público": 1 (rara vez) a 5 (con frecuencia)
GuttmanÍtems acumulativos: si el examinado aprueba uno, aprueba los anteriores. Escala jerarquica.Ítems ordenados por dificultad creciente de ansiedad social
ThurstoneLos ítems tienen un valor preasignado por jueces. El examinado marca los que esta de acuerdo.Frases sobre ansiedad social con valores asignados por expertos
Diferencial semánticoEscalas bipolares de adjetivos (7 puntos entre dos opuestos)."Hablar en público es": relajado (1) a tenso (7)
Truco de memoria: para los cuatro tipos de escalamiento piensa en LGTD: Likert (grado de acuerdo), Guttman (acumulativo), Thurstone (jueces asignan valor), Diferencial semántico (opuestos). O si prefieres: "La Gente Transforma Discursos".

4. Redacción de ítems: las reglas de oro

  1. Unidimensionalidad: cada ítem mide una sola cosa. Si una pregunta mezcla dos ideas ("Me pongo nervioso y tiemblo cuando hablo en público"), no sabras qué esta midiendo.
  2. Claridad: una sola idea por ítem, redacción simple, sin doble negación ni palabras ambiguas.
  3. Ítems positivos y negativos: se mezclan ítems redactados en sentido directo ("estar con gente me relaja") y en sentido inverso ("estar con gente me incomoda") para controlar sesgo de aquiescencia. Los negativos se recodifican al sumar.
  4. Evitar sesgos: sin lenguaje tecnico innecesario, sin preguntas que induzcan la respuesta, sin dobles barriles.
Definición clave: el sesgo de aquiescencia es la tendencia del examinado a estar de acuerdo sin importar el contenido. Mezclar ítems positivos y negativos lo controla, pero exige recodificar los negativos antes de sumar.

5. Tamaño muestral para análisis factorial

Esta es una pregunta frecuente en parciales. Hay varias reglas, ninguna universal:

ReglaRecomendaciónOrigen
N mínima indiscutible100 a 200 casosComrey y Lee (1992)
Ratio casos por ítem10 a 20 casos por cada ítem del análisisNunnally (1978)
Kaiser-Meyer-Olkin (KMO)KMO mayor o igual a 0.60 como mínimo, ideal 0.80 o masKaiser (1974)
Reglas derivadas de simulaciónDepende de las cargas factoriales esperadas: con cargas altas (mayor o igual a 0.80) basta con menos casosMacCallum y cols. (1999)

Lo práctico: una escala de 20 ítems pide entre 200 y 400 casos para un AFE confiable. Con menos, las cargas factoriales son inestables.

6. Las tres valideces

Cronbach y Meehl (1955) propusieron clasificar la validez en tres grandes familias. La distinción sigue siendo util para ordenar las pruebas que hace una escala para defenderse.

Tipo de validezQué respondeEjemplo con ansiedad social
De contenido¿Los ítems cubren el dominio completo del constructo?Juicio de expertos confirma que hay ítems de interacción, actuación y observación
De criterio¿La escala predice un criterio externo?Correlaciona con una escala de ansiedad social validada (concurrente) o con evitar dar un discurso (predictiva)
De constructo¿La escala mide realmente el constructo teórico?Estructura factorial esperada, correlaciones con constructos relacionados (convergente) y no relacionados (discriminante)
Trampa de parcial: confundir validez de contenido con validez de constructo. La de contenido se evalúa con expertos antes de pasar la escala: ¿los ítems cubren el dominio? La de constructo se evalúa empíricamente después: ¿la estructura factorial, las correlaciones con otros tests y el comportamiento de los ítems confirman que se mide el constructo teórico?

7. Ejemplo guiado: escala de ansiedad social

Imagina que construyes una escala de ansiedad social para universitarios. Asi se verian los pasos:

  1. Definir: "ansiedad ante situaciones sociales evaluativas, tanto de interacción como de actuación".
  2. Generar: escribes 50 ítems tipo Likert de 5 puntos.
  3. Juicio de expertos: cuatro psicólogos clínicos revisan. Calculas V de Aiken. Se caen 12 ítems.
  4. Piloto: aplicas los 38 restantes a 200 universitarios. Detectas 3 ítems con varianza casi nula (cada examinado responde "1").
  5. AFE: con los 35 restantes, el AFE sugiere tres factores: interacción, actuación, observación. Se caen 5 ítems mas por cargas bajas.
  6. AFC: con una muestra nueva de 300, el modelo de tres factores ajusta (CFI 0.96, RMSEA 0.05).
  7. Consistencia: alfa de Cronbach 0.88 en total; entre 0.76 y 0.84 por subescala. Omega 0.89.
  8. Baremación: percentiles con 800 universitarios. Defines punto de corte clínico en el percentil 85.
Lo que con probabilidad te van a preguntar:
  • Los pasos de construcción en orden (Definir, Generar, Juicio, Piloto, AFE, AFC, Consistencia, Baremación).
  • Diferencia entre AFE y AFC (exploratorio vs confirmatorio, muestras distintas).
  • Los tres tipos de escalamiento (Likert, Guttman, Thurstone, diferencial semántico).
  • Reglas de redacción de ítems (unidimensionalidad, claridad, positivos y negativos).
  • Diferencia entre validez de contenido, de criterio y de constructo.
  • Tamaño muestral para análisis factorial: 10 a 20 casos por ítem.
  • Alfa de Cronbach vs omega de McDonald (el segundo no asume tau-equivalencia).
Repaso en 30 segundos:
  • Construir una escala son 8 pasos: DGJPAACB.
  • AFE explora, AFC confirma. Nunca con la misma muestra.
  • Escalamiento: Likert, Guttman (acumulativo), Thurstone (jueces), diferencial semántico.
  • Ítems: una idea por pregunta, positivos y negativos mezclados.
  • Validez: contenido (expertos), criterio (predicción), constructo (factorial).
  • Muestra factorial: 10 a 20 casos por ítem. Alfa entre 0.70 y 0.90.

8. Preguntas de autoevaluación

1. ¿Cuáles son los pasos de construcción de una escala psicológica?

Definir el constructo, generar el pozo de ítems (3 a 4 veces el definitivo), juicio de expertos (V de Aiken), aplicación piloto, análisis factorial exploratorio, análisis factorial confirmatorio con muestra nueva, estimación de consistencia interna (alfa y omega) y baremación.

2. ¿Qué diferencia el AFE del AFC?

El AFE es exploratorio: dejas que los datos revelen la estructura factorial. El AFC es confirmatorio: especificas una estructura previa y verificas si los datos la sostienen mediante índices de ajuste (CFI, RMSEA, SRMR). Cada análisis se corre con una muestra distinta.

3. ¿Por qué se mezclan ítems positivos y negativos en una escala?

Para controlar el sesgo de aquiescencia, la tendencia a responder de acuerdo sin importar el contenido. Los ítems negativos se recodifican antes de sumar para que cada pregunta apunte en el mismo sentido del constructo.

4. ¿Qué regla de tamaño muestral se usa para análisis factorial?

La regla clásica de Nunnally: entre 10 y 20 casos por cada ítem del análisis. Comrey y Lee sugieren un mínimo indiscutible de 100 a 200 casos. El KMO debe ser mayor o igual a 0.60 para que sea aceptable.

5. ¿En qué se diferencian alfa de Cronbach y omega de McDonald?

Alfa de Cronbach asume que los ítems son tau-equivalentes (cargas factoriales iguales). Omega de McDonald no requiere ese supuesto y por eso es mas preciso cuando las cargas difieren. Valores adecuados en ambos van de 0.70 a 0.90.

Estudia esta materia jugando en la Escuela PsiqueAcadémica — la sesión 1 es gratis. O comprueba lo que sabes en la Arena de preguntas.

PsiqueAcadémica · Cuaderno de Psicometría II

Fuentes verificadas: Cronbach y Meehl (1955, Psychological Bulletin, 52(4)); Nunnally y Bernstein (1994, Psychometric Theory, 3.ª ed.); Devellis (2017, Scale Development, 4.ª ed.); Hair y cols. (2010, Multivariate Data Analysis, 7.ª ed.); Hu y Bentler (1999, Structural Equation Modeling, 6(1)); Comrey y Lee (1992, A First Course in Factor Analysis); McDonald (1999, Test Theory).

🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →

Ponlo en práctica

Test de conocimiento: Procesos Psicológicos

Pon a prueba lo que sabes de este tema: 12 preguntas reales, tu nivel al final y los temas exactos a reforzar.

¿Leíste el artículo? Ahora pon a prueba lo que aprendiste

Los juegos clínicos de Psiqueacadémica convierten lo que lees en práctica real. Sin registro, sin costo.

Quiero aprender jugando

Gratis · Directo al juego