Skip to content

Diseños experimentales y cuasi-experimentales

Tesis del apunte. Un estudio no es "experimental" porque tenga un pre y un post. Es experimental porque el investigador decide quién recibe el estímulo y quién no, al azar. Cuando esa aleatorización no se puede aplicar, se entra a territorio cuasi-experimental, y con ella llegan amenazas a la validez que el método estadístico no resuelve solo.

Clave: aleatorización = diseño verdadero · sin azar = cuasi · Campbell y Stanley = el catálogo de trampas que acechan a ambos.

1. Diseño experimental verdadero: la aleatorización como corte

Antes de hablar de "pre-post", "controles" o "grupos", hay que poner una frontera clara. Lo que vuelve experimental a un estudio no es medir dos veces, no es tener un grupo que no recibe nada y otro que sí, no es usar placebo. El rasgo definitorio es uno solo: la asignación aleatoria de los sujetos a las condiciones. Si esa pieza está, tienes un experimento. Si no está, no.

Según Hernández Sampieri y otros manuales de metodología, un diseño experimental cumple tres requisitos mínimos: manipulación deliberada de la variable independiente, medición de la variable dependiente y, sobre todo, asignación al azar de los participantes a los grupos. Quitar uno de los tres degrada el diseño hacia la cuasi-experimentación o la pura observación.

Definición clave. Asignación aleatoria es tirar una moneda, usar una tabla de números aleatorios o un software que decida a qué grupo va cada sujeto. Lo que se randomiza es la pertenencia al grupo, no el contenido del estímulo.

¿Por qué importa tanto la aleatorización? Porque cuando los grupos se forman al azar, las diferencias iniciales entre ellos — edad, sexo, nivel socioeconómico, inteligencia, motivación, lo que sea — tienden a distribuirse parejo. Eso significa que si al final del estudio el grupo que recibió el estímulo muestra un cambio y el otro no, ese cambio se puede atribuir con razonable confianza al estímulo, y no a que los grupos ya eran distintos desde el arranque.

Sin azar, esa garantía se pierde. Y ahí empieza la zona de riesgo.

1.1. El grupo control: el espejo silencioso

El grupo control no es un adorno ni un requisito formal. Es el espejo que dice qué habría pasado sin la intervención. Si solo mides al grupo que recibe el estímulo, no tienes forma de separar el efecto real de la historia, del paso del tiempo, del mero hecho de haber sido medido.

Un control adecuado cumple dos funciones simultáneas: recibir las mismas condiciones de medición que el grupo experimental (mismo instrumento, mismo momento, mismo contexto) y no recibir el estímulo que se está probando. A veces el control recibe placebo, a veces no recibe nada, a veces recibe la intervención estándar previa. El punto es que cada divergencia entre control y experimental al final del estudio se pueda leer como efecto del estímulo.

ojo: control distinto de "no hice nada". control = "hice todo igual menos la variable independiente".

1.2. Diseños experimentales típicos

Hay varias formas de organizar el tiempo y las mediciones dentro de un diseño experimental verdadero. Las tres que más aparecen en los manuales son:

  1. Pre-experimental con un solo grupo (pre-post). Mides, intervienes, vuelves a medir. Sin Randomización, sin grupo paralelo. Este es el más débil del conjunto y, de hecho, varios autores lo clasifican como pre-experimental, no como experimental. Lo trabaja Campbell y Stanley como ejemplo de "qué no hacer".
  2. Diseño con grupo control no equivalente. Tienes experimental y control, pero la asignación no es al azar. Por esa razón formalmente pertenece a la familia cuasi-experimental, aunque muchos textos lo coloquen en una zona intermedia.
  3. Diseño experimental puro con pre-prueba y post-prueba. Aleatorización, pre, intervención, post. Es el referente canónico y el más sólido para inferir causalidad.

Diseños más complejos, como los factoriales (varias variables independientes a la vez) o los de medidas repetidas, también exigen aleatorización. Si la pierdes, dejan de ser experimentos en sentido estricto.

Mnemotecnia de la frontera. ¿Hay asignación al azar? Sí = experimental. No = cuasi (o pre-experimental). La respuesta es binaria. No hay "experimental a medias".

2. Diseños cuasi-experimentales: pre-post y series temporales

La investigación seria rara vez ocurre en un laboratorio controlado. En educación, psicología clínica, salud pública, trabajo social, raras veces puedes tomar un grupo de pacientes o de alumnos y tirarlos al azar entre "reciben terapia" y "no la reciben". Hay restricciones éticas, institucionales, logísticas. En esos terrenos la cuasi-experimentación es lo que queda.

Un diseño cuasi-experimental es aquel que se parece a un experimento —manipula la variable independiente, mide la dependiente—, pero no puede asignar al azar. Los grupos ya existen antes de empezar: aulas intactas, consultorios, barrios, cohortes clínicas. El investigador interviene sobre lo que hay.

Trampa clásica de parcial. "Hice un pre-post con grupo control, entonces es experimental." No. Si los grupos no se formaron al azar, no es experimental. Es cuasi. La forma del diseño (pre, post, control) no compra lo que la aleatorización garantiza.

2.1. Diseño de pre-post con grupo control no equivalente

Este es el patrón más usado en ciencias sociales y de la salud. Tienes un grupo que recibe la intervención y otro que no (o que recibe la alternativa habitual). Mides antes y después en ambos. La tentación es comparar los cambios y atribuir la diferencia al estímulo. Pero como los grupos no se formaron al azar, ya desde el pre pueden ser distintos, y esa diferencia previa contamina la lectura del post.

Para mitigar este problema los analistas usan técnicas estadísticas: puntajes de diferencia, ANCOVA con la pre como covariable, propensity score matching, modelos de diferencias en diferencias. Ninguna de estas técnicas sustituye a la aleatorización; lo que hacen es reducir el sesgo bajo supuestos que no se cumplen con frecuencia.

2.2. Diseños de series temporales

Cuando no hay grupo control, o cuando se quiere ver la trayectoria del efecto a lo largo del tiempo, se recurre a las series temporales. Se toman múltiples mediciones antes de la intervención, luego se aplica el estímulo y se siguen tomando mediciones después. La idea es simple: si la serie es estable antes y se mueve justo después de la intervención, hay un indicio fuerte de efecto.

Estos diseños son sensibles a las amenazas de historia (¿pasó algo más en ese momento?) y de maduración (¿la tendencia ya iba a cambiar sola?). La forma más robusta es la serie temporal interrumpida con múltiples puntos antes y después, que permite ver tanto la estabilidad previa como el cambio posterior.

O1 O2 O3 O4 X (intervención) O5 O6 O7 O8

esquema: serie temporal interrumpida. O = observación. X = intervención. Si la línea se mantenía y se quiebra tras X, el efecto se ve.

2.3. Diseños de pre-post de un solo grupo

El más débil de los cuasi: medir, intervenir, volver a medir. Sin control, sin azar, sin serie. Sirve como piloto, como antecedente, como primera exploración. No sirve para afirmar causalidad. Quien haya leído a Campbell y Stanley sabe que estos diseños son los más vulnerables a casi la mayoría de las amenazas a la validez.

Analogía. Es como probar un nuevo fertilizante en una sola maceta, sin grupo de comparación, sin repetir: si la planta creció, no sabes si fue por el fertilizante, por el agua, por la luz, o porque era su semana buena. La maceta no te lo dice.

3. Amenazas a la validez interna (Campbell y Stanley)

Donald Campbell y Julian Stanley, en su texto clásico de 1963 que la mayoría de los manuales citan, propusieron un catálogo de factores que pueden hacer que una investigación parezca mostrar un efecto que en realidad no existe, o viceversa. A estos factores los llamaron amenazas a la validez interna: cada evento o condición que debilite la confianza en que la variación observada en la dependiente se debe a la independiente.

La validez interna no es un lujo. Es el primer requisito. Si un estudio no es internamente válido, discutir si sus resultados generalizan es irrelevante: está hablando de un fantasma.

3.1. Historia

La amenaza de historia ocurre cuando, entre la pre y la post, sucede un evento externo que también afecta a la variable dependiente. Una noticia, una crisis, un cambio de política, un desastre natural, una campaña mediática. Si el grupo experimental y el control no están igualmente expuestos (y rara vez lo están), el cambio en la post puede deberse al evento y no al estímulo.

En diseños de un solo grupo sin control, la historia es prácticamente imposible de separar del efecto. Por eso los diseños longitudinales con controles paralelos la mitigan: si ambos grupos viven el mismo evento, queda neutralizado.

3.2. Maduración

La maduración es el cambio que ocurre porque los sujetos pasan por un proceso interno natural: crecen, se cansan, se aburren, se adaptan, se recuperan de una crisis sola. Si aplicas un programa de reducción de ansiedad y mides después de tres meses, parte de la mejora puede deberse a que la gente estaba mejorando sola, con el tiempo.

Es una amenaza con frecuencia subestimada. Sobre todo en estudios con niños, con pacientes en proceso de recuperación, o con mediciones separadas por mucho tiempo. El grupo control es la contramedida canónica: si la maduración afecta parejo, se cancela en la comparación.

3.3. Testing (efecto de la prueba)

Hacer una pre-prueba cambia a los sujetos. Aprenden a responder, se familiarizan con el instrumento, se vuelven más rápidos, descubren pistas. Si en el post los encuentras con puntajes más altos, parte de la ganancia puede deberse al simple hecho de haber tomado la prueba antes, no al estímulo.

En cuestionarios de personalidad, en pruebas de memoria, en mediciones de attitudes, el efecto de la prueba es considerable. La solución clásica es el diseño de Solomon: cuatro grupos, mitad con pre y mitad sin pre, lo que permite estimar y descontar el efecto del testing.

3.4. Instrumentación

Cuando el instrumento de medición cambia entre la pre y la post — calibración, observadores diferentes, reactivos cambiados, software actualizado, fatiga del codificador — el cambio observado puede ser artificial. No es que los sujetos hayan cambiado; es que la regla con que se midió cambió.

Esto es frecuente en estudios longitudinales largos. La contramedida es estandarizar exhaustivamente: mismo instrumento, mismo entrenamiento, misma calibración, doble codificación ciega cuando aplica.

3.5. Regresión estadística a la media

Si en la pre seleccionas a los sujetos por tener puntajes extremos (los más ansiosos, los más agresivos, los más bajos en una prueba), en la post tenderán a mostrar valores más cercanos al promedio. No porque mejoraron, sino porque los extremos, al volver a medirse, regresan al centro. Este fenómeno estadístico puede confundirse con un efecto del tratamiento.

La regresión a la media es engañosa porque parece evidencia de cambio real. Se evita con grupos control, porque si el control también regresa a la media, el efecto aparente del tratamiento se diluye.

3.6. Mortalidad (o atrición)

Cuando los sujetos abandonan el estudio entre la pre y la post, y esos abandonos no son al azar — los que están más comprometidos, los que más se aburren, los que más viajan, los que menos entienden —, queda un grupo sesgado al final. La mortalidad diferencial entre experimental y control es una de las amenazas más serias en estudios largos.

No es lo mismo que perder un sujeto por mudanza al azar que perder sistemáticamente a los que estaban más comprometidos. La solución es reportar tasas de retención por grupo, analizar si los que abandonan difieren en variables clave, y usar técnicas de imputación o análisis de sensibilidad cuando hay motivos para sospechar sesgo.

3.7. Selección

La amenaza de selección ocurre cuando los grupos experimental y control difieren desde el inicio en características que también afectan a la variable dependiente. La sola contramedida robusta es la aleatorización. En cuasi-experimentación, donde no hay azar, la selección es la amenaza de fondo, latente, y hace falta estadística para empujar contra ella.

Para tener a mano. Campbell y Stanley enumeran ocho amenazas clásicas a la validez interna: historia, maduración, testing, instrumentación, regresión, mortalidad, selección, y la maduración-selección (cuando se confunden). Del conjunto, selección es la más difícil de domeñar sin aleatorización.

4. Amenazas a la validez externa y generalización

Un estudio puede ser internamente válido y seguir siendo inútil para el mundo real. La validez externa se refiere a la posibilidad de generalizar los resultados más allá de la muestra, el lugar, el momento y los investigadores que hicieron el estudio. Es decir: ¿lo que encontré aquí, lo voy a encontrar allá?

Kerlinger lo formuló con claridad: la validez externa responde a la pregunta de en qué condiciones y poblaciones se replica el hallazgo. Un experimento con 30 universitarios de psicología de una sola universidad, realizado en horario diurno, midiendo con un instrumento en inglés, no habla, por sí mismo, de cómo funcionará la intervención en adultos mayores, en contextos rurales, en otro idioma, con problemas clínicos reales.

Trampa que aparece en parciales. "Tengo N=500, entonces el estudio es generalizable." No. Validez externa no se compra con N grande. Una muestra enorme pero homogénea —mujeres, jóvenes, estudiantes— generaliza menos que una muestra más chica pero diversa y representativa. El tamaño ayuda a la precisión, no a la cobertura.

4.1. Amenazas comunes a la validez externa

Entre las amenazas a la validez externa que recoge la literatura están:

  • Interacción selección-tratamiento. El efecto del estímulo depende de qué tipo de persona recibe el estímulo. Si solo probaste con voluntarios, solo sabes del efecto en voluntarios.
  • Interacción setting-tratamiento. El laboratorio es un setting particular. Un hallazgo en laboratorio puede no trasladarse a la clínica, la escuela, la calle.
  • Interacción historia-tratamiento. El efecto puede depender del momento histórico. Un programa de reducción de estrés probado en 2019 puede no funcionar igual en 2026.
  • Efecto novedad. A veces una intervención funciona solo porque es nueva. Cuando se vuelve rutinaria, el efecto se diluye.
  • Efecto del experimentador. Si el experimentador sabe quién está en qué condición (no es ciego), su trato puede diferir y contaminar el efecto.
  • Reactividad o efecto Hawthorne. Las personas modifican su conducta porque saben que están siendo observadas, no por el estímulo.

4.2. Validez externa y validez interna: una tensión real

Hay una tensión estructural entre validez interna y externa. Los diseños más controlados (laboratorio, asignación al azar estricta, doble ciego) maximizan la confianza causal pero reducen la representatividad. Los diseños más cercanos al mundo real (escuela, consultorio, comunidad) ganan en representatividad pero pierden control. La decisión de investigación es una decisión de equilibrio, y cada diseño es un compromiso distinto.

Eso quiere decir que no existe el diseño que sirve para todo. Ni el más limpio experimento de laboratorio cubre la escena completa, ni el estudio más naturalista reemplaza la fuerza inferencial del azar.

Analogía de la generalización. Es como probar un procedimiento en tu cocina con tu horno, a tu altitud, con tu marca de harina. Que salga bien no significa que salga bien en otra cocina. La validez interna te dice "este procedimiento funciona aquí". La externa te pregunta "¿y en la otra cocina?".

5. Control de variables extrañas

Una variable extraña es cada factor que no sea la variable independiente pero que también pueda afectar a la variable dependiente. Si no se controla, se vuelve una explicación alternativa para los resultados. La batalla del diseño es mantener esas variables bajo control, dentro de lo que el contexto permita.

5.1. Formas de control

Hay varias estrategias, y se eligen según el diseño, la población y los recursos:

  1. Aleatorización. Distribuye las variables extrañas por igual entre los grupos. Es la más poderosa y la que ofrece la solución limpi.
  2. Emparejamiento. Se forman parejas de sujetos con perfiles similares y se asigna al azar dentro de cada pareja. Útil cuando la muestra es chica y hay variables clave conocidas.
  3. Bloqueo. Se agrupan los sujetos por alguna variable relevante (sexo, edad, nivel) y dentro de cada bloque se aleatoriza. Asegura balance dentro de cada estrato.
  4. Diseño de cuadrado latino o contrabalanceado. Se controla el orden de presentación de los estímulos, muy usado en Psicología experimental para eliminar efectos de secuencia y fatiga.
  5. Control estadístico. ANCOVA, regresión múltiple, modelos mixtos. Útiles cuando no se pudo controlar en el diseño, aunque no sustituyen al control experimental.
  6. Instrum entación estandarizada. Protocolos rígidos, entrenamiento de observadores, doble codificación ciega. Eliminan variabilidad por instrumento o por codificador.
  7. Instrucciones uniformes y ambiente constante. Condiciones iguales para la mayoría, en lo posible. Reduce varianza por contexto.

5.2. ¿Qué pasa cuando no se puede controlar todo?

En la vida real, sobre todo en campo, rara vez se controla todo. Quedan fuentes de variabilidad que se asumen aleatorias y se manejan con estadística. Lo importante es identificarlas antes del estudio, no después. Si no las pensaste, no las podrás reportar, ni podrás discutir los límites del trabajo.

El control de variables extrañas no es un detalle técnico. Es lo que separa una conclusión defendible de una anécdota con números.

Mnemotecnia de control. Aleatorizar > emparejar > bloquear > controlar estadísticamente > describir y asumir. Cuando no puedes subir de escalón, documenta por qué. Cuando sí puedes, sube.

5.3. Tabla resumen: experimental contra cuasi-experimental

Criterio Diseño experimental verdadero Diseño cuasi-experimental
Variable independiente Manipulada por el investigador Manipulada por el investigador
Variable dependiente Medida Medida
Asignación a grupos Al azar Grupos ya formados, no al azar
Grupo control Habitual, con equivalencia inicial Frecuente, pero no equivalente
Pre-prueba Habitual (diseño pre-post) Habitual en pre-post con control no equivalente
Validez interna Alta, si el diseño se ejecuta bien Media a baja; sensible a selección y maduración
Validez externa Variable; depende del setting Suele ser más alta, por el contexto realista
Amenaza dominante Fallos de instrumentación, mortalidad, efectos del experimentador Selección, historia, maduración
Cuándo se usa Cuando se puede asignar al azar sin vulnerar ética ni viabilidad Cuando los grupos ya existen y aleatorizar es inviable
Conclusión de causalidad Fuerte, con cautela Probable, con más cautela y Quid pro quo

clave: la frontera es la aleatorización. el resto (control, pre, post, series) son ayudas para robustecer la inferencia, no la frontera misma.

5.4. Cómo reportarlo en un trabajo

En la sección de método de un trabajo de investigación cuantitativa, conviene explicitar cinco cosas: si hubo aleatorización y cómo; si hubo grupo control y de qué tipo; cómo se controlaron las variables extrañas relevantes para el estudio; qué amenazas a la validez se identificaron y cómo se mitigaron; y cuál es el alcance de la generalización que se defiende. Esto es lo que convierte un "hice un pre-post" en un diseño defendible.

Para el parcial. La frontera entre experimental y cuasi-experimental es la asignación al azar. Si no está, no es experimental, por más pre, post y control que se acumulen. Las amenazas a la validez interna de Campbell y Stanley son las que aparecen en casi toda pregunta aplicada. La validez externa no se mejora con N grande, sino con diversidad y representatividad de la muestra. Y el control de variables extrañas es lo que vuelve defendible una conclusión.

Autoevaluación

1. ¿Por qué un estudio "pre-post con grupo control" puede no ser experimental?

Porque la asignación al azar es lo que vuelve experimental a un diseño. Si los grupos se formaron por asignación no aleatoria (aulas intactas, consultorios separados, cohortes ya constituidas), sigue siendo cuasi-experimental aunque tenga pre, post y control. La forma del diseño no compra la equivalencia inicial que da la aleatorización.

2. Diferencia entre amenaza de historia y amenaza de maduración.

La historia es un evento externo que ocurre entre las mediciones y que también puede afectar a la variable dependiente. La maduración es un cambio interno en los propios sujetos, independiente del tratamiento: el paso del tiempo, el cansancio, el aprendizaje, la recuperación natural. Las dos pueden confundirse si no hay grupo control que las absorba en la comparación.

3. ¿Qué es la regresión a la media y por qué confunde?

Es el fenómeno por el cual los puntajes extremos, al volver a medirse, tienden a acercarse al promedio del grupo. No porque el sujeto cambió, sino por variación aleatoria. Si en la pre se seleccionan los casos extremos, en la post parecerá que mejoraron, y ese "efecto" puede atribuirse erróneamente al tratamiento. Se controla con grupo control y con selección no sesgada por extremos.

4. ¿Por qué N grande no garantiza validez externa?

Porque la validez externa depende de la representatividad y la diversidad de la muestra, no de su tamaño. Una muestra enorme pero homogénea —una sola universidad, un solo país, un solo rango etario— generaliza menos que una muestra más chica pero diversa y representativa de la población a la que se quiere hablar. El N ayuda a la precisión de la estimación; la representatividad ayuda a la cobertura.

5. ¿Cuándo conviene un diseño cuasi-experimental en lugar de uno experimental?

Cuando aleatorizar es inviable por razones éticas, logísticas o institucionales: aulas que no se pueden reorganizar, pacientes que no se pueden asignar al azar, intervenciones que la propia organización ya determina. En esos casos, el cuasi-experimental es la opción más adecuada posible, pero hay que ser explícito sobre las amenazas a la validez que eso trae y mitigarlas con control estadístico, series temporales o pre-post con control no equivalente.

PsiqueAcadémica · Cuaderno de Investigación Cuantitativa

🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →

Ponlo en práctica

Test de afrontamiento del estrés

Identifica tu estilo de afrontamiento en 2 minutos — útil para lo que acabas de leer.

¿Quieres practicar este tema de verdad?

La Escuela convierte la carrera en sesiones: teoría, casos y banco con justificación. Empieza por la sesión 1, sin registro.

Abrir la sesión 1

Gratis · sin tarjeta