Skip to content

Análisis de varianza (ANOVA) y tamaños de efecto

Tesis del tema: El ANOVA compara tres o más medias a la vez. En lugar de hacer muchos t-test (que infla el error tipo I), reparte la varianza total en dos partes: la que separa a los grupos y la que queda dentro de ellos. El estadístico F es el cociente entre esas dos. Y porque "significativo" no siempre es "relevante", se acompana con un tamaño de efecto.

En una frase: F igual a varianza entre grupos sobre varianza dentro.

1. Por qué no hacer muchos t-test

Supongamos que hay cuatro terapias y se quiere saber si se diferencian en eficacia. Si se comparan de a pares con la t de Student, son seis pruebas. Cada una tiene un 5 por ciento de probabilidad de error tipo I (falso positivo). Con seis pruebas, el error global sube por encima del 26 por ciento. Es lo que se llama inflación del error tipo I.

Analogía útil: es como jugar a la loteria seis veces en vez de una: las chances de ganar algo (aunque sea por azar) suben. El ANOVA es como jugar una sola vez con el conjunto de comparaciones juntas, controlando el error en un único 5 por ciento.

Fisher planteo esta solución en los años veinte, trabajando en diseño experimental agricola. Su idea fue comparar las medias de los grupos en un único cociente.

2. La lógica del ANOVA en tres pasos

  1. Varianza total: mide cuánto se alejan los datos respecto de la gran media (la media del conjunto de sujetos sin importar el grupo).
  2. Varianza entre grupos: mide cuánto se alejan las medias de cada grupo respecto de esa gran media. Refleja el efecto del tratamiento.
  3. Varianza dentro de grupos: mide cuánto se alejan los datos de cada sujeto respecto de la media de su propio grupo. Refleja el error o variabilidad individual.
Truco de memoria: la fórmula de F
F = Fuera / Dentro. "Fuera" es la varianza entre grupos (las medias por fuera del promedio general); "Dentro" es la varianza dentro de cada grupo (el ruido individual). Si las medias de los grupos son muy distintas, el numerador crece y F se hace grande.
F = Fuera/Dentronumerador = entredenominador = dentro
Regla práctica: un F cercano a 1 significa que las medias de los grupos son parecidas (entre y dentro casi coinciden). Un F mucho mayor que 1 sugiere que las medias se separan bastante, señal de que el tratamiento tiene efecto.

3. La tabla ANOVA como receta

El ANOVA se organiza en una tabla con columnas fijas. Si se recuerdan las columnas en orden, se reconstruye toda la lógica del análisis. Así se lee de izquierda a derecha.

Fuente de variaciónSuma de cuadrados (SC)Grados de libertad (gl)Cuadrado medio (CM)FValor p
Entre gruposvariabilidad de las medias grupales respecto de la gran mediak - 1 (k = número de grupos)SC entre / gl entreCM entre / CM dentrode la distribución F
Dentro de gruposvariabilidad individual dentro de cada grupoN - k (N = total de sujetos)SC dentro / gl dentro
Totalvariabilidad de los datos respecto de la gran mediaN - 1
Otro truco: el orden de la tabla
Suma, grados, cuadrado, F, p. La frase "Sumando Grados logras Cuadrar la F hasta la p" recorre las columnas en orden. SC primero, después gl, después CM (que es SC sobre gl), después F (que es CM entre sobre CM dentro) y por último p.
SumaGradosCuadradoFp

4. Supuestos del ANOVA

El ANOVA es una prueba paramétrica, así que pide condiciones sobre los datos. Tres supuestos clásicos:

  1. Normalidad: la variable dependiente sigue una distribución normal dentro de cada grupo. Se revisa con pruebas como Kolmogorov-Smirnov o Shapiro-Wilk.
  2. Homocedasticidad: las varianzas de los grupos son aproximadamente iguales. Se contrasta con la prueba de Levene o de Bartlett.
  3. Independencia: las observaciones no se influyen entre si. Depende del diseño del estudio, no de un test estadístico.
Trampa de parcial: el supuesto de independencia no se revisa con una prueba estadística. Se garantiza con el diseño (asignación al azar, un dato por sujeto). Si lo rompen, los grados de libertad y los valores p se distorsionan.

5. Pruebas post-hoc

Si el ANOVA da significativo, sabemos que al menos dos medias difieren, pero no cuáles. Para averiguarlo sin inflar el error, se usan las pruebas post-hoc. Cada una ajusta el error a su manera.

PruebaCómo controla el errorCuándo conviene
Tukey HSD (Tukey, 1949)Controla el error para el conjunto de comparaciones por pares; tasa de error familiar controladaGrupos del mismo tamaño; el estándar para pares simples
BonferroniDivide el nivel alfa entre el número de comparaciones; conservadorPocas comparaciones planeadas; cuando se quiere ser estricto
Scheffe (Scheffe, 1953)Ajusta para contrastes lineales y no lineales; el más conservadorComparaciones complejas, no solo pares
Analogía útil: el ANOVA te dice que hay una pelea en un grupo, pero no te dice quienes están peleando. Las pruebas post-hoc son las que entran a separar a los boxeadores y te indican exactamente que pares son distintos.

6. Tamaño del efecto

Un valor p pequeño te dice que la diferencia es poco probable por azar, pero no te dice si esa diferencia importa en la práctica. Para eso existen los tamaños de efecto, que cuantifican la magnitud, no la significancia.

IndiceQué mideInterpretacion orientativa
Eta-cuadradoProporcion de varianza total explicada por el factor (analogia del R-cuadrado)0.01 pequeño, 0.06 moderado, 0.14 grande (Cohen, 1988)
Omega-cuadradoComo el eta-cuadrado pero corregido por sesgo de estimaciónMenos sesgo en muestras pequeñas; preferido por algunos textos
d de CohenDiferencia estandarizada entre dos medias (en unidades de desviación estándar)0.20 pequeño, 0.50 moderado, 0.80 grande (Cohen, 1988)
Diferencia clave: la significancia estadística responde "¿hay efecto?". El tamaño del efecto responde "¿cuánto efecto hay?". Un estudio con N enorme puede dar p menor que 0.01 con un efecto minusculo; por eso reportar ambos es la práctica recomendada (APA, 2020).
Trampa de parcial: confundir significancia con relevancia. Un p de 0.001 no significa efecto grande. Si la muestra es de miles de sujetos, hasta diferencias triviales se vuelven estadísticamente significativas. El tamaño de efecto aclara si la diferencia vale la pena en la práctica clínica o educativa.

7. El tema en 3 frases

  1. El ANOVA evita inflar el error tipo I al comparar tres o más medias en un solo estadístico.
  2. F es el cociente entre la varianza que separa a los grupos y la que queda dentro de ellos.
  3. La significancia responde "¿hay efecto?", pero solo el tamaño del efecto responde "¿cuánto importa?".

8. Errores frecuentes en el parcial

1. Creer que un F significativo dice cuáles grupos difieren. No lo dice. Dice que al menos dos medias se separan. Para localizar dónde, se necesita una prueba post-hoc.
2. Olvidar la diferencia entre eta-cuadrado y omega-cuadrado. El eta-cuadrado sobreestima el efecto en muestras pequeñas porque no corrige el sesgo. El omega-cuadrado si lo hace.
3. Confundir varianza "entre" con varianza "total". La varianza total se reparte: parte va al numerador (entre grupos) y parte al denominador (dentro de grupos). El F compara solo las dos partes, no el total contra una de ellas.

9. Para el parcial

Lo que con probabilidad te van a preguntar:
  • Por qué el ANOVA en vez de muchos t-test: controla la inflación del error tipo I.
  • La fórmula del estadístico F: varianza entre grupos dividida entre varianza dentro de grupos.
  • La estructura de la tabla ANOVA: fuente, SC, gl, CM, F, p.
  • Los grados de libertad: k - 1 para el numerador, N - k para el denominador.
  • Los tres supuestos: normalidad, homocedasticidad, independencia.
  • La diferencia entre significancia estadística y tamaño del efecto.
Repaso en 30 segundos:
  • Multiples t-test inflan el error tipo I; el ANOVA lo controla en un único 5 por ciento.
  • F = Fuera/Dentro = varianza entre / varianza dentro.
  • Tabla: Suma, Grados, Cuadrado medio, F, p.
  • Post-hoc: Tukey para pares, Bonferroni conservador, Scheffe para contrastes complejos.
  • Eta-cuadrado y omega-cuadrado miden el efecto; d de Cohen compara dos medias.

10. Preguntas de autoevaluación

1. ¿Por qué se prefiere el ANOVA sobre múltiples pruebas t?

Porque cada prueba t tiene su propia probabilidad de error tipo I. Al hacer varias, el error global se multiplica. El ANOVA controla el error familiar en un único nivel (por ejemplo 0.05), sin importar cuántos grupos se comparen.

2. ¿Qué significa un valor F = 1?

Que la varianza entre grupos es igual a la varianza dentro de grupos. En la práctica, eso indica que las medias de los grupos no se separan más de lo que cabria esperar por azar: no hay evidencia de efecto del factor.

3. ¿Para qué sirve una prueba post-hoc?

El ANOVA significativo indica que al menos dos medias difieren, pero no identifica cuáles. Las pruebas post-hoc (Tukey HSD, Bonferroni, Scheffe) hacen comparaciones por pares controlando el error tipo I para localizar las diferencias específicas.

4. ¿Qué diferencia hay entre eta-cuadrado y omega-cuadrado?

Ambos estiman la proporción de varianza explicada por el factor. El eta-cuadrado tiende a sobreestimar el efecto, sobre todo en muestras pequeñas. El omega-cuadrado aplica una corrección por sesgo y por eso suele preferirse como estimación más precisa.

5. ¿Por qué un resultado significativo puede no ser clínicamente relevante?

Porque con muestras grandes, diferencias triviales pueden alcanzar valores p pequeños. El tamaño del efecto (eta-cuadrado, omega-cuadrado, d de Cohen) cuantifica la magnitud real de la diferencia y permite juzgar si tiene peso práctico, más alla del veredicto significativo/no significativo.

Estudia esta materia jugando en la Escuela PsiqueAcadémica — la sesión 1 es gratis. O comprueba lo que sabes en la Arena de preguntas.

PsiqueAcadémica · Cuaderno de Estadística Inferencial

Fuentes verificadas: Fisher, R. A. (1925, Statistical Methods for Research Workers, Oliver and Boyd); Tukey, J. W. (1949, Biometrics, 5(2), 99-114); Scheffe, H. (1953, Biometrika, 40(1-2), 87-104); Cohen, J. (1988, Statistical Power Analysis for the Behavioral Sciences, 2.ª ed., Lawrence Erlbaum); APA (2020, Publication Manual of the American Psychological Association, 7.ª ed.); Field, A. (2018, Discovering Statistics Using IBM SPSS Statistics, 5.ª ed., Sage).

🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →

Ponlo en práctica

Test de conocimiento: Procesos Psicológicos

Pon a prueba lo que sabes de este tema: 12 preguntas reales, tu nivel al final y los temas exactos a reforzar.

¿Leíste el artículo? Ahora pon a prueba lo que aprendiste

Los juegos clínicos de Psiqueacadémica convierten lo que lees en práctica real. Sin registro, sin costo.

Quiero aprender jugando

Gratis · Directo al juego