
Esta unidad cubre el segundo tramo de estadística descriptiva: lo que necesitas para mirar un conjunto de datos con criterio antes de pasar a inferencia o a modelos más exigentes. Vamos a trabajar cinco bloques en orden. Cada uno parte de una definición precisa, presenta las métricas centrales y cierra con trampas frecuentes en parcial. Antes de tocar pruebas de hipótesis o ANOVA conviene tener claro qué dice una distribución, cómo se transforma cuando hace falta y cuándo un gráfico dice más que un valor p. Si necesitas repasar el andamiaje del diseño que sostiene a estos datos, vuelve a Diseños experimentales y cuasiexperimentales o a Alcances, hipótesis y operacionalización. Para la parte de justificación y viabilidad del estudio, consulta Objetivos, justificación y viabilidad.
| # | Subtema | Foco del bloque | Pregunta que responde |
|---|---|---|---|
| 1 | Distribuciones y su evaluación | Forma, simetría, colas, regla empírica. | ¿Qué aspecto tiene la nube de datos? |
| 2 | Transformaciones de variables | Log, raíz, inverso, reflexión, Box-Cox. | ¿Cómo acerco una variable a una forma tratable? |
| 3 | Normalidad: pruebas y gráficos | Shapiro-Wilk, Lilliefors, Q-Q plot. | ¿La variable se comporta como una normal? |
| 4 | Tendencia, dispersión y forma | Media, mediana, DE, IQR, CV, asimetría, curtosis. | ¿Qué número resume cada eje del comportamiento? |
| 5 | Visualización efectiva de datos | Histograma, boxplot, violin, dispersión. | ¿Qué gráfico expone la historia sin mentir? |
- Evalúa la forma de la distribución antes de resumir con un solo número.
- Transforma cuando la asimetría o las colas dificultan el análisis.
- Contrasta normalidad con una prueba formal y un gráfico, no solo con un valor p.
- Reporta tendencia, dispersión y forma con índices congruentes con el tipo de variable.
- Elige gráficos honestos, con ejes sin truncar y leyendas legibles.
1. Distribuciones y su evaluación
Una distribución es el patrón que siguen los valores de una variable dentro del rango observado. Mirarla antes de calcular promedios te evita resumir un conjunto con un solo número que no representa lo que pasa. Hay familias útiles para reconocer: la normal (simétrica, con forma de campana y colas asintóticas), la uniforme (los valores dentro del intervalo son parecidos en frecuencia), la sesgada a la derecha (cola larga hacia valores altos) y la sesgada a la izquierda (cola larga hacia valores bajos). Las dos últimas dominan en ciencias sociales y salud: ingresos, tiempos de reacción, conteos de eventos y puntajes con techo suelen cargarse hacia un lado.
Para describir la forma se usan dos índices: asimetría (skewness) y curtosis (kurtosis). La primera mide hacia dónde se estira la cola; la segunda mide el peso relativo de las colas y el centro. Un valor de asimetría próximo a cero indica simetría; positivo señala cola derecha; negativo señala cola izquierda. En curtosis, la referencia es la normal con valor tres en la definición clásica (o cero en la definición excedente, según el software). Conviene reportar el valor junto con su error estándar para saber si la desviación respecto de cero es relevante.
La regla empírica aproxima proporciones dentro de una distribución normal con forma de campana: cerca del 68 por ciento de los casos cae dentro de una desviación estándar respecto de la media, cerca del 95 por ciento dentro de dos y cerca del 99.7 por ciento dentro de tres. Esta regla es una guía rápida, no una verdad universal; deja de servir cuando la distribución se aleja de la normal o cuando hay valores atípicos marcados.
| Índice | Qué mide | Lectura típica | Sustento adicional |
|---|---|---|---|
| Asimetría (skewness) | Dirección y largo de la cola. | Cero: simétrica. Positivo: cola derecha. Negativo: cola izquierda. | Error estándar: SE aproximado por la raíz de seis dividido por n. |
| Curtosis (kurtosis) | Peso de colas y centro. | Tres en referencia clásica, cero en excedente. | Comparar contra el valor esperado y su error estándar. |
| Rango intercuartílico (IQR) | Dispersión del 50 por ciento central. | Útil con asimetría marcada. | Cuartiles 1 y 3 por posición o por interpolación. |
| Regla empírica | Proporciones dentro de 1, 2 y 3 DE. | 68 / 95 / 99.7 por ciento. | Válida solo bajo forma de campana. |
2. Transformaciones de variables
Transformar una variable significa aplicarle una función matemática con el objetivo de acercarla a una forma tratable para el análisis. Se transforma cuando hay asimetría marcada, cuando la varianza crece con la media (heterocedasticidad) o cuando un modelo exige linealidad aproximada. Las transformaciones más usadas son cuatro: logaritmo, raíz cuadrada, inverso y reflexión previa al logaritmo. La elección depende del rango y de la presencia de ceros o negativos.
- Logaritmo natural. Acerca distribuciones con cola derecha marcada, en casos donde la variable es positiva. Reduce el peso de los valores grandes y comprime la escala.
- Raíz cuadrada. Funciona bien con conteos y con datos Poisson moderados. Estira poco y mantiene la lectura intuitiva.
- Inverso (uno dividido por x). Útil con colas muy largas, por ejemplo tiempos de reacción con valores enormes. Hace perder lectura directa.
- Reflexión previa al logaritmo. Cuando hay valores negativos o ceros, se refleja la variable (se resta el máximo más uno y se toma el logaritmo de la nueva variable) para hacer aplicable el logaritmo.
La familia Box-Cox generaliza la idea: busca el exponente lambda que maximiza la normalidad aproximada de la variable transformada. Es un atajo útil cuando no tienes clara la transformación adecuada. Aquí la mencionamos sin desplegar la fórmula exacta: en la práctica se usa como herramienta y se reporta el lambda elegido junto con la transformación aplicada.
| Transformación | Cuándo aplicarla | Efecto sobre la forma | Lectura posterior |
|---|---|---|---|
| Logaritmo natural | Variable positiva, cola derecha. | Reduce asimetría positiva. | Diferencias se vuelven proporcionales. |
| Raíz cuadrada | Conteos Poisson moderados. | Suaviza cola derecha. | Interpretación en la escala original. |
| Inverso | Cola muy larga. | Comprime valores grandes. | Pierde lectura directa. |
| Reflexión + log | Negativos o ceros con cola. | Habilita el logaritmo. | Reportar el procedimiento. |
3. Normalidad: pruebas y gráficos
La hipótesis de normalidad plantea que los datos provienen de una distribución normal con una media y una varianza desconocidas. Contrastarla es un paso habitual antes de pruebas paramétricas, porque muchas de ellas (t de Student, ANOVA, regresión por mínimos cuadrados) son robustas a desviaciones moderadas cuando n es intermedio, pero pueden deteriorarse con asimetría marcada o colas pesadas. Por eso se combinan pruebas formales con gráficos: cada una aporta una pieza del veredicto.
Las dos pruebas más usadas son Shapiro-Wilk y Kolmogorov-Smirnov con corrección de Lilliefors. Shapiro-Wilk tiene potencia alta con muestras pequeñas y medianas, hasta alrededor de doscientos casos, y suele ser la primera opción. Kolmogorov-Smirnov por sí solo exige parámetros conocidos; por eso se aplica la corrección de Lilliefors, que relaja ese requisito y lo hace utilizable con parámetros estimados. Esta versión funciona con mayor solidez con n grande. En ambos casos la lectura es la misma: un valor p bajo lleva a rechazar la normalidad.
El gráfico Q-Q plot enfrenta los cuantiles observados contra los cuantiles teóricos de una normal. Si los puntos se alinean sobre la diagonal, la variable se comporta como una normal. Desviaciones sistemáticas en los extremos señalan colas pesadas o colas livianas; desviaciones en uno solo de los extremos señalan asimetría. El histograma complementa la lectura cuando el n es suficiente para que la forma sea estable. Ninguno de los dos reemplaza a la prueba formal, y la prueba formal no reemplaza al gráfico.
| Herramienta | Tipo | Rango de n recomendado | Lectura |
|---|---|---|---|
| Shapiro-Wilk | Prueba formal. | Pequeño a mediano. | Valor p bajo: rechazar. |
| Kolmogorov-Smirnov + Lilliefors | Prueba formal. | Mediano a grande. | Valor p bajo: rechazar. |
| Q-Q plot | Gráfico diagnóstico. | Cada rango de n, con cautela en n chico. | Curvatura en colas: colas pesadas o livianas. |
| Histograma | Gráfico de forma. | Mediano a grande. | Simetría aproximada: lectura visual. |
4. Índices de tendencia, dispersión y forma
Una variable se resume en tres planos: tendencia central (dónde se ubica el grueso), dispersión (cuánto se separan los valores) y forma (cómo se distribuyen). Reportar los tres planos juntos evita conclusiones incompletas: dos grupos con la misma media pueden tener varianzas muy distintas, y dos grupos con la misma mediana pueden tener colas opuestas.
En tendencia central hay tres medidas: media, mediana y moda. La media es sensible a valores extremos porque suma cada observación; la mediana es robusta porque usa solo la posición. La moda es el valor más frecuente, útil con variables categóricas o con distribuciones multimodales. Con datos asimétricos, la mediana suele describir la ubicación con mayor solidez que la media. Con datos multimodales, ninguna de las tres cuenta la historia sola.
En dispersión hay cuatro medidas de uso frecuente: rango, varianza, desviación estándar y rango intercuartílico (IQR). El rango usa solo los extremos y se distorsiona con atípicos. La varianza y la desviación estándar usan el conjunto de observaciones; la desviación estándar se interpreta en la misma unidad que la variable. El IQR, igual a la diferencia entre el cuartil tres y el cuartil uno, es robusto y útil cuando hay asimetría. La desviación estándar muestral usa n menos uno en el denominador; la poblacional usa n. La muestral es la que aparece cuando calculas a partir de una muestra.
Para comparar dispersión entre escalas distintas sirve el coeficiente de variación (CV): desviación estándar dividida por la media, expresada como proporción o porcentaje. Es útil cuando comparas variables medidas en unidades diferentes (por ejemplo, puntaje y tiempo) o cuando la media varía entre grupos.
En forma se reportan la asimetría y la curtosis, acompañadas de su error estándar. Una asimetría con magnitud mayor que el doble de su error estándar sugiere asimetría relevante; una curtosis con magnitud mayor que el doble de su error estándar sugiere colas pesadas o livianas relevantes.
| Índice | Plano | Sensible a | Alternativa robusta |
|---|---|---|---|
| Media | Tendencia central. | Valores extremos. | Mediana. |
| Mediana | Tendencia central. | Poco ante atípicos. | Media recortada. |
| Desviación estándar | Dispersión. | Valores extremos. | IQR / MAD. |
| IQR | Dispersión del 50 por ciento central. | Poco ante atípicos. | Percentiles. |
| Coeficiente de variación | Dispersión relativa. | Media próxima a cero. | Comparar solo con medias positivas. |
5. Visualización efectiva de datos
Un gráfico bien elegido comunica en segundos lo que una tabla tarda en decir. Cada tipo de gráfico resuelve una pregunta específica. El histograma resume la forma de una variable continua y permite ver asimetría y colas. El boxplot muestra mediana, IQR, bigotes y atípicos, y permite comparar grupos. El violin une la idea del boxplot con una estimación de densidad y deja ver si hay bimodalidad. El diagrama de dispersión enfrenta dos variables numéricas y expone relaciones, linealidades y atípicos bidimensionales.
- Histograma. Útil con n intermedio y grande. Cuidado con el ancho del bin: muy ancho oculta la forma; muy estrecho añade ruido.
- Boxplot. Útil para comparar grupos y detectar atípicos. La caja marca el IQR; la línea interna marca la mediana; los bigotes alcanzan valores dentro de 1.5 veces el IQR desde los bordes de la caja.
- Violin. Útil para detectar bimodalidad u otras formas no captadas por el boxplot. Con n pequeño puede verse engañoso.
- Diagrama de dispersión. Útil para evaluar relación lineal, heterocedasticidad y atípicos bidimensionales. Complementa, no reemplaza, al coeficiente de correlación.
El gráfico debe ser legible sin leer el texto: títulos claros, ejes etiquetados, leyenda sin ambigüedad y una sola historia por gráfico. Cuando compares entre grupos, usa el mismo rango en cada uno de los paneles y mantén la misma escala de color. Cuando presentes una variable ordinal, describe su ubicación con mediana e IQR y acompaña con un boxplot; evita la media con desviación estándar en ordinales, porque la media no tiene sentido cuando los valores son rangos.
| Gráfico | Pregunta que responde | Variables | Cuándo evitarlo |
|---|---|---|---|
| Histograma | ¿Qué forma tiene la variable? | Una continua. | n muy pequeño. |
| Boxplot | ¿Cómo se comparan los grupos? | Una continua por grupo. | n muy pequeño por grupo. |
| Violin | ¿Hay bimodalidad o forma no uniforme? | Una continua por grupo. | n muy pequeño por grupo. |
| Dispersión | ¿Hay relación entre dos variables? | Dos continuas. | n muy pequeño o variable ordinal. |
Autoevaluación
Pregunta 1. Una variable tiene asimetría positiva marcada. ¿Qué medida de tendencia central reporta con mayor solidez la ubicación?
La mediana. La media es sensible a los valores extremos de la cola derecha y se corre hacia el lado largo. La mediana usa solo la posición y se ve poco afectada por atípicos. Cuando la asimetría es marcada, reporta además la media y el IQR para que se vea la diferencia.
Pregunta 2. Estás contrastando normalidad con n igual a 800. Shapiro-Wilk devuelve valor p inferior a 0.01. ¿Debes concluir que la variable no es normal?
No de forma automática. Con n grande, Shapiro-Wilk rechaza desviaciones triviales. Conviene mirar el Q-Q plot, los índices de asimetría y curtosis con su error estándar, y el histograma. Si la desviación es leve y la prueba posterior es robusta, puedes seguir con el análisis; si la desviación es marcada, transforma o usa una prueba robusta.
Pregunta 3. Calculas la desviación estándar a partir de una muestra de 60 casos. ¿Qué denominador usas?
Usas n menos uno, es decir, 59. La desviación estándar muestral divide la suma de cuadrados de las desviaciones entre n menos uno. Esta corrección se llama grados de libertad y compensa el sesgo al estimar la varianza poblacional desde una muestra. Si tuvieras la población entera, dividirías entre n.
Pregunta 4. Tienes una variable de conteo (eventos por hora) con cola derecha marcada. ¿Qué transformación aplicas primero?
La raíz cuadrada si los conteos son moderados, o el logaritmo si los conteos son grandes y positivos. La raíz cuadrada suaviza la cola derecha de Poisson sin perder lectura directa. Si hay ceros, no puedes tomar logaritmo directo: reflexiona la variable o usa un esquema de manejo de ceros antes de transformar.
🎮 12 experiencias — ¿prefieres practicarlo jugando? Psique Juegos — aprende jugando →
Siguiente paso de estudio
Guía gratuita de estudio DSM-5-TR
20 cuadros clínicos para ubicar sin diagnosticar
Mapa educativo para estudiantes: señales orientativas, diferenciales frecuentes y alertas éticas. No incluye dosis ni indicaciones médicas.
Material educativo. No diagnostica, no sustituye evaluación clínica ni reemplaza el manual DSM-5-TR.