Herramientas · Bioestadística abierta
Descriptivos de una variable: media, DE, intervalo de confianza, cuartiles, asimetría, curtosis y prueba de Shapiro-Wilk
Pega una columna desde tu hoja de cálculo y obtén el resumen completo de esa variable: media con intervalo de confianza, desviación estándar, mediana y cuartiles, asimetría y curtosis, prueba de normalidad de Shapiro-Wilk y valores atípicos, con el histograma y el diagrama de caja que hay que mirar antes de decidir qué reportar.
https://udgca1190.com.mx/herramientas/bioestadistica/descriptivos
Este enlace no incluye los datos pegados: son demasiado largos para una URL.
Resultados
Valores (n)
40
Media
142.6
128.6 a 156.6
IC 95 % · distribución t
Desviación estándar (DE)
43.87
Error estándar de la media (EEM)
6.936
Mediana
147.5
cuantil tipo 7
Primer cuartil (Q₁)
122.8
cuantil tipo 7
Tercer cuartil (Q₃)
166
cuantil tipo 7
Rango intercuartílico (IQR)
43.25
cuantil tipo 7
Mínimo
47
Máximo
226
Rango
179
Coeficiente de variación (CV)
30.8 %
Asimetría (G1)
-0.45
Joanes y Gill, tipo 2
Curtosis (G2)
0.03
Joanes y Gill, tipo 2
Media geométrica
134.3
Shapiro-Wilk (W)
0.962
AS R94 (Royston 1995)
Shapiro-Wilk (p)
0.196
AS R94 (Royston 1995)
Valores atípicos (Tukey)
3
cercas de 1.5 × IQR
Interpretación
Se describieron 40 valores: media 142.6 (DE 43.87; IC 95 % de la media 128.6 a 156.6), mediana 147.5 (IQR 122.8 a 166), rango 47 a 226. El error estándar de la media es 6.936. El coeficiente de variación es 30.8 %: la desviación estándar como fracción de la media.
Asimetría G1 = -0.45: la distribución es aproximadamente simétrica; curtosis G2 = 0.03, donde 0 corresponde a la normal, los valores positivos a colas más pesadas y los negativos a una forma más plana.
Shapiro-Wilk: W = 0.962, p = 0.196: no hay evidencia contra la normalidad en estos 40 valores. La prueba no demuestra que la variable sea normal, solo que estos datos no bastan para descartarlo; con n grande, p pequeños no implican desviaciones relevantes.
Para el manuscrito: reporte media (DE) cuando la distribución sea aproximadamente simétrica y sin atípicos, es decir 142.6 (43.87); reporte mediana (IQR) cuando no lo sea, es decir 147.5 (122.8 a 166). Media geométrica, útil cuando la variable es multiplicativa (títulos, cargas virales, diluciones): 134.3.
3 valores quedan fuera de las cercas de Tukey (por debajo de 57.88 o por encima de 230.9, es decir a más de 1.5 veces el IQR de la caja). Un valor atípico no es un error por sí mismo: compruebe la captura y las unidades antes de excluirlo, y si lo excluye, dígalo.
- 3 valores quedan fuera de las cercas de Tukey (a más de 1.5 veces el IQR por debajo de Q₁ o por encima de Q₃). Compruebe si son errores de captura o de unidades antes de excluirlos.
Explicación
Antes de comparar nada hay que describir. La pregunta práctica es qué par de números resume mejor a la variable: la media con su desviación estándar, que solo se lee bien cuando la distribución es aproximadamente simétrica, o la mediana con el rango intercuartílico, que aguanta las colas largas y los valores extremos. Esta calculadora da los dos y añade el intervalo de confianza de la media, que es lo que responde «¿dónde está la media de la población?» y no debe confundirse con la desviación estándar, que describe la dispersión de los individuos.
La asimetría G1 y la curtosis G2 ponen número a la forma. G1 vale 0 en una distribución simétrica, es positiva cuando hay cola a la derecha (unos pocos valores altos, como en los tiempos de estancia o las cargas virales) y negativa cuando la cola está a la izquierda. G2 se mide en exceso sobre la normal: 0 es la normal, por encima hay colas más pesadas y un pico más agudo, por debajo la distribución es más plana. Se calculan con los estimadores G1 y G2 de Joanes y Gill (1998), los mismos que reportan SPSS y SAS; como cortes prácticos, |G1| por debajo de 0.5 se lee como aproximadamente simétrica.
La prueba de Shapiro-Wilk compara los datos ordenados con lo que cabría esperar de una normal: W cercana a 1 indica buen ajuste y el valor p es la probabilidad de ver un W tan bajo si la variable fuera normal. Tiene dos límites que conviene tener presentes. Con muestras pequeñas casi nunca rechaza, aunque la distribución esté lejos de ser normal; con muestras grandes rechaza por desviaciones mínimas que no cambian ninguna decisión clínica. Por eso el resultado se lee junto al histograma y no en lugar de él, y por eso la prueba no se calcula con menos de 3 ni con más de 5,000 valores.
Las cercas de Tukey marcan como atípico todo valor que quede a más de 1.5 veces el rango intercuartílico por debajo del primer cuartil o por encima del tercero. Es una regla de exploración, no un criterio de exclusión: un valor atípico puede ser un error de captura, una unidad equivocada o el paciente más interesante del estudio. El histograma usa la regla de Sturges (1926) para elegir el número de clases y el diagrama de caja dibuja esos valores como puntos sueltos, fuera de los bigotes.
Ecuaciones
- número de valores de la columna
- valor i-ésimo
- desviación estándar muestral (denominador n − 1)
- cuantil de la t de Student con n − 1 grados de libertad
- i-ésimo valor de la columna ordenada
- 0.25 (Q₁), 0.5 (mediana) o 0.75 (Q₃)
- momento central muestral de orden k
- coeficientes normalizados, derivados de los cuantiles esperados de la normal
- rango intercuartílico, Q₃ − Q₁
Código R
# Descriptive statistics for one pasted column - Bioestadistica abierta, UDG-CA-1190
# Runs as is in R, RStudio or webR; prints the results as JSON at the end.
library(jsonlite)
# The pasted column, one numeric value per row:
x <- c(47, 165, 97, 138, 202, 156, 166, 141, 96, 132, 177, 51, 150, 117, 210,
178, 208, 138, 171, 50, 162, 139, 134, 126, 160, 147, 196, 75, 166, 204,
226, 148, 99, 123, 160, 147, 153, 148, 79, 122)
nivel <- 0.95
n <- length(x)
media <- mean(x); de <- sd(x); eem <- de/sqrt(n) # sd() uses the n - 1 denominator
# t interval for the mean, written out because t.test() stops with constant data;
# otherwise identical to t.test(x, conf.level = nivel)$conf.int
tcrit <- qt(1 - (1 - nivel)/2, n - 1)
media_ic <- c(media, media - tcrit*eem, media + tcrit*eem)
q <- quantile(x, c(0.25, 0.5, 0.75), type = 7, names = FALSE) # type 7 = R's default (Hyndman & Fan 1996)
iqr <- q[3] - q[1]
cv <- de/media
# Sample skewness G1 and excess kurtosis G2 (Joanes & Gill 1998, "type 2": the SPSS/SAS pair)
m <- function(k) mean((x - media)^k)
g1 <- if (n >= 3 && m(2) > 0) m(3)/m(2)^1.5 * sqrt(n*(n - 1))/(n - 2) else NA_real_
g2 <- if (n >= 4 && m(2) > 0) ((n + 1)*(m(4)/m(2)^2 - 3) + 6)*(n - 1)/((n - 2)*(n - 3)) else NA_real_
media_geom <- if (all(x > 0)) exp(mean(log(x))) else NA_real_ # undefined with zero or negative values
# Shapiro-Wilk (Royston 1995, AS R94): needs 3 <= n <= 5000 and a non-zero range
sw <- if (n >= 3 && n <= 5000 && diff(range(x)) > 0) shapiro.test(x) else NULL
sw_w <- if (is.null(sw)) NA_real_ else unname(sw$statistic)
sw_p <- if (is.null(sw)) NA_real_ else sw$p.value
n_atipicos <- sum(x < q[1] - 1.5*iqr | x > q[3] + 1.5*iqr) # Tukey's fences
res <- list(n = n, media = media_ic, de = de, eem = eem,
mediana = q[2], q1 = q[1], q3 = q[3], iqr = iqr,
min = min(x), max = max(x), rango = diff(range(x)), cv = cv,
g1 = g1, g2 = g2, media_geom = media_geom,
sw_w = sw_w, sw_p = sw_p, n_atipicos = n_atipicos)
cat(toJSON(res, auto_unbox = TRUE, digits = NA))
# Equivalent in RStudio (not run in the browser):
# DescTools::Skew(x, method = 2); DescTools::Kurt(x, method = 2); e1071::skewness(x, type = 2)
Este es el mismo código que valida la calculadora: cópialo y ejecútalo en R o RStudio para reproducir el resultado.
La verificación con R dentro del navegador llegará en una próxima versión; mientras tanto, copia el código y ejecútalo en RStudio.
Métodos para manuscrito
Las variables continuas se resumieron como media (desviación estándar) o mediana (rango intercuartílico) según su distribución, evaluada con la prueba de Shapiro-Wilk [2,3] y la inspección gráfica del histograma y del diagrama de caja [1]; los cuartiles se calcularon con el tipo 7 de Hyndman y Fan [5], la asimetría y la curtosis con los estimadores G1 y G2 [6] y el intervalo de confianza al 95 % de la media con la distribución t de Student [8]. Se describieron 40 valores. Los cálculos se realizaron con la calculadora «Descriptivos de una variable» de Bioestadística abierta (Cuerpo Académico UDG-CA-1190, https://udgca1190.com.mx/herramientas/bioestadistica/descriptivos), verificada contra R (mean, sd, quantile con type = 7 y shapiro.test).
Párrafo listo para la sección de Métodos; los números entre corchetes remiten a la lista de referencias.
Referencias
- 01 Tukey JW. Exploratory Data Analysis. Reading, MA: Addison-Wesley; 1977. Fuente original
- 02 Shapiro SS, Wilk MB. An analysis of variance test for normality (complete samples). Biometrika. 1965;52(3-4):591–611. doi:10.1093/biomet/52.3-4.591 Fuente original
- 03 Royston P. Remark AS R94: a remark on algorithm AS 181: the W-test for normality. Journal of the Royal Statistical Society. Series C (Applied Statistics). 1995;44(4):547–551. doi:10.2307/2986146 Fuente original
- 04 Royston P. Approximating the Shapiro-Wilk W-test for non-normality. Statistics and Computing. 1992;2(3):117–119. doi:10.1007/BF01891203 Complementaria
- 05 Hyndman RJ, Fan Y. Sample quantiles in statistical packages. The American Statistician. 1996;50(4):361–365. doi:10.1080/00031305.1996.10473566 Fuente original
- 06 Joanes DN, Gill CA. Comparing measures of sample skewness and kurtosis. Journal of the Royal Statistical Society. Series D (The Statistician). 1998;47(1):183–189. doi:10.1111/1467-9884.00122 Fuente original
- 07 Sturges HA. The choice of a class interval. Journal of the American Statistical Association. 1926;21(153):65–66. doi:10.1080/01621459.1926.10502161 Fuente original
- 08 Student. The probable error of a mean. Biometrika. 1908;6(1):1–25. doi:10.1093/biomet/6.1.1 Complementaria
- 09 Altman DG. Practical Statistics for Medical Research. London: Chapman & Hall; 1991. Lectura didáctica