← Índice de Bioestadística abierta
Cálculo instantáneo en el navegador · verificable con R Activa

Entradas

40 valores leídos

Copia la columna en tu hoja de cálculo (Excel, Google Sheets, Numbers) y pégala aquí: un valor por renglón. También se admiten valores separados por tabuladores, comas o punto y coma, y se reconoce la coma decimal. El encabezado y los textos que no son números se descartan con aviso.

Ejemplo cargado

Ejemplo ilustrativo: recuento de plaquetas (×10³/µL) de 40 pacientes febriles, simulado en R con set.seed(1190) y round(rnorm(40, 150, 45)) (datos ficticios, no reales).

Datos ilustrativos, no reales.

Resultados

Valores (n)

40

Media

142.6

128.6 a 156.6

IC 95 % · distribución t

Desviación estándar (DE)

43.87

Error estándar de la media (EEM)

6.936

Mediana

147.5

cuantil tipo 7

Primer cuartil (Q₁)

122.8

cuantil tipo 7

Tercer cuartil (Q₃)

166

cuantil tipo 7

Rango intercuartílico (IQR)

43.25

cuantil tipo 7

Mínimo

47

Máximo

226

Rango

179

Coeficiente de variación (CV)

30.8 %

Asimetría (G1)

-0.45

Joanes y Gill, tipo 2

Curtosis (G2)

0.03

Joanes y Gill, tipo 2

Media geométrica

134.3

Shapiro-Wilk (W)

0.962

AS R94 (Royston 1995)

Shapiro-Wilk (p)

0.196

AS R94 (Royston 1995)

Valores atípicos (Tukey)

3

cercas de 1.5 × IQR

Interpretación

Se describieron 40 valores: media 142.6 (DE 43.87; IC 95 % de la media 128.6 a 156.6), mediana 147.5 (IQR 122.8 a 166), rango 47 a 226. El error estándar de la media es 6.936. El coeficiente de variación es 30.8 %: la desviación estándar como fracción de la media.

Asimetría G1 = -0.45: la distribución es aproximadamente simétrica; curtosis G2 = 0.03, donde 0 corresponde a la normal, los valores positivos a colas más pesadas y los negativos a una forma más plana.

Shapiro-Wilk: W = 0.962, p = 0.196: no hay evidencia contra la normalidad en estos 40 valores. La prueba no demuestra que la variable sea normal, solo que estos datos no bastan para descartarlo; con n grande, p pequeños no implican desviaciones relevantes.

Para el manuscrito: reporte media (DE) cuando la distribución sea aproximadamente simétrica y sin atípicos, es decir 142.6 (43.87); reporte mediana (IQR) cuando no lo sea, es decir 147.5 (122.8 a 166). Media geométrica, útil cuando la variable es multiplicativa (títulos, cargas virales, diluciones): 134.3.

3 valores quedan fuera de las cercas de Tukey (por debajo de 57.88 o por encima de 230.9, es decir a más de 1.5 veces el IQR de la caja). Un valor atípico no es un error por sí mismo: compruebe la captura y las unidades antes de excluirlo, y si lo excluye, dígalo.

  • 3 valores quedan fuera de las cercas de Tukey (a más de 1.5 veces el IQR por debajo de Q₁ o por encima de Q₃). Compruebe si son errores de captura o de unidades antes de excluirlos.
Histograma con la curva normal superpuesta y diagrama de caja de la misma columnaValores (n): 40; Media: 142.6; Desviación estándar (DE): 43.87; Mediana: 147.5 (122.8 a 166); Rango: 47 a 226; Valores atípicos (Tukey): 3Curva normal ajustadaFrecuencia051050100150200250Valor de la variableMedia
Histograma con la curva normal superpuesta y diagrama de caja de la misma columna

Explicación

Antes de comparar nada hay que describir. La pregunta práctica es qué par de números resume mejor a la variable: la media con su desviación estándar, que solo se lee bien cuando la distribución es aproximadamente simétrica, o la mediana con el rango intercuartílico, que aguanta las colas largas y los valores extremos. Esta calculadora da los dos y añade el intervalo de confianza de la media, que es lo que responde «¿dónde está la media de la población?» y no debe confundirse con la desviación estándar, que describe la dispersión de los individuos.

La asimetría G1 y la curtosis G2 ponen número a la forma. G1 vale 0 en una distribución simétrica, es positiva cuando hay cola a la derecha (unos pocos valores altos, como en los tiempos de estancia o las cargas virales) y negativa cuando la cola está a la izquierda. G2 se mide en exceso sobre la normal: 0 es la normal, por encima hay colas más pesadas y un pico más agudo, por debajo la distribución es más plana. Se calculan con los estimadores G1 y G2 de Joanes y Gill (1998), los mismos que reportan SPSS y SAS; como cortes prácticos, |G1| por debajo de 0.5 se lee como aproximadamente simétrica.

La prueba de Shapiro-Wilk compara los datos ordenados con lo que cabría esperar de una normal: W cercana a 1 indica buen ajuste y el valor p es la probabilidad de ver un W tan bajo si la variable fuera normal. Tiene dos límites que conviene tener presentes. Con muestras pequeñas casi nunca rechaza, aunque la distribución esté lejos de ser normal; con muestras grandes rechaza por desviaciones mínimas que no cambian ninguna decisión clínica. Por eso el resultado se lee junto al histograma y no en lugar de él, y por eso la prueba no se calcula con menos de 3 ni con más de 5,000 valores.

Las cercas de Tukey marcan como atípico todo valor que quede a más de 1.5 veces el rango intercuartílico por debajo del primer cuartil o por encima del tercero. Es una regla de exploración, no un criterio de exclusión: un valor atípico puede ser un error de captura, una unidad equivocada o el paciente más interesante del estudio. El histograma usa la regla de Sturges (1926) para elegir el número de clases y el diagrama de caja dibuja esos valores como puntos sueltos, fuera de los bigotes.

Ecuaciones

xˉ=1n∑i=1nxi,s=∑i=1n(xi−xˉ)2n−1,SE⁡(xˉ)=sn\bar x=\frac{1}{n}\sum_{i=1}^{n}x_i,\qquad s=\sqrt{\frac{\sum_{i=1}^{n}(x_i-\bar x)^2}{n-1}},\qquad \se(\bar x)=\frac{s}{\sqrt{n}}
nn
número de valores de la columna
xix_i
valor i-ésimo
ss
desviación estándar muestral (denominador n − 1)
La desviación estándar describe a los individuos; el error estándar de la media describe la precisión con que se estimó la media.
IC1−α(xˉ)=xˉ±t1−α/2,  n−1⋅sn\IC_{1-\alpha}(\bar x)=\bar x\pm t_{1-\alpha/2,\;n-1}\cdot\frac{s}{\sqrt{n}}
t1−α/2,  n−1t_{1-\alpha/2,\;n-1}
cuantil de la t de Student con n − 1 grados de libertad
Intervalo de confianza de la media (Student 1908); es el que devuelve t.test() en R.
Q(p)=x(⌊h⌋)+(h−⌊h⌋)(x(⌈h⌉)−x(⌊h⌋)),h=1+(n−1) pQ(p)=x_{(\lfloor h\rfloor)}+\left(h-\lfloor h\rfloor\right)\left(x_{(\lceil h\rceil)}-x_{(\lfloor h\rfloor)}\right),\qquad h=1+(n-1)\,p
x(i)x_{(i)}
i-ésimo valor de la columna ordenada
pp
0.25 (Q₁), 0.5 (mediana) o 0.75 (Q₃)
Cuantil del tipo 7 de Hyndman y Fan (1996), el que usa R por omisión.
G1=m3m23/2⋅n(n−1)n−2,G2=n−1(n−2)(n−3)[(n+1)(m4m22−3)+6],mk=1n∑i=1n(xi−xˉ)kG_1=\frac{m_3}{m_2^{3/2}}\cdot\frac{\sqrt{n(n-1)}}{n-2},\qquad G_2=\frac{n-1}{(n-2)(n-3)}\left[(n+1)\left(\frac{m_4}{m_2^{2}}-3\right)+6\right],\qquad m_k=\frac{1}{n}\sum_{i=1}^{n}(x_i-\bar x)^k
mkm_k
momento central muestral de orden k
Estimadores G1 y G2 de Joanes y Gill (1998), «tipo 2»: los de SPSS y SAS. G1 necesita n ≥ 3 y G2, n ≥ 4.
W=(∑i=1nai x(i))2∑i=1n(xi−xˉ)2W=\frac{\left(\sum_{i=1}^{n}a_i\,x_{(i)}\right)^{2}}{\sum_{i=1}^{n}(x_i-\bar x)^{2}}
aia_i
coeficientes normalizados, derivados de los cuantiles esperados de la normal
Estadístico de Shapiro y Wilk (1965) con los coeficientes y el valor p del algoritmo AS R94 de Royston (1995), el que ejecuta shapiro.test en R.
IQR=Q3−Q1,[ Q1−1.5⋅IQR,    Q3+1.5⋅IQR ]\mathrm{IQR}=Q_3-Q_1,\qquad \left[\,Q_1-1.5\cdot \mathrm{IQR},\;\; Q_3+1.5\cdot \mathrm{IQR}\,\right]
IQR\mathrm{IQR}
rango intercuartílico, Q₃ − Q₁
Cercas de Tukey (1977): se marca como atípico todo valor fuera de ese intervalo.

Código R

# Descriptive statistics for one pasted column - Bioestadistica abierta, UDG-CA-1190
# Runs as is in R, RStudio or webR; prints the results as JSON at the end.
library(jsonlite)

# The pasted column, one numeric value per row:
x <- c(47, 165, 97, 138, 202, 156, 166, 141, 96, 132, 177, 51, 150, 117, 210,
  178, 208, 138, 171, 50, 162, 139, 134, 126, 160, 147, 196, 75, 166, 204,
  226, 148, 99, 123, 160, 147, 153, 148, 79, 122)
nivel <- 0.95
n <- length(x)

media <- mean(x); de <- sd(x); eem <- de/sqrt(n)   # sd() uses the n - 1 denominator

# t interval for the mean, written out because t.test() stops with constant data;
# otherwise identical to t.test(x, conf.level = nivel)$conf.int
tcrit <- qt(1 - (1 - nivel)/2, n - 1)
media_ic <- c(media, media - tcrit*eem, media + tcrit*eem)

q <- quantile(x, c(0.25, 0.5, 0.75), type = 7, names = FALSE)   # type 7 = R's default (Hyndman & Fan 1996)
iqr <- q[3] - q[1]
cv <- de/media

# Sample skewness G1 and excess kurtosis G2 (Joanes & Gill 1998, "type 2": the SPSS/SAS pair)
m <- function(k) mean((x - media)^k)
g1 <- if (n >= 3 && m(2) > 0) m(3)/m(2)^1.5 * sqrt(n*(n - 1))/(n - 2) else NA_real_
g2 <- if (n >= 4 && m(2) > 0) ((n + 1)*(m(4)/m(2)^2 - 3) + 6)*(n - 1)/((n - 2)*(n - 3)) else NA_real_

media_geom <- if (all(x > 0)) exp(mean(log(x))) else NA_real_   # undefined with zero or negative values

# Shapiro-Wilk (Royston 1995, AS R94): needs 3 <= n <= 5000 and a non-zero range
sw <- if (n >= 3 && n <= 5000 && diff(range(x)) > 0) shapiro.test(x) else NULL
sw_w <- if (is.null(sw)) NA_real_ else unname(sw$statistic)
sw_p <- if (is.null(sw)) NA_real_ else sw$p.value

n_atipicos <- sum(x < q[1] - 1.5*iqr | x > q[3] + 1.5*iqr)   # Tukey's fences

res <- list(n = n, media = media_ic, de = de, eem = eem,
            mediana = q[2], q1 = q[1], q3 = q[3], iqr = iqr,
            min = min(x), max = max(x), rango = diff(range(x)), cv = cv,
            g1 = g1, g2 = g2, media_geom = media_geom,
            sw_w = sw_w, sw_p = sw_p, n_atipicos = n_atipicos)
cat(toJSON(res, auto_unbox = TRUE, digits = NA))

# Equivalent in RStudio (not run in the browser):
# DescTools::Skew(x, method = 2); DescTools::Kurt(x, method = 2); e1071::skewness(x, type = 2)

Este es el mismo código que valida la calculadora: cópialo y ejecútalo en R o RStudio para reproducir el resultado.

La verificación con R dentro del navegador llegará en una próxima versión; mientras tanto, copia el código y ejecútalo en RStudio.

Métodos para manuscrito

Las variables continuas se resumieron como media (desviación estándar) o mediana (rango intercuartílico) según su distribución, evaluada con la prueba de Shapiro-Wilk [2,3] y la inspección gráfica del histograma y del diagrama de caja [1]; los cuartiles se calcularon con el tipo 7 de Hyndman y Fan [5], la asimetría y la curtosis con los estimadores G1 y G2 [6] y el intervalo de confianza al 95 % de la media con la distribución t de Student [8]. Se describieron 40 valores. Los cálculos se realizaron con la calculadora «Descriptivos de una variable» de Bioestadística abierta (Cuerpo Académico UDG-CA-1190, https://udgca1190.com.mx/herramientas/bioestadistica/descriptivos), verificada contra R (mean, sd, quantile con type = 7 y shapiro.test).

Párrafo listo para la sección de Métodos; los números entre corchetes remiten a la lista de referencias.

Referencias

  1. 01 Tukey JW. Exploratory Data Analysis. Reading, MA: Addison-Wesley; 1977. Fuente original
  2. 02 Shapiro SS, Wilk MB. An analysis of variance test for normality (complete samples). Biometrika. 1965;52(3-4):591–611. doi:10.1093/biomet/52.3-4.591 Fuente original
  3. 03 Royston P. Remark AS R94: a remark on algorithm AS 181: the W-test for normality. Journal of the Royal Statistical Society. Series C (Applied Statistics). 1995;44(4):547–551. doi:10.2307/2986146 Fuente original
  4. 04 Royston P. Approximating the Shapiro-Wilk W-test for non-normality. Statistics and Computing. 1992;2(3):117–119. doi:10.1007/BF01891203 Complementaria
  5. 05 Hyndman RJ, Fan Y. Sample quantiles in statistical packages. The American Statistician. 1996;50(4):361–365. doi:10.1080/00031305.1996.10473566 Fuente original
  6. 06 Joanes DN, Gill CA. Comparing measures of sample skewness and kurtosis. Journal of the Royal Statistical Society. Series D (The Statistician). 1998;47(1):183–189. doi:10.1111/1467-9884.00122 Fuente original
  7. 07 Sturges HA. The choice of a class interval. Journal of the American Statistical Association. 1926;21(153):65–66. doi:10.1080/01621459.1926.10502161 Fuente original
  8. 08 Student. The probable error of a mean. Biometrika. 1908;6(1):1–25. doi:10.1093/biomet/6.1.1 Complementaria
  9. 09 Altman DG. Practical Statistics for Medical Research. London: Chapman & Hall; 1991. Lectura didáctica