← Índice de Bioestadística abierta
Cálculo instantáneo en el navegador · verificable con R Activa

Entradas

Resultado de la prueba Estándar de referencia Total
Enfermo Sano
Positivo 74
Negativo 126
Total 80 120 200
  1. Verdaderos positivos (VP)
  2. Falsos positivos (FP)
  3. Falsos negativos (FN)
  4. Verdaderos negativos (VN)

Wilson es el método recomendado (Newcombe 1998). Wald solo con fines didácticos.

Úsala cuando una celda vale 0: suma 0.5 a las cuatro celdas antes de calcular LR+, LR− y DOR (no afecta a Sn, Sp ni a los valores predictivos).

Ejemplo cargado

Ejemplo ilustrativo: prueba rápida de antígeno NS1 frente a RT-PCR para dengue en 200 pacientes febriles: 68 verdaderos positivos, 6 falsos positivos, 12 falsos negativos y 114 verdaderos negativos (datos ficticios).

Datos ilustrativos, no reales.

Resultados

Total de participantes (n)

200

Sensibilidad (Sn)

85.0 %

75.6 % a 91.2 %

IC 95 % · Wilson (score)

Especificidad (Sp)

95.0 %

89.5 % a 97.7 %

IC 95 % · Wilson (score)

Valor predictivo positivo (VPP)

91.9 %

83.4 % a 96.2 %

IC 95 % · Wilson (score)

Valor predictivo negativo (VPN)

90.5 %

84.1 % a 94.5 %

IC 95 % · Wilson (score)

Prevalencia en la muestra

40.0 %

33.5 % a 46.9 %

IC 95 % · Wilson (score)

Exactitud

91.0 %

86.2 % a 94.2 %

IC 95 % · Wilson (score)

Índice de Youden (J)

0.80

0.71 a 0.89

IC 95 % · método delta

LR+

17.00

7.75 a 37.28

IC 95 % · método logarítmico de Simel

LR−

0.16

0.0936 a 0.27

IC 95 % · método logarítmico de Simel

Razón de momios diagnóstica (DOR)

107.67

38.63 a 300.07

IC 95 % · método logarítmico de Woolf

Interpretación

De 200 participantes, 68 + 12 tenían la enfermedad y 6 + 114 no la tenían (prevalencia en la muestra: 40.0 %). La prueba detecta al 85.0 % de las personas con la enfermedad (sensibilidad; IC 95 %: 75.6 % a 91.2 %) y descarta correctamente al 95.0 % de las que no la tienen (especificidad; IC 95 %: 89.5 % a 97.7 %). Exactitud global: 91.0 % (IC 95 %: 86.2 % a 94.2 %).

LR+ = 17.00 (IC 95 %: 7.75 a 37.28): un resultado positivo multiplica los momios preprueba por 17.00, un cambio grande y a menudo concluyente de la probabilidad de enfermedad (Jaeschke 1994).

LR− = 0.16 (IC 95 %: 0.0936 a 0.27): un resultado negativo reduce de forma moderada la probabilidad de enfermedad (Jaeschke 1994).

En esta muestra, 91.9 % de los positivos tenían la enfermedad (VPP; IC 95 %: 83.4 % a 96.2 %) y 90.5 % de los negativos no la tenían (VPN; IC 95 %: 84.1 % a 94.5 %). Ambas cifras dependen de la prevalencia (40.0 %) y no se trasladan a otra población; en un diseño de casos y controles no son válidas. Para otra prevalencia usa la calculadora «Valores predictivos».

DOR = 107.67 (IC 95 %: 38.63 a 300.07): los momios de un resultado positivo son 107.67 veces mayores en las personas con la enfermedad que en las que no la tienen. Índice de Youden J = 0.80 (IC 95 %: 0.71 a 0.89); J = 1 sería una prueba perfecta y J = 0, una prueba sin valor.

Estimaciones con su intervalo de confianza: proporciones (arriba) y razones en escala logarítmica (abajo)Sensibilidad (Sn): 85.0 % (75.6 % a 91.2 %); Especificidad (Sp): 95.0 % (89.5 % a 97.7 %); LR+: 17.00; LR−: 0.16Sensibilidad (Sn)Especificidad (Sp)Valor predictivo positivo(VPP)Valor predictivo negativo(VPN)Exactitud0 %20 %40 %60 %80 %100 %Razones (escala logarítmica; referencia en 1)LR+LR−Razón de momiosdiagnóstica (DOR)0.010.11101001,000
Estimaciones con su intervalo de confianza: proporciones (arriba) y razones en escala logarítmica (abajo)

Explicación

Una prueba diagnóstica se evalúa comparándola con un estándar de referencia en la misma población. La tabla 2×2 cruza el resultado de la prueba (positivo o negativo) con el estado real (enfermo o sano): verdaderos positivos (VP), falsos positivos (FP), falsos negativos (FN) y verdaderos negativos (VN).

La sensibilidad es la proporción de enfermos con prueba positiva y la especificidad, la de sanos con prueba negativa (Yerushalmy 1947). Ambas describen la prueba y no dependen de la prevalencia. Los valores predictivos responden a la pregunta clínica (¿qué probabilidad hay de estar enfermo con un resultado positivo?), pero cambian con la prevalencia (Vecchio 1966): los que se muestran aquí valen para la prevalencia de esta muestra.

Las razones de verosimilitud (LR+ y LR−) resumen ambas propiedades en un solo número por resultado y son las que se trasladan a la probabilidad posprueba con el teorema de Bayes (nomograma de Fagan). La razón de momios diagnóstica (DOR) condensa la capacidad discriminativa global en una sola cifra, útil para comparar pruebas, no para decidir sobre un paciente.

Cada proporción lleva el intervalo de confianza del método elegido (Wilson por defecto, el recomendado por Newcombe 1998); las razones llevan el intervalo logarítmico de Simel (1991) y de Woolf (1955). Cuando una celda vale 0, una razón queda en 0 o en infinito y sin intervalo; la corrección de Haldane-Anscombe (sumar 0.5 a cada celda) devuelve una estimación finita y debe reportarse.

Ecuaciones

Sn=aa+c,Sp=db+d,VPP=aa+b,VPN=dc+d,Exactitud=a+dn\mathrm{Sn}=\frac{a}{a+c},\qquad \mathrm{Sp}=\frac{d}{b+d},\qquad \mathrm{VPP}=\frac{a}{a+b},\qquad \mathrm{VPN}=\frac{d}{c+d},\qquad \mathrm{Exactitud}=\frac{a+d}{n}
aa
verdaderos positivos (VP)
bb
falsos positivos (FP)
cc
falsos negativos (FN)
dd
verdaderos negativos (VN)
nn
total, a + b + c + d
Sensibilidad y especificidad (Yerushalmy 1947); valores predictivos con la prevalencia de la muestra, (a + c)/n.
LR+=Sn1−Sp,LR−=1−SnSp,DOR=adbc=LR+LR−\mathrm{LR}^{+}=\frac{\mathrm{Sn}}{1-\mathrm{Sp}},\qquad \mathrm{LR}^{-}=\frac{1-\mathrm{Sn}}{\mathrm{Sp}},\qquad \mathrm{DOR}=\frac{ad}{bc}=\frac{\mathrm{LR}^{+}}{\mathrm{LR}^{-}}
Razones de verosimilitud y razón de momios diagnóstica (Glas 2003).
IC(LR+)=exp⁡ ⁣[ln⁡LR+±z1−α/21a−1a+c+1b−1b+d],IC(LR−)=exp⁡ ⁣[ln⁡LR−±z1c−1a+c+1d−1b+d]\mathrm{IC}(\mathrm{LR}^{+})=\exp\!\left[\ln \mathrm{LR}^{+}\pm z_{1-\alpha/2}\sqrt{\frac{1}{a}-\frac{1}{a+c}+\frac{1}{b}-\frac{1}{b+d}}\right],\qquad \mathrm{IC}(\mathrm{LR}^{-})=\exp\!\left[\ln \mathrm{LR}^{-}\pm z\sqrt{\frac{1}{c}-\frac{1}{a+c}+\frac{1}{d}-\frac{1}{b+d}}\right]
z1−α/2z_{1-\alpha/2}
cuantil normal del nivel de confianza (1.96 al 95 %)
Intervalos logarítmicos de Simel, Samsa y Matchar (1991). Con la corrección de Haldane-Anscombe, a, b, c y d llevan 0.5 sumado.
IC(DOR)=exp⁡ ⁣[ln⁡DOR±z1a+1b+1c+1d]\mathrm{IC}(\mathrm{DOR})=\exp\!\left[\ln \mathrm{DOR}\pm z\sqrt{\frac{1}{a}+\frac{1}{b}+\frac{1}{c}+\frac{1}{d}}\right]
Intervalo logarítmico de Woolf (1955).
J=Sn+Sp−1,IC(J)=J±zSn (1−Sn)a+c+Sp (1−Sp)b+dJ=\mathrm{Sn}+\mathrm{Sp}-1,\qquad \mathrm{IC}(J)=J\pm z\sqrt{\frac{\mathrm{Sn}\,(1-\mathrm{Sn})}{a+c}+\frac{\mathrm{Sp}\,(1-\mathrm{Sp})}{b+d}}
Índice de Youden (1950) con intervalo de Wald por el método delta.
p^+z22m±zp^ (1−p^)m+z24m21+z2m\frac{\hat p+\frac{z^2}{2m}\pm z\sqrt{\frac{\hat p\,(1-\hat p)}{m}+\frac{z^2}{4m^2}}}{1+\frac{z^2}{m}}
p^\hat p
proporción observada, x/m
mm
denominador de la proporción (a + c, b + d, a + b, c + d o n)
Intervalo de Wilson (1927), el método por defecto para cada proporción; el selector ofrece Clopper-Pearson, Agresti-Coull, Jeffreys y Wald (ver la calculadora «IC de una proporción»).

Código R

# Diagnostic test accuracy from a 2x2 table - Bioestadistica abierta, UDG-CA-1190
# Runs as is in R, RStudio or webR; prints the results as JSON at the end.
library(binom)      # CIs for proportions: "wilson" (default), "exact" (Clopper-Pearson), "agresti-coull", "asymptotic" (Wald)
library(jsonlite)

vp <- 68; fp <- 6; fn <- 12; vn <- 114   # rows = test result (+, -), columns = reference standard (diseased, not diseased)
nivel  <- 0.95
metodo <- "wilson"   # CI method for proportions: "wilson", "clopper-pearson", "agresti-coull", "jeffreys" or "wald"
corr   <- 0     # 0.5 = Haldane-Anscombe correction for the ratios (LR, DOR) when a cell is 0; 0 = none
n <- vp + fp + fn + vn
z <- qnorm(1 - (1 - nivel) / 2)

# Proportion with CI -> c(estimate, lower, upper); Jeffreys is the equal-tailed interval (Brown, Cai & DasGupta 2001)
ic_prop <- function(x, m) {
  if (metodo == "jeffreys") {
    lo <- if (x == 0) 0 else qbeta((1 - nivel) / 2, x + 0.5, m - x + 0.5)
    hi <- if (x == m) 1 else qbeta(1 - (1 - nivel) / 2, x + 0.5, m - x + 0.5)
    return(c(x / m, lo, hi))
  }
  m_binom <- switch(metodo, wilson = "wilson", "clopper-pearson" = "exact", "agresti-coull" = "agresti-coull", wald = "asymptotic")
  ci <- binom.confint(x, m, conf.level = nivel, methods = m_binom)
  c(x / m, ci$lower, ci$upper)
}
sn   <- ic_prop(vp, vp + fn)    # sensitivity
sp   <- ic_prop(vn, vn + fp)    # specificity
vpp  <- ic_prop(vp, vp + fp)    # positive predictive value (at this sample's prevalence)
vpn  <- ic_prop(vn, vn + fn)    # negative predictive value
prev <- ic_prop(vp + fn, n)     # prevalence in the sample
exactitud <- ic_prop(vp + vn, n)   # accuracy

# Youden's J = Sn + Sp - 1 with a delta-method (Wald) CI
j    <- sn[1] + sp[1] - 1
j_ee <- sqrt(sn[1] * (1 - sn[1]) / (vp + fn) + sp[1] * (1 - sp[1]) / (vn + fp))
youden <- c(j, j - z * j_ee, j + z * j_ee)

# Ratios with the log-method CI: exp(log(est) -/+ z * SE); undefined (NA) when a cell of the (corrected) table is 0
a <- vp + corr; b <- fp + corr; c <- fn + corr; d <- vn + corr
ic_log <- function(est, ee) {
  if (is.finite(log(est)) && is.finite(ee)) c(est, exp(log(est) - z * ee), exp(log(est) + z * ee)) else c(est, NA, NA)
}
ee_lr <- function(x1, n1, x2, n2) sqrt((1 - x1 / n1) / x1 + (1 - x2 / n2) / x2)   # Simel, Samsa & Matchar 1991
lr_pos <- ic_log(a / (a + c) / (b / (b + d)), ee_lr(a, a + c, b, b + d))
lr_neg <- ic_log(c / (a + c) / (d / (b + d)), ee_lr(c, a + c, d, b + d))
dor    <- ic_log((a * d) / (b * c), sqrt(1 / a + 1 / b + 1 / c + 1 / d))         # Woolf 1955

res <- list(n = n, sn = sn, sp = sp, vpp = vpp, vpn = vpn, prev = prev, exactitud = exactitud,
            youden = youden, lr_pos = lr_pos, lr_neg = lr_neg, dor = dor)
cat(toJSON(res, auto_unbox = TRUE, digits = NA))

# Equivalent in RStudio (not run in the browser):
# epiR::epi.tests(as.table(matrix(c(vp, fp, fn, vn), nrow = 2, byrow = TRUE)), method = "wilson", conf.level = nivel)

Este es el mismo código que valida la calculadora: cópialo y ejecútalo en R o RStudio para reproducir el resultado.

La verificación con R dentro del navegador llegará en una próxima versión; mientras tanto, copia el código y ejecútalo en RStudio.

Métodos para manuscrito

Se calcularon la sensibilidad, la especificidad, los valores predictivos, la exactitud, el índice de Youden, las razones de verosimilitud (LR+ y LR−) y la razón de momios diagnóstica (DOR) a partir de la tabla 2×2 frente al estándar de referencia [1,2]. Los intervalos de confianza al 95 % de las proporciones se obtuvieron con el método de Wilson (score) [6,7]; los de las razones de verosimilitud, con el método logarítmico de Simel et al. [3]; el de la DOR, con el método de Woolf [4,5], y el del índice de Youden, por el método delta. Los cálculos se realizaron con la calculadora «Prueba diagnóstica (tabla 2×2)» de Bioestadística abierta (Cuerpo Académico UDG-CA-1190, https://udgca1190.com.mx/herramientas/bioestadistica/prueba-diagnostica-2x2), verificada contra R (paquete binom).

Párrafo listo para la sección de Métodos; los números entre corchetes remiten a la lista de referencias.

Referencias

  1. 01 Yerushalmy J. Statistical problems in assessing methods of medical diagnosis, with special reference to X-ray techniques. Public Health Reports. 1947;62(40):1432–1449. doi:10.2307/4586294 PMID: 20340527 Fuente original
  2. 02 Youden WJ. Index for rating diagnostic tests. Cancer. 1950;3(1):32–35. doi:10.1002/1097-0142(1950)3:1<32::AID-CNCR2820030106>3.0.CO;2-3 PMID: 15405679 Fuente original
  3. 03 Simel DL, Samsa GP, Matchar DB. Likelihood ratios with confidence: sample size estimation for diagnostic test studies. Journal of Clinical Epidemiology. 1991;44(8):763–770. doi:10.1016/0895-4356(91)90128-V PMID: 1941027 Fuente original
  4. 04 Woolf B. On estimating the relation between blood group and disease. Annals of Human Genetics. 1955;19(4):251–253. doi:10.1111/j.1469-1809.1955.tb01348.x PMID: 14388528 Fuente original
  5. 05 Glas AS, Lijmer JG, Prins MH, Bonsel GJ, Bossuyt PMM. The diagnostic odds ratio: a single indicator of test performance. Journal of Clinical Epidemiology. 2003;56(11):1129–1135. doi:10.1016/S0895-4356(03)00177-X PMID: 14615004 Complementaria
  6. 06 Wilson EB. Probable inference, the law of succession, and statistical inference. Journal of the American Statistical Association. 1927;22(158):209–212. doi:10.1080/01621459.1927.10502953 Fuente original
  7. 07 Newcombe RG. Two-sided confidence intervals for the single proportion: comparison of seven methods. Statistics in Medicine. 1998;17(8):857–872. doi:10.1002/(SICI)1097-0258(19980430)17:8<857::AID-SIM777>3.0.CO;2-E PMID: 9595616 Fuente original
  8. 08 Clopper CJ, Pearson ES. The use of confidence or fiducial limits illustrated in the case of the binomial. Biometrika. 1934;26(4):404–413. doi:10.1093/biomet/26.4.404 Complementaria
  9. 09 Agresti A, Coull BA. Approximate is better than “exact” for interval estimation of binomial proportions. The American Statistician. 1998;52(2):119–126. doi:10.1080/00031305.1998.10480550 Complementaria
  10. 10 Brown LD, Cai TT, DasGupta A. Interval estimation for a binomial proportion. Statistical Science. 2001;16(2):101–133. doi:10.1214/ss/1009213286 Complementaria
  11. 11 Altman DG, Machin D, Bryant TN, Gardner MJ. Statistics with Confidence: Confidence Intervals and Statistical Guidelines. 2.ª ed. London: BMJ Books; 2000. Complementaria
  12. 12 Haldane JBS. The estimation and significance of the logarithm of a ratio of frequencies. Annals of Human Genetics. 1956;20(4):309–311. doi:10.1111/j.1469-1809.1955.tb01285.x PMID: 13314400 Fuente original
  13. 13 Anscombe FJ. On estimating binomial response relations. Biometrika. 1956;43(3-4):461–464. doi:10.1093/biomet/43.3-4.461 Fuente original
  14. 14 Jaeschke R, Guyatt GH, Sackett DL. Users' guides to the medical literature. III. How to use an article about a diagnostic test. B. What are the results and will they help me in caring for my patients? JAMA. 1994;271(9):703–707. doi:10.1001/jama.271.9.703 PMID: 8309035 Lectura didáctica
  15. 15 Altman DG, Bland JM. Diagnostic tests 1: sensitivity and specificity. BMJ. 1994;308(6943):1552. doi:10.1136/bmj.308.6943.1552 PMID: 8019315 Lectura didáctica
  16. 16 Vecchio TJ. Predictive value of a single diagnostic test in unselected populations. New England Journal of Medicine. 1966;274(21):1171–1173. doi:10.1056/NEJM196605262742104 PMID: 5934954 Lectura didáctica
  17. 17 Deeks JJ, Altman DG. Diagnostic tests 4: likelihood ratios. BMJ. 2004;329(7458):168–169. doi:10.1136/bmj.329.7458.168 PMID: 15258077 Lectura didáctica