Tus datos
Pega una tabla directamente desde Excel o Google Sheets, o suelta un archivo CSV. No se sube nada: todo el cálculo ocurre dentro de esta pestaña del navegador.
CSV, TSV o texto plano. Los archivos guardados en windows-1251 se detectan y se releen automáticamente, así los encabezados no se convierten en caracteres raros.
Opciones de lectura
Columnas
Resultado
Guardar y compartir
La biblioteca de dibujo se descarga solo al pulsar el botón y solo en esta página.
Esta página no tiene parte de servidor en absoluto. La tabla que pegas la procesa JavaScript dentro de tu propio navegador, el gráfico se dibuja en un elemento canvas de tu máquina y el archivo de exportación se arma localmente. Nada se sube, se almacena ni se escribe en ningún registro. Puedes desconectar la red después de cargar la página y todo seguirá funcionando: es la forma más sencilla de comprobarlo tú mismo.
Datos y límites del método
| Prueba usada | Prueba t de Welch: no supone varianzas iguales |
|---|---|
| Por qué Welch | La versión clásica de Student exagera la significación cuando difieren tamaños o dispersiones |
| Grados de libertad | Aproximación de Welch–Satterthwaite, normalmente fraccionaria |
| Valor p | Exacto, de la distribución t mediante la beta incompleta regularizada |
| Tamaño del efecto | d de Cohen, con la desviación estándar combinada |
| Filas mínimas | 2 por grupo; con sentido a partir de unas 15 cada uno |
Cuándo induce a error
- Un valor p no es la probabilidad de que tu hipótesis sea cierta, ni la probabilidad de que el resultado sea casualidad. Es la probabilidad de observar una diferencia al menos así de grande si los dos grupos realmente tuvieran la misma media: una afirmación sutil pero decisivamente distinta.
- La significación estadística no es importancia práctica. Con suficientes filas, una diferencia de dos segundos en una tarea de cinco minutos se vuelve muy significativa y sigue siendo irrelevante. Por eso la d de Cohen se reporta junto a p: una d por debajo de 0,2 es un efecto insignificante por pequeño que sea el valor p.
- La prueba compara medias, así que es ciega a todo lo demás. Dos grupos con promedios idénticos y dispersiones completamente distintas dan un valor p cercano a 1 siendo procesos obviamente diferentes.
- Ejecutar la prueba tras espiar los datos, o repetirla en muchos pares hasta que algo salga significativo, invalida el valor p por completo. El umbral del 5 % supone exactamente una comparación planificada de antemano.
Cómo se calcula
El estadístico es la diferencia entre las dos medias dividida por el error estándar de esa diferencia. Cuanto mayor sea la diferencia y menor la variación interna, mayor será t y menos plausible que los grupos compartan media.
Se usa la versión de Welch en lugar de la prueba clásica de Student. La de Student supone que los dos grupos tienen varianzas iguales, y cuando no las tienen —el caso normal con datos reales de tamaños desiguales— produce valores p demasiado pequeños y declara significativas diferencias que no lo son.
Los grados de libertad salen de la ecuación de Welch–Satterthwaite y normalmente no son un número entero, lo cual es una característica y no un error: la corrección ajusta la forma de la distribución de referencia al desequilibrio entre grupos.
La d de Cohen divide la diferencia de medias por la desviación estándar combinada, dando una medida sin unidades de cuán separados están los grupos respecto a su dispersión interna. Por convención 0,2 es pequeño, 0,5 medio y 0,8 grande, y no cambia al recoger más datos, a diferencia del valor p, que se reduce indefinidamente.
Preguntas y respuestas
¿Qué significa realmente p < 0,05?
Que una diferencia al menos así de grande ocurriría menos del 5 % de las veces si los dos grupos tuvieran de verdad la misma media. Es una afirmación sobre los datos bajo un supuesto, no sobre la probabilidad de que tu conclusión sea correcta.
¿Por qué Welch en vez de la prueba t estándar?
Porque Welch no supone varianzas iguales y casi no pierde nada cuando resultan serlo. La práctica estadística moderna la recomienda por defecto, y es la que ejecuta esta página.
Mi p es significativo pero la diferencia parece mínima.
Mira la d de Cohen. Una d de 0,1 con un p significativo significa que tienes muchos datos y una diferencia demasiado pequeña para actuar. Significación e importancia son preguntas separadas.
¿Mis dos columnas están emparejadas?
Esta es la prueba no emparejada, que trata las columnas como grupos independientes. Si cada fila es el mismo sujeto medido dos veces —antes y después— la prueba correcta es la emparejada, y esta página subestimará el efecto.
¿Se suben mis datos?
No. El estadístico, los grados de libertad y el valor p se calculan en local.