Tus datos
Pega una tabla directamente desde Excel o Google Sheets, o suelta un archivo CSV. No se sube nada: todo el cálculo ocurre dentro de esta pestaña del navegador.
CSV, TSV o texto plano. Los archivos guardados en windows-1251 se detectan y se releen automáticamente, así los encabezados no se convierten en caracteres raros.
Opciones de lectura
Resultado
Guardar y compartir
La biblioteca de dibujo se descarga solo al pulsar el botón y solo en esta página.
Esta página no tiene parte de servidor en absoluto. La tabla que pegas la procesa JavaScript dentro de tu propio navegador, el gráfico se dibuja en un elemento canvas de tu máquina y el archivo de exportación se arma localmente. Nada se sube, se almacena ni se escribe en ningún registro. Puedes desconectar la red después de cargar la página y todo seguirá funcionando: es la forma más sencilla de comprobarlo tú mismo.
Datos y límites del método
| Funciona con | Texto y números por igual: los valores se comparan tal como están escritos |
|---|---|
| Orden | Por frecuencia, el más común primero |
| Columnas devueltas | Valor, recuento, proporción del total, proporción acumulada |
| Celdas vacías | Se cuentan como categoría propia en vez de descartarse |
| Límite de visualización | Se muestran las 60 primeras filas; la exportación incluye todos los valores |
| Gráfico | Barras de los 20 valores más frecuentes |
Cuándo induce a error
- Los valores se comparan exactamente como están escritos, así que «Madrid» y «madrid » son dos categorías distintas. Es deliberado —fusionarlas en silencio ocultaría un problema de calidad de datos— pero implica que una columna sucia produce una tabla sucia hasta que se limpia.
- Una tabla de frecuencias es la herramienta equivocada para mediciones continuas. Los tiempos de respuesta o los precios rara vez se repiten, así que casi cada fila se convierte en su propia categoría con recuento uno; agrúpalos en intervalos con el histograma.
- La proporción acumulada depende por completo del orden, y aquí ese orden es la frecuencia. Responde a «cuánto cubren los valores más comunes» y no a «cuánto cubren los primeros alfabéticamente», que sería otra pregunta y normalmente sin sentido.
- Las columnas de alta cardinalidad desbordan el formato. Una columna de identificadores produce una fila por registro, lo que es una tabla correcta e inútil.
Cómo se calcula
Cada valor de la columna elegida se compara como texto tras recortar los espacios que lo rodean, y las cadenas idénticas se agrupan. Comparar tal como está escrito, sin intentar normalizar mayúsculas ni ortografía, es lo que hace que la herramienta sea honesta sobre el estado de tus datos.
Las filas se ordenan por recuento descendente, así que el valor más común va primero. Ese orden es lo que da sentido a la proporción acumulada: responde cuánto de tus datos cubren ya las primeras categorías, que es la pregunta práctica detrás de la mayoría de los recuentos.
Las celdas vacías se convierten en su propia categoría en lugar de descartarse. Una columna donde una quinta parte de las filas está en blanco te está diciendo algo importante, y una tabla que las omitiera en silencio ocultaría justamente eso.
La visualización se limita a 60 filas porque las tablas más largas dejan de leerse en una página, pero la exportación CSV contiene todos los valores distintos con su recuento y proporción. El gráfico muestra los 20 primeros, que es el punto a partir del cual las etiquetas chocan.
Preguntas y respuestas
¿Por qué «Madrid» y «madrid» son filas separadas?
Porque los valores se comparan tal como están escritos. Fusionarlos automáticamente ocultaría una inconsistencia en tus datos. Limpia la columna si la diferencia no es significativa: el informe de calidad de datos te dirá cuán extendido está el problema.
¿Tabla de frecuencias o histograma?
Tabla de frecuencias para categorías y para números que se repiten, como valoraciones o recuentos. Histograma para mediciones continuas, donde los valores rara vez se repiten y hay que agruparlos en intervalos.
¿Qué me dice la proporción acumulada?
Cuánto de los datos cubren juntas las primeras categorías. Si los tres primeros valores llegan al 70 %, la mayor parte de tus datos vive en tres categorías y la cola larga puede no merecer mucha atención.
Mi tabla tiene cientos de filas.
Tu columna tiene alta cardinalidad, a menudo un identificador o un campo de texto libre. Una tabla de frecuencias no es el resumen adecuado; el informe de calidad de datos te dirá cuántos valores distintos hay sin listarlos todos.
¿Se suben mis datos?
No. El recuento y el gráfico ocurren en tu navegador.