Tus datos
Pega una tabla directamente desde Excel o Google Sheets, o suelta un archivo CSV. No se sube nada: todo el cálculo ocurre dentro de esta pestaña del navegador.
CSV, TSV o texto plano. Los archivos guardados en windows-1251 se detectan y se releen automáticamente, así los encabezados no se convierten en caracteres raros.
Opciones de lectura
Resultado
Guardar y compartir
La biblioteca de dibujo se descarga solo al pulsar el botón y solo en esta página.
Esta página no tiene parte de servidor en absoluto. La tabla que pegas la procesa JavaScript dentro de tu propio navegador, el gráfico se dibuja en un elemento canvas de tu máquina y el archivo de exportación se arma localmente. Nada se sube, se almacena ni se escribe en ningún registro. Puedes desconectar la red después de cargar la página y todo seguirá funcionando: es la forma más sencilla de comprobarlo tú mismo.
Datos y límites del método
| Por columna | Tipo detectado, ausentes, proporción de ausentes, valores distintos |
|---|---|
| Detección de tipo | Numérica si al menos el 70 % de las celdas no vacías se interpretan como números |
| Filas duplicadas | Coincidencias exactas en todas las columnas, contadas |
| Columnas constantes | Columnas con un valor distinto o menos, marcadas aparte |
| Peor columna | La que más ausentes tiene, reportada arriba |
| Funciona con | Cualquier tabla, numérica o no |
Cuándo induce a error
- El informe encuentra problemas estructurales, no valores equivocados. Un precio registrado como 120 en vez de 1200 está presente, es numérico y es único: pasa todas las comprobaciones de aquí. La detección de atípicos es la herramienta para esa otra mitad del problema.
- La detección de duplicados compara filas completas exactamente como están escritas. Dos registros del mismo pedido con marcas de tiempo distintas no son duplicados según esta definición, aunque lo sean en todo sentido que te importe.
- El umbral del 70 % para llamar numérica a una columna es una heurística. Una columna de números con unas pocas entradas «n/d» se detecta correctamente; una columna de códigos postales también se llamará numérica, lo cual es técnicamente cierto y analíticamente erróneo.
- Los ausentes solo se detectan como celdas vacías. Una columna donde la ausencia se codifica como 0, −1 o «desconocido» parece completa aquí, y esa codificación es una de las formas más habituales en que se esconden los datos faltantes.
Cómo se calcula
Cada columna se perfila de forma independiente: se cuentan sus celdas no vacías, se cuentan sus valores distintos y se clasifica como numérica o de texto según si al menos el 70 % de sus celdas no vacías se interpretan como números. Ese umbral tolera algunas etiquetas sueltas sin clasificar mal una columna genuinamente numérica.
Las filas duplicadas se encuentran comparando el contenido completo de la fila. El recuento se reporta de forma destacada porque los duplicados inflan en silencio cada total, promedio y correlación posteriores, y son invisibles en una hoja con más filas de las que caben en pantalla.
Las columnas constantes —con un valor distinto o ninguno— se marcan aparte. No aportan información, rompen la correlación y la regresión por tener varianza cero, y suelen ser el residuo de un filtro aplicado aguas arriba.
La columna con más ausentes se destaca arriba con su porcentaje, porque es la cifra que más a menudo determina si merece la pena empezar un análisis. Una columna vacía en un 60 % rara vez sostiene la conclusión que alguien quiere extraer de ella.
Preguntas y respuestas
¿Qué hago con los valores ausentes?
Primero averigua por qué faltan. Los ausentes al azar suelen poder descartarse o imputarse; los ausentes por un motivo —clientes que no respondieron, máquinas que no reportaron— llevan información, y descartarlos sesga todo lo que venga después.
Mi recuento de duplicados es cero pero veo duplicados.
La detección exige que todas las columnas coincidan exactamente. Filas que difieren en una marca de tiempo, un id o un espacio final no son duplicados exactos. Elimina la columna que difiere y vuelve a ejecutarlo.
¿Por qué mi columna de códigos postales se llama numérica?
Porque sus valores se interpretan como números. La detección es sintáctica, no semántica. Toma el tipo como una pista: identificadores, códigos y teléfonos son texto con aspecto numérico que nunca debe promediarse.
¿Qué hace una columna constante en mis datos?
Normalmente es el residuo de un filtro: todo se exportó para una región, un año o un estado. No aporta información y romperá la correlación y la regresión, que necesitan varianza para funcionar.
¿Se suben mis datos?
No. Todo el perfil se calcula en tu navegador, que es justo lo que hace seguro ejecutarlo sobre datos que no puedes enviar a ninguna parte.