Punto de partida. Actividad «Análisis de datos e informe de decisiones», sesión 1 de 4. Abre los materiales enlazados y crea el registro de la unidad. La guía de arranque permite preparar las herramientas sin depender de otros módulos.

Se explica

10 minutos · contexto, explicación y ejemplo

Un dataset es un conjunto de datos organizado. Una fila no siempre equivale a un cliente o una factura: en Online Retail representa una línea de producto dentro de una factura. Entender esa unidad evita contar las líneas como si fueran pedidos distintos.

Un notebook combina texto explicativo, código y resultados en celdas. pandas permite leer y resumir tablas en Python. Empezaremos con un cuaderno preparado: ejecutaremos una celda, observaremos su salida y explicaremos su significado antes de pedir más análisis. Los datos históricos sirven para practicar; no describen las ventas actuales de la empresa.

Consultar ejemplos y conceptos de esta sesión

¿Qué contiene?

Las principales variables son:

Variable Significado
InvoiceNo Número de factura
StockCode Código del producto
Description Nombre del producto
Quantity Cantidad
InvoiceDate Fecha y hora
UnitPrice Precio por unidad
CustomerID Identificador del cliente
Country País

Por ejemplo:

InvoiceNo
536365
Description
WHITE HANGING HEART
Quantity
6
UnitPrice
2.55
Country
United Kingdom

Una columna que NO existe

Queremos analizar cuánto dinero genera cada operación.

El conjunto de datos, sin embargo, no incluye una columna Revenue.

Podemos calcularla:

Revenue = Quantity × UnitPrice

Este tipo de columna calculada aparece constantemente en análisis de datos.

La IA puede ayudarnos a crearla.

Antes conviene comprobar si todos los registros son utilizables de forma directa.

Un dato extraño no siempre es un error

Imaginemos:

Quantity = -10

Podríamos pensar:

Eso es imposible. Lo eliminamos.

Ese valor puede representar, no obstante, una devolución, una cancelación o un ajuste contable.

Los datos necesitan contexto.

En nuestro dataset, determinados números de factura permiten identificar cancelaciones.

Por tanto:

limpiar datos no significa borrar todo lo que parece extraño.

Significa comprender qué representa.

Se trabaja

45 minutos · trabajo guiado sobre la actividad

  1. Descarga el cuaderno de datos, extráelo y sigue su guia-datos.pdf. Abre analisis.ipynb con el entorno indicado y selecciona el intérprete de Python preparado.
  2. Ejecuta las celdas iniciales en orden. La descarga conserva Online Retail.xlsx y la carga muestra filas, columnas y primeras observaciones. Compara los nombres con el diccionario incluido.
  3. Localiza dos filas con el mismo número de factura. Explica por qué no son necesariamente duplicadas: pueden corresponder a productos distintos.
  4. Ejecuta el bloque de calidad y registra ausencias, cantidades no positivas y cancelaciones. Todavía no borres registros. Elige una anomalía y explica qué hecho del negocio podría representar.
  5. Guarda el notebook y añade una nota con fuente, periodo y unidad de observación. Si una celda falla, revisa la ruta y el mensaje de error antes de cambiar el formato del dato.

Cierre

5 minutos · comprobar el resultado

Al terminar la sesión:

El cuaderno carga el Excel real y contiene una descripción interpretada de los datos. No se exige crear un CSV ni dominar previamente pandas.