Presentación
Business Intelligence con Python – Cree sus propias herramientas de BI de principio a fin es una guía práctica y completa para aprender a utilizar Python en el ámbito de la Business Intelligence y transformar datos empresariales en información útil para la toma de decisiones.
El libro aborda todo el proceso de Business Intelligence, desde la recopilación y preparación de datos hasta su análisis, visualización y presentación mediante paneles de control e informes interactivos.
A lo largo de la obra, el lector aprende a trabajar con diferentes fuentes de información, incluyendo archivos, bases de datos, API y técnicas de web scraping, utilizando herramientas y bibliotecas de Python como pandas.
También se abordan la limpieza y calidad de los datos, el análisis estadístico, la creación de Data Warehouses y la automatización de pipelines de datos mediante herramientas como Apache Airflow y Luigi.
La obra dedica especial atención a la visualización de datos y a la creación de dashboards interactivos utilizando Matplotlib, Seaborn, Plotly, Streamlit, Taipy y Dash, así como a la elaboración y difusión de informes mediante Jupyter Notebooks y Quarto.
Además, se incluyen aspectos fundamentales relacionados con la ética, la seguridad de los datos y el cumplimiento del RGPD, permitiendo abordar los proyectos de Business Intelligence desde una perspectiva técnica y profesional.
Cada capítulo incorpora ejemplos, casos prácticos y ejercicios que permiten aplicar inmediatamente los conceptos aprendidos. Es un recurso especialmente indicado para profesionales de datos, analistas y estudiantes que desean desarrollar herramientas de BI completas utilizando Python.
Índice
Introducción y Python como herramienta de Business Intelligence
- Fundamentos, definición y evolución de la Business Intelligence.
- Componentes y beneficios de la BI.
- Ventajas de utilizar Python para Business Intelligence.
- Configuración del entorno de desarrollo.
- Python, Jupyter Notebooks e IDE.
- Control de versiones y organización de proyectos.
- Buenas prácticas de programación, documentación, pruebas y depuración.
- Integración continua con GitHub Actions.
Extracción de datos desde diferentes fuentes
- Introducción a pandas y los DataFrames.
- Archivos CSV, TXT, TSV, Excel, JSON, XML y PDF.
- Bases de datos relacionales: PostgreSQL, MySQL y SQLite.
- Bases de datos NoSQL y MongoDB.
- Data Warehouses y soluciones como BigQuery y Snowflake.
- Conexiones FTP y SFTP.
- Consumo de API mediante Python.
- Web scraping con requests, BeautifulSoup y Selenium.
Preparación y limpieza de los datos
- Calidad de los datos y sus principales criterios.
- Depuración y manipulación de conjuntos de datos.
- Gestión de duplicados y valores perdidos.
- Tratamiento de valores atípicos y series temporales.
- Filtrado y selección de datos.
- Unión y combinación de DataFrames.
- Ordenación, agrupación y agregación de información.
Análisis estadístico de los datos
- Tipos de variables, población y muestra.
- Probabilidad y estadística descriptiva.
- Análisis univariante y bivariante.
- Correlaciones y asociaciones entre variables.
- Inferencia estadística e intervalos de confianza.
- Pruebas de hipótesis paramétricas y no paramétricas.
- Regresión lineal simple y múltiple.
- Evaluación de modelos y análisis predictivo.
- Caso práctico de A/B testing aplicado al marketing.
Creación de un Data Warehouse
- Conceptos OLTP y OLAP.
- Definición, características y ventajas de un Data Warehouse.
- Arquitecturas analíticas.
- Normalización y desnormalización.
- Metodologías Inmon, Kimball, OBT y Data Vault.
- Tablas de hechos y tablas de dimensiones.
- Star Schema y Snowflake Schema.
- Desarrollo de un proyecto Data Warehouse con Python.
Automatización de pipelines de datos
- Conceptos de ETL y automatización de procesos.
- Introducción a Apache Airflow.
- DAG, Tasks y Operators.
- Creación y ejecución de pipelines con Airflow.
- Introducción a Luigi y sus principales componentes.
- Comparación entre Airflow y Luigi.
- Buenas prácticas para diseñar pipelines de datos.
- Gestión de errores, logging, monitoring y pruebas.
- Caso práctico de creación de un pipeline ETL completo.
Visualización de datos
- Principios y objetivos de la visualización de datos.
- Matplotlib y creación de gráficos.
- Seaborn para análisis y visualización estadística.
- Plotly y gráficos interactivos.
- Mapas, indicadores, gráficos combinados y visualizaciones personalizadas.
- Buenas prácticas de diseño.
- Caso práctico de visualización de datos.
Paneles de control e informes
- Del análisis de datos a la toma de decisiones.
- Storytelling y comunicación de información mediante datos.
- Creación de dashboards con Streamlit.
- Creación de interfaces y paneles con Taipy.
- Desarrollo de dashboards interactivos con Dash.
- Elaboración de informes con Jupyter Notebooks y Quarto.
- Despliegue y difusión de aplicaciones de BI.
- Seguridad, acceso, mantenimiento y actualización.
Ética, seguridad y RGPD
- Importancia de la ética y la protección de datos en BI.
- Transparencia, equidad y responsabilidad.
- Sesgos en los datos y en los análisis.
- Gobernanza ética de los datos.
- Amenazas y riesgos de seguridad.
- Control de acceso, autenticación y cifrado.
- Copias de seguridad y recuperación ante incidentes.
- Principios del RGPD aplicados a proyectos de Business Intelligence.
- Derechos de los usuarios y protección de datos.
- Privacy by Design y Privacy by Default.
- Integración de ética, seguridad y cumplimiento durante todo el ciclo de vida de los proyectos de BI.
Sobre el autor
Gaël Penessot cuenta con 15 años de experiencia en Python y análisis de datos. Combina su experiencia técnica con una visión empresarial y comparte sus conocimientos sobre datos y Business Intelligence mediante formación, contenido profesional en LinkedIn y trabajos de consultoría.
A través de su experiencia, busca hacer accesibles las principales herramientas del análisis de datos moderno y ayudar a los profesionales a desarrollar soluciones prácticas de Business Intelligence.
En esta obra comparte sus conocimientos para que los lectores puedan aplicar de manera inmediata los conceptos aprendidos y crear sus propias herramientas de BI utilizando Python.





