D

Glosario

22 conceptos que tienes que tener en la cabeza

Cada termino esta definido en su contexto y enlazado desde los capitulos donde se usa.

Dificultad: introductorio intermedio avanzado

M11 SQL Avanzado para Analistas

Window Function

I

Funcion que calcula un valor sobre un conjunto de filas relacionadas (una "ventana") sin colapsarlas en una sola fila, a diferencia de GROUP BY.

Ej: ROW_NUMBER() OVER (PARTITION BY cliente ORDER BY fecha DESC)

CTE (Common Table Expression)

I

Tabla temporal nombrada definida con WITH, valida solo dentro de la query. Mejora legibilidad frente a subqueries anidadas.

CTE Recursiva

A

CTE que se referencia a si misma, usada para queries jerarquicas (organigramas, arboles de categorias).

Star Schema

I

Modelo de datos con una tabla de hechos central rodeada de tablas de dimension, optimizado para consultas analiticas y BI.

Optimizacion de Queries

A

Practicas para reducir el costo de una consulta: usar indices, evitar SELECT *, revisar el plan de ejecucion con EXPLAIN.

M12 Python para Analisis y Automatizacion

Automatizacion de Reportes

I

Reemplazar la generacion manual de reportes recurrentes por scripts que leen, consolidan y exportan datos automaticamente.

resample (Pandas)

I

Metodo de Pandas para cambiar la frecuencia de una serie temporal (diaria a mensual, por ejemplo), agregando valores en el proceso.

M13 ETL: el Patron, no la Herramienta

ETL (Extract, Transform, Load)

I

Patron de integracion de datos: extraer de una fuente, transformar (limpiar, tipar, aplicar reglas) y cargar en un destino de consumo.

ETL vs ELT

I

ELT carga los datos crudos primero y transforma despues, dentro del data warehouse (aprovechando su poder de computo). Comun en BigQuery/Snowflake.

Idempotencia

A

Propiedad de un proceso que produce el mismo resultado sin efectos secundarios adicionales si se ejecuta mas de una vez con la misma entrada.

Carga Incremental

I

Estrategia de ETL que procesa solo los datos nuevos o modificados desde la ultima ejecucion, en vez de recargar todo (full load).

M14 Google Cloud Platform para Datos

BigQuery

I

Data warehouse serverless de Google Cloud. Ejecuta SQL sobre datasets masivos, cobra por bytes escaneados.

Particionamiento y Clustering (BigQuery)

A

Tecnicas para reducir el costo de una query: particionar divide la tabla por columna (ej. fecha), clustering ordena fisicamente los datos dentro de cada particion.

Dataflow (Apache Beam)

A

Servicio de GCP para pipelines de datos batch y streaming, basado en el modelo de programacion Apache Beam.

M15 Git y Control de Versiones para Analistas

Feature Branch

I

Rama de Git creada para desarrollar una funcionalidad de forma aislada, luego integrada al branch principal via Pull Request.

Merge vs Rebase

I

Dos formas de integrar cambios de un branch a otro: merge preserva el historial con un commit de fusion, rebase reescribe el historial linealmente.

Pull Request (PR)

I

Solicitud para fusionar cambios de un branch a otro, con revision de codigo y comentarios antes de aceptarla.

M16 AWS Basico: Complemento a GCP

Amazon S3

I

Servicio de almacenamiento de objetos de AWS. Base de la mayoria de los data lakes en esa nube.

Amazon Athena

I

Servicio serverless de AWS para ejecutar SQL directamente sobre archivos en S3, sin necesidad de cargar los datos en una base.

AWS Lambda

I

Servicio de computo serverless de AWS: ejecuta funciones en respuesta a eventos, sin gestionar servidores.

M17 ML Aplicado e IA Generativa como Herramienta

Prompting

I

Practica de redactar instrucciones efectivas para un modelo de lenguaje (LLM), de forma que genere el resultado deseado.

Integracion de LLMs en el flujo de trabajo

I

Uso de APIs de modelos de lenguaje (OpenAI, Anthropic) o herramientas ya integradas (Copilot en Excel/Power BI) para automatizar tareas analiticas, sin entrenar modelos propios.