Glosario
92 conceptos que tienes que tener en la cabeza
Cada termino esta definido en su contexto y enlazado desde los capitulos donde se usa.
M1 Industria 4.0 y el Ecosistema de Datos
Industria 4.0
ICuarta revolucion industrial: automatizacion inteligente, interconexion, y toma de decisiones basada en datos en tiempo real.
Ej: Una fabrica con sensores IoT en cada linea de produccion que ajustan parametros automaticamente.
Sistemas Ciberfisicos (CPS)
IIntegracion profunda de componentes fisicos (sensores, maquinas) y software que permite la comunicacion y toma de decisiones descentralizada.
Gemelo Digital
IReplica virtual de un sistema fisico usada para simular, predecir y optimizar procesos antes de ejecutarlos en el mundo real.
IIoT (Industrial IoT)
IAplicacion del IoT especificamente en la industria: manufactura, energia, logistica. Sensores en maquinaria que reportan datos continuamente.
Ecosistema IoT-IoS-IoD-IoP
IFlujo de datos en 4 capas: IoT captura, IoS procesa, IoD almacena, IoP visualiza para decision humana.
M2 Python para Data Science: mas alla de la sintaxis
List Comprehension
ISintaxis compacta de Python para generar o filtrar listas en una sola linea.
Ej: [x for x in lista if x > 0]
Closure
IFuncion que "recuerda" el entorno y las variables locales de su ambito de creacion, incluso despues de que el ambito haya terminado.
Vectorizacion
IUso de operaciones sobre arrays completos (NumPy/Pandas) en lugar de bucles for, logrando velocidad 10-100x mayor.
M3 NumPy y Pandas: el motor de la manipulacion de datos
Broadcasting
IMecanismo de NumPy que permite operaciones entre arrays de distintas dimensiones ajustandolos automaticamente.
Series (Pandas)
IArray unidimensional indexado de Pandas. Equivale a una columna de un DataFrame con etiquetas de fila.
DataFrame (Pandas)
IEstructura bidimensional de Pandas: una o mas Series compartiendo el mismo indice. Es la estructura central para datos tabulares.
SettingWithCopyWarning
IWarning de Pandas cuando intentas modificar un slice. Indica ambiguedad entre modificar el original o una copia.
Ej: Solucion: usar df.loc[mask, "col"] = valor, nunca df[mask]["col"] = valor
Tidy Data
IFormato estandar donde cada variable es una columna, cada observacion es una fila, y cada tipo de unidad forma una tabla.
Split-Apply-Combine (Groupby)
IParadigma: dividir datos en grupos, aplicar una funcion, combinar resultados. Implementado en groupby().agg() y groupby().transform().
M4 Pandas avanzado: limpieza, series temporales y datos faltantes
Imputacion
IReemplazo de valores faltantes por sustitutos estadisticamente razonables (media, mediana, KNN, etc).
IQR (Rango Intercuartilico)
IDiferencia entre el percentil 75 (Q3) y el percentil 25 (Q1). Usado para detectar outliers (> Q3 + 1.5*IQR o < Q1 - 1.5*IQR).
MCAR / MAR / MNAR
ATres mecanismos de datos faltantes: MCAR (completamente al azar), MAR (al azar dado lo observado), MNAR (no al azar - relacionado con el valor faltante).
Resample (Pandas)
IAgregacion temporal: convierte serie de tiempo a otra frecuencia (D/W/M/Q/Y). Requiere DatetimeIndex ordenado.
M5 Visualizacion: contar historias con datos
Chart Junk
IElementos visuales innecesarios (cuadriculas gruesas, texturas 3D) que distraen de la informacion.
KDE (Kernel Density Estimation)
ITecnica no parametrica para estimar la funcion de densidad. Crea una curva suave en lugar de bloques como un histograma.
Paleta Colorblind-Safe
IPaleta distinguible por personas con daltonismo. Varia luminosidad, no solo tono. Ej: viridis, cividis.
M6 Machine Learning basico: el primer modelo de verdad
Machine Learning
ICampo donde los sistemas aprenden patrones desde datos sin estar programados explicitamente para cada caso.
Aprendizaje Supervisado
ITipo de ML con pares (X, y) etiquetados. El modelo aprende a mapear X -> y observando ejemplos historicos.
Features (X) y Target (y)
IFeatures son las variables de entrada. Target es lo que queremos predecir: categorico (clasificacion) o numerico (regresion).
Overfitting
ICuando el modelo memoriza los datos de entrenamiento (alta accuracy en train) pero generaliza mal a datos nuevos (baja en test).
Underfitting
ICuando el modelo es demasiado simple y no captura la estructura real (bajo desempeno en train Y test).
Trade-off Bias-Variance
ABias alto = modelo simple que subajusta. Variance alta = modelo complejo que sobreajusta. El objetivo: encontrar el equilibrio.
Regresion Logistica
IAlgoritmo de CLASIFICACION (no regresion) que estima probabilidades con funcion sigmoide.
Arbol de Decision
IAlgoritmo que particiona el espacio de features recursivamente. Cada nodo pregunta una condicion.
Random Forest
IEnsemble de muchos arboles. Cada arbol vota (clasificacion) o se promedia (regresion). Robusto, no requiere escalado.
K-Nearest Neighbors (KNN)
IAlgoritmo lazy que clasifica un punto segun la mayoria de sus K vecinos mas cercanos en el espacio de features.
Hiperparametros
IConfiguraciones que fijas ANTES del fit (max_depth, C, K). No se aprenden automaticamente.
Parametros del Modelo
IValores que el algoritmo aprende durante el fit (coeficientes en LR, splits en arboles).
Train-Test Split
IDivision de datos en entrenamiento (~80%) y prueba (~20%) para evaluar capacidad de generalizacion.
Cross-Validation (CV)
ITecnica que divide datos en k folds. El modelo se entrena k veces, rotando el fold de validacion. Reduce sesgo en la evaluacion.
M7 ML aplicado: pipelines, segmentacion y sistemas de recomendacion
Pipeline (scikit-learn)
ISecuencia encadenada de transformaciones + modelo final. Automatiza flujo y previene data leakage.
ColumnTransformer
IAplica transformaciones distintas a columnas segun tipo (numericas/categoricas) y las une en una sola salida.
K-Means
IAlgoritmo de clustering que asigna cada punto al centroide mas cercano, minimizando inercia intra-cluster.
Analisis RFM
IFramework de segmentacion: Recency (recencia), Frequency (frecuencia), Monetary (valor monetario).
Sistema de Recomendacion
IPredice que items le gustaran a un usuario. Tipos: user-based, item-based, filtrado colaborativo, matrix factorization.
TimeSeriesSplit
AValidacion cruzada para series temporales. Train en [0:t], val en [t:t+k], desplazandose. Evita mirar el futuro.
M8 Aprendizaje Supervisado profundo: regresion, metricas, cross-validation
Regresion Lineal
IModelo que ajusta un hiperplano minimizando suma de errores al cuadrado (OLS).
Ridge / Lasso
AVariantes de regresion lineal con regularizacion L2 (Ridge) o L1 (Lasso) para evitar overfitting.
Data Leakage
ACuando informacion del test contamina el entrenamiento. Ej: imputar nulos con media global antes del split.
Accuracy
I(TP + TN) / Total. Proporcion de predicciones correctas. Enganoso en clases desbalanceadas.
Precision
ITP / (TP + FP). De los positivos predichos, cuantos eran correctos. Usala cuando FP son costosos.
Recall (Sensibilidad)
ITP / (TP + FN). De los positivos reales, cuantos detectamos. Usala cuando FN son costosos.
F1-Score
IMedia armonica de Precision y Recall. 2*P*R / (P+R). Balanceada, util en desbalance.
ROC-AUC
AArea bajo la curva ROC. Mide capacidad discriminante. Independiente del threshold. Bueno en clases balanceadas.
PR-AUC (Average Precision)
AArea bajo la curva Precision-Recall. MEJOR que ROC-AUC en desbalance extremo (fraude, enfermedades raras).
MSE / RMSE / MAE
IMetricas de regresion. MSE/RMSE penalizan errores grandes al cuadrado. MAE es mas robusto a outliers.
R-cuadrado
IProporcion de varianza en y explicada por el modelo. Rango 0-1. Mayor es mejor.
Escalado de Features
ILlevar features a escala comun (StandardScaler media 0 std 1; MinMax rango [0,1]; Robust usa mediana+IQR).
One-Hot Encoding
IConversion de variable categorica en N columnas binarias (0/1), una por categoria.
Target Encoding
AReemplaza cada categoria con la media del target. Util con alta cardinalidad. Riesgo de leakage.
M9 Aprendizaje No Supervisado: clustering, asociacion y reduccion de dimensionalidad
Aprendizaje No Supervisado
IAprende estructura/patrones a partir de datos SIN etiquetas. Sin variable objetivo.
Clustering
ITecnica de agrupamiento que particiona observaciones en grupos homogeneos segun similitud.
Inercia (WCSS)
ISuma de distancias cuadradas de cada punto a su centroide. K-Means la minimiza.
Silhouette Score
AMetrica interna de clustering. Rango [-1, 1]. Mayor = mejor. Mide que tan bien asignado esta un punto.
Metodo del Codo (Elbow)
ITecnica para elegir K en K-Means. Graficar inercia vs K y buscar el "codo" donde agregar clusters ya no aporta.
Clustering Jerarquico Aglomerativo
IConstruye un arbol de clusters (dendrograma) de abajo hacia arriba. No requiere K de antemano.
Dendrograma
IDiagrama en arbol que muestra la jerarquia de clusters. La altura de corte determina K.
Linkage (Jerarquico)
ACriterio de distancia entre clusters: Ward (varianza), complete (max), average (promedio), single (min).
DBSCAN
AClustering basado en densidad. Encuentra clusters de forma arbitraria y marca outliers. Parametros: eps y min_samples.
eps (DBSCAN)
ARadio de vecindad. Dos puntos estan "conectados" si su distancia es menor a eps.
min_samples (DBSCAN)
AMinimo de puntos en la vecindad eps para que un punto sea "core" (centro de cluster).
Reglas de Asociacion
IPatrones "si A entonces B" extraidos de datos transaccionales. Miden co-ocurrencia entre items.
Support (Soporte)
IFraccion de transacciones que contienen un itemset. Mide frecuencia de la combinacion.
Confidence (Confianza)
IP(B|A). De las transacciones con A, que fraccion tiene B. Mide fuerza de la regla.
Lift (Elevacion)
ARatio entre confianza observada y esperada. = 1 independencia, > 1 correlacion positiva, < 1 negativa.
Apriori
IAlgoritmo clasico de reglas de asociacion. Genera candidatos y poda por support minimo.
FP-Growth
AAlgoritmo de asociacion mas eficiente que Apriori. Usa estructura de arbol (FP-Tree).
PCA (Principal Component Analysis)
AReduccion de dimensionalidad. Encuentra direcciones de maxima varianza y proyecta datos sobre ellas.
Componente Principal
ANueva variable (combinacion lineal de originales) que captura la mayor varianza posible.
Explained Variance Ratio
AFraccion de varianza total capturada por cada componente. Accesible via pca.explained_variance_ratio_.
Loadings (PCA)
ACoeficientes que indican cuanto aporta cada feature original a cada componente principal.
t-SNE / UMAP
ATecnicas no lineales de reduccion para visualizacion 2D/3D. Preservan estructura local (t-SNE) o global (UMAP).
M10 Fundamentos de IA, Machine Learning y Produccion
IA vs ML vs Deep Learning
IIA es el campo amplio. ML es subcampo (aprenden de datos). Deep Learning es subcampo de ML (redes neuronales profundas).
IA Generativa
IModelos que CREAN contenido nuevo (texto, imagenes, codigo). Ej: GPT-4, DALL-E, Stable Diffusion.
LLM (Large Language Model)
IModelo de lenguaje entrenado con miles de millones de parametros. Ej: GPT, LLaMA, Claude, Gemini.
Aprendizaje por Refuerzo (RL)
AParadigma donde un agente aprende a tomar decisiones maximizando recompensa acumulada.
Feature Engineering
ICrear, transformar y seleccionar features para mejorar el modelo. La parte mas impactante de un proyecto.
GridSearchCV
IBusqueda exhaustiva de hiperparametros. Prueba todas las combinaciones de un grid. Costoso para espacios grandes.
RandomizedSearchCV
IBusqueda aleatoria de hiperparametros. Muestrea N combinaciones. Mas eficiente que GridSearch para espacios grandes.
Optuna / Hyperopt
AFrameworks de busqueda BAYESIANA de hiperparametros. Aprenden de iteraciones anteriores.
Data Drift
ACambio en la distribucion de los INPUTS entre train y produccion. Detectado con KS test o PSI.
Concept Drift
ACambio en la relacion X -> y entre train y produccion. El mundo cambio, el modelo quedo desactualizado.
joblib
ILibreria de sklearn para serializar modelos y pipelines a disco. joblib.dump(pipeline, "modelo.joblib").
MLOps
AConjunto de practicas para llevar modelos de ML del notebook a produccion: pipelines, versionado, monitoreo, reentrenamiento.
SHAP (SHapley Additive exPlanations)
ATecnica de explicabilidad basada en teoria de juegos. Mide contribucion de cada feature a una prediccion individual.
MLflow
APlataforma open source para tracking de experimentos de ML. Registra parametros, metricas, modelos y artefactos.
FastAPI
IFramework Python para construir APIs REST rapidas y tipadas. Muy usado para servir modelos de ML.