D
Cloud M16 introductorio 10 min

Capitulo 06

AWS Basico: Complemento a GCP

No lo ignores solo porque tu apuesta principal sea GCP — aparece en ofertas de Data Engineering con buen fit de seniority junior

S3, Athena, Lambda, EMR y CloudWatch: los servicios de AWS que aparecen concentrados en ofertas de Data Engineering.

9% de las ofertas, concentrado en un perfil especifico

En la muestra analizada, AWS aparecio sobre todo en ofertas de Data Engineering (Infosys: Athena, Lambda, EMR, CloudWatch). No es tu prioridad si vas por GCP, pero reconocer estos 5 servicios te cubre la mayoria de esas conversaciones.

6.1 S3: el almacenamiento base

Amazon S3

M16

Servicio de almacenamiento de objetos de AWS. Es la base de la mayoria de los data lakes en esa nube: los archivos (CSV, Parquet, JSON) se guardan en 'buckets' organizados por carpetas logicas.

#aws #cloud

6.2 Athena: SQL directo sobre S3

Amazon Athena

M16

Servicio serverless de AWS para ejecutar consultas SQL directamente sobre archivos almacenados en S3, sin necesidad de cargar los datos en una base de datos tradicional. Cobra por bytes escaneados, igual que BigQuery.

#aws #sql
sql query_athena.sql
-- Athena usa Presto/Trino SQL sobre una tabla externa definida en el Glue Data Catalog
SELECT region, SUM(monto) AS total
FROM ventas_s3
WHERE anio = 2026 AND mes = 7
GROUP BY region
ORDER BY total DESC;
Paralelo directo con GCP

Athena es al ecosistema AWS lo que BigQuery es a GCP en cuanto al modelo de “SQL serverless sobre almacenamiento de objetos, cobrando por bytes escaneados” — pero Athena consulta datos que YA estan en S3 en vez de tener su propio almacenamiento gestionado como BigQuery.

Caso real: Data Engineer junior en un stack AWS

En la muestra de mercado, Infosys pide Athena/Lambda/EMR/CloudWatch para un rol de Data Engineer con buen fit de seniority junior. Un caso tipico: datos de logs de aplicacion llegan a S3 en formato JSON, y en vez de montar una base de datos completa solo para consultarlos ocasionalmente, se define una tabla externa en Athena sobre esos archivos — cero infraestructura que mantener para un caso de uso esporadico.

1. No particionar los datos en S3 antes de consultarlos con Athena
✗ Guardar todos los archivos JSON sueltos en un solo bucket sin estructura de carpetas por fecha.
✓ Organizar los archivos en S3 con una estructura tipo anio=2026/mes=07/dia=24/archivo.json y declarar esas particiones en el Glue Data Catalog — reduce drasticamente los bytes escaneados por query.

6.3 Lambda: computo serverless por eventos

AWS Lambda

M16

Servicio de computo serverless: ejecuta una funcion en respuesta a un evento (un archivo nuevo en S3, una llamada HTTP, un mensaje en una cola) sin que el usuario administre servidores. Se cobra solo por el tiempo de ejecucion real.

#aws

Un patron tipico en pipelines de datos: un archivo se sube a S3 → dispara una funcion Lambda → la funcion valida/transforma el archivo → escribe el resultado en otra ubicacion o dispara el siguiente paso del pipeline.

Por que Lambda y no un servidor siempre encendido

Un servidor tradicional corriendo 24/7 solo para procesar un archivo que llega cada tanto desperdicia computo (y dinero) el resto del tiempo. Lambda se ejecuta solo cuando el evento ocurre y se cobra por milisegundos de ejecucion real — la eleccion correcta cuando el trabajo es esporadico y reactivo a eventos, no constante.

6.4 EMR: Spark y Hadoop gestionados

EMR (Elastic MapReduce) es el equivalente de AWS a Dataproc en GCP: clusters gestionados de Spark y Hadoop, usados cuando el volumen de datos requiere procesamiento distribuido y ya existe codigo Spark que no se quiere reescribir.

6.5 CloudWatch: logs y monitoreo

CloudWatch centraliza logs y metricas de todos los servicios de AWS. En un pipeline de datos, es donde revisas si una funcion Lambda fallo, cuanto tiempo tardo un job de EMR, o configuras alertas automaticas ante errores.

6.6 IAM, a nivel conceptual

IAM (Identity and Access Management) es el sistema de permisos de AWS: define QUIEN (usuario, servicio) puede hacer QUE (leer, escribir, ejecutar) sobre QUE recursos. No hace falta profundizar como Data Analyst, pero es importante saber que existe y que ningun servicio de AWS deberia tener permisos “abiertos por defecto”.

6.7 Comparativa rapida GCP vs AWS

NecesidadGCPAWS
1 BigQuery
2 Cloud Storage
3 Cloud Functions
4 Dataproc

6.8 Recursos

Articulo: AWS Documentation: "What is Amazon Athena?" (documentacion oficial)
Curso: AWS Skill Builder: "AWS Cloud Practitioner Essentials" (gratuito, introductorio)

6.9 Preguntas de entrevista

Q: ¿Cual es la diferencia entre Athena y BigQuery?

Ambos son motores SQL serverless que cobran por bytes escaneados, pero difieren en donde vive el dato: Athena consulta archivos que YA estan en S3 (necesitas definir una tabla externa sobre esos archivos), mientras que BigQuery tiene su propio almacenamiento gestionado donde cargas los datos. En la practica, Athena es mas flexible si el dato ya vive en un data lake S3; BigQuery da mejor rendimiento si puedes cargar los datos dentro de su storage nativo.

🪤 Decir que son 'exactamente lo mismo' sin mencionar la diferencia de donde reside el almacenamiento.
Practica: consulta analitica sobre S3 con Athena avanzado
  1. Crea una cuenta AWS (free tier) y sube un dataset publico en formato Parquet a un bucket S3.
  2. Define una tabla externa en el Glue Data Catalog que apunte a ese bucket.
  3. Ejecuta 2-3 queries analiticas con Athena sobre esa tabla, incluyendo al menos una window function del primer capitulo.
  4. Revisa en CloudWatch cuanto tiempo tardo cada query y cuantos bytes escaneo.