Urgent.News

What's breaking now, across thousands of outlets.

Tech

Introducción a los Data Lakes Parte 2

En el post anterior exploramos qué es un Data Lake y por qué son tan importantes en el ecosistema de datos actual. Ahora es momento de ensuciarnos las manos y ver exactamente qué servicios de AWS necesitamos para construir un Data Lake completamente serverless y cómo orquestarlos. Los Servicios Fundamentales Un Data Lake serverless en AWS se construye sobre cinco pilares fundamentales que…

Original Spanish Read in English

En el post anterior, se discutió qué es un Data Lake y por qué es importante en el ecosistema de datos actual. Ahora, se profundiza en los servicios de AWS necesarios para construir un Data Lake serverless y cómo orquestarlos. Los servicios fundamentales son:

1. Storage: Amazon S3 es el corazón del Storage. Almacena tanto datos crudos como procesados y su organización es crucial para el rendimiento y los costos. Se recomienda que todo el data lake se encuentre en un mismo bucket, ya que S3 tiene un límite de 100 bucket por cuenta.

2. Procesamiento: AWS Glue es el motor de transformación. Es una suite de servicios de data serverless que maneja descubrimiento de esquemas y transformaciones de datos. Los componentes principales son Glue Jobs, Glue Catalog y Glue Crawlers.

3. Catalogo: Glue Catalog es un metastore centralizado que actúa como un diccionario o catálogo de datos. Permite descubrir automáticamente la estructura de los datos almacenados en el storage.

4. Seguridad: Amazon S3 y AWS LakeFormation permiten gobernar los datos de manera segura. Se pueden habilitar versionado, configurar lifecycle policies para optimizar costos, habilitar encriptación server-side con KMS y replicar entre regiones para recuperación ante desastres.

5. Explotación: Amazon Athena permite consultar datos directamente desde S3 usando SQL estándar sin necesidad de provisionar servidores. Es pay-per-query, integrado con Glue Catalog, soporta múltiples formatos y proporciona particionamiento automático para optimizar la performance.

Written by urgent.news from Dev.to's reporting — not their text. Machine-written — may contain errors; check the original before relying on it.

Read the original at dev.to →

More in Tech

Building Distributed Systems in Elixir: Part 6 — Named Processes

In the previous part of this series, we built a tiny supervisor from scratch. When a worker crashed, the supervisor started a replacement.

  • Named processes provide discoverable addresses for workers in distributed systems.
  • Process.register/2 associates a PID with a local name on a BEAM node.
  • Process.whereis/1 retrieves the current PID for a registered local name.

More from Wednesday 19 August →