Urgent.News

One page, thousands of outlets. See who else covered it.

Editions

Tech

Introducción a los Data Lakes Parte 2

En el post anterior exploramos qué es un Data Lake y por qué son tan importantes en el ecosistema de datos actual. Ahora es momento de ensuciarnos las manos y ver exactamente qué servicios de AWS necesitamos para construir un Data Lake completamente serverless y cómo orquestarlos. Los Servicios Fundamentales Un Data Lake serverless en AWS se construye sobre cinco pilares fundamentales que…

En el post anterior, se discutió qué es un Data Lake y por qué es importante en el ecosistema de datos actual. Ahora, se profundiza en los servicios de AWS necesarios para construir un Data Lake serverless y cómo orquestarlos. Los servicios fundamentales son:

1. Storage: Amazon S3 es el corazón del Storage. Almacena tanto datos crudos como procesados y su organización es crucial para el rendimiento y los costos. Se recomienda que todo el data lake se encuentre en un mismo bucket, ya que S3 tiene un límite de 100 bucket por cuenta.

2. Procesamiento: AWS Glue es el motor de transformación. Es una suite de servicios de data serverless que maneja descubrimiento de esquemas y transformaciones de datos. Los componentes principales son Glue Jobs, Glue Catalog y Glue Crawlers.

3. Catalogo: Glue Catalog es un metastore centralizado que actúa como un diccionario o catálogo de datos. Permite descubrir automáticamente la estructura de los datos almacenados en el storage.

4. Seguridad: Amazon S3 y AWS LakeFormation permiten gobernar los datos de manera segura. Se pueden habilitar versionado, configurar lifecycle policies para optimizar costos, habilitar encriptación server-side con KMS y replicar entre regiones para recuperación ante desastres.

5. Explotación: Amazon Athena permite consultar datos directamente desde S3 usando SQL estándar sin necesidad de provisionar servidores. Es pay-per-query, integrado con Glue Catalog, soporta múltiples formatos y proporciona particionamiento automático para optimizar la performance.

Written by urgent.news from Dev.to's reporting — not their text. Machine-written — may contain errors; check the original before relying on it.

Read the original at dev.to →

More in Tech

Building Distributed Systems in Elixir: Part 6 — Named Processes

In the previous part of this series, we built a tiny supervisor from scratch. When a worker crashed, the supervisor started a replacement.

  • Named processes provide discoverable addresses for workers in distributed systems.
  • Process.register/2 associates a PID with a local name on a BEAM node.
  • Process.whereis/1 retrieves the current PID for a registered local name.

More from Wednesday 19 August →