Etiqueta: Python

Comparando plataformas de datos en la nube: Databricks vs Snowflake

Post author By 54admin
Post date 30/04/2023

La adopción de soluciones de datos en la nube ha estado en aumento en los últimos años y dos de las principales opciones son Databricks y Snowflake. Ambas ofrecen servicios en la nube, de hecho pueden ser instaladas tanto en AWS como en Azure. Pero cada una tiene sus propias fortalezas y debilidades. En este artículo, se comparan ambas plataformas en términos de su arquitectura, capacidad de procesamiento y herramientas de análisis.

Ambas plataformas son muy eficientes en el procesamiento y análisis de datos a gran escala, pero tienen diferencias significativas en cuanto a su funcionalidad y enfoque. #Databricks se enfoca en el procesamiento de datos y el análisis de datos en tiempo real, mientras que #Snowflake se centra en la gestión de datos y el almacenamiento de datos en la nube. Ambas plataformas son muy utilizadas en la industria y son una buena opción para cualquier empresa que busque procesar y analizar grandes cantidades de datos.

Veamos algunos puntos particulares. Empecemos con:

Arquitectura

Databricks se basa en Apache Spark y tiene una arquitectura abierta y flexible que permite a los usuarios integrar diversas fuentes de datos y herramientas de análisis. También tiene integración nativa con Microsoft Azure y Amazon Web Services (AWS).

Snowflake utiliza un enfoque basado en la nube y se centra en el almacenamiento de datos. Tiene una arquitectura de tres capas y utiliza una base de datos columnar.

Capacidad de procesamiento

Databricks tiene la capacidad de procesar grandes volúmenes de datos y realizar tareas de procesamiento en paralelo en múltiples nodos. Además, su capacidad de procesamiento se puede escalar según sea necesario para manejar grandes cargas de trabajo.

Snowflake también puede procesar grandes cantidades de datos, pero se enfoca en la velocidad y la eficiencia. Además, su arquitectura basada en la nube permite a los usuarios escalar fácilmente el procesamiento según sea necesario.

Herramientas de análisis

Databricks tiene una variedad de herramientas de análisis, incluyendo librerías de ciencia de datos y herramientas de visualización. También tiene integración con herramientas de terceros, como Tableau y Power BI.

Snowflake se centra en el almacenamiento de datos y la consulta de datos. Tiene una interfaz de usuario sencilla que permite a los usuarios consultar los datos y crear informes.

Finalizando, nos llama mucho la atención que Snowflake y Databricks, dos empresas que inicialmente tenían objetivos muy diferentes, han estado compitiendo en un mercado cada vez más convergente. Snowflake se enfocó en equipos de BI mientras que Databricks se enfocó en equipos de ciencia de datos, pero ahora ambos están expandiéndose a los dominios del otro, creando una verdadera batalla por la “Plataforma de Datos en la Nube”. La propiedad de los datos es esencial en esta competencia, y ambas empresas comenzaron con sistemas de almacenamiento cerrados. Pero, para sorpresa de muchos, Databricks sorprendió a Snowflake al abrir partes de Delta Lake, lo que provocó que Snowflake siguiera el ejemplo adoptando Apache Iceberg. En respuesta, Databricks tomó medidas drásticas y donó todo Delta Lake a la Fundación Linux con el lanzamiento de Delta Lake 2.0, dejando en claro su compromiso con un estándar abierto para el almacenamiento de datos.

Ambas plataformas ofrecen soluciones de datos en la nube y tienen sus propias fortalezas y debilidades. Databricks es ideal para usuarios que requieren una plataforma de análisis de datos altamente personalizable, mientras que Snowflake es ideal para usuarios que necesitan una plataforma de almacenamiento de datos rápida y eficiente.

Alternativas a estas plataformas

Existen varias alternativas a Snowflake y Databricks en el mercado, dependiendo de las necesidades y requisitos de la empresa. Algunas de estas alternativas incluyen:

Almacenes de datos en la nube: otras opciones populares incluyen Amazon #Redshift, Google #BigQuery, Microsoft Azure #Synapse Analytics y #Oracle Autonomous Data Warehouse.
Plataformas de análisis unificado: hay varias opciones, como Google Cloud Dataproc, Apache Flink, Apache Beam y Apache Storm.
Plataformas de ciencia de datos: algunas opciones incluyen Google Cloud AI Platform, Microsoft Azure Machine Learning, IBM Watson Studio y Amazon SageMaker.

Cada una de estas opciones tiene sus propias ventajas y desventajas, y la elección dependerá de los requisitos específicos de la empresa. Es importante hacer una investigación exhaustiva y evaluar las diferentes opciones antes de tomar una decisión.

Si estás buscando alternativas a Snowflake y Databricks para la gestión de tus datos en la nube, te recomendamos considerar Redshift de #AWS y Synapse de #Azure. Ambas plataformas ofrecen soluciones de almacenamiento y procesamiento de datos escalables y seguras.

AWS se destaca por su proceso constante de innovación y la incorporación de nuevas funciones y aplicaciones a su ecosistema de datos. Con Redshift, los usuarios pueden almacenar y analizar grandes cantidades de datos utilizando herramientas de análisis de datos de código abierto, como #SQL y #Python. Además, Redshift es altamente escalable y puede manejar desde pequeñas cargas de trabajo hasta grandes conjuntos de datos.

Por otro lado, Synapse de Azure se distingue por su simplicidad y robustez. La plataforma ofrece una amplia gama de herramientas integradas para el procesamiento de datos, desde la ingestión hasta el análisis. Además, la adopción de tecnología de Azure es fácil y rápida, lo que permite a los usuarios obtener resultados inmediatos.

#BigQuery es una solución de almacenamiento y análisis de datos en la nube altamente escalable y eficiente que se ha vuelto muy popular entre los usuarios de #GCP. Ofrece una variedad de características avanzadas, como la capacidad de analizar datos en tiempo real y la integración con otras herramientas de Google, como #DataStudio y #TensorFlow.

Sin embargo, a nosotros no nos resulta efectiva la calidad de su soporte técnico. En comparación con AWS y Microsoft, el soporte proporcionado por Google aún tiene mucho por mejorar.

En resumen, tanto Redshift de AWS como Synapse de Azure son excelentes alternativas a considerar si estás buscando una plataforma de gestión de datos en la nube segura, escalable y eficiente.

Tags aws, azure, BigQuery, DataBricks, DataStudio, GCP, Oracle, Python, Redshift, Snowflake, SQL, Synapse, TensorFlow

54cuatro

Comparativa entre herramientas de ETL

Post author By 54admin
Post date 26/01/2023

ETL es un acrónimo que significa Extracción, Transformación y Carga. Es un proceso utilizado en la gestión de datos para recopilar datos de diferentes fuentes, limpiarlo y transformarlo en un formato adecuado para su análisis y utilización en un sistema de información. Luego se carga en una base de datos o sistema de almacenamiento para su uso futuro. Es una técnica comúnmente utilizada en la integración de datos.

Existen herramientas open source, comerciales e incluso serverless provistas por cloud providers.

ETL (Extraction, Transformation & Load) – La Taberna del BI

¿Que herramienta de #ETL usar?

Talend es una plataforma de integración de datos que permite la conexión, la transformación y la integración de datos entre diferentes sistemas. Utiliza una interfaz gráfica de usuario para diseñar flujos de trabajo de integración de datos, lo que facilita la creación de tareas de integración de datos para usuarios sin experiencia en programación. Además, #Talend ofrece una amplia gama de componentes preconstruidos que se pueden utilizar para conectarse a diferentes fuentes de datos, como bases Talend Data Fabric - Opiniones, precios y características - Capterra Colombia 2023 de datos, aplicaciones empresariales y servicios web. Estos componentes se pueden personalizar y combinar para adaptarse a las necesidades específicas de cada proyecto.

______________

Pentaho Data Integration (PDI) es una herramienta de integración de datos open-source que permite la conexión, la transformación y la integración de datos entre diferentes sistemas. Utiliza una interfaz gráfica de usuario para diseñar flujos de trabajo de integración de datos, conocida como Spoon, que facilita la creación de tareas de integración de datos para usuarios sin experiencia en programación. Qué es Pentaho Data Integration (PDI) y para qué sirve?

PDI tiene una amplia gama de componentes preconstruidos, llamados transformaciones y tareas, que se pueden utilizar para conectarse a diferentes fuentes de datos, como bases de datos, aplicaciones empresariales y servicios web. Estos componentes se pueden personalizar y combinar para adaptarse a las necesidades específicas de cada proyecto. También cuenta con herramientas para la limpieza y análisis de datos, así como para la generación de informes y la creación de dashboards.

PDI se utiliza en conjunto con el resto de herramientas de la suite Pentaho, como #Pentaho Report Designer y Pentaho Analyzer, para crear soluciones completas de Business Intelligence.

______________

Apache NiFi es una plataforma de flujo de datos open-source que permite la captura, flujo, transformación y distribución de datos a través de una interfaz gráfica de usuario fácil de usar. Es una herramienta altamente escalable y escalable que se puede utilizar para automatizar y optimizar los flujos de trabajo de datos en una variedad de entornos, desde pequeñas aplicaciones hasta implementaciones de gran escala.

Tus datos se cambian de casa? Apache NiFi te ayuda con la mudanza - Future Space S.A.

NiFi utiliza una arquitectura basada en flujos para organizar y controlar los datos, lo que permite a los usuarios crear flujos de trabajo de integración de datos mediante la arrastrado y soltado de componentes preconstruidos en una interfaz gráfica de usuario. Estos componentes, conocidos como procesadores, se pueden utilizar para realizar tareas como la captura de datos, la transformación de datos, la validación de datos y la distribución de datos a diferentes destinos.

#NiFi también cuenta con características avanzadas, como la capacidad de manejar y procesar datos en tiempo real, la seguridad y el control de acceso, y la monitorización y la gestión de flujos de trabajo. También tiene una integración con otras herramientas y tecnologías de big data, como Apache #Kafka, Apache #Storm y Apache #Hadoop.

Y que hay de los serverless, los que son ejecutados en las #cloud?

Azure Data Factory (ADF) es una plataforma de integración de datos en la nube de Microsoft que permite la conexión, la transformación y la integración de datos entre diferentes sistemas. Es un servicio en la nube que se ejecuta en Microsoft Azure y se utiliza para automatizar los flujos de trabajo de integración de datos.

ADF utiliza una interfaz gráfica de usuario para diseñar flujos de trabajo de integración de datos, llamados “pipelines”, que se componen de diferentes “actividades” que representan tareas específicas, como la copia de datos, la transformación y el procesamiento. Estas actividades se pueden utilizar para conectarse a diferentes fuentes de datos, como bases de datos, aplicaciones empresariales y servicios web, y para copiar y mover datos entre estos sistemas.

ADF también cuenta con herramientas para la automatización de tareas, como la planificación de trabajos y la generación de informes, y cuenta con integración con otras herramientas y tecnologías de Microsoft Azure, como #Azure Data Lake Storage, Azure SQL Data Warehouse y #PowerBI.

Ademas, ADF tiene la capacidad de escalar automáticamente para manejar grandes volúmenes de datos y también cuenta con una variedad de opciones de seguridad y cumplimiento.

______________

AWS Glue es una plataforma de integración de datos en la nube de Amazon Web Services (AWS) que permite la conexión, la transformación y la integración de datos entre diferentes sistemas. Es un servicio en la nube que se ejecuta en AWS y se utiliza para automatizar los flujos de trabajo de integración de datos.

AWS #Glue ofrece una interfaz gráfica de usuario para diseñar flujos de trabajo de integración de datos, llamados “jobs”, que se componen de diferentes “tareas” que representan tareas específicas, como la copia de datos, la transformación y el procesamiento. Estas tareas se pueden utilizar para conectarse a diferentes fuentes de datos, como bases de datos, aplicaciones empresariales y servicios web, y para copiar y mover datos entre estos sistemas.

AWS Glue también cuenta con herramientas para la automatización de tareas, como la planificación de trabajos y la generación de informes, y cuenta con integración con otras herramientas y tecnologías de AWS, como Amazon S3, Amazon Redshift y Amazon Athena.

Ademas, AWS Glue cuenta con un catálogo de metadatos, que permite a los usuarios registrar y gestionar información sobre sus datos, como estructura, relaciones y calidad de los datos. También tiene la capacidad de escalar automáticamente para manejar grandes volúmenes de datos y cuenta con opciones de seguridad y cumplimiento. Asimismo, AWS tiene otro servicio que se llama #DataPipeline.

AWS Data Pipeline es un servicio de #Amazon Web Services (#AWS) que permite automatizar la transferencia y la transformación de datos entre diferentes sistemas de almacenamiento y procesamiento de datos. Es un servicio en la nube que se ejecuta en AWS y se utiliza para crear flujos de trabajo de integración de datos y automatizar tareas relacionadas con la gestión de datos.

Con AWS Data Pipeline, los usuarios pueden crear flujos de trabajo de integración de datos mediante la definición de “tareas” y “relaciones” entre ellas. Cada tarea representa una actividad específica, como la copia de datos desde una fuente a un destino, la ejecución de una transformación o la ejecución de un script. Las relaciones entre las tareas definen el orden en que deben ejecutarse las tareas.

AWS Data Pipeline también cuenta con herramientas para la planificación automatizada de tareas, como la programación de trabajos y la generación de informes, y cuenta con integración con otras herramientas y tecnologías de AWS, como Amazon #S3, Amazon #RDS y Amazon EMR.

Ademas, AWS Data Pipeline tiene la capacidad de escalar automáticamente para manejar grandes volúmenes de datos y cuenta con opciones de seguridad y cumplimiento. También permite a los usuarios monitorear y supervisar el progreso de los flujos de trabajo y detectar y solucionar problemas de manera eficiente.

______________

Google Cloud Dataflow es una plataforma de procesamiento de datos en la nube de #Google Cloud Platform (#GCP) que permite la ejecución de tareas de procesamiento y transformación de datos a gran escala. Es un servicio en la nube que se ejecuta en GCP y se utiliza para crear flujos de trabajo de integración de datos y automatizar tareas relacionadas con la gestión de datos.

Con Cloud #Dataflow, los usuarios pueden crear flujos de trabajo de procesamiento de datos mediante la definición de “tareas” y “relaciones” entre ellas. Cada tarea representa una actividad específica, como la lectura de datos desde una fuente, la ejecución de una transformación, la escritura de datos en un destino. Las relaciones entre las tareas definen el orden en que deben ejecutarse las tareas.

Dataflow permite a los usuarios crear flujos de trabajo utilizando un lenguaje de programación #Java o #Python, y utiliza un modelo de programación de tuberías y filtros para procesar los datos. Ademas, Dataflow es escalable y maneja de manera automática la distribución y el balanceo de carga para procesar grandes volúmenes de datos.

Dataflow también cuenta con herramientas para la planificación automatizada de tareas, como la programación de trabajos y la generación de informes, y cuenta con integración con otras herramientas y tecnologías de GCP, como #BigQuery, Cloud Storage, Cloud Pub/Sub.

Esperamos que esta nota haya sido de interés, y si tienes dudas puedes ponerte en contacto con nosotros.

[popup_anything id=”2076″]

Tags Amazon, aws, azure, BigQuery, cloud, Dataflow, DataPipeline, ETL, GCP, Glue, Google, Hadoop, Java, Kafka, NiFi, Pentaho, PowerBI, Python, RDS, S3, Storm, Talend

54cuatro

Usando Airflow para Dataops

Post author By 54admin
Post date 15/06/2020
No hay comentarios en Usando Airflow para Dataops

A medida que las personas que trabajan con datos comienzan a automatizar sus procesos, inevitablemente escriben trabajos por lotes. Estos trabajos deben ejecutarse según una planificación que generalmente tienen un conjunto de dependencias en otros conjuntos de datos existentes y tienen otros trabajos que dependen de ellos.

La gestión del flujo de trabajo se ha convertido en una necesidad tan común que la mayoría de las empresas tienen múltiples formas de crear y programar trabajos internamente. Siempre hay un buen programador cron para comenzar, y muchos paquetes de proveedores se envían con capacidades de programación. El siguiente paso es automatizar los pipelines, y es aquí donde aparecen algunas soluciones que permiten resolver problemas como el almacenamiento del estado de los trabajos y las dependencias.

Por lo general, estas soluciones crecen de manera reactiva como respuesta a la creciente necesidad de programar trabajos individuales. Vamos a conocer #Airflow, una aplicación escrita en #Python desde cero por los ingenieros de #Airbnb.

Airflow

Airflow nació dentro de Airbnb como respuesta a la falta de soluciones que satisfagan sus requerimientos. Luego el proyecto fue abierto bajo licencia Open Source como proyecto Apache.

Estos son algunos de los procesos impulsados por Airflow en Airbnb:

Almacenamiento de datos: limpia, organiza, y verifica la calidad de los datos y publica datos en su almacén de datos
Análisis de crecimiento: calcula las métricas en torno a la participación de invitados y anfitriones, así como la contabilidad de crecimiento
Experimentación: calcula la lógica y agregados de marcos de experimentación de pruebas A / B
Orientación por correo electrónico: aplica reglas para orientar e involucrar a los usuarios de la plataforma a través de campañas de correo electrónico
Sesión: calcula el flujo de clics y el tiempo dedicado a los conjuntos de datos
Búsqueda: calcula las métricas relacionadas con el ranking de búsqueda
Mantenimiento de la infraestructura de datos: raspado de bases de datos, limpieza de carpetas, aplicación de políticas de retención de datos

La creación del pipeline también se realiza en Python, lo que significa que la generación dinámica de tuberías a partir de archivos de configuración o cualquier otra fuente de metadatos es algo natural.

Why we switched to Apache Airflow – Solita

Si bien se puede comenzar a usar Airflow con solo unos pocos comandos, la arquitectura completa tiene los siguientes componentes:

CLI (interfaz de línea de comandos) para probar, ejecutar, rellenar, describir y borrar partes de los trabajos.
Una aplicación web, para explorar la definición de sus trabajos, sus dependencias, progreso, metadatos y registros. El servidor web está empaquetado con Airflow y está construido sobre el marco web Flask Python.
Un repositorio de metadatos, generalmente una base de datos MySQL o Postgres que Airflow utiliza para control de los estados de tareas.
Una serie de workers que ejecutan las instancias de tareas de forma distribuida.
Procesos del planificador, que activan las instancias de tareas que están listas para ejecutarse.

Extensibilidad

Si bien Airflow viene completamente cargado con formas de interactuar con sistemas de uso común como Hive, Presto, MySQL, HDFS, Postgres y S3, y le permite activar scripts arbitrarios, los módulos base se han diseñado para ampliarse con mucha facilidad.

Existen operadores que aprovechan “hooks” para generar un cierto tipo de tarea que se convierten en nodos en los flujos de trabajo cuando se instancian. Todos los operadores derivan de BaseOperator y heredan un rico conjunto de atributos y métodos. Hay 3 tipos principales de operadores:

Operadores que realizan una acción o le dicen a otro sistema que realice una acción.
Los operadores de transferencia mueven datos de un sistema a otro
Los sensores, son un cierto tipo de operadores que seguirán funcionando hasta que se cumplan ciertos criterios

Los ejecutores implementan una interfaz que permite que los componentes de Airflow (CLI, planificador, servidor web) ejecuten trabajos de forma remota. Airflow actualmente se envía con un SequentialExecutor (para fines de prueba), un LocalExecutor roscado y un CeleryExecutor que aprovecha Celery, una excelente cola de tareas asincrónicas basada en el paso de mensajes distribuidos.

Una interfaz de usuario brillante

Si bien Airflow trae una excelente línea de comandos, la mejor manera de monitorear e interactuar con los flujos de trabajo es a través de la interfaz de usuario web. Se puede visualizar fácilmente las dependencias de los pipelines, ver cómo progresan, obtener acceso a los registros, ver el código relacionado, desencadenar tareas, corregir falsos positivos / negativos, analizar dónde se invierte el tiempo y obtener una vista completa de como terminan las diferentes tareas. La interfaz de usuario también es un lugar donde se exponen algunas funciones administrativas: administrar conexiones, grupos y pausar el progreso en ejecuciones específicas.

Airflow: a workflow management platform - Airbnb Engineering ...

Ademas, y como plato fuerte, la interfaz de usuario sirve una sección de perfil de datos que permite a los usuarios ejecutar consultas SQL en las conexiones registradas, examinar los conjuntos de resultados y ofrecer una forma de crear y compartir gráficos simples. La aplicación de gráficos es una combinación de Highcharts, la interfaz CRUD de Flask Admin y las bibliotecas de hooks y macros de Airflow. Los parámetros de URL se pueden pasar al SQL en su gráfico, y las macros Airflow están disponibles a través de la plantilla Jinja. Con estas características, los usuarios de Airflow pueden crear y compartir fácilmente consultas, conjuntos de resultados y gráficos.

Un catalizador

Airbnb dice que como resultado del uso de Airflow, la productividad y el entusiasmo de las personas que trabajan con datos se han multiplicado. El proceso de creación se ha acelerado y la cantidad de tiempo de monitoreo y solución de problemas se reduce significativamente. Más importante aún, esta plataforma permite a las personas ejecutar a un nivel más alto de abstracción, creando bloques de construcción reutilizables, así como marcos y servicios de cómputo.
Para conocer mas sobre Airflow, este el sitio de Airbnb: https://github.com/airbnb/airflow

[popup_anything id=”2076″]

Tags Airbnb, Airflow, Python

54cuatro

Las diferentes etapas de la gestión de datos

Post author By 54admin
Post date 25/04/2020
No hay comentarios en Las diferentes etapas de la gestión de datos

Actualmente mucho se habla de #BigData y #DataScience, y sus beneficios. Pero es importante destacar que la informacion es algo común en todas las empresas, que los Reportes y Dashboards existen hace mucho tiempo y que no es necesario realizar inversiones grandes para sacar valor de nuestros datos. Actualmente se menciona el uso de la informacion como el “petroleo” de las compañías a raíz del gran valor que se obtiene, pero mas allá de una cuestión tecnológica una estrategia de datos requiere coordinación de distintas áreas, desde los sectores de negocios, hasta los sectores técnicos. En #54cuatro tenemos una metodología propia de gestión, basada en #DataOps para realizar acciones conjuntas entre sectores para lograr los objetivos de negocios planteados.

Infografía

Analisis de Datos — Las diferentes etapas en la **Gestión de Datos**. *Clic para ver la imagen completa*

Marco metodológico

Cuando iniciamos una consultoría basada en datos, es preciso identificar el tipo de proyecto, basado en el resultado esperado. No es el mismo abordaje el que se realiza en un proyecto basado en la búsqueda de ahorros operativos que un proyecto que busque monetizar los datos. Tampoco es igual un cliente de la industria manufacturera que un cliente de retail electrónico. Es por tal motivo que en #54cuatro trabajamos las necesidades de negocio ante una metodología propia de análisis.

Antes de abordar un proyecto de datos, debemos recordar que no es lo mismo definir Estrategia, Táctica y Técnica, y que el resultado exitoso dependerá en gran parte del planeamiento Estratégico, que contenga la Táctica y la Técnica para dar con el resultado propuesto.

1) En la Estrategia debemos definir aquellos elementos que seran necesarios para alcanzar un objetivo propuesto.

2) En la Táctica definimos propiamente el método utilizado a fin de dar con objetivo.

3) Y la Técnica es la forma de utilizar los recursos de manera eficiente para cumplir con lo propuesto.

A partir de esto es que nuestra metodología busca:

Entender los requisitos de negocios, ya que son el paso fundamental de todo proyecto, y para esta fase, un analista de negocios asignado debe ser especialista en la Industria/Rubro del cliente.
A partir de conocer que se busca, se plantean los objetivos, y como se alinearan las estrategias de negocios con las tácticas y técnicas para lograr los resultados.
Finalmente se desarrollaran tecnológicamente todas las soluciones que nos acerquen al objetivo.
Y finalmente serán presentados resultados con el fin de determinar el nivel de cumplimiento con lo buscado originalmente.

La presentación de resultados

Esta etapa es tan importante que podría hacerse una nota completa para esto. Saber comunicar los resultados es vital en todo proyectos de datos. Es necesario poder identificar la forma en que se mostraran resultados operativos, KPI, reportes, métricas, alarmas, etc. También es una condición fundamental lograr interpretar el publico al que dirigimos nuestra información, y poder saber cuando corresponde enviar un archivo, cuando podemos crear un tablero de #BI, o cuando necesitamos comunicar de otras maneras, ya sea haciendo #StoryTelling de la info o mandando un mail con un resumen.

Por ejemplo, si un gerente comercial quiere conocer un agrupamiento de ventas, que creen que querría ver:

En el gráfico 1 tenemos la salida de un agrupamiento realizado en #Python. En el gráfico 2, un Dashboard con informacion consolidada. No quedan dudas que un Dashboard es útil como Cuadro de Mando, no solo por la informacion, sino porque visualmente permite explorar datos complejos y conocer métricas claves de manera simple.

[popup_anything id=”2076″]

Tags BI, BigData, dataops, Datascience, Python, StoryTelling

54cuatro

Observatorio CoVid_19

Post author By 54admin
Post date 16/03/2020
No hay comentarios en Observatorio CoVid_19

Si te interesa conocer las estadísticas del #Coronavirus, podes visualizar toda la informacion, actualizada automáticamente de forma diaria haciendo clic acá abajo

[popup_anything id=”2163″]

Es un desarrollo hecho en #Python y graficado con el modulo Dash de #Plotlypor el equipo de #54cuatro.

[popup_anything id=”2076″]

Tags coronavirus, Plotlypor, Python

54cuatro

El triatlon y su relación con el mercado laboral de IT

Post author By 54admin
Post date 18/01/2020
No hay comentarios en El triatlon y su relación con el mercado laboral de IT

Hace unos años atrás los triatletas no eran #triatletas de nacimiento. Para los que no saben, el triatlon como deporte es relativamente joven. El #triatlon #Ironman, nació en 1978, del desafío acerca de sus cualidades como atletas de un #nadador, un #ciclista y un #maratonista. Y la International Triathlon Union que regula el triatlon olímpico fue fundada en 1989. Hasta hace poco tiempo, las competencias eran ganadas por ex nadadores devenidos en triatletas, ex ciclistas devenidos en triatletas o ex maratonistas devenidos en triatletas.

Gonzalo D’Angelo – CTO de 54cuatro y 3x Ironman

Con el pasar de los años naciendo deportistas formados como triatletas desde su infancia. Su fortaleza no reside en nadar, en pedalear o en correr, de forma individual, sino en ejecutar las 3 disciplinas de forma eficaz, permitiendo generar marcas asombrosas en cada carrera.
Y porque esta introducción? En la tecnología esta pasando algo similar. Ex sysadmins devenidos en #DevOps. Ex administradores de storage transformados en Cloud Specialist. Ex #DBA que mutaron a roles de #BigData. Ni que hablar de los programadores. Con el auge de #Python y #R, muchos fueron variando sus perfiles hacia este lenguaje.

Todos sabemos el déficit de profesionales de IT, pero también sabemos que es necesario lograr perfiles de especialistas en poco tiempo. La industria de los videojuegos crece YoY de manera sustancial, una demanda que crece por muchos sobre la oferta de recursos. De igual manera, la industria basada en datos, crece al ritmo de la generación de datos. Las necesidades de recursos como #DataEngineers y #DataScientist son cada vez mayores. Incluso gracias al auge del análisis de informacion, se han sumado al IT tradicional muchos especialistas en estadísticas (desde matemáticos hasta economistas) que han logrado aportar un gran valor a la generación de algoritmos.

Ni que hablar la unión de los mundos físicos y lógicos, que vienen de la mano de las tecnologías 4.0. Electrónica, Robótica, Seguridad Informática, Desarrollo, Análisis de datos. Lo que hasta hace poco eran actividades con algunos puntos de contacto hoy son un subconjunto en el marco de la revolución 4.0.

Entidades como el #ITBA o #DigitalHouse vienen haciendo un trabajo estupendo, aggiornando su curricula, desarrollando programas específicos, pero es necesario habilitar de forma inmediata la especialización de la formación desde etapas tempranas para generar nuevos Ingenieros, con dotes de #Desarrolladores, #Ingenieros y Cientistas de Datos, Especialistas de Seguridad, ligados de forma temprana a Ingenieros eléctricos, civiles, en robótica, para que las industrias puedan lograr cubrir la demanda de profesionales; y porque no también pensar en Ingenieros en Videojuegos o en Industria 4.0.

[popup_anything id=”2076″]

Tags BigData, ciclista, DataEngineers, datascientist, DBA, desarrolladores, DevOps, DigitalHouse, Ingenieros, ironman, ITBA, maratonista, nadador, Python, triatletas, triatlon