<?xml version="1.0" encoding="UTF-8"?>
<feed xmlns="http://www.w3.org/2005/Atom" xmlns:dc="http://purl.org/dc/elements/1.1/">
<title>Vol. 8, no. 01 | Simposio Argentino de Ciencia de Datos y GRANdes DAtos (AGRANDA 2022)</title>
<link href="http://sedici.unlp.edu.ar:80/handle/10915/151570" rel="alternate"/>
<subtitle/>
<id>http://sedici.unlp.edu.ar:80/handle/10915/151570</id>
<updated>2026-07-19T06:16:51Z</updated>
<dc:date>2026-07-19T06:16:51Z</dc:date>
<entry>
<title>Generación automática de código fuente a través de modelos preentrenados de lenguaje, un análisis de la literatura</title>
<link href="http://sedici.unlp.edu.ar:80/handle/10915/151591" rel="alternate"/>
<author>
<name>Bender, Adrian</name>
</author>
<author>
<name>Nicolet, Santiago</name>
</author>
<author>
<name>Folino, Pablo</name>
</author>
<author>
<name>Lopez, Juan José</name>
</author>
<author>
<name>Hansen, Gustavo</name>
</author>
<id>http://sedici.unlp.edu.ar:80/handle/10915/151591</id>
<updated>2023-05-03T19:59:46Z</updated>
<published>2022-01-01T00:00:00Z</published>
<summary type="text">Objeto de conferencia
Simposio Argentino de Ciencia de Datos y GRANdes DAtos (AGRANDA 2022) - JAIIO 51 (Modalidad virtual y presencial (UAI), octubre 2022)
Un Transformer es un modelo de Aprendizaje Profundo creado en 2017 con el objetivo de realizar traducciones entre lenguajes naturales. Las innovaciones que introdujo, particularmente la de auto-atención, han permitido construir prototipos que tienen una noción intuitiva del contexto, y comprenden el significado y los patrones subyacentes del lenguaje. En 2020 OpenAI hizo público GPT-3, un modelo preentrenado enfocado hacia la generación de lenguaje, que mostró resultados prometedores, creando textos con una calidad tal que se hace difícil distinguir si fueron escritos por un humano o por una máquina. Podemos afirmar que el código fuente es texto generado en un lenguaje formal, y por lo tanto podría ser generado con herramientas basadas en estos prototipos. Este trabajo presenta un estudio de la evolución y el estado del arte en este campo: la generación automática de código fuente a partir de especificaciones escritas en lenguaje natural. Recorremos diferentes casos, su éxito, las dificultades de encontrar mecanismos de evaluación y su posible implementación en un futuro por las empresas 
</summary>
<dc:date>2022-01-01T00:00:00Z</dc:date>
<dc:description>Un Transformer es un modelo de Aprendizaje Profundo creado en 2017 con el objetivo de realizar traducciones entre lenguajes naturales. Las innovaciones que introdujo, particularmente la de auto-atención, han permitido construir prototipos que tienen una noción intuitiva del contexto, y comprenden el significado y los patrones subyacentes del lenguaje. En 2020 OpenAI hizo público GPT-3, un modelo preentrenado enfocado hacia la generación de lenguaje, que mostró resultados prometedores, creando textos con una calidad tal que se hace difícil distinguir si fueron escritos por un humano o por una máquina. Podemos afirmar que el código fuente es texto generado en un lenguaje formal, y por lo tanto podría ser generado con herramientas basadas en estos prototipos. Este trabajo presenta un estudio de la evolución y el estado del arte en este campo: la generación automática de código fuente a partir de especificaciones escritas en lenguaje natural. Recorremos diferentes casos, su éxito, las dificultades de encontrar mecanismos de evaluación y su posible implementación en un futuro por las empresas </dc:description>
</entry>
<entry>
<title>Automating Customer Experience Agents’ Evaluation with Natural Language Processing</title>
<link href="http://sedici.unlp.edu.ar:80/handle/10915/151592" rel="alternate"/>
<author>
<name>García Aramouni, Nicolás</name>
</author>
<author>
<name>Pelli, Nahuel</name>
</author>
<author>
<name>Soules, Lucas</name>
</author>
<author>
<name>De Antonio, Julieta</name>
</author>
<author>
<name>Nosetti, Ines</name>
</author>
<author>
<name>Cazorla, Juan</name>
</author>
<author>
<name>Fraguas, Pedro</name>
</author>
<id>http://sedici.unlp.edu.ar:80/handle/10915/151592</id>
<updated>2023-05-03T19:59:46Z</updated>
<published>2022-01-01T00:00:00Z</published>
<summary type="text">Objeto de conferencia
Simposio Argentino de Ciencia de Datos y GRANdes DAtos (AGRANDA 2022) - JAIIO 51 (Modalidad virtual y presencial (UAI), octubre 2022)
The importance and relevance of online commerce in society have grown uninterruptedly over the last years, with people changing their purchasing habits. The COVID-19 pandemic significantly accelerated this adoption, as quarantines forced people to stay in their homes. Under this scenario, online shopping became a more convenient option, considering product availability, the possibility to compare prices and shipping options, and door-to-door delivery. With this, e-commerce retailers and marketplaces must give excellent customer service to their customers, especially in this context when most activities are returning to their pre-COVID levels and restrictions. To manage customers that have any kind of problem, digital marketplaces and retailers usually have a team of Customer Experience (CX) agents that interact, talk and answer clients’ questions and inquiries, avoiding any potential negative situations on three different channels: voice calls, e-mails, and chat messages.
</summary>
<dc:date>2022-01-01T00:00:00Z</dc:date>
<dc:description>The importance and relevance of online commerce in society have grown uninterruptedly over the last years, with people changing their purchasing habits. The COVID-19 pandemic significantly accelerated this adoption, as quarantines forced people to stay in their homes. Under this scenario, online shopping became a more convenient option, considering product availability, the possibility to compare prices and shipping options, and door-to-door delivery. With this, e-commerce retailers and marketplaces must give excellent customer service to their customers, especially in this context when most activities are returning to their pre-COVID levels and restrictions. To manage customers that have any kind of problem, digital marketplaces and retailers usually have a team of Customer Experience (CX) agents that interact, talk and answer clients’ questions and inquiries, avoiding any potential negative situations on three different channels: voice calls, e-mails, and chat messages.</dc:description>
</entry>
<entry>
<title>Generación automática de resúmenes abstractivos de noticias en español</title>
<link href="http://sedici.unlp.edu.ar:80/handle/10915/151590" rel="alternate"/>
<author>
<name>Bernoldi, Renso</name>
</author>
<author>
<name>Tolosa, Gabriel Hernán</name>
</author>
<id>http://sedici.unlp.edu.ar:80/handle/10915/151590</id>
<updated>2023-05-03T19:59:46Z</updated>
<published>2022-01-01T00:00:00Z</published>
<summary type="text">Objeto de conferencia
Simposio Argentino de Ciencia de Datos y GRANdes DAtos (AGRANDA 2022) - JAIIO 51 (Modalidad virtual y presencial (UAI), octubre 2022)
Una tarea desafiante es la extracción automática de información relevante en documentos escritos. Los últimos esfuerzos, principalmente para el idioma inglés, toman ventaja de las arquitecturas basadas en Transformers, actualmente utilizadas para diferentes tareas relacionadas con el lenguaje. En este trabajo se propone y evalúa un pipeline de procesamiento basado en BERT para la generación de resúmenes abstractivos sobre noticias en español. Los resultados preliminares muestran una performance competitiva con los modelos para el idioma inglés, estableciendo una referencia para potenciales mejoras.
</summary>
<dc:date>2022-01-01T00:00:00Z</dc:date>
<dc:description>Una tarea desafiante es la extracción automática de información relevante en documentos escritos. Los últimos esfuerzos, principalmente para el idioma inglés, toman ventaja de las arquitecturas basadas en Transformers, actualmente utilizadas para diferentes tareas relacionadas con el lenguaje. En este trabajo se propone y evalúa un pipeline de procesamiento basado en BERT para la generación de resúmenes abstractivos sobre noticias en español. Los resultados preliminares muestran una performance competitiva con los modelos para el idioma inglés, estableciendo una referencia para potenciales mejoras.</dc:description>
</entry>
<entry>
<title>Geolocalización de usuarios en Twitter utilizando redes convolucionales de grafos</title>
<link href="http://sedici.unlp.edu.ar:80/handle/10915/151589" rel="alternate"/>
<author>
<name>Funes, Federico M.</name>
</author>
<author>
<name>Álvarez-Hamelin, J. Ignacio</name>
</author>
<author>
<name>Beiró, Mariano G.</name>
</author>
<id>http://sedici.unlp.edu.ar:80/handle/10915/151589</id>
<updated>2023-05-03T19:59:46Z</updated>
<published>2022-01-01T00:00:00Z</published>
<summary type="text">Objeto de conferencia
Simposio Argentino de Ciencia de Datos y GRANdes DAtos (AGRANDA 2022) - JAIIO 51 (Modalidad virtual y presencial (UAI), octubre 2022)
En este trabajo utilizamos un conjunto de datos recolectados de la red social Twitter con el objetivo de analizar el desempeño de distintos modelos que proponemos para determinar la geolocalización de los usuarios de la plataforma. También realizamos un análisis sobre los perfiles de los usuarios para verificar qué tan fiable puede ser la determinación de su residencia. En el artículo detallamos distintas formas de construir las redes que modelan las relaciones entre los usuarios a fin de mejorar la estimación de su ubicación, con sus respectivas ventajas y desventajas. Por último, explicamos nuestro procedimiento para la detección de términos locales, y la conformación de secuencias para los métodos basados en redes neuronales.
</summary>
<dc:date>2022-01-01T00:00:00Z</dc:date>
<dc:description>En este trabajo utilizamos un conjunto de datos recolectados de la red social Twitter con el objetivo de analizar el desempeño de distintos modelos que proponemos para determinar la geolocalización de los usuarios de la plataforma. También realizamos un análisis sobre los perfiles de los usuarios para verificar qué tan fiable puede ser la determinación de su residencia. En el artículo detallamos distintas formas de construir las redes que modelan las relaciones entre los usuarios a fin de mejorar la estimación de su ubicación, con sus respectivas ventajas y desventajas. Por último, explicamos nuestro procedimiento para la detección de términos locales, y la conformación de secuencias para los métodos basados en redes neuronales.</dc:description>
</entry>
<entry>
<title>Ciencia de datos y reportes de movilidad Google para modelizar la demanda de combustible</title>
<link href="http://sedici.unlp.edu.ar:80/handle/10915/151586" rel="alternate"/>
<author>
<name>No, Irma Noemí</name>
</author>
<author>
<name>Tornillo, Julián E.</name>
</author>
<author>
<name>Pascal, Guadalupe</name>
</author>
<author>
<name>Rabbione, Leandro</name>
</author>
<id>http://sedici.unlp.edu.ar:80/handle/10915/151586</id>
<updated>2023-05-03T19:59:46Z</updated>
<published>2022-01-01T00:00:00Z</published>
<summary type="text">Objeto de conferencia
Simposio Argentino de Ciencia de Datos y GRANdes DAtos (AGRANDA 2022) - JAIIO 51 (Modalidad virtual y presencial (UAI), octubre 2022)
La reciente situación de pandemia mundial impulsó la generación de reportes abiertos de movilidad, iniciativa creada por la empresa Google en apoyo a las políticas sanitarias asociadas al COVID-19. El cambio significativo en el flujo de vehículos durante la situación de pandemia y la variación en el consumo de combustible asociado al transporte y a diversas actividades productivas, requirió la creación de nuevos modelos predictivos relacionados con un conjunto de datos inusuales (por ejemplo, la geolocalización de los conductores). La manipulación y el análisis adecuado de estos datos proporcionan un pronóstico que mejora la previsión de la demanda de combustible asociada al consumo real. En este trabajo analizamos las bases de datos de la venta de combustibles (nafta y diésel), disponibles y abiertas en sitios web oficiales e información de la empresa YPF. Los resultados muestran una correlación positiva entre las variables relacionadas a la demanda de estos combustibles y los registros de movilidad de Google, con ciertas particularidades. El lenguaje de programación utilizado para el desarrollo del código de visualización, geoestadística, cálculo predictivo y reportes de la investigación es “R”.
</summary>
<dc:date>2022-01-01T00:00:00Z</dc:date>
<dc:description>La reciente situación de pandemia mundial impulsó la generación de reportes abiertos de movilidad, iniciativa creada por la empresa Google en apoyo a las políticas sanitarias asociadas al COVID-19. El cambio significativo en el flujo de vehículos durante la situación de pandemia y la variación en el consumo de combustible asociado al transporte y a diversas actividades productivas, requirió la creación de nuevos modelos predictivos relacionados con un conjunto de datos inusuales (por ejemplo, la geolocalización de los conductores). La manipulación y el análisis adecuado de estos datos proporcionan un pronóstico que mejora la previsión de la demanda de combustible asociada al consumo real. En este trabajo analizamos las bases de datos de la venta de combustibles (nafta y diésel), disponibles y abiertas en sitios web oficiales e información de la empresa YPF. Los resultados muestran una correlación positiva entre las variables relacionadas a la demanda de estos combustibles y los registros de movilidad de Google, con ciertas particularidades. El lenguaje de programación utilizado para el desarrollo del código de visualización, geoestadística, cálculo predictivo y reportes de la investigación es “R”.</dc:description>
</entry>
<entry>
<title>Inferencia causal en series de tiempo de Twitter y encuestas políticas</title>
<link href="http://sedici.unlp.edu.ar:80/handle/10915/151587" rel="alternate"/>
<author>
<name>Albanese, Federico</name>
</author>
<author>
<name>Baldonado, Juan Manuel</name>
</author>
<author>
<name>Feuerstein, Esteban</name>
</author>
<id>http://sedici.unlp.edu.ar:80/handle/10915/151587</id>
<updated>2023-05-03T19:59:46Z</updated>
<published>2022-01-01T00:00:00Z</published>
<summary type="text">Objeto de conferencia
Time series causal inference between the political discourse on Twitter and opinion polls
Simposio Argentino de Ciencia de Datos y GRANdes DAtos (AGRANDA 2022) - JAIIO 51 (Modalidad virtual y presencial (UAI), octubre 2022)
Las redes sociales han sido utilizadas como medios para la discusión política de los ciudadanos. En este trabajo nos propusimos analizar la influencia que ejerce el discurso en las redes sociales sobre la opinión pública de los candidatos políticos en contextos electorales. Para ello conformamos un dataset con 4.4 millones de tweets políticos durante las elecciones presidenciales estadounidenses entre Trump y Biden del 2020 y analizamos 229 encuestas presidenciales realizadas por 29 encuestadores. Luego, armamos series temporales con los resultados de las encuestas y con la cantidad, tópico del que hablan y sentimiento (positividad / negatividad) de los tweets que mencionan a cada candidato, usando técnicas de procesamiento del lenguaje natural de forma similar a trabajos previos. Aplicando herramientas de inferencia causal en series de tiempo como la causalidad de Granger, Información Mutua Condicional y Base de Funciones Radiales, encontramos resultados estadísticamente significativos de una relación causal. En particular, el sentimiento con el que se habla de los candidato y ciertos tópicos particulares que se debaten en Twitter impactan sobre la intención de voto que finalmente recibe cada candidato presidencial.; In recent years, social networks have been the place where citizens exchange their political opinions. In this work, we analyzed the causal influence between the discourse in social networks on the opinion of political candidates in electoral contexts. Therefore, we created a dataset with 4.4 million political tweets during the 2020 US presidential election between Trump and Biden and analyzed 229 presidential polls conducted by 29 different pollsters. Then, we create time series with the poll’s results and with the quantity, topic and sentiment (positive / negative) of the tweets that mentioned the candidates, using natural language processing techniques similarly to previous works. Using time series causal inference tools such as Granger causality, conditional mutual information and radial basis function, we found significant results of causal relationships. In particular, the positivity / negativity of the tweets and some topics discussed on Twitter had a causal impact on each presidential candidate’s polling.
</summary>
<dc:date>2022-01-01T00:00:00Z</dc:date>
<dc:description>Las redes sociales han sido utilizadas como medios para la discusión política de los ciudadanos. En este trabajo nos propusimos analizar la influencia que ejerce el discurso en las redes sociales sobre la opinión pública de los candidatos políticos en contextos electorales. Para ello conformamos un dataset con 4.4 millones de tweets políticos durante las elecciones presidenciales estadounidenses entre Trump y Biden del 2020 y analizamos 229 encuestas presidenciales realizadas por 29 encuestadores. Luego, armamos series temporales con los resultados de las encuestas y con la cantidad, tópico del que hablan y sentimiento (positividad / negatividad) de los tweets que mencionan a cada candidato, usando técnicas de procesamiento del lenguaje natural de forma similar a trabajos previos. Aplicando herramientas de inferencia causal en series de tiempo como la causalidad de Granger, Información Mutua Condicional y Base de Funciones Radiales, encontramos resultados estadísticamente significativos de una relación causal. En particular, el sentimiento con el que se habla de los candidato y ciertos tópicos particulares que se debaten en Twitter impactan sobre la intención de voto que finalmente recibe cada candidato presidencial.

In recent years, social networks have been the place where citizens exchange their political opinions. In this work, we analyzed the causal influence between the discourse in social networks on the opinion of political candidates in electoral contexts. Therefore, we created a dataset with 4.4 million political tweets during the 2020 US presidential election between Trump and Biden and analyzed 229 presidential polls conducted by 29 different pollsters. Then, we create time series with the poll’s results and with the quantity, topic and sentiment (positive / negative) of the tweets that mentioned the candidates, using natural language processing techniques similarly to previous works. Using time series causal inference tools such as Granger causality, conditional mutual information and radial basis function, we found significant results of causal relationships. In particular, the positivity / negativity of the tweets and some topics discussed on Twitter had a causal impact on each presidential candidate’s polling.</dc:description>
</entry>
<entry>
<title>Toxicity, polarizations and cultural diversity in social networks: Using machine learning and natural language processing to analyze these phenomena in social networks</title>
<link href="http://sedici.unlp.edu.ar:80/handle/10915/151588" rel="alternate"/>
<author>
<name>Oppenheim, Abi</name>
</author>
<author>
<name>Albanese, Federico</name>
</author>
<author>
<name>Feuerstein, Esteban</name>
</author>
<id>http://sedici.unlp.edu.ar:80/handle/10915/151588</id>
<updated>2023-05-03T19:59:46Z</updated>
<published>2022-01-01T00:00:00Z</published>
<summary type="text">Objeto de conferencia
Simposio Argentino de Ciencia de Datos y GRANdes DAtos (AGRANDA 2022) - JAIIO 51 (Modalidad virtual y presencial (UAI), octubre 2022)
Social media have increased the amount of information that people consume as well as the number of interactions between them. Nevertheless, most people tend to promote their favored narratives and hence form polarized groups. This encourages polarization and extremism resulting in extreme violence. Against this backdrop, it is in our interest to find environments, strategies and mechanisms that allow us to reduce toxicity on social media (defining “toxicity” as a rude, disrespectful or unreasonable comment that is likely to make people leave a discussion). We address the hypothesis that a higher cultural diversity among community users reduces the toxicity of the user messages. We use Reddit as a case study, since this platform is characterized by a variety of discussion sub-forums where users debate political and cultural issues. Using community2vec, we generate an embedding for each community that allows us to portray users in a demographic and ideological aspect. In order to analyze each user statement, we process the data with different models, thereby obtaining which are the topics of debate and what are the levels of aggressiveness and negativism in them. Finally, we will seek to corroborate the hypothesis by analyzing the relationship between the cultural diversity present in each discussion group and the toxicity found in their posts.
</summary>
<dc:date>2022-01-01T00:00:00Z</dc:date>
<dc:description>Social media have increased the amount of information that people consume as well as the number of interactions between them. Nevertheless, most people tend to promote their favored narratives and hence form polarized groups. This encourages polarization and extremism resulting in extreme violence. Against this backdrop, it is in our interest to find environments, strategies and mechanisms that allow us to reduce toxicity on social media (defining “toxicity” as a rude, disrespectful or unreasonable comment that is likely to make people leave a discussion). We address the hypothesis that a higher cultural diversity among community users reduces the toxicity of the user messages. We use Reddit as a case study, since this platform is characterized by a variety of discussion sub-forums where users debate political and cultural issues. Using community2vec, we generate an embedding for each community that allows us to portray users in a demographic and ideological aspect. In order to analyze each user statement, we process the data with different models, thereby obtaining which are the topics of debate and what are the levels of aggressiveness and negativism in them. Finally, we will seek to corroborate the hypothesis by analyzing the relationship between the cultural diversity present in each discussion group and the toxicity found in their posts.</dc:description>
</entry>
<entry>
<title>Desarrollo de un pipeline de datos para la predicción de incendios forestales en Pinamar</title>
<link href="http://sedici.unlp.edu.ar:80/handle/10915/151585" rel="alternate"/>
<author>
<name>Martínez Saucedo, Ana</name>
</author>
<author>
<name>Inchausti, Pablo Ezequiel</name>
</author>
<id>http://sedici.unlp.edu.ar:80/handle/10915/151585</id>
<updated>2023-05-03T19:59:46Z</updated>
<published>2022-01-01T00:00:00Z</published>
<summary type="text">Objeto de conferencia
Simposio Argentino de Ciencia de Datos y GRANdes DAtos (AGRANDA 2022) - JAIIO 51 (Modalidad virtual y presencial (UAI), octubre 2022)
En los últimos años, la severidad de los incendios forestales ha llegado a niveles preocupantes tanto a nivel internacional como nacional. No obstante, gracias al avance de la tecnología es posible predecir la ocurrencia y magnitud de los mismos a través de modelos de Machine Learning especialmente desarrollados para tal fin. Para lograr este objetivo, el presente trabajo describe el desarrollo de un pipeline de datos automatizado en el lenguaje de programación Python que genera el dataset de incendios forestales específico al Partido de Pinamar, permitiendo así el posterior entrenamiento de modelos predictivos de incendios. El mismo es a su vez configurable para reunir datos meteorológicos, topográficos y de combustible de otras áreas geográficas.
</summary>
<dc:date>2022-01-01T00:00:00Z</dc:date>
<dc:description>En los últimos años, la severidad de los incendios forestales ha llegado a niveles preocupantes tanto a nivel internacional como nacional. No obstante, gracias al avance de la tecnología es posible predecir la ocurrencia y magnitud de los mismos a través de modelos de Machine Learning especialmente desarrollados para tal fin. Para lograr este objetivo, el presente trabajo describe el desarrollo de un pipeline de datos automatizado en el lenguaje de programación Python que genera el dataset de incendios forestales específico al Partido de Pinamar, permitiendo así el posterior entrenamiento de modelos predictivos de incendios. El mismo es a su vez configurable para reunir datos meteorológicos, topográficos y de combustible de otras áreas geográficas.</dc:description>
</entry>
</feed>
