Identificación de lenguaje misógino a partir de minería de textos en redes sociales

Blanco Toledano, Rubén. (2021). Identificación de lenguaje misógino a partir de minería de textos en redes sociales Master Thesis, Universidad Nacional de Educación a Distancia (España). Escuela Técnica Superior de Ingeniería Informática. Departamento de Inteligencia Artificial

Ficheros (Some files may be inaccessible until you login with your e-spacio credentials)
Nombre Descripción Tipo MIME Size
BlancoToledano_Ruben_TFM.pdf BlancoToledano_Ruben_TFM.pdf application/pdf 4.25MB

Título Identificación de lenguaje misógino a partir de minería de textos en redes sociales
Autor(es) Blanco Toledano, Rubén
Resumen En este trabajo se estudia la creación de un identificador de agresividad y de mensajes de odio hacia mujeres (mensajes misóginos) a partir de datos recogidos de la red social Twitter. Se trata de una respuesta a la tarea planteada en Automatic Misogyny Identification (AMI) por IberVal 2018. El estudio se compone de dos tareas. En la Task A se crea un identificador binario para determinar si un tweet tiene o no contenido misógino. En la Task B se desarrolla una clasificación acerca del entorno de los mensajes. Por un lado se identifica el objetivo al que va dirigido el mensaje (a una persona particular o a un público general) y por otro se realiza una clasificación del tipo de misoginia en torno a cinco posibles categorías de comportamientos misóginos. Se ha utilizado un conjunto de datos en castellano y otro en inglés para realizar una comparación entre lenguas. El estudio se basa por una parte en el preprocesado de los datos y la vectorización de los textos (con métodos como Bag of Words, TF-IDF o Doc2Vec) y por otra en la búsqueda de los mejores clasificadores posibles (con modelos como Naive Bayes, Regresión Logística, Support Vector Machine, Random Forest, Red Neuronal y Combinación de modelos ).
Abstract This project studies the creation of an identification method of cases of aggressiveness and hate speech towards women (misogynistic messages) from Twitter data. This is a response to the Automatic Misogyny Identification (AMI) shared task at IberEval 2018 The study is composed of two tasks. Task A is a binary classification task to determine if a tweet has misogynous content or not. Task B is a classification task to study the message environment. On the one hand, the objective is to know if the misogyny message was purposely addressed to a specific target (a particular person) or not (general people). On the other hand, the purpose is to distinguish different types of misogyny according to five possible categories. Two datasets are used in the study, one in Spanish and one in English, in order to make a comparison between languages. First of all, the study is based on the text vectorization (with Bag of Words, TF-IDF and Doc2Vec methods). Later, the objective is to search the best possible classifier algorithm (with models such as Naive Bayes, Logistic Regression, Support Vector Machine, Random Forest, Neural Network and Combination of models)
Notas adicionales Trabajo de Fin de Máster. Máster Universitario en Ingeniería y Ciencia de Datos. UNED
Materia(s) Ingeniería Informática
Palabra clave minería de textos
vectorización de textos
AMI
Automatic Misogyny Identification
misoginia
Twitter
clasifiación de tweets
NLP
text mining
text vectorization
misogyny
tweets classification
Editor(es) Universidad Nacional de Educación a Distancia (España). Escuela Técnica Superior de Ingeniería Informática. Departamento de Inteligencia Artificial
Director/Tutor Martínez Unanue, Raquel
Araujo Serna, Lourdes
Fecha 2021-06-01
Formato application/pdf
Identificador bibliuned:master-ETSInformatica-ICD-Rblanco
http://e-spacio.uned.es/fez/view/bibliuned:master-ETSInformatica-ICD-Rblanco
Idioma spa
Versión de la publicación acceptedVersion
Nivel de acceso y licencia http://creativecommons.org/licenses/by-nc-nd/4.0
info:eu-repo/semantics/openAccess
Tipo de recurso master Thesis
Tipo de acceso Acceso abierto

 
Versiones
Versión Tipo de filtro
Contador de citas: Google Scholar Search Google Scholar
Estadísticas de acceso: 529 Visitas, 611 Descargas  -  Estadísticas en detalle
Creado: Tue, 26 Oct 2021, 21:43:51 CET