Instituto Superior de Economia e Gestão

Trabalho Final de Mestrado

Ano Lectivo:	2019/2020
Aluno:	CATARINA CORREIA VIEGAS (50088)
Mestrado:	Gestão de Sistemas de Informação
Tipo:	Projecto
Título do Trabalho Final de Mestrado:	Assessing Public Figures? Reputation Through Sentiment Analysis on Twitter Using Machine Learning: Creation of a System
Sub Título:
Comentário:	-
Instituição:	-
Homologação:	Dia 19/12/2020 às 10:35 por NUNO JOÃO DE OLIVEIRA VALÉRIO

Resumo

Nunca se geraram tantos dados e a um ritmo tão alucinante como atualmente. Vive-se indubitavelmente numa era de Big Data e este termo não passa despercebido, trazendo consigo inúmeros desafios, mas também múltiplas oportunidades. Cerca de 80% dos dados encontra-se de forma desestruturada. Aqui, há um foco especial para o formato de texto, formato esse que para além de comum, agrega um grande potencial. Existem várias aplicações, técnicas e ferramentas associadas à análise de documentos textuais, e esta área surge fortemente ligada ao Processamento de Linguagem Natural. Um dos grandes desafios de ambos está relacionado com Análise de Sentimentos. Sendo interessante aliar tendências e abordar questões como a reputação online, o presente projeto focou-se na criação de um sistema capaz de identificar o sentimento associado a figuras públicas demonstrado através de publicações no Twitter. Com essa finalidade, o levou-se a cabo uma revisão de literatura capaz de explicitar os tópicos associados à temática escolhida. Relativamente ao sistema, optou-se por uma abordagem de Machine Learning com recurso a métodos supervisionados de aprendizagem. Para tal, criou-se um dataset manualmente anotado e procedeu-se ao treino de três classificadores (Naïve Bayes, Support Vector Machines e Entropia Máxima). O impacto de algumas técnicas de pré-processamento também foi medido. Os resultados obtidos não foram tão bons como desejado, mas o melhor modelo foi incorporado no sistema. Este projeto contribuiu para aumentar a base de conhecimento das áreas em que se insere, e fornece ainda um dataset manualmente anotado que poderá ser utilizado em investigações futuras. (Português)

Never has so much data been generated and at such an astounding rate as nowadays. This is undoubtedly an era of Big Data and this term does not go unnoticed, bearing within innumerous challenges, but also a multitude of opportunities. Of the generated data, roughly 80% comes unstructured, and there is a special focus on the text format, which appears frequently and carries great potential. There are several applications, techniques and tools connected to the analysis of textual documents and this area is strongly linked to Natural Language Processing. One of the greatest challenges of both is related to Sentiment Analysis. Since it would be interesting to combine trends and address issues such as online reputation, this project focused on creating a system capable of identifying the sentiment associated with public figures, demonstrated through Twitter publications. Firstly, a literature review capable of exploring the topics associated with the chosen subject was carried out. Afterwards,and regarding the system, a Machine Learning approach using supervised learning methods was adopted. For this, a manually annotated dataset was created and three of the most used classifiers (Naïve Bayes, Support Vector Machines and Maximum Entropy) were trained. The impact of some pre-processing techniques was also assessed. The obtained results were not as good as initially desired, nonetheless the best model was chosen to incorporate the system. This project contributed to increase the knowledge base of the areas in which it is comprised and provides a manually annotated dataset that can be used in further research. (Inglês)

Palavras-chave

Big Data, Machine Learning, Processamento Natural de Linguagem, Análise de Sentimentos, Reputação Online (Português)

Big Data, Machine Learning, Online Reputation, Natural Language Processing, Sentiment Analysis (Inglês)

Resumo Alargado

O Resumo Alargado ainda não foi submetido.

Data da Prova Pública

Data da Prova Pública:	13-01-2021 12:00

Voltar