Este documento orienta os projetos de classificação de texto utilizando Processamento de Linguagem Natural (NLP) e Machine Learning (ML). O foco será em explorar diversas bases de dados, entender o contexto de cada uma e aplicar técnicas avançadas para resolver problemas de classificação de texto do mundo real.
Este grupo ficou responsável para implementação da base de dados o Text Classification on Emails do Kaggle Repository. O projeto contará com 4 etapas:
- Tratamento da base de dados
- Implementação de um modelo baseline (KNN)
- Implementação de modelo avançado (LLMs)
- Comparativo dos modelos
Além disso, foram utilizadas as seguintes bibliotecas para importar, tratar, criar e treinar os modelos:
- Numpy
- Pandas
- Os
- Matplotlib
- Seaborn
- Streamlit
- Wordcloud
- Plotly
- Nltk
- String
- Regex
- Sklearn
- Disciplina: Tópicos de IA (ELE 606) - DEE/UFRN
- Semestre: 2024.1
- Componente(s): Roosewelt Muniz Marinho Junior