Currículo
Text Mining (Tda) 04397
Contextos
Groupo: Tecnologias Digitais e Inteligência Artificial - 2025 > 1º Ciclo > Unidades Curriculares Obrigatórias
ECTS
6.0 (para cálculo da média)
Objectivos
OA1: Definir os conceitos, etapas e métodos principais envolvidos no desenvolvimento de processos de Text Mining. OA2: Atomizar documentos, criar dicionários e realizar outras tarefas de pré-processamento para preparar texto para tarefas de classificação. OA3: Selecionar e justificar as técnicas apropriadas para tarefas específicas de processamento de texto. OA4: Construir representações vetoriais a partir de textos. OA5: Explicar o funcionamento de algoritmos para classificação de texto, como o Naïve Bayes ou KNN. OA6: Aplicar um classificador no tratamento de casos reais. OA7: Agrupar documentos usando o algoritmo K-means. OA8: Desenvolver engenharia de prompt em LLMs.
Programa
CP1: Utilidade de grandes quantidades de texto, desafios e métodos atuais. CP2: Informação não estruturada vs. (semi-)estruturada. CP3: Obtenção e filtragem de informação, extração de informação e Data Mining. CP4: Preparação e limpeza de documentos, extração de propriedades e estratégias de pesagem de termos. CP5: Modelos de espaços vetoriais e medidas de similaridade. CP6: Introdução à aprendizagem automática estatística e medidas de avaliação. CP7: Aprendizagem supervisionada: Naïve Bayes, KNN e K-means. CP8: Análise de sentimento. CP9: Recursos para Text Mining. CP10: Introdução a Deep Learning. CP11: LLMs e modelos Retrieval Augmented Generation (RAG).
Método de Avaliação
Esta UC segue o modelo de Avaliação ao Longo do Semestre (ALS). A ALS é constituída pelos seguintes elementos: - 1 trabalho prático [40%] - 3 mini-testes [20% cada * 3 = 60% no total] O trabalho prático poderá ser realizado individualmente ou em grupo, consistindo na elaboração de um projeto que será posteriormente alvo de discussão oral individual. Em qualquer elemento de avaliação, o docente ou coordenador da UC poderá solicitar, em qualquer momento durante o semestre, uma discussão oral individual destinada à confirmação da autoria dos trabalhos apresentados e/ou à aferição dos conhecimentos e competências demonstrados pelo estudante. A utilização de ferramentas de inteligência artificial generativa é permitida apenas como instrumento de apoio ao processo de aprendizagem, não podendo, em momento algum, substituir a autoria intelectual e a responsabilidade individual do estudante sobre qualquer elemento de avaliação entregue. O estudante é integralmente responsável pelo conteúdo submetido, devendo ser capaz de o justificar, explicar e defender perante o docente e/ou coordenador. Para esclarecimento adicional, é indispensável a leitura de outros documentos de referência para o processo de avaliação, tais como o Guia para uma Utilização Responsável da Inteligência Artificial em Trabalhos Académicos (Conselho Científico, 21/04/2026), o Código de Conduta Académica (CCA) e o Regulamento Disciplinar de Discentes (RDD). A presença física do aluno é obrigatória em todos os elementos de avaliação, sob pena de reprovação à UC e/ou de atribuição de 0 valores ao elemento de avaliação. Para obter aprovação na UC, o estudante deve obter uma classificação final mínima de 10 valores, calculada com base na soma ponderada de todos os elementos de avaliação, quer no modelo de ALS, quer no modelo de Avaliação por Exame. Um estudante é considerado reprovado a esta UC caso não obtenha aprovação na ALS ou em Avaliação por Exame. Em caso de reprovação na ALS (<10 valores), ou caso o estudante opte pelo modelo de Avaliação por Exame, o exame corresponde a 100% da nota. A presença nas aulas não é obrigatória.
Carga Horária
Carga Horária de Contacto -
Trabalho Autónomo - 113.0
Carga Total -
Bibliografia
Principal
- 1. Ozdemir, S. (2023). Quick Start Guide to Large Language Models: Strategies and Best Practices for Using ChatGPT and Other LLMs. Addison-Wesley Professional. 2. Tunstall, L., von Werra, L., & Wolf, T. (2022). Natural language processing with transformers, revised edition. O’Reilly Media. 3. Dan Jurafsky and James H. Martin (Sep 2021). Speech and Language Processing (3rd ed. draft). https://web.stanford.edu/~jurafsky/slp3/ 4. Vajjala, S., Majumder, B., Surana, H., & Gupta, A. (2020). Practical natural language processing: A pragmatic approach to processing and analyzing language data. O’Reilly Media. 5. Lane, H., Howard, C., & Hapke, H. (2019). Natural Language Processing in Action (First Edition). Pearson Professional.:
Secundária
- Charu C. Aggarwal (2018). Machine Learning for Text. https://doi.org/10.1007/978-3-319-73531- 3. Gabe Ignatow, Rada F. Mihalcea (2017). An Introduction to Text Mining: Research Design, Data Collection, and Analysis 1st Edition (2017). SAGE Publications: