Ficha Unidade Curricular (FUC)
Informação Geral / General Information
Carga Horária / Course Load
Área científica / Scientific area
Sistemas de Informação
Departamento / Department
Departamento de Ciências e Tecnologias da Informação
Ano letivo / Execution Year
2026/2027
Pré-requisitos / Pre-Requisites
É esperado que os alunos tenham alguns conhecimentos básicos em probabilidades e estatística, vetores e espaços vetoriais e análise matemática, embora estes conceitos sejam revistos na sua primeira utilização. O aluno deve ter conhecimentos de programação (conhecer as estruturas de dados mais comuns) e saber escrever programas em Python. O aluno deve também ter alguns conhecimentos básicos de shell script.
Objetivos Gerais / Objectives
O principal objetivo desta UC é o de dar a conhecer ao aluno o potencial das grandes quantidades de texto atualmente disponíveis e os métodos computacionais que podem ser utilizados para extrair conhecimento a partir desses dados. Os alunos devem ficar a conhecer as tecnologias necessárias ao desenvolvimento de processos de Text Mining. Pretende-se que os alunos conheçam as tecnologias envolvidas, as suas aplicações imediatas e as suas limitações. Assim, as principais competências e atitudes que identificam os processos cognitivos internos do aluno serão as seguintes: reconhecer as diferentes vertentes científicas envolvidas nos processos de Text Mining; perceber quais são os métodos, algoritmos e resultados de cada uma das tarefas envolvidas; conhecer as aplicações realizáveis com as tecnologias atuais e discutir a evolução futura (previsível) dos tópicos nucleares e sua aplicação específica a tarefas de extração de conhecimento de texto.
Objetivos de Aprendizagem e a sua compatibilidade com o método de ensino (conhecimentos, aptidões e competências a desenvolver pelos estudantes) / Learning outcomes
OA1. Compreender os fundamentos e desafios de Text Mining OA2. Conhecer técnicas de preparação, limpeza e representação de documentos OA3. Aplicar métodos de Processamento Computacional da Língua OA4. Classificar textos usando aprendizagem automática OA5. Agrupar documentos usando modelos de tópicos OA6. Aplicar na prática técnicas de Text Mining OA7. Descrever os conceitos, etapas e métodos principais envolvidos no desenvolvimento de processos de Text Mining OA8. Explicar o funcionamento de algoritmos avançados para extração de informação e classificação de texto e a sua aplicação no tratamento de casos reais OA9. Selecionar as técnicas apropriadas para tarefas específicas de análise de texto e avaliar os benefícios e desafios das opções adotadas
Conteúdos Programáticos / Syllabus
Introdução CP1: Utilidade de grandes quantidades de texto, desafios e métodos atuais CP2: Informação não estruturada vs. (semi-)estruturada CP3: Obtenção e filtragem de informação, extração de informação e Data Mining Representação de documentos CP4: Preparação e limpeza de documentos CP5: Extração de propriedades CP6: Estratégias de pesagem de termos CP7: Modelos de espaços vetoriais CP8: Medidas de similaridade Processamento Computacional da Língua CP9: Modelos de língua CP10: Morfologia e análise morfossintática CP11: Estruturas complexas: análise sintática e semântica CP12: Extração de informação Extração de conhecimento de texto CP13: Introdução à aprendizagem automática CP14: Abordagens supervisionadas CP15: Abordagens não supervisionadas CP16: Classificação de texto CP17: Descoberta de tópicos CP18: Aplicações
Demonstração da coerência dos conteúdos programáticos com os objetivos de aprendizagem da UC / Evidence that the curricular unit's content dovetails with the specified learning outcomes
Os conteúdos programáticos foram estruturados para dar resposta aos objetivos de aprendizagem. O bloco introdutório (CP1–CP3) sustenta OA1 e OA7, enquadrando fundamentos, desafios e etapas de Text Mining. A representação de documentos (CP4–CP8) concretiza OA2, cobrindo preparação, extração de propriedades, pesagem, modelos vetoriais e similaridade. O Processamento Computacional da Língua (CP9–CP12) operacionaliza OA3 e contribui para OA8, ao detalhar modelos de língua, análise morfossintáctica, sintáctica e extração de informação. A extração de conhecimento (CP13–CP15) alicerça a aprendizagem automática subjacente a OA4 e OA5, enquanto CP16 e CP17 respondem especificamente à classificação de texto (OA4) e à descoberta de tópicos (OA5). CP18, transversal, materializa OA6, OA8 e OA9, promovendo aplicação prática, compreensão de algoritmos avançados em casos reais e seleção fundamentada de técnicas com avaliação crítica das opções.
Avaliação / Assessment
Apenas é possível obter aprovação a esta UC por avaliação ao longo do semestre, não contemplando a modalidade de avaliação por exame. Componentes de avaliação: a) TESTES (2 mini-testes: 5% cada, teste final: 30%) - os mini-testes serão realizados durante o período letivo; - o teste final será realizado na data da avaliação de 1ª época b) TRABALHOS - proposta de trabalho final (relatório e apresentação) — 20% - trabalho final (relatório, código e apresentação) — 40% - entregues e apresentados durante o período letivo. Os trabalhos podem ser realizados individualmente ou em grupo, sendo o número de elementos do grupo definido nos enunciados dos trabalhos. Não existindo notas mínimas, a nota de TRABALHOS está limitada à nota de TESTES + 6 valores. Exemplos de cálculo da nota final: TRABALHOS = 20, TESTES = 14 --> Nota Final = 18 TRABALHOS = 20, TESTES = 10 --> Nota Final = 14 (a nota da componente TRABALHOS foi limitada a 16 valores = 10 + 6) Em caso de reprovação, a nota da componente TESTES pode ser substituída por uma prova escrita a realizar no período de avaliação correspondente à 2ª época ou época especial. A 2ª época também pode ser usada, nos mesmos moldes, para efeitos de melhoria de nota. A assiduidade não é requisito de aprovação.
Metodologias de Ensino / Teaching methodologies
15h de aulas teóricas e 21h de aulas teórico/práticas semestrais; esperam-se aproximadamente 6h/semana de trabalho autónomo. Todas as aulas deverão ser lecionadas em salas equipadas com projeção digital. Nas aulas teórico/práticas os estudantes devem ter acesso a computadores com acesso à Internet, a um ambiente de desenvolvimento de software (Python) e a um terminal para aceder a uma shell UNIX.
Demonstração da coerência das metodologias de ensino e avaliação com os objetivos de aprendizagem da UC / Evidence that the teaching and assessment methodologies are appropriate for the learning outcomes
As aulas teóricas são o meio ideal para a exposição dos conceitos teóricos necessários. As aulas teórico/práticas permitem uma maior interação entre o docente e o aluno, o que não só ajudará ao desenvolvimento do raciocínio e análise crítica desejáveis como também permitirá um enriquecimento da turma com os contributos específicos de cada estudante. O trabalho autónomo permitirá que o aluno desenvolva uma maior independência na abordagem deste tipo de problemas, permitindo um maior domínio dos principais conceitos.
Observações / Observations
Bibliografia Principal / Main Bibliography
Charu C. Aggarwal, Machine Learning for Text, 2018, https://link.springer.com/book/10.1007/978-3-319-73531-3 Gabe Ignatow, Rada F. Mihalcea, An Introduction to Text Mining: Research Design, Data Collection, and Analysis — 1st Edition, 2017, https://methods.sagepub.com/book/an-introduction-to-text-mining Dan Jurafsky and James H. Martin, Speech and Language Processing (3rd ed. draft), https://web.stanford.edu/~jurafsky/slp3/
Bibliografia Secundária / Secondary Bibliography
Atefeh Farzindar and Diana Inkpen, Natural Language Processing for Social Media, Second Edition. Synthesis Lectures on Human Language Technologies, 2018, https://link.springer.com/book/10.1007/978-3-031-02167-1 K. P. Murphy, Probabilistic Machine Learning: An Introduction, 2022, MIT Press. J. Eisenstein, Introduction to Natural Language Processing, 2019, MIT Press L. Tunstall, L. von Werra & T. Wolf, Natural Language Processing with Transformers (Revised ed.), 2022, O'Reilly.
Data da última atualização / Last Update Date
2026-09-09