Sumários

Alignment and Reasoning

20 Maio 2026, 18:00 Ana Catarina dos Santos Martins


1. Reasoning Models

2. Scaling Reinforcement Learning
3. Group Relative Policy Optimization

AlignmentPreference tuning, Data collection, Reinforcement Learning from Human Feedback

15 Maio 2026, 18:00 Ana Catarina dos Santos Martins


1. Preference tuning

2. Data collection
3. Reinforcement Learning from Human Feedback

Implementation and introduction to training

14 Maio 2026, 18:00 Ana Catarina dos Santos Martins


1. Implementation of the models presented in asynchronous lectures

2. Pretraining
3. Training optimizations
4. Supervised finetuning
5. Parameter efficient finetuning

Multimodality

8 Maio 2026, 18:00 Ana Catarina dos Santos Martins


1. Embeddings and Representation Learning

2. CLIP contrastive learning
3. Vision Encoders
4. Cross Attention
5. Multimodal LLMs

From Large Language Models to Mixture of Experts

6 Maio 2026, 18:00 Ana Catarina dos Santos Martins


1. Mixture of Experts

2. Response Generation
3. Prompting Strategies
4. Inference optimizations