MODULE 20
Fine-Tuning and Model Adaptation
Full fine-tuning, LoRA and QLoRA, quantisation, distributed training and data curation — with the maths behind each.
26 lessons~12h reading
- 0126 min
Prompt, RAG or Fine-Tune?
BeginnerComing soonA decision framework based on whether you need knowledge, behaviour or format, with cost comparisons.
Assumes: Prompt Engineering Fundamentals
- 0230 min
Full Fine-Tuning
AdvancedComing soonUpdating every parameter: memory arithmetic for weights, gradients and optimiser states, and when it is justified.
Assumes: Prompt, RAG or Fine-Tune?
- 0326 min
Catastrophic Forgetting
AdvancedComing soonWhy fine-tuning erases prior capability, how to measure it, and replay and regularisation mitigations.
Assumes: Full Fine-Tuning
- 0428 min
Instruction Tuning
IntermediateComing soonTurning a base model into an assistant: task diversity, response quality and template consistency.
Assumes: Full Fine-Tuning
- 0528 min
Dataset Formats and Chat Templates
IntermediateComing soonCompletion vs chat formats, special tokens, loss masking on prompts, and template mismatch bugs.
Assumes: Instruction Tuning
- 0624 min
Parameter-Efficient Fine-Tuning: The Landscape
IntermediateComing soonAdditive, selective and reparameterisation methods mapped, with trainable-parameter comparisons.
Assumes: Catastrophic Forgetting
- 0732 min
LoRA: Low-Rank Adaptation
AdvancedComing soonThe low-rank update derived, why it works, the zero-initialisation detail, and merging adapters at inference.
Assumes: Parameter-Efficient Fine-Tuning: The Landscape · Singular Value Decomposition
- 0826 min
LoRA Hyperparameters
AdvancedComing soonChoosing rank, alpha scaling, target modules, dropout and learning rate, with practical defaults.
Assumes: LoRA: Low-Rank Adaptation
- 0924 min
Adapter Layers
AdvancedComing soonBottleneck adapters inserted in the block, the inference-latency cost, and adapter composition.
Assumes: Parameter-Efficient Fine-Tuning: The Landscape
- 1026 min
Prefix, Prompt and P-Tuning
AdvancedComing soonLearning soft tokens instead of weights, prefix tuning of the KV cache, and their capacity limits.
Assumes: Adapter Layers
- 1130 min
Quantisation Fundamentals
AdvancedComing soonFloating point formats, scale and zero-point, symmetric vs asymmetric, per-tensor vs per-channel.
Assumes: Parameter-Efficient Fine-Tuning: The Landscape
- 1228 min
INT8, INT4 and NF4
AdvancedComing soonOutlier features and LLM.int8(), 4-bit formats, NF4's information-theoretic motivation, and quality loss.
Assumes: Quantisation Fundamentals
- 1326 min
GPTQ, AWQ and GGUF
AdvancedComing soonPost-training quantisation algorithms, activation-aware weighting, and the GGUF deployment format.
Assumes: INT8, INT4 and NF4
- 1430 min
QLoRA
AdvancedComing soon4-bit NF4 quantisation, double quantisation, paged optimisers, and fine-tuning large models on one GPU.
Assumes: LoRA Hyperparameters · INT8, INT4 and NF4
- 1524 min
DoRA, rsLoRA and LoRA Variants
AdvancedComing soonWeight-decomposed adaptation, rank-stabilised scaling, LoRA+, VeRA and when variants actually help.
Assumes: QLoRA
- 1626 min
Mixed Precision Training
AdvancedComing soonFP16 vs BF16, loss scaling, master weights, and where numerical instability arises.
Assumes: Quantisation Fundamentals
- 1728 min
Gradient Checkpointing and Memory Optimisation
AdvancedComing soonTrading compute for memory, activation checkpointing arithmetic, and gradient accumulation.
Assumes: Mixed Precision Training
- 1832 min
Distributed Training
AdvancedComing soonData, tensor, pipeline and sequence parallelism, collective operations, and communication cost.
Assumes: Gradient Checkpointing and Memory Optimisation
- 1930 min
FSDP and ZeRO
AdvancedComing soonSharding parameters, gradients and optimiser states across stages 1 to 3, with memory arithmetic.
Assumes: Distributed Training
- 2030 min
Data Curation for Fine-Tuning
IntermediateComing soonQuality over quantity, deduplication, decontamination, diversity measurement and annotation guidelines.
Assumes: Dataset Formats and Chat Templates
- 2128 min
Synthetic Data Generation
AdvancedComing soonSelf-Instruct and Evol-Instruct, distillation from stronger models, filtering, and model-collapse risk.
Assumes: Data Curation for Fine-Tuning
- 2230 min
Preference Tuning in Practice
AdvancedComing soonBuilding preference pairs, running DPO end to end, beta tuning, and diagnosing reward over-optimisation.
Assumes: Synthetic Data Generation · DPO and Direct Preference Optimisation
- 2328 min
Knowledge Distillation
AdvancedComing soonTeacher–student training, soft targets and temperature, and sequence-level distillation for LLMs.
Assumes: Synthetic Data Generation
- 2426 min
Pruning and Sparsity
AdvancedComing soonMagnitude, structured and movement pruning, the lottery ticket hypothesis, and hardware-friendly sparsity.
Assumes: Knowledge Distillation
- 2528 min
Evaluating a Fine-Tuned Model
IntermediateComing soonTask-specific evals, regression suites against the base model, held-out sets and human review.
Assumes: Preference Tuning in Practice
- 2628 min
Fine-Tuning Failure Modes
AdvancedComing soonOverfitting small datasets, template mismatch, degenerate repetition, loss spikes and lost safety behaviour.
Assumes: Evaluating a Fine-Tuned Model