MODULE 14
Unsupervised Learning
Clustering, dimensionality reduction, association rules and anomaly detection, each traced numerically and derived where it matters.
26 lessons~12h reading
- 0120 min
The Unsupervised Landscape
BeginnerComing soonWhat can be learned without labels, the evaluation problem, and a map of the methods ahead.
- 0228 min
Distance and Similarity Measures
BeginnerComing soonEuclidean, Manhattan, Minkowski, cosine, Jaccard, Hamming and Mahalanobis, and when each is appropriate.
Assumes: Norms and the Condition Number
- 0332 min
k-Means Clustering
BeginnerComing soonLloyd's algorithm iterated by hand, the within-cluster sum-of-squares objective, and convergence guarantees.
Assumes: Distance and Similarity Measures
- 0428 min
Initialisation and Choosing k
IntermediateComing soonSensitivity to seeds, k-means++, the elbow method, silhouette scores and the gap statistic.
Assumes: k-Means Clustering
- 0526 min
k-Medoids and PAM
IntermediateComing soonMedoids instead of means, the PAM algorithm, and robustness to outliers and arbitrary distances.
Assumes: k-Means Clustering
- 0632 min
Agglomerative Hierarchical Clustering
IntermediateComing soonBottom-up merging, the proximity matrix updated step by step, and reading a dendrogram.
Assumes: Distance and Similarity Measures
- 0728 min
Linkage Criteria
IntermediateComing soonSingle, complete, average, centroid and Ward linkage contrasted, with the chaining effect demonstrated.
Assumes: Agglomerative Hierarchical Clustering
- 0822 min
Divisive (Top-Down) Clustering
AdvancedComing soonSplitting rather than merging, DIANA, bisecting k-means, and the cost comparison with agglomerative.
Assumes: Linkage Criteria
- 0930 min
DBSCAN and OPTICS
IntermediateComing soonDensity-based clustering, core/border/noise points, eps and minPts selection, and OPTICS reachability plots.
Assumes: Initialisation and Choosing k
- 1024 min
Mean Shift Clustering
AdvancedComing soonKernel density gradient ascent, bandwidth selection, and mode-seeking behaviour.
Assumes: DBSCAN and OPTICS
- 1132 min
Spectral Clustering
AdvancedComing soonSimilarity graphs, the Laplacian eigenmap, and clustering in the spectral embedding.
Assumes: DBSCAN and OPTICS · Eigenvalues and Eigenvectors
- 1232 min
Gaussian Mixture Models
AdvancedComing soonSoft assignment via mixtures, the likelihood, and GMM as a probabilistic generalisation of k-means.
Assumes: The Multivariate Normal Distribution
- 1336 min
Expectation–Maximisation
AdvancedComing soonThe EM algorithm derived via the lower bound, applied step by step to a two-component mixture.
Assumes: Gaussian Mixture Models
- 1428 min
Cluster Validation
IntermediateComing soonInternal indices (silhouette, Davies–Bouldin, Calinski–Harabasz) and external ones (ARI, NMI, purity).
Assumes: Initialisation and Choosing k
- 1536 min
Principal Component Analysis
IntermediateComing soonMaximum-variance and minimum-reconstruction-error derivations, eigendecomposition of the covariance matrix, worked by hand.
Assumes: Eigenvalues and Eigenvectors · Covariance and Correlation
- 1626 min
PCA via SVD
AdvancedComing soonWhy practitioners compute PCA through the SVD, numerical benefits, and whitening.
Assumes: Principal Component Analysis · Singular Value Decomposition
- 1726 min
Kernel PCA
AdvancedComing soonNonlinear components via the kernel trick, centring in feature space, and the pre-image problem.
Assumes: PCA via SVD · Kernel Methods
- 1826 min
Factor Analysis
AdvancedComing soonLatent factors with explicit noise modelling, and how it differs from PCA in assumptions and output.
Assumes: Principal Component Analysis
- 1926 min
Independent Component Analysis
AdvancedComing soonBlind source separation, non-Gaussianity as the objective, and FastICA.
Assumes: Factor Analysis
- 2028 min
Multidimensional Scaling and Isomap
AdvancedComing soonPreserving pairwise distances, classical MDS via eigendecomposition, and geodesic distances on manifolds.
Assumes: Principal Component Analysis
- 2130 min
t-SNE
AdvancedComing soonNeighbour distributions, KL divergence, perplexity, the crowding problem, and how to read (and misread) a t-SNE plot.
Assumes: Multidimensional Scaling and Isomap
- 2226 min
UMAP
AdvancedComing soonFuzzy simplicial sets, the topological motivation, and the practical trade-offs against t-SNE.
Assumes: t-SNE
- 2332 min
Association Rule Mining and Apriori
IntermediateComing soonSupport, confidence and lift; the Apriori property and candidate generation traced on a transaction database.
- 2426 min
FP-Growth
AdvancedComing soonThe FP-tree, conditional pattern bases, and why it beats Apriori on dense data.
Assumes: Association Rule Mining and Apriori
- 2532 min
Anomaly Detection
AdvancedComing soonStatistical tests, Isolation Forest, Local Outlier Factor and one-class SVM, with evaluation under extreme imbalance.
Assumes: DBSCAN and OPTICS
- 2628 min
Semi-Supervised Learning
AdvancedComing soonSelf-training, label propagation, co-training and consistency regularisation when labels are scarce.
Assumes: Cluster Validation