Skip to content
VibeFormer

MODULE 14

Unsupervised Learning

Clustering, dimensionality reduction, association rules and anomaly detection, each traced numerically and derived where it matters.

26 lessons~12h reading

  1. 01

    The Unsupervised Landscape

    BeginnerComing soon

    What can be learned without labels, the evaluation problem, and a map of the methods ahead.

    20 min
  2. 02

    Distance and Similarity Measures

    BeginnerComing soon

    Euclidean, Manhattan, Minkowski, cosine, Jaccard, Hamming and Mahalanobis, and when each is appropriate.

    Assumes: Norms and the Condition Number

    28 min
  3. 03

    k-Means Clustering

    BeginnerComing soon

    Lloyd's algorithm iterated by hand, the within-cluster sum-of-squares objective, and convergence guarantees.

    Assumes: Distance and Similarity Measures

    32 min
  4. 04

    Initialisation and Choosing k

    IntermediateComing soon

    Sensitivity to seeds, k-means++, the elbow method, silhouette scores and the gap statistic.

    Assumes: k-Means Clustering

    28 min
  5. 05

    k-Medoids and PAM

    IntermediateComing soon

    Medoids instead of means, the PAM algorithm, and robustness to outliers and arbitrary distances.

    Assumes: k-Means Clustering

    26 min
  6. 06

    Agglomerative Hierarchical Clustering

    IntermediateComing soon

    Bottom-up merging, the proximity matrix updated step by step, and reading a dendrogram.

    Assumes: Distance and Similarity Measures

    32 min
  7. 07

    Linkage Criteria

    IntermediateComing soon

    Single, complete, average, centroid and Ward linkage contrasted, with the chaining effect demonstrated.

    Assumes: Agglomerative Hierarchical Clustering

    28 min
  8. 08

    Divisive (Top-Down) Clustering

    AdvancedComing soon

    Splitting rather than merging, DIANA, bisecting k-means, and the cost comparison with agglomerative.

    Assumes: Linkage Criteria

    22 min
  9. 09

    DBSCAN and OPTICS

    IntermediateComing soon

    Density-based clustering, core/border/noise points, eps and minPts selection, and OPTICS reachability plots.

    Assumes: Initialisation and Choosing k

    30 min
  10. 10

    Mean Shift Clustering

    AdvancedComing soon

    Kernel density gradient ascent, bandwidth selection, and mode-seeking behaviour.

    Assumes: DBSCAN and OPTICS

    24 min
  11. 11

    Spectral Clustering

    AdvancedComing soon

    Similarity graphs, the Laplacian eigenmap, and clustering in the spectral embedding.

    Assumes: DBSCAN and OPTICS · Eigenvalues and Eigenvectors

    32 min
  12. 12

    Gaussian Mixture Models

    AdvancedComing soon

    Soft assignment via mixtures, the likelihood, and GMM as a probabilistic generalisation of k-means.

    Assumes: The Multivariate Normal Distribution

    32 min
  13. 13

    Expectation–Maximisation

    AdvancedComing soon

    The EM algorithm derived via the lower bound, applied step by step to a two-component mixture.

    Assumes: Gaussian Mixture Models

    36 min
  14. 14

    Cluster Validation

    IntermediateComing soon

    Internal indices (silhouette, Davies–Bouldin, Calinski–Harabasz) and external ones (ARI, NMI, purity).

    Assumes: Initialisation and Choosing k

    28 min
  15. 15

    Principal Component Analysis

    IntermediateComing soon

    Maximum-variance and minimum-reconstruction-error derivations, eigendecomposition of the covariance matrix, worked by hand.

    Assumes: Eigenvalues and Eigenvectors · Covariance and Correlation

    36 min
  16. 16

    PCA via SVD

    AdvancedComing soon

    Why practitioners compute PCA through the SVD, numerical benefits, and whitening.

    Assumes: Principal Component Analysis · Singular Value Decomposition

    26 min
  17. 17

    Kernel PCA

    AdvancedComing soon

    Nonlinear components via the kernel trick, centring in feature space, and the pre-image problem.

    Assumes: PCA via SVD · Kernel Methods

    26 min
  18. 18

    Factor Analysis

    AdvancedComing soon

    Latent factors with explicit noise modelling, and how it differs from PCA in assumptions and output.

    Assumes: Principal Component Analysis

    26 min
  19. 19

    Independent Component Analysis

    AdvancedComing soon

    Blind source separation, non-Gaussianity as the objective, and FastICA.

    Assumes: Factor Analysis

    26 min
  20. 20

    Multidimensional Scaling and Isomap

    AdvancedComing soon

    Preserving pairwise distances, classical MDS via eigendecomposition, and geodesic distances on manifolds.

    Assumes: Principal Component Analysis

    28 min
  21. 21

    t-SNE

    AdvancedComing soon

    Neighbour distributions, KL divergence, perplexity, the crowding problem, and how to read (and misread) a t-SNE plot.

    Assumes: Multidimensional Scaling and Isomap

    30 min
  22. 22

    UMAP

    AdvancedComing soon

    Fuzzy simplicial sets, the topological motivation, and the practical trade-offs against t-SNE.

    Assumes: t-SNE

    26 min
  23. 23

    Association Rule Mining and Apriori

    IntermediateComing soon

    Support, confidence and lift; the Apriori property and candidate generation traced on a transaction database.

    32 min
  24. 24

    FP-Growth

    AdvancedComing soon

    The FP-tree, conditional pattern bases, and why it beats Apriori on dense data.

    Assumes: Association Rule Mining and Apriori

    26 min
  25. 25

    Anomaly Detection

    AdvancedComing soon

    Statistical tests, Isolation Forest, Local Outlier Factor and one-class SVM, with evaluation under extreme imbalance.

    Assumes: DBSCAN and OPTICS

    32 min
  26. 26

    Semi-Supervised Learning

    AdvancedComing soon

    Self-training, label propagation, co-training and consistency regularisation when labels are scarce.

    Assumes: Cluster Validation

    28 min