MA/01

Machine Learning / Case study

Content-Based Movie Recommendation

An NLP recommendation engine that ranks similar movies from metadata using TF-IDF and cosine similarity.

View repository

Problem

Recommend relevant movies from content metadata without relying on user-rating history.

Solution

Combines genre, keyword, tagline, cast, and director fields, vectorizes them with TF-IDF, and ranks candidates using cosine similarity.

Architecture

Movie metadata → combined text features → TF-IDF vectors → cosine-similarity matrix → fuzzy title match → ranked recommendations.

Technical implementation

Returns the top 25 related titles and uses Python difflib to resolve approximate movie-name input.

Key challenges

Turn sparse, heterogeneous metadata into a consistent representation and handle imperfect title input.

Lessons learned

A transparent content-based baseline can provide useful recommendations without collaborative-filtering data.