Skip to content

Latest commit

 

History

59 Commits

Folders and files

NameName
Last commit message
Last commit date
 
 
 
 
 
 

Repository files navigation

Netflix-Data-Analysis

Data analytics project focused on cleaning, analyzing, and visualizing Netflix content data using Python, SQL, Databricks, PySpark, and modern analytics workflows. The dataset includes Netflix title information and actor/director credits.

A practice of data analytics workflow of Netflix datasets, including:

- data loading,
- data cleaning
- exploratory data analysis
- joining related datasets
- SQL querying
- data visualization
- meaningful insight generation
- project documentation

Tools

  • Databricks
  • PySpark
  • SQL
  • Python
  • Spark DataFrames
  • GitHub

Dataset

  • The project uses two related datasets:

    1. titles - Contains Netflix content information such as:

        (title/type/release year/runtime/genres/IMDb score/IMDb votes/TMDB popularity)
    

    2. credits - Contains actor and director information, such as:

        (person ID/title ID/name/character/role)
    

Project Workflow

- Uploaded Netflix datasets into Databricks
- Loaded data using Spark tables
- Explored schema, columns, and row counts
- Removed duplicate records
- Handled missing values
- Analyzed movies vs TV shows
- Explored the highest-rated Netflix titles
- Analyzed release year trends
- Identified top actors and directors
- Performed joins between titles and credits
- Used SQL queries for relational analysis
- Documented insights and conclusions

Key Analysis Performed

- Movies vs TV shows distribution
- Highest IMDb-rated titles
- Release year trend analysis
- Most frequent actors
- Most frequent directors
- Actor/title relationship analysis
- Director average IMDb score analysis
- SQL join analysis using cleaned temporary views

Key Insights

- Movies make up a large portion of Netflix content.
- IMDb scores help identify highly rated Netflix titles.
- Release year analysis shows content growth patterns over time.
- Actor and director analysis reveals frequently appearing contributors.
- Joining titles and credits provides deeper relational insights.

Skills

- Databricks notebook workflow
- PySpark data processing
- Data cleaning
- Exploratory data analysis
- SQL querying
- SQL joins
- Relational dataset analysis
- Debugging real-world data issues
- GitHub 

File Structure

  - "README.md": Explaining briefly about the project
  - "data": This is a folder containing credit and title data files
  - "netflix_titles_credits_analysis.ipynb": This file contains the exact project details




    @Kusum Katwal

About

Data analytics project focused on cleaning, analyzing, and visualizing Netflix content data using Python, SQL, and modern analytics workflows.

Topics

Resources

Stars

1 star

Watchers

0 watching

Forks

Releases

Packages

Contributors

Languages