A comprehensive Jupyter notebook-based data analysis and visualization project exploring the Titanic dataset using Python data science libraries, the dataset was downloaded from Kaggle.
This project performs in-depth exploratory data analysis (EDA) and visualization on the Titanic dataset. It includes data loading, cleaning, missing value analysis, and various statistical and visual explorations to understand patterns and relationships in the data.
The project uses the classic Titanic dataset with two CSV files:
- train.csv: Training dataset with survival outcomes
- test.csv: Test dataset for predictions
Located in the Data/ directory.
Titanic_Visualization_Project/
├── titanic_analysis.ipynb # Main Jupyter notebook with all analysis
├── Data/
│ ├── train.csv # Training dataset
│ └── test.csv # Test dataset
├── virtual_enviroment/ # Python virtual environment
└── README.md # This file
The project uses a Python virtual environment with the following key libraries:
- pandas - Data manipulation and analysis
- numpy - Numerical computing
- matplotlib - 2D plotting and visualization
- seaborn - Statistical data visualization
- jupyter - Interactive notebook environment
If you haven't already set up the virtual environment:
python -m venv virtual_enviromentActivate the virtual environment:
Windows (PowerShell):
.\virtual_enviroment\Scripts\Activate.ps1Windows (Command Prompt):
.\virtual_enviroment\Scripts\activate.batMac/Linux:
source virtual_enviroment/bin/activatepip install pandas numpy matplotlib seaborn jupyter notebookStart Jupyter Notebook:
jupyter notebookThen open titanic_analysis.ipynb in your browser.
Alternatively, you can use Jupyter Lab:
jupyter labThe analysis notebook includes the following sections:
- Library Imports - Loads all required data science libraries
- Version Check - Displays library versions
- Data Loading - Imports and displays training and test datasets
- Basic Information - Dataset shape, columns, and data types
- Missing Values Analysis - Identifies and quantifies missing data
- Missing Values Visualization - Heatmaps and bar charts showing data gaps
- Statistical Analysis - Summary statistics and distributions
- Survival Analysis - Examination of survival rates across different features
- Passenger Demographics - Analysis of age, gender, class distributions
- Correlations & Relationships - Statistical relationships between variables
- Advanced Visualizations - Multiple visualization types for deeper insights
- Data Quality: Missing value patterns and data completeness
- Passenger Demographics: Age, gender, class analysis
- Survival Patterns: Factors influencing survival outcomes
- Correlations: Relationships between different variables
- Visualizations: Histograms, heatmaps, scatter plots, and more
- Python 3.x - Programming language
- Jupyter Notebook - Interactive computing environment
- Pandas - Data manipulation
- NumPy - Numerical operations
- Matplotlib - Plotting library
- Seaborn - Statistical visualization
- The notebook includes informative print statements for tracking data loading and processing steps
- Warnings are filtered to maintain clean output
- All visualizations are embedded directly in the notebook
Created for data analysis and visualization practice.
This project uses the publicly available Titanic dataset.
For questions or improvements, feel free to modify and expand this project!