This comprehensive project implements multiple machine learning and deep learning approaches to predict mental health status based on technology usage patterns and lifestyle factors. The project explores various models including traditional ML algorithms, ensemble methods, and advanced neural networks to classify mental health into four categories: Excellent, Good, Fair, and Poor.
Mental Health and Technology Usage 2024 dataset contains behavioral and lifestyle data:
- Total samples: ~10,000 records
- Features: Technology usage, lifestyle, and demographic factors
- Target: Mental Health Status (4 classes)
- Format: CSV with mixed numerical and categorical features
- Technology_Usage_Hours
- Social_Media_Usage_Hours
- Gaming_Hours
- Screen_Time_Hours
- Sleep_Hours
- Physical_Activity_Hours
- Stress_Level (Low/Medium/High)
- Age, Gender
- Support_Systems_Access (Yes/No)
- Work_Environment_Impact (Positive/Neutral/Negative)
- Online_Support_Usage (Yes/No)
- Mental_Health_Status: Excellent(0), Good(1), Fair(2), Poor(3)
NeuralNet:
├── Linear(input_size → 128) + BatchNorm + ReLU + Dropout(0.3)
├── Linear(128 → 64) + BatchNorm + ReLU + Dropout(0.3)
├── Linear(64 → 32) + BatchNorm + ReLU + Dropout(0.3)
└── Linear(32 → 4) # 4 mental health classesAdvancedNN:
├── Linear(input_size → 384) + BatchNorm + ReLU
├── Linear(384 → 256) + BatchNorm + ReLU + Dropout(0.3)
├── Linear(256 → 128) + BatchNorm + ReLU + Dropout(0.3)
├── Linear(128 → 64) + BatchNorm + ReLU + Dropout(0.3)
├── Linear(64 → 32) + BatchNorm + ReLU
└── Linear(32 → 4)- Random Forest: Ensemble of decision trees
- Gradient Boosting: Sequential weak learner improvement
- XGBoost: Optimized gradient boosting with GPU support
- LightGBM: Fast gradient boosting framework
- CatBoost: Categorical feature handling
- SVM: Support Vector Machine with RBF kernel
- Logistic Regression: Multinomial classification
- KNN: K-Nearest Neighbors
- Extra Trees: Extremely randomized trees
- Voting Classifier: Soft voting across multiple models
- Feature Extraction + ML: Deep features + traditional ML
- Advanced Ensemble: Best performing models combination
# Numerical features: Median imputation
# Categorical features: Mode imputation
# Advanced: Domain-specific imputation strategies# Label Encoding: Categorical variables
# One-Hot Encoding: Gender, Work Environment Impact
# Ordinal Encoding: Stress Level (Low=0, Medium=1, High=2)
# Binary Encoding: Support access variables# StandardScaler: Mean=0, Std=1 normalization
# MinMaxScaler: 0-1 range normalization
# Applied to: Age, usage hours, activity hours# Derived Features:
├── Total_Screen_Time = Tech + Social + Gaming hours
├── Screen_to_Sleep_Ratio = Screen_Time / Sleep_Hours
├── Activity_to_Screen_Ratio = Physical / Screen_Time
├── Health_Balance = (Sleep + Activity) / (Total_Tech + 1)
├── Stress_WorkImpact_Interaction = Stress × Work_Impact
└── Age_Category = Binned age groups- Train/Test Split: 80/20 stratified split
- Cross-Validation: 5-fold CV for model selection
- Batch Size: 64 (Neural Networks)
- Epochs: 100-1000 with early stopping
- GPU Acceleration: CUDA support for compatible models
# Grid Search CV for traditional ML
# Optuna optimization for XGBoost
# Manual tuning for neural networks
# Ensemble weight optimization- Accuracy: Overall classification accuracy
- F1-Score: Weighted F1 for class imbalance
- Classification Report: Precision, recall per class
- Confusion Matrix: Detailed error analysis
# Statistical analysis:
├── Correlation analysis
├── Chi-square tests for categorical variables
├── Feature importance ranking
├── Distribution analysis by mental health status
└── Visualization suite (heatmaps, bar plots, box plots)# Multiple selection strategies:
├── SelectKBest (f_classif)
├── Recursive Feature Elimination (RFE)
├── Random Forest feature importance
└── Correlation-based filtering# Systematic evaluation:
├── Multiple algorithm comparison
├── Hyperparameter optimization
├── Cross-validation results
├── Performance visualization
└── Best model selection# Complete workflow:
├── Data validation and cleaning
├── Automated preprocessing
├── Model training and selection
├── Prediction generation
└── Results interpretationTitanic---Machine-Learning-from-Disaster/
├── Titanic---Machine-Learning-from-Disaster.ipynb
├── README.md
├── .gitignore
└── README.md
pip install torch tensorflow scikit-learn xgboost lightgbm catboost
pip install pandas numpy matplotlib seaborn optuna# Comprehensive EDA:
├── Missing value analysis
├── Class distribution visualization
├── Feature correlation analysis
├── Statistical significance testing
└── Relationship exploration# Multi-model approach:
├── Traditional ML with GridSearchCV
├── Neural networks with PyTorch/TensorFlow
├── Ensemble methods
└── Performance comparison# Model assessment:
├── Cross-validation scores
├── Test set evaluation
├── Feature importance analysis
└── Best model identification- Batch Normalization: Accelerated training and stability
- Dropout Regularization: Overfitting prevention
- Progressive layer sizing: Optimal information flow
- GPU Acceleration: CUDA optimization
# Complex feature interactions:
├── Ratio features: Screen/Sleep, Activity/Screen
├── Interaction terms: Stress × Work_Environment
├── Polynomial features: Screen_Time²
├── Categorical interactions: Age × Screen_Time
└── Domain-specific indicators: Excessive_Screen_Flag# Multiple ensemble strategies:
├── Simple voting: Equal weights
├── Weighted voting: Performance-based weights
├── Stacking: Meta-learner combination
└── Feature-based ensemble: Different feature subsets# Comprehensive assessment:
├── Stratified cross-validation
├── Multiple random seeds
├── Statistical significance testing
└── Confidence interval estimation- Ensemble Methods: Highest accuracy and robustness
- XGBoost/LightGBM: Strong individual performance
- Neural Networks: Good with proper regularization
- Random Forest: Reliable baseline performance
- Technology usage patterns strongly correlate with mental health
- Sleep and physical activity are crucial protective factors
- Work environment significantly impacts mental wellbeing
- Support systems show measurable benefits
- Screen_Time_Hours
- Sleep_Hours
- Stress_Level
- Physical_Activity_Hours
- Social_Media_Usage_Hours
- Transformer models for sequence modeling
- Graph Neural Networks for relationship modeling
- Attention mechanisms for feature importance
- Multi-modal learning for diverse data types
- Temporal patterns: Time-series analysis
- Social network data: Relationship patterns
- Biomarker integration: Physiological data
- External factors: Weather, economic indicators
- Model compression: Pruning and quantization
- Edge deployment: Mobile/IoT optimization
- Real-time inference: Streaming predictions
- Explainable AI: SHAP/LIME integration
- PyTorch/TensorFlow: Deep learning frameworks
- Scikit-learn: Traditional ML algorithms
- XGBoost/LightGBM/CatBoost: Gradient boosting
- Pandas/NumPy: Data manipulation
- Matplotlib/Seaborn: Visualization
- Optuna: Hyperparameter optimization
- SHAP: Model interpretability
- Imbalanced-learn: Class imbalance handling
- PyCaret: Automated ML pipeline
- Multi-algorithm comparison across 10+ models
- Advanced feature engineering with domain expertise
- Comprehensive ensemble methods implementation
- GPU-accelerated training for efficiency
- Production-ready pipeline with full automation
- Statistical rigor with proper validation
- Interpretable results with feature importance analysis
This project demonstrates:
- End-to-End ML Pipeline: Complete workflow implementation
- Model Selection Strategy: Systematic algorithm comparison
- Feature Engineering Expertise: Domain-driven feature creation
- Ensemble Methods: Advanced combination techniques
- Deep Learning: Modern neural network architectures
- Statistical Analysis: Rigorous evaluation methodology