Filima Patrick

FILIMA PATRICK

Research Software Engineer & Technical Product Lead

© 2026 Filima Patrick
Back to Projects & Experience
Benchmark Ecosystem & Clinical DatasetActive Benchmark / Project 1
License: MIT

African Clinical Brain MRI Benchmark (Afri-Brain-Bench)

A Standardized Benchmark Ecosystem for Evaluating AI Generalization, Calibration, and Explainability on African Clinical Scans

Python 3.11+PyTorchMONAITorchIOResNet-18DenseNet-121EfficientNet-B0ConvNeXt TinyScikit-Learn
Core Research Ecosystem Vision

Introducing Afri-Brain-Bench—a standardized multi-center benchmark dataset of 225 clinical MRI examinations across 3 Nigerian hospitals providing 7 standardized evaluation tasks, cross-hospital splits, ECE calibration scoring, and Grad-CAM spatial ROI auditing.

7 Standardized Afri-Brain-Bench Tasks

Task 1: Multi-Class Disease Classification

Classify scans into 5 categories (Hydrocephalus, Dementia, Parkinson’s, Epilepsy, Control).

Task 2: Binary Disease Detection

Predict neurological pathology vs. Healthy Control.

Task 3: Disease-Specific Experiments

Targeted binary classification experiments (e.g., Hydrocephalus vs. Control).

Task 4: Cross-Hospital Evaluation

Train on LifeBridge, test on UPTH to evaluate direct domain transfer.

Task 5: Leave-One-Hospital-Out (LOHO)

Train on 2 hospitals, evaluate zero-shot generalization on the 3rd hospital.

Task 6: Image Quality Robustness

Evaluate performance stratified across High, Moderate, and Low SNR quality cohorts.

Task 7: Explainability Evaluation

Spatial ROI overlap (IoU) of Grad-CAM attention maps under clinical domain shift.

Evaluation AxisTarget Metrics & Protocol
ClassificationAccuracy, Precision, Recall, F1-Score, ROC-AUC, PR-AUC
CalibrationExpected Calibration Error (ECE), Brier Score
RobustnessCross-hospital accuracy decay (Delta F1-Score)
GeneralizationLeave-One-Hospital-Out zero-shot degradation
ExplainabilityGrad-CAM Attention Consistency & Spatial ROI Overlap (IoU)
Statistical Stability95% Bootstrap Confidence Intervals (1,000 iterations)

Execution Commands & Pipeline Workflow

# 1. Train MONAI 3D DenseNet-121 Benchmark:
python src/models/cnn.py --model densenet121 --task task4 --epochs 50 --batch_size 4 --out_dir ./checkpoints/densenet
# 2. Evaluate Degradation Robustness & RRI Metrics:
python src/evaluation/metrics.py --evaluate_robustness --model_dir ./checkpoints/ --out_dir ./results/
# 3. Generate Grad-CAM Explainability Heatmaps under Perturbation:
python src/evaluation/explain.py --model_path ./checkpoints/densenet/best.pth --method gradcam --out_dir ./results/explanations/