Federated Bioinformatics Platforms
DOI:
https://doi.org/10.5281/zenodo.19549568Keywords:
Federated learning; Bioinformatics; Privacy-preserving analytics; Differential privacy; Multi-institutional collaboration; Genomic data sharing; Non-IID distributions; Secure computation; Clinical predictionAbstract
Biomedical research increasingly relies on large, multi-institutional datasets -- genomic cohorts, electronic health records, clinical trial registries, and imaging archives -- yet data sharing is constrained by privacy regulations (GDPR, HIPAA), institutional governance, and patient consent limitations. Federated learning (FL) enables collaborative model training across distributed datasets without sharing raw data, but applying FL to bioinformatics presents unique challenges: heterogeneous data modalities (genomic, clinical, imaging), extreme class imbalance (rare diseases, uncommon variants), non-IID data distributions across institutions, and the need for reproducible, auditable analyses compliant with regulatory frameworks. This study developed and benchmarked six distributed bioinformatics approaches -- centralised training (data pooling, upper bound), local-only training (no collaboration, lower bound), naive federated averaging (FedAvg), federated proximal (FedProx), personalised federated learning (Per-FedAvg), and a proposed Federated Bioinformatics Intelligence Platform (FedBioIP) combining differential privacy-guaranteed gradient aggregation, domain-adaptive batch normalisation for cross-institutional heterogeneity, multi-modal federated encoding for heterogeneous omics data, and secure aggregation with verifiable computation -- across three multi-institutional bioinformatics tasks: rare variant pathogenicity classification (6 biobanks, n = 284,000 exomes), cancer histopathology classification (8 hospitals, n = 42,600 whole-slide images), and clinical outcome prediction from EHR (12 health systems, n = 1.8 million patient records). FedBioIP achieved 97.2% of centralised performance across all tasks (mean AUROC 0.886 vs centralised 0.912), significantly outperforming FedAvg (91.4%; p < 0.001), FedProx (93.8%; p < 0.001), and Per-FedAvg (95.2%; p = 0.008), while providing formal differential privacy guarantee (epsilon = 1.0, delta = 10^-5). The domain-adaptive normalisation reduced inter-institutional performance variance by 64.2% compared to FedAvg, addressing the non-IID distribution problem that is the primary challenge in biomedical federated learning. These results establish privacy-preserving federated platforms as a viable alternative to data centralisation for large-scale bioinformatics.Downloads
Published
2026-08-15
Issue
Section
Articles
How to Cite
Federated Bioinformatics Platforms. (2026). The Biosis Bulletin: Bioscience and Information Science Journal , 4(1), 37-45. https://doi.org/10.5281/zenodo.19549568

