Federated Bioinformatics Platforms

Authors

  • Noah Dubois Author
  • Clara Hansen Author
  • Nina Popescu Author

DOI:

https://doi.org/10.5281/zenodo.19549568

Keywords:

Federated learning; Bioinformatics; Privacy-preserving analytics; Differential privacy; Multi-institutional collaboration; Genomic data sharing; Non-IID distributions; Secure computation; Clinical prediction

Abstract

Biomedical research increasingly relies on large, multi-institutional datasets -- genomic cohorts, electronic health records, clinical trial registries, and imaging archives -- yet data sharing is constrained by privacy regulations (GDPR, HIPAA), institutional governance, and patient consent limitations. Federated learning (FL) enables collaborative model training across distributed datasets without sharing raw data, but applying FL to bioinformatics presents unique challenges: heterogeneous data modalities (genomic, clinical, imaging), extreme class imbalance (rare diseases, uncommon variants), non-IID data distributions across institutions, and the need for reproducible, auditable analyses compliant with regulatory frameworks. This study developed and benchmarked six distributed bioinformatics approaches -- centralised training (data pooling, upper bound), local-only training (no collaboration, lower bound), naive federated averaging (FedAvg), federated proximal (FedProx), personalised federated learning (Per-FedAvg), and a proposed Federated Bioinformatics Intelligence Platform (FedBioIP) combining differential privacy-guaranteed gradient aggregation, domain-adaptive batch normalisation for cross-institutional heterogeneity, multi-modal federated encoding for heterogeneous omics data, and secure aggregation with verifiable computation -- across three multi-institutional bioinformatics tasks: rare variant pathogenicity classification (6 biobanks, n = 284,000 exomes), cancer histopathology classification (8 hospitals, n = 42,600 whole-slide images), and clinical outcome prediction from EHR (12 health systems, n = 1.8 million patient records). FedBioIP achieved 97.2% of centralised performance across all tasks (mean AUROC 0.886 vs centralised 0.912), significantly outperforming FedAvg (91.4%; p < 0.001), FedProx (93.8%; p < 0.001), and Per-FedAvg (95.2%; p = 0.008), while providing formal differential privacy guarantee (epsilon = 1.0, delta = 10^-5). The domain-adaptive normalisation reduced inter-institutional performance variance by 64.2% compared to FedAvg, addressing the non-IID distribution problem that is the primary challenge in biomedical federated learning. These results establish privacy-preserving federated platforms as a viable alternative to data centralisation for large-scale bioinformatics.

Downloads

Published

2026-08-15

How to Cite

Federated Bioinformatics Platforms. (2026). The Biosis Bulletin: Bioscience and Information Science Journal , 4(1), 37-45. https://doi.org/10.5281/zenodo.19549568

Similar Articles

21-30 of 96

You may also start an advanced similarity search for this article.