Full Catalog

Benchmarks

Every AI biology and biomedical benchmark we track, with saturation status, scores, and successor information.

272 of 272 benchmarks
NameDomainYear ▼TypeStatusTime to SaturationBest ScoreHuman BaselineSuccessor
MolQuestDrug Discovery2026Agent WorkflowActive—SOTA ~50%; most <30%——
FLIP2Protein2026RegressionActive—Varies——
Doctorina MedBenchClinical2026Agent SimulationActive—Varies (>1,000 cases)——
LABBench2Agentic Bio2026Research WorkflowActive—26-46% drop vs LAB-Bench——
MolGenBenchDrug Discovery2025Structure-based GenerationActive—Varies——
ToxiMolDrug Discovery2025GenerationActive—Low success rates——
PDBbind CleanSplitDrug Discovery2025RegressionActive—Varies (leak-free)——
PoseXDrug Discovery2025Pose PredictionActive—AI > physics-based (post-relaxation)——
FoldBenchProtein2025Structural PredictionActive—Varies by task——
AbBiBenchProtein2025Antibody DesignActive—Varies——
EC-BenchProtein2025ClassificationActive—Varies——
MotifBenchProtein2025GenerationActive—RFdiffusion solves ~16/30——
SHAPESProtein2025GenerationActive—Most models fail on loops/mixed——
PFMBenchProtein2025Multi-taskActive—Varies across 38 tasks——
LiveProteinBenchProtein2025Multi-taskActive—Varies——
rnaglibProtein2025Multi-task (RNA 3D)Active—Varies——
PeptoneBenchProtein2025Conformational DynamicsActive—BioEmu and PepTron lead——
PDFBenchProtein2025Protein Design from FunctionActive—Varies across 16 metrics——
SafeProteinBiosecurity2025Red-teamingActive—Varies——
Gene-MTEBGenomics2025Classification/ClusteringActive—0.59 average——
NullsettesGenomics2025Zero-shot PredictionActive—Most models fail——
METAGENE-1Genomics2025Classification/ClusteringActive—MCC 92.96 (pathogen)——
OmniGenBenchGenomics2025Multi-taskActive—Varies across 123+ datasets——
DNALongBenchGenomics2025Classification/RegressionActive—Expert models lead——
NABenchGenomics2025Fitness PredictionActive—Varies——
AlphaGenomeGenomics2025Multi-taskActive—25/26 VEP evaluations SOTA——
TraitGymGenomics2025Variant PredictionActive—CADD/GPN-MSA best for disease traits——
Arc Institute Virtual Cell ChallengeVirtual Cell2025Perturbation PredictionActive—Statistical baselines competitive with AI——
scPerturBenchVirtual Cell2025Perturbation PredictionActive—No method consistently wins; linear baselines competitive——
HLE (Bio/Medicine)Science QA2025Short Answer/MCQActive—44.7% overall; ~22% bio/med98%—
ATLAS (Bio)Science QA2025Open-endedActive—Varies——
MedHELMClinical2025Multi-task ClinicalActive—66% win-rate (DeepSeek R1)——
MedAgentBenchClinical2025Agent WorkflowActive—69.67%——
HealthBenchClinical2025ConversationalActive—60% (o3); Hard: 32%——
FHIR-AgentBenchClinical2025Agent WorkflowActive—Varies——
LiveMedBenchClinical2025Dynamic MCQActive—Varies (refreshes weekly)——
MedXpertQAClinical2025MCQActive—Varies (4,460 Qs, 17 specialties)——
DiagnosisArenaClinical2025Diagnostic ReasoningActive—45.82%——
Script Concordance TestingClinical2025Probabilistic ReasoningActive—Varies——
AgentClinicClinical2025Diagnostic AgentActive—Varies (120 NEJM cases)——
MedBench v4 (China)Clinical2025Multi-taskActive—Agent 85.3/100 (Claude Sonnet 4.5)——
VCTBiosecurity2025Multimodal QAActive—43.8% (o3)22.1% (expert virologists)—
ABC-BenchBiosecurity2025Agent WorkflowActive—53% (Grok 3)24% (PhD experts)—
ABLEBiosecurity2025Agent WorkflowActive—7/8 low-level tasks——
BBG Framework / B3Biosecurity2025Open-endedUnknown—Pilot phase——
Scale AI FORTRESS (CBRNE)Biosecurity2025Adversarial SafetyActive—Varies——
Scale AI PropensityBenchBiosecurity2025Agent SafetyActive—Varies (5,874 tasks)——
TroubleshootingBenchBiosecurity2025Protocol QAActive—No model exceeds 80th-pct expert (36.4%)80th-pct expert: 36.4%—
BixBenchAgentic Bio2025BioinformaticsActive—17% (Claude 3.5 Sonnet); 9% (GPT-4o)——
MedAgentGymAgentic Bio2025Training EnvironmentActive—N/A——
BioProBenchAgentic Bio2025Protocol UnderstandingActive—Varies——
CT-BenchMedical Imaging2025Multimodal QAActive—61.8%——
ReXVQAMedical Imaging2025Visual QAActive—83.24% (MedGemma)——
MatBench DiscoveryDrug Discovery2025Crystal StabilityNearing12 moF1=0.924——
FairMedQAClinical2025Fairness EvaluationActive—3-19 pct point accuracy disparity——
MEDECClinical2025Error Detection/CorrectionActive—Varies——
MedThink-BenchClinical2025Reasoning EvaluationActive—Varies (500 QA pairs)——
CLINICClinical2025TrustworthinessActive—DeepSeek-R1-LLaMA best robustness——
MedAgentsBenchClinical2025Multi-agent ReasoningActive—92.6% (TeamMedAgents)——
TDC-2 (Single-cell DTI)Drug Discovery2024ClassificationActive—Varies——
TDC-2 Protein-Peptide BindingDrug Discovery2024RegressionActive—Varies——
DrugGymDrug Discovery2024Agent WorkflowActive—N/A (simulator)——
MolScoreDrug Discovery2024Meta-frameworkUnknown—N/A——
PolarisDrug Discovery2024Classification/RegressionActive—Varies (blind test)——
WelQrateDrug Discovery2024ClassificationActive—Varies——
PharmaBenchDrug Discovery2024Classification/RegressionActive—Varies——
PLINDERDrug Discovery2024Docking/RegressionActive—DiffDock drops 38%->15% with leak control——
CPI2MDrug Discovery2024RegressionActive—Baseline——
PoseBenchDrug Discovery2024Pose PredictionActive—~68% (PB); ~33% (DockGen-E)——
DockGenDrug Discovery2024Pose PredictionActive—~24-33% top-1 RMSD<2A——
MF-PCBADrug Discovery2024Virtual ScreeningActive—Baselines established——
TOMG-BenchDrug Discovery2024LLM GenerationActive—Fine-tuned Llama > GPT-3.5 by 46.5%——
ChemBenchDrug Discovery2024MCQ/Free-formNearing24 moClaude 3.5 Sonnet > best human chemistsExpert chemists—
CASP16 (Complexes)Protein2024Structural PredictionActive—Varies; AB-Ag major failure area——
CASP16 (RNA)Genomics2024Structural PredictionActive—No TM-score >0.8 for novel RNAs——
CASP16 (Protein-Ligand)Drug Discovery2024Binding AffinityActive—Max Kendall tau 0.42——
ProteinBenchProtein2024Multi-taskActive—Varies; drops >20% at 500+ residues——
PPB-AffinityProtein2024RegressionActive—Varies——
BEACON (RNA Tasks)Genomics2024Multi-task (13 RNA tasks)Active—PLMs surpass SOTA on 8/13——
ATLAS MD Ensemble DatasetProtein2024Conformational DynamicsActive—Varies——
Evo / Evo 2Genomics2024Multi-taskActive—BRCA1 >90% AUROC (Evo 2)——
DART-EvalGenomics2024Multi-taskActive—DNALMs inconsistent——
GenBenchGenomics2024Multi-taskActive—Varies across 43 datasets——
Genomics Long-Range BenchmarkGenomics2024Classification/RegressionActive—Large gaps in VEP——
BorzoiGenomics2024Gene Expression PredictionActive—524kb input, 32bp resolution—AlphaGenome
PRIDICT 2.0 (Prime Editing)Genomics2024RegressionActive—Spearman R=0.85——
CZI cz-benchmarksVirtual Cell2024Classification/PredictionActive—Varies——
scPerturbVirtual Cell2024Data Resource/QCActive—E-distance metric—scPerturBench
PerturBenchVirtual Cell2024Perturbation PredictionActive—Simple models outperform complex——
MMLU-Pro MedicalBio NLP2024MCQSaturated18 mo90.1%——
MedCalc-BenchClinical2024CalculationActive—50.9%——
MedS-BenchClinical2024Multi-taskActive—Varies across 39 datasets——
JAMA Clinical ChallengeClinical2024MCQActive—88.6% (o1-preview on 70 cases)——
AfriMed-QAClinical2024MCQActive—Varies (15K+ Qs, 32 specialties)——
MMedBenchClinical2024Multilingual MCQActive—Varies across 6 languages——
MultiADEBio NLP2024ExtractionActive—Varies across 6 ADE datasets——
WMDP-BioBiosecurity2024MCQSaturated7 mo87%60.5%VCT, ABC-Bench
BioLP-BenchBiosecurity2024Protocol Error DetectionActive—34% (o4-mini)~38% (expert avg)—
LAB-BenchAgentic Bio2024Research WorkflowSaturated18 mo89%; several subtasks at ceiling~79% (expert on ProtocolQA)LABBench2
ScienceAgentBenchAgentic Bio2024Code GenerationActive—42.2% (o1-preview + self-debug)——
BioCoderAgentic Bio2024Code GenerationNearing24 mo~50% Pass@1 (GPT-4)—BixBench
LitQA2 / PaperQA2Agentic Bio2024Literature QANearing24 mo~90% (PaperQA2)~67% (human experts)—
OmniMedVQAMedical Imaging2024Visual QAActive—LVLMs struggle——
ReXrankMedical Imaging2024Report GenerationActive—1/RadCliQ-v1 0.98 (ReXGradient)——
TDC Clinical Trial OutcomeDrug Discovery2023ClassificationActive—Varies——
TARTARUSDrug Discovery2023Generation/RLActive—Low success on hard objectives——
TOXRICDrug Discovery2023ClassificationActive—Varies——
PoseBustersDrug Discovery2023Pose ValidationActive—~75% PB-Valid——
ProteinGymProtein Fitness2023RegressionActive—Spearman ~0.52——
ProteinInvBenchProtein2023GenerationActive—Recovery ~66%——
Mega-Scale Stability DatasetProtein2023RegressionActive—PCC 0.72 (ThermoMPNN)——
GUEGenomics2023ClassificationActive—F1 0.3-0.95—DART-Eval, GenBench
BENDGenomics2023Classification/RegressionActive—Varies——
NT-18 BenchmarkGenomics2023ClassificationActive—MCC 0.974 (promoter); 0.983 (splice)—NTv3
DeepPrimeGenomics2023RegressionActive—Approaching strong performance for specific edits——
GEARSVirtual Cell2023Perturbation PredictionActive—40% higher precision than baselines (claimed); linear models outperform (2025)——
GPQA Diamond (Bio)Science QA2023MCQSaturated36 mo94.1%67%HLE, ATLAS
EHRSHOTClinical2023Few-shot PredictionActive—Varies across 15 tasks——
ACI-BENCHClinical2023Note GenerationActive—MEDCON 57.78——
TotalSegmentatorMedical Imaging2023SegmentationNearing36 moAvg Dice >0.90 for major organs——
MedPerfClinical2023Federated BenchmarkingActive—N/A (platform)——
PMODrug Discovery2022OptimizationActive—Varies——
DOCKSTRINGDrug Discovery2022Regression/GenerationActive—Varies——
PEERProtein2022Multi-taskActive—Varies across 17 tasks——
LRGB Peptides-funcProtein2022ClassificationActive—Varies (AP)——
LRGB Peptides-structProtein2022RegressionActive—Varies (MAE)——
GenomicBenchmarksGenomics2022ClassificationSaturated18 mo95%+ accuracy—GUE, BEND
SeiGenomics2022ClassificationActive—AUROC 0.972; AUPRC 0.409—AlphaGenome
MedMCQAClinical2022MCQActive—~75-80%——
BigBIOBio NLP2022FrameworkActive—N/A (126+ datasets)——
BioREDBio NLP2022Relation ExtractionActive—Varies——
AMOSMedical Imaging2022SegmentationActive—Varies (15 organs)—AMOS-MM (2024)
TDC ADMET (22 leaderboards)Drug Discovery2021Classification/RegressionActive—Varies by task—TDC-2
TDC DrugComboDrug Discovery2021RegressionActive—Varies——
TDC DockingDrug Discovery2021GenerationActive—Varies——
TDC DTI DG GroupDrug Discovery2021RegressionActive—Varies——
PCQM4Mv2Drug Discovery2021RegressionActive—MAE 0.0719 eV——
FLIPProtein2021RegressionNearing60 moVaries—FLIP2
ATOM3DProtein2021Multi-task (3D)Active—Varies across 8 tasks——
EnformerGenomics2021Gene Expression PredictionActive—Cross-gene CAGE Pearson 0.85~0.94 (experimental replicate ceiling)Borzoi, AlphaGenome
DNABERT evaluation tasksGenomics2021ClassificationNearing60 moF1 0.940 (promoter); MCC 0.871 (splice)—DNABERT-2, GUE
CRISPR on-target (CRISPRon)Genomics2021RegressionNearing60 moSpearman ~0.80Ceiling ~0.85-0.90 (biological noise)—
Open Problems (single-cell)Virtual Cell2021Multi-taskActive—Varies across 12 tasks——
MedQA (USMLE)Clinical2021MCQSaturated42 mo96.5%87%MedXpertQA, HealthBench
SLAKEMedical Imaging2021Visual QAActive—~78.7%——
RadGraphMedical Imaging2021Entity/Relation ExtractionActive—Micro F1 0.82——
TDC Caco-2 PermeabilityDrug Discovery2021RegressionActive—MAE 0.256—TDC-2
TDC Human Intestinal AbsorptionDrug Discovery2021ClassificationActive—AUROC 0.993—TDC-2
TDC P-glycoprotein InhibitionDrug Discovery2021ClassificationActive—AUROC 0.938—TDC-2
TDC BioavailabilityDrug Discovery2021ClassificationActive—AUROC 0.942—TDC-2
TDC LipophilicityDrug Discovery2021RegressionActive—MAE 0.456—TDC-2
TDC Aqueous SolubilityDrug Discovery2021RegressionActive—MAE 0.741—TDC-2
TDC Blood-Brain BarrierDrug Discovery2021ClassificationActive—AUROC 0.924—TDC-2
TDC Plasma Protein BindingDrug Discovery2021RegressionActive—MAE 7.526—TDC-2
TDC Volume of DistributionDrug Discovery2021RegressionActive—Spearman 0.713—TDC-2
TDC CYP2C9 InhibitionDrug Discovery2021ClassificationActive—AUPRC 0.859—TDC-2
TDC CYP2D6 InhibitionDrug Discovery2021ClassificationActive—AUPRC 0.79—TDC-2
TDC CYP3A4 InhibitionDrug Discovery2021ClassificationActive—AUPRC 0.916—TDC-2
TDC CYP2C9 SubstrateDrug Discovery2021ClassificationActive—AUPRC 0.474—TDC-2
TDC CYP3A4 SubstrateDrug Discovery2021ClassificationActive—AUPRC 0.667—TDC-2
TDC Half-LifeDrug Discovery2021RegressionActive—Spearman 0.576—TDC-2
TDC Hepatocyte ClearanceDrug Discovery2021RegressionActive—Spearman 0.536—TDC-2
TDC Microsome ClearanceDrug Discovery2021RegressionActive—Spearman 0.63—TDC-2
TDC Acute Toxicity LD50Drug Discovery2021RegressionActive—MAE 0.552—TDC-2
TDC hERG CardiotoxicityDrug Discovery2021ClassificationActive—AUROC 0.88—TDC-2
TDC AMES MutagenicityDrug Discovery2021ClassificationActive—AUROC 0.871—TDC-2
TDC Drug-Induced Liver InjuryDrug Discovery2021ClassificationActive—AUROC 0.956—TDC-2
TDC DTI BindingDBDrug Discovery2021RegressionActive—PCC 0.588—TDC-2
BioREDBio NLP2021Relation ExtractionActive—F1 % 89.3——
Montreal Archive of Sleep StudiesClinical2021ClassificationActive—Accuracy % 86.8——
LIT-PCBADrug Discovery2020Virtual ScreeningActive—Varies—MF-PCBA
CrossDocked2020Drug Discovery2020Scoring/PoseActive—R 0.612——
S669 (Stability blind test)Protein2020RegressionActive—PCC ~0.43-0.67——
OGB Protein TasksProtein2020Classification/Link PredictionActive—Varies——
scIBVirtual Cell2020IntegrationNearing72 moscANVI ~0.8—CZI cz-benchmarks
BEELINE (GRN inference)Virtual Cell2020GRN InferenceActive—Close to random predictor in many cases——
MMLU-BioBio NLP2020MCQSaturated48 mo93%+89.8%MMLU-Pro
BLURBBio NLP2020Multi-task NLPNearing72 mo82.91 BLURB score—BigBIO
MIMIC-IV BenchmarksClinical2020PredictionActive—Hospitalization AUROC ~0.87——
PathVQAMedical Imaging2020Visual QAActive—50-65%—GEMeX
PANDA (Prostate Gleason)Medical Imaging2020ClassificationActive—QWK ~0.93+——
OC20Drug Discovery2020Catalyst PredictionActive—EquiformerV2 leads—OC22, OC25
OGB-MolHIVDrug Discovery2020ClassificationActive—0.835 ROC-AUC——
LIT-PCBA (ALDH1)Drug Discovery2020ClassificationActive—AUC 0.806——
LIT-PCBA (KAT2A)Drug Discovery2020ClassificationActive—AUC 0.746——
LIT-PCBA (MAPK1)Drug Discovery2020ClassificationActive—AUC 0.743——
LIT-PCBA (ESR1 antagonist)Drug Discovery2020ClassificationActive—AUC 0.666——
BioNLP13-CGBio NLP2020NERActive—F1 % 87.83——
GuacaMolDrug Discovery2019GenerationSaturated24 moNear-perfect on simple goals—PMO, TARTARUS, DrugGym
MOSESDrug Discovery2019GenerationSaturated48 moHigh validity/uniqueness—MolScore, TARTARUS
TAPEProtein2019Multi-taskSaturated48 moNear-ceiling on most tasks—ProteinGym, PEER, FLIP
SKEMPI 2.0Protein2019RegressionActive—Pearson R ~0.7-0.8——
SpliceAIGenomics2019ClassificationNearing84 moAUPRC 0.98; ~95% top-k—OpenSpliceAI, AlphaGenome
dynverse (Trajectory inference)Virtual Cell2019Trajectory InferenceActive—Varies by topology——
PubMedQABio NLP2019MCQActive72 mo81.6%78%MedHELM, BigBIO
PhysioNet 2019 (Sepsis)Clinical2019PredictionActive—Varies (104 teams)——
CheXpertMedical Imaging2019ClassificationNearing84 moAUC ~0.942.6/3 radiologistsCheXpert Plus
MIMIC-CXRMedical Imaging2019Report GenerationActive—RadCliQ-v1 0.92——
APTOS Diabetic RetinopathyMedical Imaging2019ClassificationNearing84 moQWK 0.967——
MedNLIClinical2019ClassificationActive—Accuracy % 86.59——
DDI Extraction 2013Bio NLP2019Relation ExtractionActive—F1 % 83.35——
MoleculeNetDrug Discovery2018Classification/RegressionNearing96 moAUROC 0.85-0.95—TDC, WelQrate
MedNLIBio NLP2018NLINearing96 mo~82% accuracy—BioNLI
VQA-RADMedical Imaging2018Visual QAUnknown—79.2%——
HAM10000Medical Imaging2018ClassificationNearing96 mo~96%+ accuracy—DermaMNIST-E
PCamMedical Imaging2018ClassificationNearing96 mo~97%+ accuracy——
Medical Segmentation DecathlonMedical Imaging2018SegmentationActive—nnU-Net variants lead——
RSNA Pneumonia DetectionMedical Imaging2018Object DetectionActive—Varies (1,400+ Kaggle teams)——
BBBPDrug Discovery2018ClassificationNearing—96.4% ROC-AUC——
BACEDrug Discovery2018ClassificationActive—88.4% ROC-AUC——
ClinToxDrug Discovery2018ClassificationNearing—99.2% ROC-AUC——
SIDERDrug Discovery2018Multi-label ClassificationActive—91.1% ROC-AUC——
ToxCastDrug Discovery2018Multi-label ClassificationActive—78.2% ROC-AUC——
MUVDrug Discovery2018Virtual ScreeningNearing—99.8% ROC-AUC——
HIV (MoleculeNet)Drug Discovery2018ClassificationActive—AUC 0.851——
EBM-NLPBio NLP2018NERActive—F1 % 76.01——
USPTO-MITDrug Discovery2017Reaction PredictionNearing108 mo>90% top-1 (forward)——
CAMI (Metagenomic)Genomics2017Classification/AssemblyActive—Good at genus, poor at strain—CAMI III
CRISPR off-target (CIRCLE-seq)Genomics2017ClassificationActive—AUROC 0.977 (CCLMoff)——
ChemProt REBio NLP2017Relation ExtractionNearing108 moF1 90.8%——
MIMIC-III BenchmarksClinical2017PredictionNearing108 moAUROC ~0.94 (mortality)—MIMIC-IV, YAIB
TAC ADRBio NLP2017ExtractionNearing108 moF1 ~85.2%—MultiADE
SMM4HBio NLP2017Social Media MiningActive—ADR detection F1 ~0.65-0.70——
NIH ChestX-ray14Medical Imaging2017ClassificationNearing108 moAUC ~0.85-0.88—CheXpert, MIMIC-CXR
Camelyon17Medical Imaging2017ClassificationActive—Kappa ~0.89—Camelyon+
CASF-2016Drug Discovery2016Scoring/Ranking/DockingNearing120 moPearson R ~0.86—PDBbind CleanSplit
USPTO-50KDrug Discovery2016RetrosynthesisNearing120 mo65% top-1~48.2% avg (forward)—
HoC (Hallmarks of Cancer)Bio NLP2016ClassificationNearing120 moF1 ~90.3%——
ISIC ChallengesMedical Imaging2016Classification/SegmentationNearing120 moExceeds cliniciansClinician level3D TBP (2024)
Camelyon16Medical Imaging2016ClassificationSaturated72 moAUC 0.994Pathologist AUCCamelyon17, Camelyon+
CAMELYON16Medical Imaging2016Pathology DetectionNearing—0.987 AUC——
OGB-MolPCBADrug Discovery2016Classification/RegressionActive—Test AP 0.3167——
TS115Protein2016RegressionActive—Q3 Accuracy 0.87——
ZINCDrug Discovery2015Regression/GenerationActive—Varies—ZINC20, ZINC-22
Schneider 50KDrug Discovery2015Reaction ClassificationSaturated72 mo>99% (RXNFP)—USPTO 1K TPL
QM8Drug Discovery2015RegressionNearing132 moNear saturation—QM9
DeepSEAGenomics2015ClassificationNearing132 moAUC 0.958—Sei, AlphaGenome
BC5CDR-Chemical NERBio NLP2015NERSaturated84 moF1 94.2%—BioRED
BC5CDR-Disease NERBio NLP2015NERNearing132 moF1 ~90%——
EyePACS DRMedical Imaging2015ClassificationSaturated48 moAUC ~0.99——
BC5CDRBio NLP2015Relation ExtractionNearing—91.9% F1——
PCBADrug Discovery2015ClassificationActive—AUC 0.8887——
Tox21Drug Discovery2014ClassificationUnknown—AUC ~0.85——
KIBADrug Discovery2014RegressionActive—CI ~0.898——
QM9Drug Discovery2014RegressionNearing144 moNear chemical accuracy—PCQM4Mv2
SAbDab (CDR design)Protein2014GenerationActive—CDR-H3 AAR ~40-50%; RMSD ~2.5-3.5A——
NCBI-Disease NERBio NLP2014NERSaturated96 moF1 ~91%IAA ~87%—
CAMEOProtein2013Structure EvaluationSaturated144 moAlphaFold dominant—CAMEO complexes/ligands/peptides
ClinVar (coding variants)Genomics2013ClassificationNearing156 moAUC ~0.95——
BioASQBio QA2013Semantic QAActive—F1 ~0.58; yes/no >80%——
DDI REBio NLP2013Relation ExtractionSaturated120 moF1 83.3%—MultiADE
DUD-EDrug Discovery2012Virtual ScreeningSaturated96 moBiased high AUC—LIT-PCBA, MF-PCBA, WelQrate
QM7/QM7bDrug Discovery2012RegressionSaturated96 moChemical accuracy achieved—QM9
RNA-PuzzlesProtein2012Structural PredictionActive—Best RMSD 3-7AHuman experts outperform servers—
BraTSMedical Imaging2012SegmentationActive—Dice ~0.88 whole tumor—BraTS 2025 Lighthouse
HIV-DTI-77Drug Discovery2012ClassificationActive—F1 % 68.3——
HIV-fMRI-77Medical Imaging2012ClassificationActive—F1 % 72.2——
DAVISDrug Discovery2011RegressionNearing180 moCI ~0.903——
CAGIGenomics2011Variant InterpretationActive—Varies——
CAFAProtein2010Function PredictionActive—Fmax 0.4-0.6——
LINNAEUS NERBio NLP2010NERSaturated132 moMid-to-high 90s%——
BC2GMBio NLP2008Named Entity RecognitionActive—88.8% F1——
BC2GM NERBio NLP2007NERNearing228 moF1 ~90.9%——
PDBbindDrug Discovery2004RegressionNearing264 moPearson R >0.86 (standard); <0.60 (CleanSplit)—PDBbind CleanSplit, PLINDER
JNLPBA NERBio NLP2004NERSaturated204 moF1 ~79.6%——
GAD REBio NLP2004Relation ExtractionSaturated204 moF1 ~85%——
JNLPBABio NLP2004Named Entity RecognitionActive—82.0% F1——
DB5.5 (Docking Benchmark)Protein2003DockingActive—Top-10 success ~38%——
CAPRIProtein2001Docking/InteractionActive—Varies——
CB513Protein1999Structure PredictionActive—0.763 Q8 Accuracy——
CATHProtein1997ClassificationNearing348 moHigh accuracy (known folds)——
CASP (Single-Chain)Protein1994Structural PredictionSaturated312 moGDT-TS 92.4~90 (experimental)CASP complexes/RNA tracks