Abstract

Comparing a patient’s MRI series across visits, or assembling a cohort from a large multi-site, multi-vendor database, both depend on the same step: retrieving the right series. Automating this is difficult because series names are inconsistent across scanner vendors, and often differ between sites using the same vendor. Vision-language models (VLMs) are a natural fit, embedding series thumbnails into a shared image-text space that can be queried with prompts such as “T2-weighted sagittal MRI of the female pelvis”. We benchmark three medical VLMs (PubMedCLIP, BiomedCLIP, MedSigLIP) and one state-of-the-art general VLM (SigLIP-2) on 2,702 female pelvic MRI series from five cohorts, across three tiers: zero-shot classification, linear probing, and full fine-tuning. Zero-shot fails: every model scores 14.5 to 29.4% sequence accuracy, below the 36.2% majority-class baseline. This gap is not bridged by medical pretraining or by general-purpose scale. Fine-tuning closes it: all four models reach ≥93% sequence accuracy after end-to-end training. We release two fine-tuned SigLIP-based checkpoints as Pelvis-SigLIP: a fine-tuned MedSigLIP reaching 95.1% sequence accuracy, and a fine-tuned SigLIP-2 reaching 90.5% orientation accuracy on a held-out patient test set. Both are released for clinical research use.

Links to Paper and Supplementary Materials

Main Paper (Open Access Version): https://papers.miccai.org/miccai-2026-sat/paper/CAPI_WOMEN_019.pdf

SharedIt Link: Not yet available

SpringerLink (DOI): Not yet available

Supplementary Material: Not Submitted

Link to Open Review

Open Review Page: https://openreview.net/forum?id=uwBxCtqACf

BibTex

@InProceedings{LinMax_PelvisSigLIP_MICCAISAT2026,
        author = { Lindholz, Maximilian AND Ruppel, Richard AND Hamm, Charlie Alexander AND Knupfer, Anika AND Eminovic, Semil AND Schmidt, Robin AND Haack, Anna-Maria AND El-Nahry, Yasmin AND Dominguez Aleixo, Carolina AND Hutter, Jana AND Mechsner, Sylvia AND Penzkofer, Tobias},
        title = { { Pelvis-SigLIP: Benchmarking Vision-Language Models for Female Pelvic MRI Series Retrieval across Zero-Shot, Linear-Probe, and Fine-Tuning } },
        booktitle = {Medical Image Computing and Computer Assisted Intervention -- MICCAI 2026 Workshops and Challenges},
        year = {2026},
        publisher = {Springer Nature Switzerland},
        volume = {LNCS 17256},
        month = {pending},
        page = {pending}
}


back to top