Abstract

Vision-language models (VLMs) are increasingly being applied to three-dimensional medical imaging, but their application to knee MRI remains limited, particularly for interpreting the complementary sequences used in clinical practice. We introduce Knee3DVLM, a sequence-aware VLM that uses full-volume DESS and fluid-sensitive TSE MRI to predict 57 anatomically resolved binary diagnostic targets derived from the MRI Osteoarthritis Knee Score (MOAKS) for structured reporting. We evaluated DESS-only, TSE-only, and paired DESS-TSE configurations using subject-disjoint Osteoarthritis Initiative partitions. In a held-out cohort of 1,074 examinations, the fused model achieved 72.98% average accuracy, 71.17% balanced accuracy, 78.96% mean ROC-AUC, and 78.74% macro ROC-AUC, the highest values among the three configurations. In a secondary multiclass analysis aligned with the released 3DReasonKnee cohort, Knee3DVLM was numerically higher than the strongest reported 3DReasonKnee configuration across five pathology categories. These findings support dual-sequence full-volume modeling for comprehensive knee MRI assessment.

Keywords

Subject

Publication details

Journal
Not available
Open access
Green open access

Cite this article

APA 7

Baizhigitova, M., Yu, A. S., Chen, P. H., Subhas, N., Chen, S., Wang, X., Nakamura, K., Lartey, R., Li, X., & Yang, M. (2026). Knee3DVLM: Dual-Sequence Full-Volume Vision-Language Modeling for Comprehensive Knee MRI Assessment. https://omanscience.com/en/articles/knee3dvlm-dual-sequence-full-volume-vision-language-modeling-for-comprehensive-knee-mri-assessment

MLA 9

Baizhigitova, Maryam, et al. "Knee3DVLM: Dual-Sequence Full-Volume Vision-Language Modeling for Comprehensive Knee MRI Assessment." https://omanscience.com/en/articles/knee3dvlm-dual-sequence-full-volume-vision-language-modeling-for-comprehensive-knee-mri-assessment.

Chicago (author–date)

Baizhigitova, Maryam, Andrew Seohwan Yu, Po-Hao Chen, Naveen Subhas, Sixu Chen, Xinxin Wang, Kunio Nakamura, Richard Lartey, Xiaojuan Li, and Mingrui Yang. 2026. "Knee3DVLM: Dual-Sequence Full-Volume Vision-Language Modeling for Comprehensive Knee MRI Assessment." https://omanscience.com/en/articles/knee3dvlm-dual-sequence-full-volume-vision-language-modeling-for-comprehensive-knee-mri-assessment.

Harvard

Baizhigitova, M., Yu, A. S., Chen, P. H., Subhas, N., Chen, S., Wang, X., Nakamura, K., Lartey, R., Li, X. and Yang, M. (2026) 'Knee3DVLM: Dual-Sequence Full-Volume Vision-Language Modeling for Comprehensive Knee MRI Assessment', Available at: https://omanscience.com/en/articles/knee3dvlm-dual-sequence-full-volume-vision-language-modeling-for-comprehensive-knee-mri-assessment.

Vancouver

Baizhigitova M, Yu AS, Chen PH, Subhas N, Chen S, Wang X, et al. Knee3DVLM: Dual-Sequence Full-Volume Vision-Language Modeling for Comprehensive Knee MRI Assessment. https://omanscience.com/en/articles/knee3dvlm-dual-sequence-full-volume-vision-language-modeling-for-comprehensive-knee-mri-assessment

IEEE

M. Baizhigitova, A. S. Yu, P. H. Chen, N. Subhas, S. Chen, X. Wang, K. Nakamura, R. Lartey, X. Li, and M. Yang, "Knee3DVLM: Dual-Sequence Full-Volume Vision-Language Modeling for Comprehensive Knee MRI Assessment," https://omanscience.com/en/articles/knee3dvlm-dual-sequence-full-volume-vision-language-modeling-for-comprehensive-knee-mri-assessment.