Abstract

Generating ultrasound reports from multiple images requires aggregating clinical evidence across views, yet archived key frames capture only part of the dynamic examination. Raw-report imitation is therefore misaligned with visual supervision: content that is clinically valid for the full examination may be unverifiable from the images available to a model. This gap creates a clinical behavior alignment problem. A model must preserve visible findings, avoid diagnostic reversals and unsupported completion, and not collapse into conservative templates. We propose CAMEO, a Clinically Aware Multi-image Evidence-grounded Orchestration framework for ultrasound report generation. Stage I learns ultrasound visual-language primitives; Stage II performs Cross-View Evidence Grounding by distilling trusted visible report points into multi-image QA and report-style supervision; and Stage III performs Clinically Aware Preference Alignment using clinical-error-oriented preference pairs. From USReport, we construct USReport-Distilled with 17,670 evidence-grounded paired-image training instances and USReport-Pref with 21,869 preference pairs; we additionally use 25,631 PubMedVision-US ultrasound instruction samples for domain adaptation and multi-image instruction tuning. On the primary USReport-Distilled benchmark, CAMEO improves over EchoVLM from 0.25 to 0.40 BLEU-1, 0.28 to 0.45 ROUGE-1, and 0.27 to 0.43 METEOR, while raising ClinicalScore from 55.02 to 74.20. These results underscore the value of evidence-grounded supervision, clinically aware alignment, and clinically structured evaluation for reliable ultrasound report generation.

Keywords

Subject

Publication details

Journal
Not available
Open access
Green open access

Cite this article

APA 7

Yang, Y., Wang, X., Wang, L., Pan, Y., Feng, Y., & Yang, Y. (2026). Beyond Report Imitation: Clinically Aware Multi-Image Ultrasound Report Generation from Visible Evidence. https://omanscience.com/en/articles/beyond-report-imitation-clinically-aware-multi-image-ultrasound-report-generation-from-visible-evidence

MLA 9

Yang, Yuchen, et al. "Beyond Report Imitation: Clinically Aware Multi-Image Ultrasound Report Generation from Visible Evidence." https://omanscience.com/en/articles/beyond-report-imitation-clinically-aware-multi-image-ultrasound-report-generation-from-visible-evidence.

Chicago (author–date)

Yang, Yuchen, Xin Wang, Lufan Wang, Yinghong Pan, Yujuan Feng, and Yuqing Yang. 2026. "Beyond Report Imitation: Clinically Aware Multi-Image Ultrasound Report Generation from Visible Evidence." https://omanscience.com/en/articles/beyond-report-imitation-clinically-aware-multi-image-ultrasound-report-generation-from-visible-evidence.

Harvard

Yang, Y., Wang, X., Wang, L., Pan, Y., Feng, Y. and Yang, Y. (2026) 'Beyond Report Imitation: Clinically Aware Multi-Image Ultrasound Report Generation from Visible Evidence', Available at: https://omanscience.com/en/articles/beyond-report-imitation-clinically-aware-multi-image-ultrasound-report-generation-from-visible-evidence.

Vancouver

Yang Y, Wang X, Wang L, Pan Y, Feng Y, Yang Y. Beyond Report Imitation: Clinically Aware Multi-Image Ultrasound Report Generation from Visible Evidence. https://omanscience.com/en/articles/beyond-report-imitation-clinically-aware-multi-image-ultrasound-report-generation-from-visible-evidence

IEEE

Y. Yang, X. Wang, L. Wang, Y. Pan, Y. Feng, and Y. Yang, "Beyond Report Imitation: Clinically Aware Multi-Image Ultrasound Report Generation from Visible Evidence," https://omanscience.com/en/articles/beyond-report-imitation-clinically-aware-multi-image-ultrasound-report-generation-from-visible-evidence.