الباحثون

Cheng Tan

المنشورات 1

نسخة أولية وصول مفتوح

Xiaomi-OCR-0 Technical Report

Xin Chen, Anan Du, Feng Feng وآخرون · 2026

Compact OCR-specific vision-language models achieve strong document parsing performance, but often rely on costly supervision and focus primarily on visual-text reconstruction. We introduce Xiaomi-OCR-0, a unified 0.8B model for document parsing and OCR-centric understanding. We build an approximately 170M-sample OCR-c …

المؤلفون المشاركون