Preprint Open access
Diffusion Drafts, AR Verifies: Accelerating Document OCR with Self-Speculative Decoding
Autoregressive OCR vision-language models accurately convert document images into text and structured markup, but require one sequential decoding step per output token, limiting inference speed. Unlike open-ended text generation, OCR outputs are strongly grounded in the input image, making diffusion-based parallel gene …