ATH MaaS/Vision-Language
Alibaba's OvisOCR2 turns page images into Markdown
A compact 0.8B vision-language model aims to parse full documents—text, tables, and formulas—in a single pass.
Company
Releases
A compact 0.8B vision-language model aims to parse full documents—text, tables, and formulas—in a single pass.