PaddleOCR VL Models by Baidu AI

Baidu AIApache 2.0Open source
Baidu AI releases · 9 in the last 12 months · this family litChangelog →
1 model2025Up to 16k ctxFrom $0.020/1M input

Last refreshed 2026-05-22. Next refresh: weekly.

Details

ResearcherBaidu AI
LicenseApache 2.0OSI-approved
Commercial useCommercial use: permitted
Models1
Released2025
Max context16k

Capabilities

VisionAll models
MultimodalAll models

About

PaddleOCR VL is Baidu's ultra-compact vision-language model family for multilingual document parsing and OCR. The flagship 0.9B model combines a NaViT-style dynamic resolution visual encoder with ERNIE-4.5-0.3B and supports 109 languages. Achieved SOTA on OmniDocBench V1.5 at launch.

Decision facts

Best fit
vision and multimodal workcoding
Capability starting point
PaddleOCR VL with 16k context and multimodal inputs
Lowest tracked input
PaddleOCR VL · $0.020/1M · Novita AI
Closest related family
ERNIE 4.5

Current Variants

Use-when guidance is based on each model's tracked capabilities, context window, release date, and replacement status.

1 in view

Use when the workload needs vision, 16k context, and 900M parameters.

2025-10vision16k context900M parameters

Release Timeline

1 release group
2025-10
1 current
PaddleOCR VL
vision16k context900M parameters
Current

Specifications(1 models)

PaddleOCR VL model specifications comparison
ModelReleasedContextParametersVisionMultimodal
PaddleOCR VL2025-1016k0.9BYesYes

Available From(1 provider)

Pricing

PaddleOCR VL model pricing by provider
ModelProviderInput / 1MOutput / 1MType
PaddleOCR VLNovita AI$0.02$0.02Serverless