| name | paddleocr |
| description | Toolkit OCR líder mundial + motor de Document AI — convierte PDFs e imágenes en datos estructurados listos para LLMs. 79K+ estrellas. |
| url | https://github.com/PaddlePaddle/PaddleOCR |
| category | herramientas |
| fecha | 2026-06-05T00:00:00.000Z |
PaddleOCR — Document AI Engine
¿Qué hace?
PaddleOCR es el toolkit OCR de código abierto más utilizado del mundo (70K+ estrellas), integrado con Dify, RAGFlow, Cherry Studio y otros proyectos top. Convierte documentos PDF e imágenes en datos estructurados (JSON/Markdown) listos para LLMs, con precisión líder en la industria.
Componentes principales
- PaddleOCR-VL-1.6 (0.9B): Modelo vision-language ligero para parsing de documentos. 96.3% de precisión en OmniDocBench v1.6. Soporta 111 idiomas.
- PP-OCRv5: Modelo de reconocimiento de texto universal. 100+ idiomas, 13% mejora de precisión sobre la versión anterior. Solo 2M parámetros.
- PP-StructureV3: Conversión de PDFs/imágenes complejas a Markdown o JSON con coordenadas de celdas, texto, etc.
Casos de uso
- RAG pipelines: Extraer texto estructurado de PDFs para alimentar vectordbs
- Document processing: Convertir documentos escaneados, fotos de IDs, carteles a texto
- Multilingual OCR: Reconocimiento en 100+ idiomas incluyendo chino, árabe, hindi, cirílico
- Element recognition: Tablas, fórmulas, gráficos, sellos, documentos antiguos
- Edge deployment: Funciona en CPU, GPU, XPU, NPU — ideal para edge computing
- Browser inference: PaddleOCR.js — ejecutar OCR directamente en el navegador
Snippets útiles
Instalación básica
pip install paddleocr
OCR básico
from paddleocr import PaddleOCR
ocr = PaddleOCR(use_angle_cls=True, lang='es')
result = ocr.ocr('imagen.jpg', cls=True)
for line in result:
for word_info in line:
print(word_info[1])
PaddleOCR-VL para documentos
from paddleocr import PaddleOCRVL
vl = PaddleOCRVL(model_name="PaddleOCR-VL-1.6")
result = vl.ocr('documento.pdf', format='markdown')
PP-StructureV3 para parsing complejo
from paddleocr import PPStructureV3
parser = PPStructureV3()
result = parser('documento_complejo.pdf')
PaddleOCR.js en navegador
import { PaddleOCR } from 'paddleocr.js';
const ocr = await PaddleOCR.load();
const result = await ocr.recognize(imageData);
Cómo integrarlo
- Instalar con
pip install paddleocr
- Configurar modelo según necesidad: PP-OCRv5 (texto), PaddleOCR-VL (documentos), PP-StructureV3 (estructura)
- Para RAG: pipeline OCR → Markdown/JSON → vectorización → consulta
- Para edge: exportar a ONNX + TensorRT para inferencia optimizada
- Para web: usar PaddleOCR.js para OCR client-side
Pitfalls
- PaddlePaddle framework — requiere instalar PaddlePaddle (no es solo una librería Python estándar)
- Tamaño del modelo — los modelos VL son pesados (~GB), considerar versiones ONNX para edge
- Dependencias CUDA — para GPU, verificar versión de CUDA compatible
- PaddleOCR.js — funcionalidad limitada comparada con la versión Python
- Idiomas no latinos — mejor rendimiento en idiomas latinos y chinos; otros pueden necesitar tuning
- Documentos escaneados vs nativos — para PDFs nativos (texto selectable), considerar extracción directa primero
Fecha de descubrimiento
2026-06-05 — trending diario, 79K estrellas, integrado con Dify y RAGFlow