Qué hace
pdfmux extrae el texto de archivos PDF y revisa su propio resultado página a página. Cada página pasa por el motor de extracción que mejor le corresponde, como PyMuPDF, Docling, OCR o un modelo de lenguaje de respaldo, y las páginas con baja confianza se vuelven a procesar. Las páginas que no puede leer se marcan y no desaparecen en silencio.
Casos de uso
- 01Extraer texto de PDF mixtos, incluidas páginas escaneadas
- 02Marcar las páginas que no se pudieron leer
- 03Preparar documentos para un flujo de búsqueda o recuperación