AcademyServidores MCPDatos e informes

pdfmux

Equipos de datos y operaciones que necesitan texto limpio de informes, contratos o documentos escaneados antes de analizarlos o buscarlos.

  • Recomendadonuestra valoración
  • 83estrellas en GitHub
  • MITlicencia
  • hace 3 díasúltima actualización

Úsalo ahora

claude mcp add pdfmux -- npx -y pdfmux-mcp
README.md

Cargando el archivo...

Qué hace

pdfmux extrae el texto de archivos PDF y revisa su propio resultado página a página. Cada página pasa por el motor de extracción que mejor le corresponde, como PyMuPDF, Docling, OCR o un modelo de lenguaje de respaldo, y las páginas con baja confianza se vuelven a procesar. Las páginas que no puede leer se marcan y no desaparecen en silencio.

Casos de uso

  1. 01Extraer texto de PDF mixtos, incluidas páginas escaneadas
  2. 02Marcar las páginas que no se pudieron leer
  3. 03Preparar documentos para un flujo de búsqueda o recuperación

Preguntas sobre
pdfmux.

¿Para qué sirve pdfmux?

Equipos de datos y operaciones que necesitan texto limpio de informes, contratos o documentos escaneados antes de analizarlos o buscarlos. pdfmux extrae el texto de archivos PDF y revisa su propio resultado página a página. Cada página pasa por el motor de extracción que mejor le corresponde, como PyMuPDF, Docling, OCR o un modelo de lenguaje de respaldo, y las páginas con baja confianza se vuelven a procesar. Las páginas que no puede leer se marcan y no desaparecen en silencio.

¿Cómo instalo pdfmux?

Ejecuta en tu terminal: claude mcp add pdfmux -- npx -y pdfmux-mcp

¿pdfmux es de código abierto?

Sí. El código está publicado en GitHub (NameetP/pdfmux) con licencia MIT.

¿Es seguro usar pdfmux?

Superó nuestro análisis automático de robo de credenciales, instrucciones ocultas y comandos de instalación peligrosos. Software de código abierto de terceros. Sabemos AI no lo mantiene. Revisa el código y los permisos antes de conectarlo a datos de la empresa.