Skip to main content

Extrator e processador de documentos PDF utilizando Docling

Project description

pdfplucker

Uma ferramenta completa para extração e processamento de documentos PDF.

Características

  • Extração de texto, tabelas e imagens de documentos PDF
  • Processamento em paralelo para alta performance
  • Suporte para aceleração via CPU ou CUDA
  • Interface de linha de comando simples e intuitiva
  • Criação de estruturas de saída personalizáveis

Instalação

pip install pdf-processor
Ou diretamente do repositório:
bashgit clone https://github.com/yourusername/pdf-processor.git
cd pdf-processor
pip install -e .

Dependências

Este pacote requer as seguintes bibliotecas:

  • docling
  • PyMuPDF (fitz)
  • PyPDF2
  • Ainda preciso descobrir o resto das dependências

Uso

Linha de Comando

Processar todos os PDFs em um diretório:

pdf-processor /caminho/para/pdfs -o /caminho/de/saida -w 4

Processar um único arquivo PDF:

pdf-processor /caminho/para/arquivo.pdf --single-file

Usar aceleração CUDA:

pdf-processor /caminho/para/pdfs -d CUDA -w 4

Opções

usage: pdf-processor [-h] [-o OUTPUT] [-i IMAGES] [-s] [-w WORKERS] [-t TIMEOUT]
                     [-d {CPU,CUDA,cuda,cpu}] [--single-file]
                     source

Extrator de PDFs - Processador de documentos PDF

positional arguments:
  source                Caminho para os arquivos PDF (diretório ou arquivo único)

options:
  -h, --help            show this help message and exit
  -o OUTPUT, --output OUTPUT
                        Diretório para salvar os resultados (default: ./resultados)
  -i IMAGES, --images IMAGES
                        Diretório para salvar as imagens extraídas (ignorado se
                        --separate-folders estiver ativado) (default: None)
  -s, --separate-folders
                        Criar pastas separadas para cada PDF processado (default: False)
  -w WORKERS, --workers WORKERS
                        Número de processos paralelos a serem usados (default: 4)
  -t TIMEOUT, --timeout TIMEOUT
                        Tempo limite em segundos para processamento de cada PDF (default: 900)
  -d {CPU, CUDA, AUTO}, --device {CPU, CUDA, AUTO}
                        Dispositivo para processamento (CPU, CUDA ou AUTO) (default: CPU)
  --single-file         
                        Processar apenas um arquivo em vez de usar paralelismo (default: False)

Exemplo de uso

python cli.py --source //storage6/usuarios/CGDTI/IpeaDataLab/projetos/ted_mdic/BrasilMaisProdutivo/pastas_pdfs/TDs --output D:/Users/B19943781742/Desktop/teste --separate-folders --workers 6 --timeout 720 --device CPU --markdown-also

Como Funciona

O PDF Processor extrai informações estruturadas de documentos PDF:

  • Texto: Extrai o conteúdo textual, preservando a estrutura de seções e parágrafos
  • Tabelas: Identifica e extrai tabelas, preservando sua estrutura em formato JSON
  • Imagens: Extrai imagens contidas nos documentos PDF

Os resultados são salvos em formato JSON estruturado para facilitar o processamento posterior. Licença

Este projeto está licenciado sob a Licença MIT - veja o arquivo LICENSE para detalhes.

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

pdfplucker-0.1.6.tar.gz (9.6 kB view details)

Uploaded Source

Built Distribution

If you're not sure about the file name format, learn more about wheel file names.

pdfplucker-0.1.6-py3-none-any.whl (11.0 kB view details)

Uploaded Python 3

File details

Details for the file pdfplucker-0.1.6.tar.gz.

File metadata

  • Download URL: pdfplucker-0.1.6.tar.gz
  • Upload date:
  • Size: 9.6 kB
  • Tags: Source
  • Uploaded using Trusted Publishing? Yes
  • Uploaded via: twine/6.1.0 CPython/3.12.9

File hashes

Hashes for pdfplucker-0.1.6.tar.gz
Algorithm Hash digest
SHA256 728d1e4ffabf85ad30616e814b4126fdd53175d32d5de60e677dd7d3643c1b4b
MD5 a0cdb9162f70617a107c11a46e26b35b
BLAKE2b-256 4afe6c3e7a0104f7937b316489d7d5a479cf085f2f97dc73f9ea8ebadc71ecd7

See more details on using hashes here.

Provenance

The following attestation bundles were made for pdfplucker-0.1.6.tar.gz:

Publisher: release.yaml on rafaelghiorzi/pdfplucker

Attestations: Values shown here reflect the state when the release was signed and may no longer be current.

File details

Details for the file pdfplucker-0.1.6-py3-none-any.whl.

File metadata

  • Download URL: pdfplucker-0.1.6-py3-none-any.whl
  • Upload date:
  • Size: 11.0 kB
  • Tags: Python 3
  • Uploaded using Trusted Publishing? Yes
  • Uploaded via: twine/6.1.0 CPython/3.12.9

File hashes

Hashes for pdfplucker-0.1.6-py3-none-any.whl
Algorithm Hash digest
SHA256 35c93aeb2ffb32823ac8e6e16c4b458495da9c7de71efec3c43e4099e98edabb
MD5 2ee410f4776d719e153885aed017a4b6
BLAKE2b-256 6be55e49b44d651f4ecc7018ec5f3ea47b5671890eea4cbc98f6adf9dc82185b

See more details on using hashes here.

Provenance

The following attestation bundles were made for pdfplucker-0.1.6-py3-none-any.whl:

Publisher: release.yaml on rafaelghiorzi/pdfplucker

Attestations: Values shown here reflect the state when the release was signed and may no longer be current.

Supported by

AWS Cloud computing and Security Sponsor Datadog Monitoring Depot Continuous Integration Fastly CDN Google Download Analytics Pingdom Monitoring Sentry Error logging StatusPage Status page