Skip to main content

Pacote desenvolvido para buscar informações em arquivos pdf

Project description

BUSCA INFORMAÇÃO NO PDF

Objetivo

Pacote desenvolvido para auxiliar na busca de informações contidas nos pdf, o pacote opera na busca de duas maneiras;

  1. Busca por Regex: Nas fuções que utilizam a busca por regex os códigos foram desenvolvidos para buscar em todos os valores existentes no pdf, isto pode tornar mais lenta a leitura.
  2. Busca por posição: Na busca por posição, é necessário informar o termo que se busca e o local que ele se encontra, mais a frente serão demonstrados exemplos.

Funções

Instalação

```bash 
pip install busca_inf_pdf
```

busca_regex_pdf

  1. Esta função busca em um dicionário o texto em regex informado e retorna o valor conforme pesquisado, recebe os seguintes argumentos:

    1. pdf_path (obrigatório): Caminho em que se encontra o arquivo pdf
    2. regex (obrigatório): Código regex que deseja buscar
    3. empresa (opcional): Nome da empresa, se não informar será atribuido como None
    4. mes (opcional): Mês de referência, se não informar será atribuido como None

    Exemplo

      import busca_inf_pdf as bid
    
      path = r'./arquivo.pdf'
      regex = r'\d{2}\.\d{3}\.\d{3}/0001-\d{2}'
      empresa = 'Python Inc'
      mes = 'Janeiro'
    
      bid.busca_regex_pdf(path=path,
                              regex=regex,
                              empresa = empresa,
                              mes=mes)
    

extract_regex_values

  1. Esta função extrai apenas o valor regex buscado e recebe os seguintes argumentos:

    1. regex (obrigatório): Informa o código regex que será buscado
    2. string (obrigatório): Informar a string que contém o dado

    Exemplo

      import busca_inf_pdf as bid
    
      regex = r'\d{2}\.\d{3}\.\d{3}/0001-\d{2}'
      string  = 'CNPJ: 09.157.003/0001-37'
     
    
      bid.extract_regex_values(
          regex = regex,
          sting = string
      )
    

abertura_notas_e_criacao_lista

  1. Esta função busca em um diretório todos os arquivos pdf e realiza a extração dos dados, retonando duas listas, uma com os arquivos que deram erro e outra com o valor procurado:

    1. path_arquivos (obrigatório): Caminho da pasta com os arquivos
    2. str_regex (obrigatório): Código regex que deseja buscar
    3. empresa (opcional): Nome da empresa, se não informar será atribuido como None
    4. mes (opcional): Mês de referência, se não informar será atribuido como None

    Exemplo

      import busca_inf_pdf as bid
      import os
    
      list_pdf = os.listdir('diretorio com os arquivos pdf')
      regex = r'\d{2}\.\d{3}\.\d{3}/0001-\d{2}'
      empresa = 'Python Inc'
      mes = 'Janeiro'
     
    
      bid.abertura_notas_e_criacao_lista(path_arquivos=list_pdf,
                              regex=regex,
                              empresa = empresa,
                              mes=mes)
    

procura_desc_in_dict

  1. Esta função busca em uma lista se determinado termo esta na posição x e retorna a posição y, os argumentos são:

    1. dict: dict (obrigatório): Dicioário que deseja avaliar
    2. term: str (obrigatório): Palavra que busca para retorno
    3. x: int (obrigatório): Posição em que a palavra buscada no dicionário deve estar
    4. y: int (obrigatório): Posição em que a palavra de retorno deve estar

    Exemplo

      import busca_inf_pdf as bid
      import os
    
      bid.procura_desc_in_dict(
          dict = dicionario_a_partir_pdf,
          term = 'DESCR',
          x=0,
          y=1
      )
    

busca_no_dict_table

  1. Esta função busca em uma lista se determinado termo esta na posição x e retorna a posição y, os argumentos são:

    1. tables (obrigatório): retorno ao abrir um pdf utilizando camelot
    2. term_loc: str (obrigatório): Palavra que busca para retorno
    3. x: int (obrigatório): Posição em que a palavra buscada no dicionário deve estar
    4. y: int (obrigatório): Posição em que a palavra de retorno deve estar

    Exemplo

      import busca_inf_pdf as bid
      import camelot
    
      tables = camelot.read_pdf('arquivo.pdf', pages="all")
    
      bid.busca_no_dict_table(
          tables = tables,
          term = 'DESCR',
          x=0,
          y=1
      )
    

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

busca_inf_pdf-0.0.1.tar.gz (4.5 kB view details)

Uploaded Source

File details

Details for the file busca_inf_pdf-0.0.1.tar.gz.

File metadata

  • Download URL: busca_inf_pdf-0.0.1.tar.gz
  • Upload date:
  • Size: 4.5 kB
  • Tags: Source
  • Uploaded using Trusted Publishing? No
  • Uploaded via: twine/5.1.1 CPython/3.11.9

File hashes

Hashes for busca_inf_pdf-0.0.1.tar.gz
Algorithm Hash digest
SHA256 655f468a63eddf6910ba4985f6673c02272ee13e5541848212514b0f730c30e7
MD5 0a7fdf563d421151819a5a14d0c7b7b7
BLAKE2b-256 15701159b1a4c64439f96eea38585ad8a76c29bc4842077c80601e8a6ec12817

See more details on using hashes here.

Supported by

AWS Cloud computing and Security Sponsor Datadog Monitoring Depot Continuous Integration Fastly CDN Google Download Analytics Pingdom Monitoring Sentry Error logging StatusPage Status page