Skip to main content

Pré-processamento de corpus para português e inglês usando spaCy.

Project description

Pre_processamento

Descrição:

O pacote Pre_processamento oferece uma solução eficiente para o pré-processamento de texto em português e inglês, facilitando a preparação de corpus para tarefas de NLP (Processamento de Linguagem Natural). Ele integra diversas etapas de limpeza e normalização do texto, removendo ruídos e transformando o conteúdo para que esteja pronto para análise, classificação ou modelagem. Utiliza a biblioteca spaCy, garantindo suporte a modelos avançados de linguagem para ambos os idiomas.

Etapas do Pre-processamento:

1. Detecção e Carregamento Automático de Modelos SpaCy:

  • O pacote tenta carregar automaticamente o maior modelo SpaCy disponível (large, medium ou small) para o idioma em questão.
  • Exemplo: Se os modelos "large" e "medium" não estiverem disponíveis, o modelo "small" será carregado.

2. Conversão para Minúsculas:

  • Todo o texto é convertido para minúsculas, garantindo uniformidade e padronização para facilitar as comparações entre palavras.
  • Exemplo: "Hello World!" âž” "hello world!"

3. Remoção de URLs:

  • Todos os links (URLs) que começam com 'http', 'https' ou 'www' são removidos do texto, eliminando conteúdos irrelevantes como referências a sites.
  • Exemplo: "Visite https://site.com para mais informações" âž” "Visite para mais informações."

4. Remoção de Menções e Hashtags:

  • Menções a usuários (como @usuário) e hashtags (como #exemplo) são removidas automaticamente, filtrando elementos típicos de redes sociais.
  • Exemplo: "@joao, veja o #exemplo" âž” "veja o."

5. Remoção de Emojis:

  • O pacote utiliza expressões regulares para detectar e remover uma ampla gama de emojis do texto.
  • Exemplo: "Estou feliz 😊" âž” "Estou feliz."

6. Remoção de Pontuações e Caracteres Especiais:

  • O pacote remove todos os caracteres especiais e pontuações, exceto letras e números.
  • Exemplo: "Olá, tudo bem!?" âž” "Olá tudo bem"

7. Lematização:

  • O pacote aplica a técnica de lematização, que converte cada palavra para sua forma básica ou "lemma".
  • Exemplo: "correram" âž” "correr"

8. Remoção de Stopwords:

  • As stopwords (palavras comuns e geralmente irrelevantes para análises, como "e", "de", "o", "para") são removidas com base nas listas pré-definidas do SpaCy, específicas para inglês e português.
  • Exemplo: "o gato e o cachorro" âž” "gato cachorro"

9. Filtragem de Tokens:

  • Tokens numéricos e tokens com menos de dois caracteres são eliminados, mantendo apenas palavras que têm relevância semântica e eliminando "ruídos" de dados.
  • Exemplo: "a 123 casas" âž” "casas"

Instalação

Use o gerenciador de pacotes pip para instalar o pacote:

pip install Pre_processamento

Modo de uso

Português

from Pre_processamento.Pre_pt_br import Pro_pt_br
Pro_pt_br.P_pt_br("Seu corpus em português aqui.")

Inglês

from Pre_processamento.Pre_eng import Pro_eng
Pro_eng.P_eng("Your English corpus here.")

Requisitos

Para assegurar o correto funcionamento do pacote, é necessário realizar o download dos modelos de linguagem do spaCy para português e inglês.

Modelos do spaCy para Português

Para analisar textos em português, você pode escolher entre três tamanhos de modelos:

pt_core_news_sm (small): Modelo leve e rápido.

  • Benefícios: Ideal para análises rápidas ou ambientes com restrições de memória.

  • Desvantagens: Menos preciso e captura menos variações linguísticas.

Comando para instalar

python -m spacy download pt_core_news_sm

pt_core_news_md (medium): Modelo balanceado.

  • Benefícios: Melhor precisão do que o modelo "small", com um desempenho razoável.

  • Desvantagens: Ocupa mais memória e tempo de processamento.

Comando para instalar

python -m spacy download pt_core_news_md

pt_core_news_lg (large): Modelo grande, mais preciso.

  • Benefícios: Captura mais nuances linguísticas e tem maior precisão nas análises.

  • Desvantagens: Mais pesado, consome mais memória e tempo de processamento.

Comando para instalar

python -m spacy download pt_core_news_lg

Modelos do spaCy para Inglês

Da mesma forma, para textos em inglês, há diferentes modelos disponíveis:

en_core_web_sm (small): Modelo leve e rápido.

  • Benefícios: Ótimo para tarefas simples ou quando o desempenho é uma prioridade.

  • Desvantagens: Menor precisão, captura menos informações detalhadas.

Comando para instalar

python -m spacy download en_core_web_sm

en_core_web_md (medium): Modelo médio, balanceado.

  • Benefícios: Melhor precisão em comparação com o modelo pequeno.

  • Desvantagens: Um pouco mais lento e consome mais memória.

Comando para instalar

python -m spacy download en_core_web_md

en_core_web_lg (large): Modelo grande e mais robusto.

  • Benefícios: Alta precisão, captura mais nuances do idioma.

  • Desvantagens: O modelo mais pesado, consome mais recursos de memória e processamento.

Comando para instalar

python -m spacy download en_core_web_lg

Author

Alexsandro Da Silva Bezerra

License

MIT

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

Pre_processamento-0.0.1.tar.gz (5.2 kB view details)

Uploaded Source

Built Distribution

If you're not sure about the file name format, learn more about wheel file names.

Pre_processamento-0.0.1-py3-none-any.whl (7.2 kB view details)

Uploaded Python 3

File details

Details for the file Pre_processamento-0.0.1.tar.gz.

File metadata

  • Download URL: Pre_processamento-0.0.1.tar.gz
  • Upload date:
  • Size: 5.2 kB
  • Tags: Source
  • Uploaded using Trusted Publishing? No
  • Uploaded via: twine/5.1.1 CPython/3.9.13

File hashes

Hashes for Pre_processamento-0.0.1.tar.gz
Algorithm Hash digest
SHA256 fc09fa67254b0a117cde65ac1f4a7a7083d02a6a5ea50aadb13fb360e33b0618
MD5 7fadc2cd69b3705d67e82eb2a82f22ec
BLAKE2b-256 116a0bb51b50f78175f4f295f6a7b252439cd0f9be7ad8f3a8c1b90763f62a22

See more details on using hashes here.

File details

Details for the file Pre_processamento-0.0.1-py3-none-any.whl.

File metadata

File hashes

Hashes for Pre_processamento-0.0.1-py3-none-any.whl
Algorithm Hash digest
SHA256 1c84a4cefa0fff76af24d7b6541001a3e963a6028cfa2f094081756431dbb388
MD5 971d632502b5856a91cb9fddaf6fe015
BLAKE2b-256 2d7e6434a565503993e3c57ceb65c84126dc29224ab39823520512d957d196ac

See more details on using hashes here.

Supported by

AWS Cloud computing and Security Sponsor Datadog Monitoring Depot Continuous Integration Fastly CDN Google Download Analytics Pingdom Monitoring Sentry Error logging StatusPage Status page