Pré-processamento de corpus para português e inglês usando spaCy.
Project description
Pre_processamento
Descrição:
O pacote Pre_processamento oferece uma solução eficiente para o pré-processamento de texto em português e inglês, facilitando a preparação de corpus para tarefas de NLP (Processamento de Linguagem Natural). Ele integra diversas etapas de limpeza e normalização do texto, removendo ruÃdos e transformando o conteúdo para que esteja pronto para análise, classificação ou modelagem. Utiliza a biblioteca spaCy, garantindo suporte a modelos avançados de linguagem para ambos os idiomas.
Etapas do Pre-processamento:
1. Detecção e Carregamento Automático de Modelos SpaCy:
- O pacote tenta carregar automaticamente o maior modelo SpaCy disponÃvel (large, medium ou small) para o idioma em questão.
- Exemplo: Se os modelos "large" e "medium" não estiverem disponÃveis, o modelo "small" será carregado.
2. Conversão para Minúsculas:
- Todo o texto é convertido para minúsculas, garantindo uniformidade e padronização para facilitar as comparações entre palavras.
- Exemplo: "Hello World!" âž” "hello world!"
3. Remoção de URLs:
- Todos os links (URLs) que começam com 'http', 'https' ou 'www' são removidos do texto, eliminando conteúdos irrelevantes como referências a sites.
- Exemplo: "Visite https://site.com para mais informações" ➔ "Visite para mais informações."
4. Remoção de Menções e Hashtags:
- Menções a usuários (como @usuário) e hashtags (como #exemplo) são removidas automaticamente, filtrando elementos tÃpicos de redes sociais.
- Exemplo: "@joao, veja o #exemplo" âž” "veja o."
5. Remoção de Emojis:
- O pacote utiliza expressões regulares para detectar e remover uma ampla gama de emojis do texto.
- Exemplo: "Estou feliz 😊" ➔ "Estou feliz."
6. Remoção de Pontuações e Caracteres Especiais:
- O pacote remove todos os caracteres especiais e pontuações, exceto letras e números.
- Exemplo: "Olá, tudo bem!?" ➔ "Olá tudo bem"
7. Lematização:
- O pacote aplica a técnica de lematização, que converte cada palavra para sua forma básica ou "lemma".
- Exemplo: "correram" âž” "correr"
8. Remoção de Stopwords:
- As stopwords (palavras comuns e geralmente irrelevantes para análises, como "e", "de", "o", "para") são removidas com base nas listas pré-definidas do SpaCy, especÃficas para inglês e português.
- Exemplo: "o gato e o cachorro" âž” "gato cachorro"
9. Filtragem de Tokens:
- Tokens numéricos e tokens com menos de dois caracteres são eliminados, mantendo apenas palavras que têm relevância semântica e eliminando "ruÃdos" de dados.
- Exemplo: "a 123 casas" âž” "casas"
Instalação
Use o gerenciador de pacotes pip para instalar o pacote:
pip install Pre_processamento
Modo de uso
Português
from Pre_processamento.Pre_pt_br import Pro_pt_br
Pro_pt_br.P_pt_br("Seu corpus em português aqui.")
Inglês
from Pre_processamento.Pre_eng import Pro_eng
Pro_eng.P_eng("Your English corpus here.")
Requisitos
Para assegurar o correto funcionamento do pacote, é necessário realizar o download dos modelos de linguagem do spaCy para português e inglês.
Modelos do spaCy para Português
Para analisar textos em português, você pode escolher entre três tamanhos de modelos:
pt_core_news_sm (small): Modelo leve e rápido.
-
BenefÃcios: Ideal para análises rápidas ou ambientes com restrições de memória.
-
Desvantagens: Menos preciso e captura menos variações linguÃsticas.
Comando para instalar
python -m spacy download pt_core_news_sm
pt_core_news_md (medium): Modelo balanceado.
-
BenefÃcios: Melhor precisão do que o modelo "small", com um desempenho razoável.
-
Desvantagens: Ocupa mais memória e tempo de processamento.
Comando para instalar
python -m spacy download pt_core_news_md
pt_core_news_lg (large): Modelo grande, mais preciso.
-
BenefÃcios: Captura mais nuances linguÃsticas e tem maior precisão nas análises.
-
Desvantagens: Mais pesado, consome mais memória e tempo de processamento.
Comando para instalar
python -m spacy download pt_core_news_lg
Modelos do spaCy para Inglês
Da mesma forma, para textos em inglês, há diferentes modelos disponÃveis:
en_core_web_sm (small): Modelo leve e rápido.
-
BenefÃcios: Ótimo para tarefas simples ou quando o desempenho é uma prioridade.
-
Desvantagens: Menor precisão, captura menos informações detalhadas.
Comando para instalar
python -m spacy download en_core_web_sm
en_core_web_md (medium): Modelo médio, balanceado.
-
BenefÃcios: Melhor precisão em comparação com o modelo pequeno.
-
Desvantagens: Um pouco mais lento e consome mais memória.
Comando para instalar
python -m spacy download en_core_web_md
en_core_web_lg (large): Modelo grande e mais robusto.
-
BenefÃcios: Alta precisão, captura mais nuances do idioma.
-
Desvantagens: O modelo mais pesado, consome mais recursos de memória e processamento.
Comando para instalar
python -m spacy download en_core_web_lg
Author
Alexsandro Da Silva Bezerra
License
Project details
Release history Release notifications | RSS feed
Download files
Download the file for your platform. If you're not sure which to choose, learn more about installing packages.
Source Distribution
Built Distribution
Filter files by name, interpreter, ABI, and platform.
If you're not sure about the file name format, learn more about wheel file names.
Copy a direct link to the current filters
File details
Details for the file Pre_processamento-0.0.1.tar.gz.
File metadata
- Download URL: Pre_processamento-0.0.1.tar.gz
- Upload date:
- Size: 5.2 kB
- Tags: Source
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/5.1.1 CPython/3.9.13
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
fc09fa67254b0a117cde65ac1f4a7a7083d02a6a5ea50aadb13fb360e33b0618
|
|
| MD5 |
7fadc2cd69b3705d67e82eb2a82f22ec
|
|
| BLAKE2b-256 |
116a0bb51b50f78175f4f295f6a7b252439cd0f9be7ad8f3a8c1b90763f62a22
|
File details
Details for the file Pre_processamento-0.0.1-py3-none-any.whl.
File metadata
- Download URL: Pre_processamento-0.0.1-py3-none-any.whl
- Upload date:
- Size: 7.2 kB
- Tags: Python 3
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/5.1.1 CPython/3.9.13
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
1c84a4cefa0fff76af24d7b6541001a3e963a6028cfa2f094081756431dbb388
|
|
| MD5 |
971d632502b5856a91cb9fddaf6fe015
|
|
| BLAKE2b-256 |
2d7e6434a565503993e3c57ceb65c84126dc29224ab39823520512d957d196ac
|