Biblioteca com tokenizadores criados por Luis Chary
Project description
CharyluTokenizer
Biblioteca elaborada e utilizada por Luis Felipe Chary para utilização em projetos de DeepLearning envolvendo linguagem natural.
Consiste em uma gama de tokenizadores treinados utilizando a biblioteca Tokenizers mas com conjunto de dados próprios. Todos os tokenizadores foram treinados utilizando o algoritmo byte-pair encoding.
Os tokenizadores foram especialmente projetados para utilização em linguas latinas, com foco no Português.
Utilização básica
Para utilizar os tokenizadores utilize o seguinte código de exemplo:
from charylutokenizer import load_tokenizer
# inicializa o tokenizer
tokenizer = load_tokenizer(90, "_nocode") # tamanho do vocabulario desejado (k) e tipo
# tokeniza string
tokenizer.tokenize("texto de teste") # [47941, 9851, 16941]
# detokeniza tokens
tokenizer.detokenize([47941, 9851, 16941]) # "testo de teste"
Escopo
Os tokenizadores foram treinados em uma base proprietária que possui uma ampla gama de origens de textos (internet, livros, publicações científicas, repositórios de código, etc).
Para o treinamento dos tokenizadores, foi feita uma filtragem principalmente nas línguas de modo a aumentar a eficiência nas linguas latinas e inglês, dessa forma o tokenizador deve comportar bem:
- Português (Brasil e Portugal) ~ 80% da base de treino
- Espanhol ~ 1.5% da base de treino
- Italiano ~ 1.5% da base de treino
- Francês ~ 2% da base de treino
- Inglês ~ 15% da base de treino
Versões
Foram treinados dois tipos diferentes de tokenizadores:
- Proposta geral - treinado em textos de múltiplas naturezas.
- No code - treinado em textos de múltiplas naturezas menos programação. Foram removidos textos de repositórios, livros, pdfs... tudo que possuia alguma linguagem de programação.
| Vocab. | Geral | NoCode |
|---|---|---|
| 32 | ✓ | ✓ |
| 50 | ✓ | ✓ |
| 60 | ✓ | ✓ |
| 70 | ✓ | ✓ |
| 80 | ✓ | ✓ |
| 90 | ✓ | ✓ |
| 100 | ✓ | ✓ |
| 110 | ✓ | |
| 120 | ✓ | ✓ |
| 130 | ✓ | |
| 150 | ✓ | ✓ |
Changelog
- version 0.0.5 - first usable version
- version 0.0.7 - updated requirements (less strict)
- version 0.0.8 - new function 'load_tokenizer' for easy load
Project details
Download files
Download the file for your platform. If you're not sure which to choose, learn more about installing packages.
Source Distribution
Built Distribution
Filter files by name, interpreter, ABI, and platform.
If you're not sure about the file name format, learn more about wheel file names.
Copy a direct link to the current filters
File details
Details for the file charylu_tokenizer-0.0.8.tar.gz.
File metadata
- Download URL: charylu_tokenizer-0.0.8.tar.gz
- Upload date:
- Size: 19.5 MB
- Tags: Source
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/6.2.0 CPython/3.12.13
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
0dabec2123838300124a6b0f7be6174966fd45e4e80cea0dc39a7299c7a35cdd
|
|
| MD5 |
95ded1d551b8501221bc08d5fc0fb118
|
|
| BLAKE2b-256 |
87a9b6a7ed422c124c6f288e915420177431e375f6cec3efcc16740e72618361
|
File details
Details for the file charylu_tokenizer-0.0.8-py3-none-any.whl.
File metadata
- Download URL: charylu_tokenizer-0.0.8-py3-none-any.whl
- Upload date:
- Size: 19.8 MB
- Tags: Python 3
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/6.2.0 CPython/3.12.13
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
c1ae532fa681a55050df2d05e6baf6d975fff5e7c805627921d1355d66e50cad
|
|
| MD5 |
42dff4c1ef66de556ab3d963905441c3
|
|
| BLAKE2b-256 |
1948effce1169626b5cdbf9082d857e2362dc0452afb490dd3f2315cc0faf330
|