Skip to main content

Biblioteca com tokenizadores criados por Luis Chary

Project description

CharyluTokenizer

Biblioteca elaborada e utilizada por Luis Felipe Chary para utilização em projetos de DeepLearning envolvendo linguagem natural.

Consiste em uma gama de tokenizadores treinados utilizando a biblioteca Tokenizers mas com conjunto de dados próprios. Todos os tokenizadores foram treinados utilizando o algoritmo byte-pair encoding.

Os tokenizadores foram especialmente projetados para utilização em linguas latinas, com foco no Português.

Utilização básica

Para utilizar os tokenizadores utilize o seguinte código de exemplo:

from charylutokenizer import load_tokenizer

# inicializa o tokenizer
tokenizer = load_tokenizer(90, "_nocode") # tamanho do vocabulario desejado (k) e tipo

# tokeniza string
tokenizer.tokenize("texto de teste") # [47941, 9851, 16941]

# detokeniza tokens
tokenizer.detokenize([47941, 9851, 16941]) # "testo de teste"

Escopo

Os tokenizadores foram treinados em uma base proprietária que possui uma ampla gama de origens de textos (internet, livros, publicações científicas, repositórios de código, etc).

Para o treinamento dos tokenizadores, foi feita uma filtragem principalmente nas línguas de modo a aumentar a eficiência nas linguas latinas e inglês, dessa forma o tokenizador deve comportar bem:

  • Português (Brasil e Portugal) ~ 80% da base de treino
  • Espanhol ~ 1.5% da base de treino
  • Italiano ~ 1.5% da base de treino
  • Francês ~ 2% da base de treino
  • Inglês ~ 15% da base de treino

Versões

Foram treinados dois tipos diferentes de tokenizadores:

  1. Proposta geral - treinado em textos de múltiplas naturezas.
  2. No code - treinado em textos de múltiplas naturezas menos programação. Foram removidos textos de repositórios, livros, pdfs... tudo que possuia alguma linguagem de programação.
Vocab. Geral NoCode
32
50
60
70
80
90
100
110
120
130
150

Changelog

  • version 0.0.5 - first usable version
  • version 0.0.7 - updated requirements (less strict)
  • version 0.0.8 - new function 'load_tokenizer' for easy load

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

charylu_tokenizer-0.0.8.tar.gz (19.5 MB view details)

Uploaded Source

Built Distribution

If you're not sure about the file name format, learn more about wheel file names.

charylu_tokenizer-0.0.8-py3-none-any.whl (19.8 MB view details)

Uploaded Python 3

File details

Details for the file charylu_tokenizer-0.0.8.tar.gz.

File metadata

  • Download URL: charylu_tokenizer-0.0.8.tar.gz
  • Upload date:
  • Size: 19.5 MB
  • Tags: Source
  • Uploaded using Trusted Publishing? No
  • Uploaded via: twine/6.2.0 CPython/3.12.13

File hashes

Hashes for charylu_tokenizer-0.0.8.tar.gz
Algorithm Hash digest
SHA256 0dabec2123838300124a6b0f7be6174966fd45e4e80cea0dc39a7299c7a35cdd
MD5 95ded1d551b8501221bc08d5fc0fb118
BLAKE2b-256 87a9b6a7ed422c124c6f288e915420177431e375f6cec3efcc16740e72618361

See more details on using hashes here.

File details

Details for the file charylu_tokenizer-0.0.8-py3-none-any.whl.

File metadata

File hashes

Hashes for charylu_tokenizer-0.0.8-py3-none-any.whl
Algorithm Hash digest
SHA256 c1ae532fa681a55050df2d05e6baf6d975fff5e7c805627921d1355d66e50cad
MD5 42dff4c1ef66de556ab3d963905441c3
BLAKE2b-256 1948effce1169626b5cdbf9082d857e2362dc0452afb490dd3f2315cc0faf330

See more details on using hashes here.

Supported by

AWS Cloud computing and Security Sponsor Datadog Monitoring Depot Continuous Integration Fastly CDN Google Download Analytics Pingdom Monitoring Sentry Error logging StatusPage Status page