Corpus en español de Colombia para procesamiento de lenguaje natural
Project description
Open Corpus CO-ES
Sistema de descarga y carga de corpus en español, con enfoque en Colombia y América Latina, para tareas de procesamiento de lenguaje natural (PLN).
Características
- 📥 Descarga automatizada desde Google Drive (mediante
gdowno URL directa) - 🧾 **Catálogo ** con metadatos de más de 70 corpus y recursos léxicos
- 📚 Carga flexible de corpus en múltiples formatos
- 🧪 Pruebas automáticas de carga para todos los corpus activos
- 🧰 Línea de comandos y uso como módulo de Python
Estructura del Proyecto
open_corpus_co_es/
├── downloader.py # Descarga y validación de archivos
├── loader.py # Carga de corpus según su formato
├── utils.py # Ruta local para almacenamiento
├── demo.py # Script de prueba para un solo corpus
├── demo_all.py # Script de prueba para todos los corpus
├── test_loader.py # Test unitarios
├── __main__.py # Entrada desde CLI
▶Instalación
Desde Pip
pip install open_corpus_co_es
Uso Básico
Listar corpus disponibles
python -m open_corpus_co_es --list
Descargar un corpus
python -m open_corpus_co_es --download salud_colombia_2024_v2
Descargar forzando reescritura
python -m open_corpus_co_es --download salud_colombia_2024_v2 --force
Descargar todos los corpus habilitados
python -m open_corpus_co_es --download_all
Ejecutar pruebas automáticas
python -m open_corpus_co_es.test_loader
Funciones Clave
download_corpus(name: str, force=False)
Descarga un corpus especificado por name usando su ID de Google Drive o URL. Verifica estructura básica y formatos.
load_corpus(name: str)
Carga un corpus previamente descargado. Aplica extracción automática de texto desde diferentes formatos.
list_corpus()
Retorna metadatos del catálogo activo en forma de diccionario.
Puedes acceder directamente a los archivos procesados para análisis posterior.
Ejemplo de Uso en Python
from open_corpus_co_es.loader import load_corpus, list_corpus
from open_corpus_co_es.downloader import download_corpus
print(f"Corpus disponibles: {list_corpus()}")
nombre = "presidentes"
print(f"\n📥 Descargando y cargando corpus: {nombre}")
download_corpus(nombre, force=True)
datos = load_corpus(nombre)
print("\n✅ Corpus cargado correctamente\n")
print(f"\n📄 Primer documento: {datos[:1]}")
Prueba interactiva
python demo.py --corpus presindetes
Autor y Créditos
Luis Gabriel Moreno Sandoval
Pontificia Universidad Javeriana
morenoluis@javeriana.edu.co
Licencia
MIT License
Project details
Release history Release notifications | RSS feed
Download files
Download the file for your platform. If you're not sure which to choose, learn more about installing packages.
Source Distribution
Built Distribution
Filter files by name, interpreter, ABI, and platform.
If you're not sure about the file name format, learn more about wheel file names.
Copy a direct link to the current filters
File details
Details for the file open_corpus_co_es-0.1.1a2.tar.gz.
File metadata
- Download URL: open_corpus_co_es-0.1.1a2.tar.gz
- Upload date:
- Size: 13.9 kB
- Tags: Source
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/6.1.0 CPython/3.12.3
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
40065c900bb17cbc43928d104de44a17885a2203017d69d90148a67a1dd2b923
|
|
| MD5 |
73cdc93632f07b4f55a6a80d89e43ce3
|
|
| BLAKE2b-256 |
b45bc44ee969a40e7ab55aebe010b5e42520e730734f6058e0856ea000fd6ff4
|
File details
Details for the file open_corpus_co_es-0.1.1a2-py3-none-any.whl.
File metadata
- Download URL: open_corpus_co_es-0.1.1a2-py3-none-any.whl
- Upload date:
- Size: 12.7 kB
- Tags: Python 3
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/6.1.0 CPython/3.12.3
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
a662d57dc69138860c952aaa2826a95ff9f0ab840673dd8a502db80646457af0
|
|
| MD5 |
8c8a4c8e9156893cbccb2910b7abe71d
|
|
| BLAKE2b-256 |
dada41460196e08ffad01b4d27b15a8e2f8281ea41d43a426d77b5776ee61abe
|