No project description provided
Project description
Europarser
Parsing d'articles de presse pour extraire le contenu et le transformer en des formats d'analyse comme TXM ou Iramuteq
This readme is also available in English
Table of Contents
Installation
PyPi
Europarser est disponible sur PyPi, vous pouvez l'installer avec pip à l'aide de la commande suivante:
pip install europarser
Vous pouvez ensuite vérifier que l'installation s'est bien passée en lançant la commande europarser --version
Une fois installé, vous pouvez lancer l'interface graphique avec la commande europarser
.
Docker
docker run -p 8000:8000 --name europarser ceressorbonne/europarser
Le serveur sera accessible sur localhost:8000, vous pouvez également spécifier un autre port de la manière suivante:
docker run -p [port souhaité]:8000 --name europarser ceressorbonne/europarser
Développement
Pour installer Europarser en mode développement, vous pouvez cloner le dépôt git et installer les dépendances avec pip:
git clone https://github.com/CERES-Sorbonne/EuropressParser.git
cd EuropressParser
pip install -e .
Usages
Usage basique
from pathlib import Path
from europarser.main import main
from europarser.models import Params
folder = Path('/path/to/your/articles')
# As a list, you can choose between "json", "txm", "iramuteq", "csv", "stats", "processed_stats", "plots", "markdown" or any combination of them
outputs = ["json", "txm", "iramuteq", "csv", "stats", "processed_stats", "plots", "markdown"]
params = Params(
minimal_support_kw=5,
minimal_support_authors=2,
minimal_support_journals=8,
minimal_support_dates=3,
)
main(folder, outputs, params=params)
Usage sous forme d'API
- Installez le package
pip install europarser
- Lancez le serveur avec la commande suivante
europarser [--host HOST] [--port PORT]
- Allez sur localhost:8000 (par défaut) pour accéder à l'interface de l'API
Usage en ligne de commande
- Installez le package
pip install europarser
- Utilisez la commande suivante pour parser un dossier
europarser-cli --folder /path/to/your/articles --output [one of "json", "txm", "iramuteq", "csv", "stats", "processed_stats", "plots", "markdown"] [--output other_output] [--minimal-support-kw 5] [--minimal-support-authors 2] [--minimal-support-journals 8] [--minimal-support-dates 3]
Exemple
europarser-cli --folder /path/to/your/articles --output json --output txm --minimal-support-kw 5 --minimal-support-authors 2 --minimal-support-journals 8 --minimal-support-dates 3
License
europarser
est distribué sous les termes de la licence AGPLv3.
Project details
Release history Release notifications | RSS feed
Download files
Download the file for your platform. If you're not sure which to choose, learn more about installing packages.
Source Distribution
Built Distribution
File details
Details for the file quackoubert-0.0.0.tar.gz
.
File metadata
- Download URL: quackoubert-0.0.0.tar.gz
- Upload date:
- Size: 121.7 kB
- Tags: Source
- Uploaded using Trusted Publishing? No
- Uploaded via: python-httpx/0.26.0
File hashes
Algorithm | Hash digest | |
---|---|---|
SHA256 | b5f7c0f4b6537faaacbd35d3b6ea67ebf364a824d4e5c5352e78c96956cfaca5 |
|
MD5 | 47479a5366d0a78f1030382c026b976c |
|
BLAKE2b-256 | 80753890b5f4a80091d241ba4e71196bc3cd2036c9bfc1ed2db4749bee354214 |
File details
Details for the file quackoubert-0.0.0-py3-none-any.whl
.
File metadata
- Download URL: quackoubert-0.0.0-py3-none-any.whl
- Upload date:
- Size: 14.8 kB
- Tags: Python 3
- Uploaded using Trusted Publishing? No
- Uploaded via: python-httpx/0.26.0
File hashes
Algorithm | Hash digest | |
---|---|---|
SHA256 | 926921309718be09cc4ce502da2157e99ba20f1b45d61e9ac4ca59d83052c77d |
|
MD5 | 17a5b889bee5de6a8aca845ad7a30c6a |
|
BLAKE2b-256 | b827f39a982f1cccd8fd029cb750e0f3592be5ea778770860280ab88ddd3bb84 |