Skip to main content

No project description provided

Project description

Europarser

PyPI - Version PyPI - Python Version

Parsing d'articles de presse pour extraire le contenu et le transformer en des formats d'analyse comme TXM ou Iramuteq.

This readme is also available in English


Table des matières

Installation

PyPi

Europarser est disponible sur PyPi, vous pouvez l'installer avec pip à l'aide de la commande suivante:

pip install europarser

Vous pouvez ensuite vérifier que l'installation s'est bien passée en lançant la commande europarser --version Une fois installé, vous pouvez lancer l'interface graphique avec la commande europarser.

Docker

docker run -p 8000:8000 --name europarser ceressorbonne/europarser

Le serveur sera accessible sur localhost:8000, vous pouvez également spécifier un autre port de la manière suivante:

docker run -p [port souhaité]:8000 --name europarser ceressorbonne/europarser

Développement

Pour installer Europarser en mode développement, vous pouvez cloner le dépôt git et installer les dépendances avec pip:

git clone https://github.com/CERES-Sorbonne/EuropressParser.git
cd EuropressParser
pip install -e .

Usages

Usage basique

from pathlib import Path

from europarser.main import main
from europarser.models import Params

folder = Path('/path/to/your/articles')
# As a list, you can choose between "json", "txm", "iramuteq", "csv", "stats", "processed_stats", "plots", "markdown" or any combination of them
outputs = ["json", "txm", "iramuteq", "csv", "stats", "processed_stats", "plots", "markdown"]
params = Params(
    minimal_support_kw=5,
    minimal_support_authors=2,
    minimal_support_journals=8,
    minimal_support_dates=3,
)

main(folder, outputs, params=params)

Usage sous forme d'API web

  1. Installez le package

    pip install europarser
    
  2. Lancez le serveur avec la commande suivante

    europarser --api [--host HOST] [--port PORT]
    
  3. Allez sur localhost:8000 (par défaut) pour accéder à l'interface de l'API

Usage en ligne de commande

  1. Installez le package

    pip install europarser
    
  2. Utilisez la commande suivante pour parser un dossier

    europarser --folder /path/to/your/articles --output [one of "json", "txm", "iramuteq", "csv", "stats", "processed_stats", "plots", "markdown"] [--output other_output] [--minimal-support-kw 5] [--minimal-support-authors 2] [--minimal-support-journals 8] [--minimal-support-dates 3]
    

Exemple

europarser --folder /path/to/your/articles --output json --output txm --minimal-support-kw 5 --minimal-support-authors 2 --minimal-support-journals 8 --minimal-support-dates 3

License

europarser est distribué sous les termes de la licence AGPLv3.

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

pedropedropedro-0.0.0.tar.gz (3.1 MB view details)

Uploaded Source

Built Distribution

pedropedropedro-0.0.0-py3-none-any.whl (14.9 kB view details)

Uploaded Python 3

File details

Details for the file pedropedropedro-0.0.0.tar.gz.

File metadata

  • Download URL: pedropedropedro-0.0.0.tar.gz
  • Upload date:
  • Size: 3.1 MB
  • Tags: Source
  • Uploaded using Trusted Publishing? No
  • Uploaded via: python-httpx/0.26.0

File hashes

Hashes for pedropedropedro-0.0.0.tar.gz
Algorithm Hash digest
SHA256 6178d6373d53d862824f7ce0e3e6fe4579f242a7598891949aae8021102b846c
MD5 f993d9d22da26e5c98a58af12943554b
BLAKE2b-256 e7db30380c8bf028b2d2b8fbe72113fdaf5bef1b9e8aed258b3f4e5c734df59e

See more details on using hashes here.

File details

Details for the file pedropedropedro-0.0.0-py3-none-any.whl.

File metadata

File hashes

Hashes for pedropedropedro-0.0.0-py3-none-any.whl
Algorithm Hash digest
SHA256 e100eb0b39f4fccae5e0da023031c4a627d06f25cccf3243ef2d42998e335005
MD5 1f61c5245e82df574ec843b8218f1f70
BLAKE2b-256 c03a9a1ffb7e584e247c428b9ea5d481cf84a7d843308da6de13231e473b4688

See more details on using hashes here.

Supported by

AWS AWS Cloud computing and Security Sponsor Datadog Datadog Monitoring Fastly Fastly CDN Google Google Download Analytics Microsoft Microsoft PSF Sponsor Pingdom Pingdom Monitoring Sentry Sentry Error logging StatusPage StatusPage Status page