Skip to main content

No project description provided

Project description

DataLib

DataLib est une bibliothèque Python dédiée à la manipulation, l'analyse et la visualisation de données. Elle offre des fonctionnalités pour charger, nettoyer, analyser et visualiser des données de manière simple et efficace.

Fonctionnalités principales

1. Manipulation des données

  • Chargement de données : Chargement de fichiers CSV dans des DataFrames à l'aide de read_csv.
  • Écriture de données : Enregistrement des DataFrames dans des fichiers CSV avec write_csv.
  • Traitement des valeurs manquantes : Remplissage des valeurs manquantes avec des méthodes comme la moyenne, la médiane ou le mode via fill_missing_values.

2. Calcul des statistiques

  • Statistiques descriptives : Calcul des principales statistiques sur les colonnes numériques (moyenne, médiane, écart-type, mode) avec des fonctions comme calculate_mean, calculate_median, calculate_std, et calculate_mode.
  • Corrélation : Calcul de la corrélation entre deux séries de données avec calculate_correlation.
  • Statistiques automatiques : Calcul automatique des statistiques pour toutes les colonnes numériques d'un DataFrame avec calculate_statistics.

3. Visualisation des données

  • Histogrammes : Visualisation de la distribution des données avec des histogrammes via plot_histogram.
  • Nuages de points : Génération de nuages de points pour explorer les relations entre deux séries de données avec plot_scatter.
  • Matrice de corrélation : Affichage d'une matrice de corrélation pour visualiser les relations entre toutes les colonnes numériques d'un DataFrame avec plot_correlation_matrix.

4. Analyse avancée

  • Régression linéaire : Application d'un modèle de régression linéaire sur des données avec linear_regression.
  • Régression polynomiale : Application d'une régression polynomiale pour ajuster des courbes de degré supérieur avec polynomial_regression.
  • Clustering K-means : Application de l'algorithme de clustering K-means pour regrouper des données avec kmeans_clustering.
  • Analyse en Composantes Principales (PCA) : Réduction de la dimensionnalité des données avec PCA via pca_analysis.
  • Classification k-NN et arbre de décision : Classification des données avec les modèles k-NN (knn_classification) et arbre de décision (decision_tree_classification).

Installation

DataLib peut être installé facilement via pip :

pip install my-datalib-sirine

Ou via Poetry :

.. code-block:: bash

   poetry add my-datalib-sirine

Utilisation


Voici un exemple d'utilisation de la bibliothèque :

.. code-block:: python

import pandas as pd from datalib.manipulation import read_csv, write_csv, fill_missing_values from datalib.data_statistics import calculate_mean, calculate_statistics from datalib.visualization import plot_histogram from datalib.analysis import linear_regression

Charger un dataset CSV

file_path = 'path_to_your_data.csv' data = read_csv(file_path)

Remplir les valeurs manquantes

data_filled = fill_missing_values(data)

Calculer la moyenne d'une colonne spécifique

mean_value = calculate_mean(data_filled['column_name']) print(f"La moyenne de la colonne est : {mean_value}")

Calculer les statistiques pour toutes les colonnes numériques

calculate_statistics(data_filled)

Visualisation des données

plot_histogram(data_filled['column_name'], title="Histogramme de la colonne_name")

Régression linéaire

X = data_filled[['feature1']] y = data_filled['target'] model = linear_regression(X, y) print(f"Coefficients de la régression linéaire : {model.coef_}")

Licence


Ce projet est sous licence MIT - voir le fichier LICENSE pour plus de détails.

Documentation complète

La documentation complète de DataLib est disponible dans le dossier docs/, générée avec Sphinx.

Contribuer

Les contributions à DataLib sont les bienvenues. Pour contribuer, suivez ces étapes :

Fork ce projet. Créez une branche pour votre fonctionnalité (git checkout -b feature-name). Committez vos changements (git commit -am 'Add feature'). Poussez la branche (git push origin feature-name). Ouvrez une Pull Request.

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

my_datalib_sirine-2.0.0.tar.gz (46.2 kB view details)

Uploaded Source

Built Distribution

If you're not sure about the file name format, learn more about wheel file names.

my_datalib_sirine-2.0.0-py3-none-any.whl (48.1 kB view details)

Uploaded Python 3

File details

Details for the file my_datalib_sirine-2.0.0.tar.gz.

File metadata

  • Download URL: my_datalib_sirine-2.0.0.tar.gz
  • Upload date:
  • Size: 46.2 kB
  • Tags: Source
  • Uploaded using Trusted Publishing? No
  • Uploaded via: poetry/1.8.4 CPython/3.10.7 Windows/10

File hashes

Hashes for my_datalib_sirine-2.0.0.tar.gz
Algorithm Hash digest
SHA256 ad48eb7a3b3e983c8a13a23edf2222072ad95a3ca026573a20c6c170b28ac11b
MD5 c7c8e1667fe723173ef1a518326a99bb
BLAKE2b-256 79ae02d7898184b74d220f158ecb9e638314753d132b70d5ce9952e0eecd70f8

See more details on using hashes here.

File details

Details for the file my_datalib_sirine-2.0.0-py3-none-any.whl.

File metadata

  • Download URL: my_datalib_sirine-2.0.0-py3-none-any.whl
  • Upload date:
  • Size: 48.1 kB
  • Tags: Python 3
  • Uploaded using Trusted Publishing? No
  • Uploaded via: poetry/1.8.4 CPython/3.10.7 Windows/10

File hashes

Hashes for my_datalib_sirine-2.0.0-py3-none-any.whl
Algorithm Hash digest
SHA256 194a25887981ea9fe10fd00e3009df5662f0bb84e34b714683ff7de4cb8c3d0d
MD5 8def3d9e3eddd1de154dd3314ae86b60
BLAKE2b-256 5b5f739c7744b18104dbd7a89066a4e1d756f949b21af644693b8b1d2489304d

See more details on using hashes here.

Supported by

AWS Cloud computing and Security Sponsor Datadog Monitoring Depot Continuous Integration Fastly CDN Google Download Analytics Pingdom Monitoring Sentry Error logging StatusPage Status page