Evaluation harness for Les Audits-Affaires LLM benchmark
Project description
Les Audits-Affaires - Harness d'Évaluation LLM
Un framework d'évaluation complet pour tester les modèles de langage sur le benchmark juridique français Les Audits-Affaires. Évalue les modèles sur 5 catégories de compétences juridiques en utilisant le dataset legmlai/les-audits-affaires.
Démarrage Rapide
Installation
pip install -e .
Utilisation de Base
# Évaluer OpenAI GPT-4o avec évaluateur Azure OpenAI
export EXTERNAL_PROVIDER=openai
export EXTERNAL_MODEL=gpt-4o
export OPENAI_API_KEY=votre_cle_openai
export AZURE_OPENAI_API_KEY=votre_cle_azure
export AZURE_OPENAI_ENDPOINT=votre_endpoint_azure
lae-eval run --max-samples 10
Configuration
Modèle à Évaluer
Fournisseurs Externes :
# OpenAI
export EXTERNAL_PROVIDER=openai
export EXTERNAL_MODEL=gpt-4o
export OPENAI_API_KEY=votre_cle
# Mistral
export EXTERNAL_PROVIDER=mistral
export EXTERNAL_MODEL=mistral-large-latest
export MISTRAL_API_KEY=votre_cle
# Claude
export EXTERNAL_PROVIDER=claude
export EXTERNAL_MODEL=claude-3-5-sonnet-20241022
export ANTHROPIC_API_KEY=votre_cle
# Gemini
export EXTERNAL_PROVIDER=gemini
export EXTERNAL_MODEL=gemini-1.5-pro
export GOOGLE_API_KEY=votre_cle
Modèles Locaux :
export MODEL_ENDPOINT=http://localhost:8000/generate
export MODEL_NAME=nom_de_votre_modele
Configuration de l'Évaluateur
Azure OpenAI (Par défaut) :
export AZURE_OPENAI_API_KEY=votre_cle
export AZURE_OPENAI_ENDPOINT=votre_endpoint
Évaluateurs Alternatifs :
# OpenAI comme évaluateur
export EVALUATOR_PROVIDER=openai
export EVALUATOR_MODEL=gpt-4o
export EVALUATOR_OPENAI_API_KEY=votre_cle
# Mistral comme évaluateur
export EVALUATOR_PROVIDER=mistral
export EVALUATOR_MODEL=mistral-large-latest
export EVALUATOR_MISTRAL_API_KEY=votre_cle
# Claude comme évaluateur
export EVALUATOR_PROVIDER=claude
export EVALUATOR_MODEL=claude-3-5-sonnet-20241022
export EVALUATOR_ANTHROPIC_API_KEY=votre_cle
# Gemini comme évaluateur
export EVALUATOR_PROVIDER=gemini
export EVALUATOR_MODEL=gemini-1.5-pro
export EVALUATOR_GOOGLE_API_KEY=votre_cle
# Modèle local comme évaluateur
export EVALUATOR_PROVIDER=local
export EVALUATOR_ENDPOINT=http://localhost:8001/generate
Commandes
Lancer l'Évaluation
# Évaluation complète (2 658 échantillons)
lae-eval run
# Échantillons limités
lae-eval run --max-samples 100
# Mode synchrone (plus stable)
lae-eval run --sync
# Endpoint chat pour modèles locaux
lae-eval run --chat
# Répertoire de sortie personnalisé
lae-eval run --output-dir resultats_personnalises
Tester les Composants
# Tester la connexion au modèle
lae-eval test-model
# Tester la connexion à l'évaluateur
lae-eval test-evaluator
# Afficher la configuration actuelle
lae-eval info
Architecture
Flux de Travail
graph TD
A[Dataset: 2 658 Questions Juridiques] --> B[Modèle à Évaluer]
B --> C[Réponse Structurée]
C --> D[Évaluateur LLM]
D --> E[Scores: 5 Catégories]
E --> F[Résultats: JSON/Excel/Rapports]
style A fill:#e3f2fd
style B fill:#e8f5e8
style C fill:#fff3e0
style D fill:#f3e5f5
style E fill:#fce4ec
style F fill:#e1f5fe
Format de Réponse Requis
Les modèles doivent répondre avec cette structure :
[Analyse et raisonnement...]
• Action Requise: [action spécifique] parce que [référence légale]
• Délai Legal: [délai] parce que [référence légale]
• Documents Obligatoires: [documents requis] parce que [référence légale]
• Impact Financier: [coûts/frais] parce que [référence légale]
• Conséquences Non-Conformité: [risques] parce que [référence légale]
Catégories d'Évaluation
- Action Requise - Actions légales nécessaires
- Délai Legal - Échéances et délais légaux
- Documents Obligatoires - Documentation obligatoire
- Impact Financier - Implications financières
- Conséquences Non-Conformité - Conséquences du non-respect
Chaque catégorie notée de 0 à 100 avec justifications détaillées.
Résultats
Fichiers de Sortie
evaluation_results.json- Résultats détaillés avec scores et justificationsevaluation_summary.csv- Statistiques agrégéesevaluation_report.xlsx- Rapport Excel multi-feuilles avec visualisationsscore_distribution.png- Graphiques de distribution des scoresevaluation.log- Logs d'exécution détaillés
Métriques Clés
- Score Global - Moyenne de toutes les catégories
- Scores par Catégorie - Performance individuelle par domaine juridique
- Qualité des Réponses - Conformité du format et complétude
- Statistiques de Traitement - Temps et taux d'erreur
Dépannage
Problèmes Courants
Erreurs de Connexion API :
# Vérifier les identifiants
lae-eval info
env | grep -E "(API_KEY|ENDPOINT)"
# Tester avec un échantillon minimal
lae-eval run --max-samples 1
Problèmes de Modèle Local :
# Tester l'endpoint manuellement
curl -X POST http://localhost:8000/generate \
-H "Content-Type: application/json" \
-d '{"prompt": "Test", "max_new_tokens": 100}'
# Essayer l'endpoint chat
lae-eval run --chat
Problèmes de Performance :
# Réduire la concurrence
export BATCH_SIZE=5
export CONCURRENT_REQUESTS=10
# Utiliser le mode synchrone
lae-eval run --sync
Mode Debug
export LOG_LEVEL=DEBUG
lae-eval run --max-samples 1
# Vérifier evaluation.log pour les informations détaillées
Dataset
Source : legmlai/les-audits-affaires sur HuggingFace
- 2 658 scénarios de droit des affaires français
- Questions juridiques réelles de divers contextes d'entreprise
- Ground truth validée par des experts sur 5 catégories juridiques
- Couverture complète du droit commercial français
Développement
Configuration
git clone <repository-url>
cd les-audits-affaires-eval-harness
python -m venv venv
source venv/bin/activate
pip install -e ".[dev]"
Qualité du Code
pytest tests/
black src/ tests/
isort src/ tests/
mypy src/
Licence
Licence MIT - voir le fichier LICENSE pour les détails.
Support
- Consultez ce README pour les solutions courantes
- Lancez
lae-eval infopour vérifier la configuration - Testez avec
--max-samples 1d'abord - Vérifiez
evaluation.logpour les messages d'erreur détaillés - Ouvrez une issue si les problèmes persistent
Project details
Download files
Download the file for your platform. If you're not sure which to choose, learn more about installing packages.
Source Distribution
Built Distribution
Filter files by name, interpreter, ABI, and platform.
If you're not sure about the file name format, learn more about wheel file names.
Copy a direct link to the current filters
File details
Details for the file les_audits_affaires_eval_harness-1.1.2.tar.gz.
File metadata
- Download URL: les_audits_affaires_eval_harness-1.1.2.tar.gz
- Upload date:
- Size: 46.2 kB
- Tags: Source
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/6.1.0 CPython/3.12.9
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
6f36a5c24b62cfdc41816213cbd6fbeda848c2e92a2bdb6e40c1891d1ad296d9
|
|
| MD5 |
52c8e79dcdee1d963969e575f917de44
|
|
| BLAKE2b-256 |
f6ef9e459cca0efd8d31ee926e8c5309887e079784a60619cfa5aba11c650848
|
File details
Details for the file les_audits_affaires_eval_harness-1.1.2-py3-none-any.whl.
File metadata
- Download URL: les_audits_affaires_eval_harness-1.1.2-py3-none-any.whl
- Upload date:
- Size: 32.6 kB
- Tags: Python 3
- Uploaded using Trusted Publishing? No
- Uploaded via: twine/6.1.0 CPython/3.12.9
File hashes
| Algorithm | Hash digest | |
|---|---|---|
| SHA256 |
db564c29de0b18d34672205a51158b04d8c1541793360400f09c67a5be43ed8b
|
|
| MD5 |
cc0b83d0589cbce1c24b5d3198397261
|
|
| BLAKE2b-256 |
3f754bf96899c6dcd2ce4732d14d3df9dc8be13d5b04031b7b816f3b0240bf32
|