Skip to main content

Dataset Complexity Profiler

License: MIT

Библиотека анализирует размеченный текстовый датасет в пространстве эмбеддингов SentenceTransformer и рекомендует оптимальную размерность для сжатия через PCA. На типовых задачах линейному классификатору достаточно 16–32 главных компонент вместо исходных 384 признаков.

Режимы:

  • Прогностический (по умолчанию). Пять признаков передаются в поставляемый RandomForestClassifier. Модель возвращает значение из дискретной сетки {4, 8, 16, 32, 64, 128, 256}.
  • Эмпирический. PCA обучается строго на train-фолдах кросс-валидации. Выбирается наименьшая размерность, при которой линейная модель сохраняет не менее 97% качества относительно исходного полного вектора.

Ограничение на размер данных: библиотека требует минимум 30 примеров. Проверка выборки срабатывает сразу — ещё до загрузки весов модели в память.

Если в данных нет явного сигнала и базовая модель работает не лучше случайного угадывания (прирост точности < 0.10 или ∣Spearman∣<0.15 для STS), сжимать эмбеддинги бессмысленно — метод выбросит ValueError.

Качество предсказаний:
Модель оценивается по двум метрикам: точному попаданию в размерность (Accuracy) и ошибке не более чем на один шаг сетки (Adjacent Accuracy, то есть попадание в диапазон [d/2, 2d]).

  • Точное попадание (Accuracy): 0.43 (при случайном бейзлайне 0.16).
  • Попадание в соседний бакет (Adjacent Accuracy): 0.79 (против 0.65 у наивного правила «всегда брать 8»). Погрешность в основном связана с шумом разметки в самих текстах, а не со слабостью алгоритма. Подробный разбор и валидация: docs/META_MODEL_METRICS.md.

Артефакт сериализован через skops. Среда выполнения: scikit-learn>=1.6.1. Несовпадение минорной версии sklearn даёт warning, загрузка не блокируется.

Установка

Предобученная модель уже встроена в пакет и работает сразу из коробки.

1. Через uv (рекомендуется)

# Базовая версия (работает с готовыми матрицами эмбеддингов):
uv add dataset-complexity-profiler

# Полная версия (с поддержкой сырого текста через PyTorch и Hugging Face):
uv add "dataset-complexity-profiler[text]"

# Или запуск без установки в окружение:
uvx --from "dataset-complexity-profiler[text]" dcp analyze --help

2. Через pip

# Базовая версия:
pip install dataset-complexity-profiler

# Полная версия:
pip install "dataset-complexity-profiler[text]"

3. Установка из исходников (для разработки и тестов)

Если вы хотите запустить тесты, переобучить модель или внести правки:

git clone https://github.com/nvtm03/dataset_complexity_profiler.git
cd dataset_complexity_profiler

# Быстрая синхронизация окружения через uv:
uv sync --extra dev --extra text

# Или классический editable install через pip:
pip install -e ".[dev,text]"

Быстрый старт

from dataset_complexity_profiler import DatasetProfiler

texts = [
    "This movie is great!",
    "Terrible plot.",
    "I loved the acting.",
    "Worst film ever.",
] * 8
labels = [1, 0, 1, 0] * 8

profiler = DatasetProfiler()
report = profiler.analyze_text_dataset(texts, labels, dataset_name="demo")
print(report["recommended_embedding_dim"])
print(report["adaptation_recommendation"]["strategy"])

X_ready = profiler.fit_transform(texts, labels)
print(X_ready.shape)

Использование через командную строку

Библиотека предоставляет консольную команду dcp:

# Быстрый анализ датасета с Hugging Face с сохранением в JSON:
dcp analyze --hf fancyzhx/ag_news --limit 400 --output report.json

# Анализ локального CSV-файла:
dcp analyze --csv data.csv --text-col text --label-col label --limit 500

# Точный эмпирический подбор размерности полным перебором PCA:
dcp analyze --csv data.csv --empirical

--empirical запускает полный перебор размерностей PCA. --limit необязателен.

Предобученная мета-модель

В пакет встроен готовый легковесный классификатор (meta_model.skops), который сразу доступен после установки и не требует обучения.

  • На чём обучен: объединенная выборка из ~250 текстовых корпусов (классификация, NLI, STS) с Hugging Face.

  • Входные признаки: 5 геометрических мета-метрик датасета (число классов, точность бейзлайна, расстояние центроидов, оценки размерности TwoNN и PCA-95).

  • Валидация: честный GroupKFold по источникам датасетов во избежание утечек между похожими выборками.

  • Базовый энкодер: paraphrase-multilingual-MiniLM-L12-v2 (384-d).

  • Среда выполнения: библиотека не тянет PyMFE в runtime (он использовался только на этапе отбора признаков).

Подробное описание обучающих выборок, порогов и метрик качества вынесено в docs/META_MODEL_METRICS.md.

Воспроизводимость и дообучение модели

Код инференса намеренно отделен от пайплайна обучения: саму мета-модель можно воспроизвести с нуля или переобучить под специфичный домен (например, медицинские или юридические тексты).

1. Воспроизведение поставляемой модели

Обучение выполняется на объединении бенчмарков из feature_selection.csv и training_extra.csv (суммарно 254 датасета):

python research/train_meta_model.py \
  --selection-csv research/feature_selection.csv \
  --train-extra-csv research/training_extra.csv

Скрипт запишет обученную модель в src/dataset_complexity_profiler/meta_model.skops

2. Обучение на собственных данных

Если вам нужно адаптировать профилировщик под узкий домен, подготовьте таблицу мета-признаков (целевая колонка recommended_dim, 5 обязательных признаков и порог разделимости) и передайте её в скрипт:

python research/train_meta_model.py \
  --selection-csv custom_domain_meta_features.csv \
  --output-model src/dataset_complexity_profiler/meta_model.skops

Структура репозитория

src/dataset_complexity_profiler/   # ядро библиотеки, meta_model.skops, CLI
research/                          # скрипты обучения, сбор данных, CSV, ноутбуки
docs/                              # архитектура, метрики и обзор литературы
tests/                             # модульные и интеграционные тесты

Лицензия

LICENSE

Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

dataset_complexity_profiler-0.3.0.tar.gz (493.5 kB view details)

Uploaded Source

Built Distribution

If you're not sure about the file name format, learn more about wheel file names.

dataset_complexity_profiler-0.3.0-py3-none-any.whl (503.5 kB view details)

Uploaded Python 3

File details

Details for the file dataset_complexity_profiler-0.3.0.tar.gz.

File metadata

File hashes

Hashes for dataset_complexity_profiler-0.3.0.tar.gz
Algorithm Hash digest
SHA256 a7996101fa88028b1b5750206804d35511d5a29bd1c91220c9058d7d91edc50b
MD5 9fb9459d6e820756f3bd8508e0b31f52
BLAKE2b-256 ad7c9e83e3f3c0c082497fb4d54ffd18eb10617f2f783820bed974bc6b86edc4

See more details on using hashes here.

File details

Details for the file dataset_complexity_profiler-0.3.0-py3-none-any.whl.

File metadata

File hashes

Hashes for dataset_complexity_profiler-0.3.0-py3-none-any.whl
Algorithm Hash digest
SHA256 9570b80f4bf07924e2599dbb7fed1eb4e2990c9e353d4cf93d56c92d3ace00b5
MD5 81edcb432e83310ec4c5758e5369b56c
BLAKE2b-256 d9ec46748a4ceba6ed7f3ce186719c13bb14419122597d77c4223809c244c129

See more details on using hashes here.

Release history Release notifications | RSS feed

This release

0.3.0 This release

2 files

0.1.7

2 files

0.1.6

2 files

0.1.5

2 files

0.1.4

2 files

0.1.3

2 files

Anthropic, PBC Visionary sponsor Bloomberg Visionary sponsor Hudson River Trading Visionary sponsor Meta Visionary sponsor NVIDIA Visionary sponsor Microsoft Sustainability sponsor Depot Continuous Integration AWS Cloud computing and Security Sponsor Datadog Monitoring Fastly CDN Google Download Analytics Sentry Error logging StatusPage Status page