Skip to main content

Sync/async Qdrant clients with Markdown chunking and pluggable embedding pipeline.

Project description

qdrant_vector_storage

Библиотека предоставляет синхронный и асинхронный клиент для Qdrant, а также готовый пайплайн: Markdown → чанки → эмбеддинги → загрузка в Qdrant.

Ключевая идея: библиотека не навязывает конкретную модель эмбеддингов.
Вы передаёте объект embedder (например, fastembed.TextEmbedding), а MarkdownProcessor использует его для расчёта векторов.


Установка

Базовая установка (клиенты + модели данных):

pip install qdrant_vector_storage

Быстрый старт

1) Создайте embedder (пример: fastembed)

from fastembed import TextEmbedding

embedder = TextEmbedding(model_name="jinaai/jina-embeddings-v3")

2) Создайте MarkdownProcessor

from qdrant_vector_storage import MarkdownProcessor

processor = MarkdownProcessor(
    embedder=embedder,
    expected_dim=1024,
    chunk_size=1024,
    chunk_overlap=300,
)

3) Асинхронная загрузка Markdown

import asyncio
from qdrant_vector_storage import QdrantAsyncClient, Distance

async def main():
    async with QdrantAsyncClient(url="http://localhost:6333") as client:
        await client.create_collection(
            collection_name="docs",
            vector_size=1024,
            distance=Distance.COSINE,
        )

        result = await client.upload_markdown(
            collection_name="docs",
            md_input="README.md",      # путь, строка Markdown или base64(Markdown)
            processor=processor,
            processor_kwargs={"add_passage_prefix": False},
        )

        print(result)

asyncio.run(main())

4) Синхронная загрузка Markdown

from qdrant_vector_storage import QdrantSyncClient, Distance

with QdrantSyncClient(url="http://localhost:6333") as client:
    client.create_collection(
        collection_name="docs",
        vector_size=1024,
        distance=Distance.COSINE,
    )

    result = client.upload_markdown(
        collection_name="docs",
        md_input="README.md",
        processor=processor,
        processor_kwargs={"add_passage_prefix": False},
    )

    print(result)

Поддерживаемые форматы входа для MarkdownProcessor

MarkdownProcessor.build_chunks(...) принимает:

  • строку Markdown
  • строку base64(Markdown) (авто-распознавание)
  • путь к файлу .md

Требования к embedder

MarkdownProcessor ожидает объект, у которого есть один из методов:

  • embed(texts: List[str]) -> Iterable[np.ndarray]
  • encode(texts: List[str]) -> Iterable[np.ndarray]

Документация API

Ниже перечислены все публичные классы и методы.

1) MarkdownProcessor

MarkdownProcessor выполняет:

  • загрузку Markdown (строка / base64 / путь)
  • нормализацию
  • разбиение на чанки
  • расчёт эмбеддингов через переданный embedder

Методы MarkdownProcessor

Метод Входные параметры Выход Назначение
MarkdownProcessor(embedder, chunk_size=900, chunk_overlap=120, keep_headings=True, keep_code_blocks=True, passage_prefix="passage: ", batch_size=64, expected_dim=None) embedder: объект с .embed(List[str]); параметры чанкинга/батчинга MarkdownProcessor Создание процессора Markdown
build_chunks(source, source_name=None, assume_base64_if_looks_like=True, add_passage_prefix=True) source: str или PathLike List[TextChunk] (вектор заполнен) Полный пайплайн: загрузка → чанки → эмбеддинги
embed_query(query_text, add_query_prefix=True) query_text: str List[float] Эмбеддинг запроса (для E5-подобных моделей можно добавлять префикс query:)

2) QdrantSyncClient / QdrantAsyncClient

Синхронный и асинхронный клиенты для Qdrant с идентичным набором методов. Различаются только синтаксисом вызова: синхронные методы vs async/await.

Конструктор

Метод Параметры Выход Исключения Описание
QdrantSyncClient()
QdrantAsyncClient()
url: str – адрес Qdrant
api_key: Optional[str] – ключ API
timeout: int – таймаут запросов (60)
**kwargs – доп. параметры клиента
объект клиента ConnectionError Инициализация подключения к Qdrant

Управление коллекциями

Метод Параметры Выход Исключения Описание
create_collection() collection_name: str – имя коллекции
vector_size: int – размерность векторов
distance: Distance – метрика (COSINE)
on_disk_payload: bool – payload на диске (True)
**kwargs – доп. параметры
Dict[str, Any] – информация о коллекции CollectionExistsError
QdrantError
Создание новой коллекции
get_collection_info() collection_name: str – имя коллекции Dict[str, Any] – информация о коллекции CollectionNotFoundError
QdrantError
Получение информации о коллекции
list_collections() List[str] – список имен коллекций QdrantError Получение списка всех коллекций
delete_collection() collection_name: str – имя коллекции bool – успех операции Удаление коллекции

Загрузка данных

Метод Параметры Выход Исключения Описание
upload_points() collection_name: str – имя коллекции
points: List[Point] – точки для загрузки
batch_size: int – размер батча (100)
wait: bool – ждать завершения (True)
List[str] – ID загруженных точек CollectionNotFoundError
QdrantError
Загрузка точек в коллекцию
upload_markdown() collection_name: str – имя коллекции
`md_input: str
PathLike – Markdown (текст/base64/путь)<br>processor: MarkdownProcessor – процессор для чанков<br>source_name: Optional[str] – имя источника<br>metadata: Optional[Dict] – метаданные<br>batch_size: int – размер батча (100)<br>wait: bool – ждать завершения (True)<br>processor_kwargs: Optional[Dict]` – параметры процессора FileUploadResult – результат загрузки CollectionNotFoundError
FileProcessingError
EmbeddingError
QdrantError

Удаление данных

Метод Параметры Выход Исключения Описание
delete_points() collection_name: str – имя коллекции
point_ids: Optional[List[str]] – ID точек
filter_condition: Optional[Dict] – фильтр для удаления
wait: bool – ждать завершения (True)
int – количество удаленных точек CollectionNotFoundError
QdrantError
Удаление точек по ID или фильтру
delete_by_metadata() collection_name: str – имя коллекции
metadata_key: str – ключ в metadata
metadata_value: Any – значение
wait: bool – ждать завершения (True)
int – количество удаленных точек CollectionNotFoundError
QdrantError
Удаление точек по значению в metadata

Поиск (универсальный метод)

Метод Параметры Выход Исключения Описание
search() collection_name: str – имя коллекции
query_vector: Optional[List[float]] – вектор запроса
query_point_id: Optional[Union[str, int]] – ID точки для поиска похожих
filter_condition: Optional[Dict] – фильтр
limit: int – лимит результатов (10)
score_threshold: Optional[float] – порог схожести
with_payload: bool – загружать payload (True)
search_mode: Literal["vector", "id", "filter", "hybrid"] – режим поиска ("vector")
List[SearchResult] – результаты поиска CollectionNotFoundError
QdrantError
ValueError
Универсальный поиск – векторный, по ID, по фильтру или гибридный

Вспомогательные методы

Метод Параметры Выход Исключения Описание
count_points() collection_name: str – имя коллекции
filter_condition: Optional[Dict] – фильтр
exact: bool – точный подсчет (False)
int – количество точек CollectionNotFoundError
QdrantError
Подсчет точек в коллекции
healthcheck() bool – доступен ли Qdrant Проверка подключения к Qdrant
close() None Закрытие соединения

3) Режимы поиска в методе search()

Режим Обязательные параметры Дополнительные параметры Описание
"vector" query_vector filter_condition Классический поиск по вектору с опциональной фильтрацией
"id" query_point_id filter_condition Поиск точек, похожих на точку с указанным ID
"filter" filter_only Поиск только по фильтру без вектора
"hybrid" query_vector filter_condition Гибридный поиск с RRF (вектор + фильтр)

4) Утилиты

FilterBuilder

Метод Входные параметры Выход Назначение
FilterBuilder.build_filter(condition) condition: Dict[str, Any] `models.Filter None`

Конвертеры

Функция Входные параметры Выход Назначение
chunks_to_points(chunks, base_metadata=None, id_factory=None) List[TextChunk] List[Point] Преобразование чанков в точки для upsert

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

qdrant_vector_storage-0.1.7.tar.gz (25.1 kB view details)

Uploaded Source

Built Distribution

If you're not sure about the file name format, learn more about wheel file names.

qdrant_vector_storage-0.1.7-py3-none-any.whl (25.4 kB view details)

Uploaded Python 3

File details

Details for the file qdrant_vector_storage-0.1.7.tar.gz.

File metadata

  • Download URL: qdrant_vector_storage-0.1.7.tar.gz
  • Upload date:
  • Size: 25.1 kB
  • Tags: Source
  • Uploaded using Trusted Publishing? Yes
  • Uploaded via: twine/6.1.0 CPython/3.13.7

File hashes

Hashes for qdrant_vector_storage-0.1.7.tar.gz
Algorithm Hash digest
SHA256 ee19ba819836821930083e89b7267471c9783b7edb2f8a994c08e0abea1a4ed1
MD5 07865b28584aa4af57cb79261f97ef30
BLAKE2b-256 4aaffad068f1e4863781ca93d166fc1e879cc9d5cea8e2077be30105964b4195

See more details on using hashes here.

Provenance

The following attestation bundles were made for qdrant_vector_storage-0.1.7.tar.gz:

Publisher: auto-publish.yml on opchik/qdrant_vector_storage

Attestations: Values shown here reflect the state when the release was signed and may no longer be current.

File details

Details for the file qdrant_vector_storage-0.1.7-py3-none-any.whl.

File metadata

File hashes

Hashes for qdrant_vector_storage-0.1.7-py3-none-any.whl
Algorithm Hash digest
SHA256 73635fec6490bed461fa192680ba200438e95a81fbea6b543677ce8da8c0473f
MD5 7e9734751c78c1ac3e8a65dc60193054
BLAKE2b-256 67c73f8df0873765262a6f15aa2b5e9b82ac7a3e5e82b7398d0c3f35f0cab3d6

See more details on using hashes here.

Provenance

The following attestation bundles were made for qdrant_vector_storage-0.1.7-py3-none-any.whl:

Publisher: auto-publish.yml on opchik/qdrant_vector_storage

Attestations: Values shown here reflect the state when the release was signed and may no longer be current.

Supported by

AWS Cloud computing and Security Sponsor Datadog Monitoring Depot Continuous Integration Fastly CDN Google Download Analytics Pingdom Monitoring Sentry Error logging StatusPage Status page