Skip to main content

Motor Central Python do Nexus RAG

Project description

nexus-rag

Motor de ingestão de documentos normativos em Python. Recebe um PDF e devolve entidades estruturadas e tipadas — prontas para alimentar um banco vetorial, um grafo de conhecimento, ou qualquer pipeline RAG que você estiver construindo.

Sem banco de dados embutido. Sem servidor. Sem opiniões sobre onde você vai guardar os dados.


O problema que isso resolve

PDFs de resoluções, portarias, leis e normas técnicas são documentos densos e mal estruturados. Converter esse tipo de conteúdo em dados utilizáveis manualmente é lento e frágil. Fazer isso com um text.split("\n\n") genérico gera lixo — chunks que cortam no meio de um artigo, perdem o contexto da seção, e não capturam nenhuma das relações entre documentos.

O nexus-rag foi construído para esse problema específico. Ele divide o documento respeitando a hierarquia normativa real (títulos, capítulos, artigos, parágrafos, incisos), e usa uma LLM com saída estruturada para extrair relações explícitas entre documentos — do tipo "a Resolução 361/2026 revoga a Resolução 221/2018".


Como funciona

O pipeline tem três fases em sequência, todas em memória:

PDF
 │
 ▼
DoclingParser          → converte para Markdown com layout preservado
 │
 ▼
ConfigurableMarkdownChunker  → divide em fragmentos semânticos (Atoms)
 │                             respeitando a hierarquia do documento
 ▼
StructuredBondExtractor      → varre os Atoms por frases-gatilho,
 │                             despacha candidatos para a LLM em paralelo,
 ▼                             e extrai relações como objetos Pydantic (Bonds)

(Molecule, [Atom, ...], [Bond, ...])

O que você recebe de volta são três objetos Python tipados. O que fazer com eles é por sua conta.


Modelo de domínio

Molecule — o documento inteiro. Metadados, aliases e o Markdown bruto produzido pelo parser.

Atom — um fragmento semântico. Carrega o trecho de texto e o caminho hierárquico de onde ele veio: ["Capítulo II", "Artigo 5", "Parágrafo 1"].

Bond — uma relação entre documentos, no formato Sujeito → Relação → Alvo. A relação é validada contra um Enum gerado a partir dos tipos que você configurou — a LLM não consegue inventar um valor fora da lista.

Resolução 361/2026  ──[ REVOGA ]──►  Resolução 221/2018
Resolução 361/2026  ──[ ALTERA ]──►  Portaria 88/2020

Instalação

pip install -e .

Para usar com Ollama local:

pip install langchain-ollama

A biblioteca aceita qualquer modelo compatível com LangChain Structured Output — Ollama, OpenAI, Anthropic, Groq, o que você preferir.


Uso básico

import asyncio
from langchain_ollama import ChatOllama
from nexus_rag import NexusPipelineRunner

async def main():
    pipeline = NexusPipelineRunner(
        llm=ChatOllama(model="qwen2.5:7b", temperature=0),
        relation_types=["REVOGA", "ALTERA", "ADICIONA", "REGULAMENTA"],
        id_format_hint="NÚMERO/ANO (ex: 361/2026)",
        chunking_rules=[
            r"(?i)^#{1,3}\s+(?:título|capítulo|seção|anexo|resolve).*",
            r"(?i)^(?:#{1,3}\s*)?(?:Art|Artigo)[\.\s]+\d+(?:º|o|°)?\b.*",
            r"(?i)^(?:-\s*)?(?:§|Parágrafo)[\.\s]*(?:\d+|único).*",
        ],
        candidate_trigger_pattern=(
            r"(?i)(ficam?\s+revogad[ao]s?|redação\s+dada\s+(?:pela|pelo)|"
            r"nos\s+termos\s+d[ao]|passa[m]?\s+a\s+vigorar)"
            r".*?(Resolução|Portaria|Decreto|Lei|Deliberação)"
        ),
    )

    molecule, atoms, bonds = await pipeline.process_from_pdf_async(
        pdf_path="./resolucao-361-2026.pdf",
        molecule_id="361/2026",
        title="Resolução 361/2026",
        aliases=["361/2026"],
    )

    print(f"{len(atoms)} átomos extraídos")
    print(f"{len(bonds)} ligações encontradas")
    for bond in bonds:
        print(f"  {bond.source_id} [{bond.relation}] {bond.target_id}")

asyncio.run(main())

Documentação


Requisitos

  • Python 3.10+
  • Uma LLM compatível com LangChain Structured Output

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

nexus_rag-0.1.2.tar.gz (14.2 kB view details)

Uploaded Source

Built Distribution

If you're not sure about the file name format, learn more about wheel file names.

nexus_rag-0.1.2-py3-none-any.whl (20.5 kB view details)

Uploaded Python 3

File details

Details for the file nexus_rag-0.1.2.tar.gz.

File metadata

  • Download URL: nexus_rag-0.1.2.tar.gz
  • Upload date:
  • Size: 14.2 kB
  • Tags: Source
  • Uploaded using Trusted Publishing? No
  • Uploaded via: twine/6.2.0 CPython/3.14.3

File hashes

Hashes for nexus_rag-0.1.2.tar.gz
Algorithm Hash digest
SHA256 caa3a96ed33cb5bc59af86b7d2a5f0688d8661fd15bf91736fe5329fc7344410
MD5 27309aa6ee4ae470507b452726fc13cb
BLAKE2b-256 3eeb6f2d4966bad0dc7db422c21410361e7332552a3c4ff8631207195cbb8c16

See more details on using hashes here.

File details

Details for the file nexus_rag-0.1.2-py3-none-any.whl.

File metadata

  • Download URL: nexus_rag-0.1.2-py3-none-any.whl
  • Upload date:
  • Size: 20.5 kB
  • Tags: Python 3
  • Uploaded using Trusted Publishing? No
  • Uploaded via: twine/6.2.0 CPython/3.14.3

File hashes

Hashes for nexus_rag-0.1.2-py3-none-any.whl
Algorithm Hash digest
SHA256 709c21f924073852ca263da7201d91c691f4fb6056cf7bdaa51e58fe20418f27
MD5 e6946d110cf0df9a6983a11bddd68497
BLAKE2b-256 afa85f8273fd492c4c7e46d85d4c152cff2529148588df64db6859a5669517c1

See more details on using hashes here.

Supported by

AWS Cloud computing and Security Sponsor Datadog Monitoring Depot Continuous Integration Fastly CDN Google Download Analytics Pingdom Monitoring Sentry Error logging StatusPage Status page