Skip to main content

Open framework + read-only scanners to review data platforms and cloud spend on GCP & AWS.

Project description

datanomad-review

PyPI Python License: MIT

Open framework + toolkit to review data platforms and cloud spend on GCP & AWS. Methodology, scorecard, anti-pattern catalog, runbooks, safety patterns, and read-only scanners. Built and maintained by DatanomadLab · MIT licensed.

datanomad-review es un "Well-Architected para plataformas de datos": evalúa una plataforma en 7 dimensiones — Arquitectura, Gobierno, Calidad, Costo (FinOps), Escalabilidad, Seguridad y AI-Readiness — y produce un scorecard con un roadmap priorizado.

Típico resultado en plataformas no gobernadas: 20–40% de ahorro en costo de datos + una ruta clara para dejar los datos listos para IA.


Tabla de contenidos


Por qué existe esto

La mayoría de los equipos de datos vive alguna combinación de:

  • Proyectos de IA trabados porque "los datos no están listos".
  • Un data lake convertido en pantano: nadie confía del todo en los números.
  • Facturas de BigQuery / Redshift / almacenamiento creciendo más rápido que los ingresos.
  • Pipelines duplicados, sin dueño, sin lineage y sin gobierno.

Los frameworks de cloud (Well-Architected) revisan infraestructura, pero no revisan la plataforma de datos como sistema: modelado, gobierno, calidad, costo por query, y si los datos sirven o no para IA. Este framework llena ese vacío — y es abierto, para que cualquier equipo pueda auto-evaluarse.

Quick start

pip install datanomad-review
# (o la última versión de desarrollo)
pip install git+https://github.com/datanomadlab/datanomad-review

# Revisión estática de un proyecto dbt (sin credenciales)
datanomad-review scan dbt ./mi-proyecto-dbt

# Linter de costo para BigQuery (usa tus propias credenciales, read-only)
pip install "datanomad-review[gcp]"
datanomad-review scan bigquery --project mi-proyecto-gcp

# Escaneo read-only de costos AWS (Cost Explorer)
pip install "datanomad-review[aws]"
datanomad-review scan aws-cost --profile mi-perfil

# Autoevaluación guiada (sin credenciales): genera scorecard desde los checklists
datanomad-review assess --interactive

Toda ejecución es read-only. Ver Safety patterns y los permisos mínimos por scanner (roles GCP / política IAM AWS).

Así se ve

Salida real del scanner dbt sobre examples/sample-dbt-project:

═══ DATANOMAD REVIEW · SCORECARD ═══

─── Hallazgos (4) ───

  🟠 [AP-G02] Solo 25% de los modelos tiene tests (3/4 sin tests)
       evidencia: ej: fct_orders, stg_customers, stg_orders
       fix: Política de PR: ningún modelo sin tests mínimos (unique/not_null).
  🟡 [AP-G02b] 3/4 modelos sin descripción
       evidencia: ej: fct_orders, stg_customers, stg_orders
       fix: Documentar modelos críticos primero (los que alimentan dashboards/IA).
  🟡 [AP-AI01] Solo 0/2 sources con freshness configurado
       fix: Definir freshness SLAs; alimenta la fase WATCH.
  🟡 [AP-C02] 1 modelos (fuera de staging) usan SELECT *
       evidencia: ej: fct_orders
       fix: Proyección explícita de columnas en capas curated/marts.

⚠  1 hallazgo de severidad alta. Prioriza con la matriz impacto×esfuerzo (fase LOCK).

Cómo funciona

┌─────────────┐     ┌──────────────┐     ┌───────────────┐
│  Checklists  │     │   Scanners    │     │   Scorecard    │
│  (rúbricas   │ ──▶ │  (read-only:  │ ──▶ │  + hallazgos   │
│   YAML/MD)   │     │  BQ/AWS/dbt)  │     │  + roadmap     │
└─────────────┘     └──────────────┘     └───────────────┘
  1. Checklists — rúbricas por dimensión en framework/checklists/, puntuables a mano o vía CLI.
  2. Scanners — chequeos automatizados read-only en src/datanomad_review/checks/ que detectan anti-patrones concretos (tablas sin particionar, SELECT * caros, recursos zombie, modelos dbt sin tests…).
  3. Scorecard — consolida todo en un puntaje 0–100 por dimensión + hallazgos priorizados por impacto/esfuerzo.

Las 7 dimensiones

# Dimensión Pregunta que responde
1 Arquitectura ¿El diseño de la plataforma es coherente, modular y mantenible?
2 Gobierno ¿Hay dueños, contratos de datos, catálogo y lineage?
3 Calidad ¿Se puede confiar en los números? ¿Hay tests y monitoreo?
4 Costo (FinOps) ¿Cuánto se desperdicia y quién es dueño de la factura?
5 Escalabilidad ¿La plataforma aguanta 10x sin reescritura?
6 Seguridad ¿PII gobernada, accesos mínimos, auditoría?
7 AI-Readiness ¿Los datos sirven hoy para entrenar/alimentar IA con confianza?

Rúbricas completas: src/datanomad_review/framework/scorecard.yaml · Checklists por dimensión: framework/checklists/

Metodología F.L.O.W.

El framework se aplica en 4 fases: Find → Lock → Optimize → Watch. Documento completo: docs/methodology-flow.md

Safety patterns

Reglas no negociables para revisar entornos ajenos (o el propio) sin romper nada: read-only por defecto, nunca borrar automático, evidencia antes de recomendación, cambios solo vía runbook y en dev primero. Detalle: docs/safety-patterns.md

Catálogo de anti-patrones

Los modos de falla más comunes (y caros) en plataformas de datos, con síntoma → impacto → detección → fix: docs/anti-patterns-catalog.md

Runbooks

Guías paso a paso para ejecutar los fixes sin downtime: docs/runbooks/

Roadmap del proyecto

  • Framework de checklists + scorecard (YAML)
  • CLI con scanners read-only: dbt, BigQuery, AWS Cost Explorer
  • Scanner GCP Billing / BigQuery INFORMATION_SCHEMA profundo
  • Scanner Redshift / Databricks
  • Reporte HTML del scorecard
  • Agente (Claude Code subagent) que ejecuta la revisión end-to-end
  • Integración con aws-cost-optimization-agent para la dimensión de costo AWS

Contribuciones bienvenidas — abre un issue o PR.

¿Quieres que aplique esto a tu plataforma?

Este framework es libre y puedes correrlo tú mismo. Si prefieres que un experto lo aplique a tu entorno real — con interpretación, roadmap accionable y ejecución — eso es el Data Platform Health Check de DatanomadLab: 3 semanas, precio fijo, 100% read-only, y garantía 3× (si no identifico valor de al menos 3 veces el fee, devuelvo el 100%). El roadmap alimenta las dos consultorías de DatanomadLab: FinOps (administración y optimización de gastos de nube) y Data Engineering (arquitectura y operaciones de datos).

📩 Agenda un diagnóstico inicial de 30 min, sin costo →


MIT © DatanomadLab / Felipe Veloso

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

datanomad_review-0.1.0.tar.gz (18.0 kB view details)

Uploaded Source

Built Distribution

If you're not sure about the file name format, learn more about wheel file names.

datanomad_review-0.1.0-py3-none-any.whl (15.8 kB view details)

Uploaded Python 3

File details

Details for the file datanomad_review-0.1.0.tar.gz.

File metadata

  • Download URL: datanomad_review-0.1.0.tar.gz
  • Upload date:
  • Size: 18.0 kB
  • Tags: Source
  • Uploaded using Trusted Publishing? No
  • Uploaded via: twine/6.2.0 CPython/3.13.3

File hashes

Hashes for datanomad_review-0.1.0.tar.gz
Algorithm Hash digest
SHA256 a6fb6ec4b2274dcafe5767a424e20bee56b929daef9116fcd1b0b8ee6bbc5fab
MD5 88a77499a85b19fc1869999d9044424b
BLAKE2b-256 63e175252d7beed3e136abeae5dff7004dbe93f777b46b052bd4a44915c01316

See more details on using hashes here.

File details

Details for the file datanomad_review-0.1.0-py3-none-any.whl.

File metadata

File hashes

Hashes for datanomad_review-0.1.0-py3-none-any.whl
Algorithm Hash digest
SHA256 6e0b62539717b1e18e8fd0248006c577665c189fbe174d571cf2ef9ab77f749e
MD5 900a5bf513eb9489583fafcbb5655d82
BLAKE2b-256 d351df35b3be83c7c1244e87bd263933342f933fc8a4739a9682296cf2dedaf2

See more details on using hashes here.

Supported by

AWS Cloud computing and Security Sponsor Datadog Monitoring Depot Continuous Integration Fastly CDN Google Download Analytics Pingdom Monitoring Sentry Error logging StatusPage Status page