Skip to main content

Open framework + read-only scanners to review data platforms and cloud spend on GCP & AWS.

Project description

datanomad-review

PyPI Python License: MIT

Open framework + toolkit to review data platforms and cloud spend on GCP & AWS. Methodology, scorecard, anti-pattern catalog, runbooks, safety patterns, and read-only scanners. Built and maintained by DatanomadLab · MIT licensed.

Demo de datanomad-review

datanomad-review es un "Well-Architected para plataformas de datos": evalúa una plataforma en 7 dimensiones — Arquitectura, Gobierno, Calidad, Costo (FinOps), Escalabilidad, Seguridad y AI-Readiness — y produce un scorecard con un roadmap priorizado.

Típico resultado en plataformas no gobernadas: 20–40% de ahorro en costo de datos + una ruta clara para dejar los datos listos para IA.


Tabla de contenidos


Por qué existe esto

La mayoría de los equipos de datos vive alguna combinación de:

  • Proyectos de IA trabados porque "los datos no están listos".
  • Un data lake convertido en pantano: nadie confía del todo en los números.
  • Facturas de BigQuery / Redshift / almacenamiento creciendo más rápido que los ingresos.
  • Pipelines duplicados, sin dueño, sin lineage y sin gobierno.

Los frameworks de cloud (Well-Architected) revisan infraestructura, pero no revisan la plataforma de datos como sistema: modelado, gobierno, calidad, costo por query, y si los datos sirven o no para IA. Este framework llena ese vacío — y es abierto, para que cualquier equipo pueda auto-evaluarse.

Quick start

pip install datanomad-review

# Demo autocontenida: escanea un proyecto de ejemplo incluido (sin credenciales, sin red)
datanomad-review demo

# Revisión estática de un proyecto dbt (sin credenciales)
datanomad-review scan dbt ./mi-proyecto-dbt

# Linter de costo para BigQuery (usa tus propias credenciales, read-only)
pip install "datanomad-review[gcp]"
datanomad-review scan bigquery --project mi-proyecto-gcp

# Escaneo read-only de costos AWS (Cost Explorer)
pip install "datanomad-review[aws]"
datanomad-review scan aws-cost --profile mi-perfil

# Autoevaluación guiada (sin credenciales): genera scorecard desde los checklists
datanomad-review assess --interactive

Toda ejecución es read-only. Ver Safety patterns y los permisos mínimos por scanner (roles GCP / política IAM AWS).

Así se ve

Salida real del scanner dbt sobre examples/sample-dbt-project:

═══ DATANOMAD REVIEW · SCORECARD ═══

─── Hallazgos (4) ───

  🟠 [AP-G02] Solo 25% de los modelos tiene tests (3/4 sin tests)
       evidencia: ej: fct_orders, stg_customers, stg_orders
       fix: Política de PR: ningún modelo sin tests mínimos (unique/not_null).
  🟡 [AP-G02b] 3/4 modelos sin descripción
       evidencia: ej: fct_orders, stg_customers, stg_orders
       fix: Documentar modelos críticos primero (los que alimentan dashboards/IA).
  🟡 [AP-AI01] Solo 0/2 sources con freshness configurado
       fix: Definir freshness SLAs; alimenta la fase WATCH.
  🟡 [AP-C02] 1 modelos (fuera de staging) usan SELECT *
       evidencia: ej: fct_orders
       fix: Proyección explícita de columnas en capas curated/marts.

⚠  1 hallazgo de severidad alta. Prioriza con la matriz impacto×esfuerzo (fase LOCK).

Cómo funciona

┌─────────────┐     ┌──────────────┐     ┌───────────────┐
│  Checklists  │     │   Scanners    │     │   Scorecard    │
│  (rúbricas   │ ──▶ │  (read-only:  │ ──▶ │  + hallazgos   │
│   YAML/MD)   │     │  BQ/AWS/dbt)  │     │  + roadmap     │
└─────────────┘     └──────────────┘     └───────────────┘
  1. Checklists — rúbricas por dimensión en framework/checklists/, puntuables a mano o vía CLI.
  2. Scanners — chequeos automatizados read-only en src/datanomad_review/checks/ que detectan anti-patrones concretos (tablas sin particionar, SELECT * caros, recursos zombie, modelos dbt sin tests…).
  3. Scorecard — consolida todo en un puntaje 0–100 por dimensión + hallazgos priorizados por impacto/esfuerzo.

Las 7 dimensiones

# Dimensión Pregunta que responde
1 Arquitectura ¿El diseño de la plataforma es coherente, modular y mantenible?
2 Gobierno ¿Hay dueños, contratos de datos, catálogo y lineage?
3 Calidad ¿Se puede confiar en los números? ¿Hay tests y monitoreo?
4 Costo (FinOps) ¿Cuánto se desperdicia y quién es dueño de la factura?
5 Escalabilidad ¿La plataforma aguanta 10x sin reescritura?
6 Seguridad ¿PII gobernada, accesos mínimos, auditoría?
7 AI-Readiness ¿Los datos sirven hoy para entrenar/alimentar IA con confianza?

Rúbricas completas: src/datanomad_review/framework/scorecard.yaml · Checklists por dimensión: framework/checklists/

Metodología F.L.O.W.

El framework se aplica en 4 fases: Find → Lock → Optimize → Watch. Documento completo: docs/methodology-flow.md

Safety patterns

Reglas no negociables para revisar entornos ajenos (o el propio) sin romper nada: read-only por defecto, nunca borrar automático, evidencia antes de recomendación, cambios solo vía runbook y en dev primero. Detalle: docs/safety-patterns.md

Catálogo de anti-patrones

Los modos de falla más comunes (y caros) en plataformas de datos, con síntoma → impacto → detección → fix: docs/anti-patterns-catalog.md

Runbooks

Guías paso a paso para ejecutar los fixes sin downtime: docs/runbooks/

Roadmap del proyecto

  • Framework de checklists + scorecard (YAML)
  • CLI con scanners read-only: dbt, BigQuery, AWS Cost Explorer
  • Scanner GCP Billing / BigQuery INFORMATION_SCHEMA profundo
  • Scanner Redshift / Databricks
  • Reporte HTML del scorecard
  • Agente (Claude Code subagent) que ejecuta la revisión end-to-end
  • Integración con aws-cost-optimization-agent para la dimensión de costo AWS

Contribuciones bienvenidas — abre un issue o PR.

¿Quieres que aplique esto a tu plataforma?

Este framework es libre y puedes correrlo tú mismo. Si prefieres que un experto lo aplique a tu entorno real — con interpretación, roadmap accionable y ejecución — eso es el Data Platform Health Check de DatanomadLab: 3 semanas, precio fijo, 100% read-only, y garantía 3× (si no identifico valor de al menos 3 veces el fee, devuelvo el 100%). El roadmap alimenta las dos consultorías de DatanomadLab: FinOps (administración y optimización de gastos de nube) y Data Engineering (arquitectura y operaciones de datos).

📩 Agenda un diagnóstico inicial de 30 min, sin costo →


MIT © DatanomadLab / Felipe Veloso

Project details


Download files

Download the file for your platform. If you're not sure which to choose, learn more about installing packages.

Source Distribution

datanomad_review-0.2.0.tar.gz (20.3 kB view details)

Uploaded Source

Built Distribution

If you're not sure about the file name format, learn more about wheel file names.

datanomad_review-0.2.0-py3-none-any.whl (18.9 kB view details)

Uploaded Python 3

File details

Details for the file datanomad_review-0.2.0.tar.gz.

File metadata

  • Download URL: datanomad_review-0.2.0.tar.gz
  • Upload date:
  • Size: 20.3 kB
  • Tags: Source
  • Uploaded using Trusted Publishing? No
  • Uploaded via: twine/6.2.0 CPython/3.13.3

File hashes

Hashes for datanomad_review-0.2.0.tar.gz
Algorithm Hash digest
SHA256 95364ccfefc178bae8c81d06c8a16160b49f1c17e19044bcee33ced6cd1570c3
MD5 3cba8a5e30872699e5a191ce14641b7e
BLAKE2b-256 57c48abad34d88512a1a8bccb049adb798d27d45a1aba63d38299121aaa17688

See more details on using hashes here.

File details

Details for the file datanomad_review-0.2.0-py3-none-any.whl.

File metadata

File hashes

Hashes for datanomad_review-0.2.0-py3-none-any.whl
Algorithm Hash digest
SHA256 a57a0ee6750cb1f0521799101c8669f0c892a936929d714288766f9cb41ca569
MD5 8b5c5f40fbbf0e03342497341772f563
BLAKE2b-256 13871c62e8fe72fc21a1995039395dc5679dafcf0d3d6d042157dcbd73f61c19

See more details on using hashes here.

Supported by

AWS Cloud computing and Security Sponsor Datadog Monitoring Depot Continuous Integration Fastly CDN Google Download Analytics Pingdom Monitoring Sentry Error logging StatusPage Status page