Saltar para o conteúdo
Praxis

Produto · Data Quality Intelligence

Os teus dados mentem-te. O DataVault descobre onde.

Transforma os teus dados no teu ativo mais fiável.

Ligas as tuas fontes em minutos, read-only. O DataVault faz profiling automático, valida regras, encontra duplicados e drift — e propõe a correção com SQL pronto e poupança estimada em euros.

DataVault

erp_demo · scan #12

82/100

Score de qualidade

Completude
92
Unicidade
71
Validade
85
Atualidade
88
Consistência
76

Agente IA · Recomendação

Fundir 214 duplicados fuzzy em clientes (confiança 0,94).

CREATE TABLE customers_clean AS SELECT DISTINCT ON (email) …

Poupança est.: 1 240€/mêsrisco: safe

O problema

Quatro problemas que não vês. Até custarem dinheiro.

Verificar qualidade à mão não escala. Estes quatro padrões repetem-se em quase todas as empresas com dados em mais do que um sítio.

01

Proliferação multi-cloud

Três a cinco plataformas de dados por empresa. Nenhuma visão unificada de qualidade. Verificações manuais, plataforma a plataforma.

02

Duplicados e inconsistências

Métricas infladas, modelos de ML corrompidos, storage desperdiçado. Fuzzy matching à mão é impraticável.

03

Schema drift silencioso

Colunas novas, tipos alterados, picos de nulls partem pipelines sem aviso. PII exposta descoberta tarde demais.

04

Modelos de ML a degradar

Garbage in, garbage out. Encontrar a causa raiz à mão é lento, caro — e chega sempre depois do estrago.

72%

das empresas lutam com dados desconectados ou de má qualidade

>50%

do tempo dos especialistas vai para caçar erros em vez de criar valor

Como funciona

Descobre. Valida. Otimiza.

Não é monitorização passiva. O DataVault encontra os problemas — e propõe a correção.

01

Descobre

Auto-descoberta e profiling automático de todas as tabelas conectadas. Sem configuração coluna a coluna.

  • Métricas por coluna: contagens, nulls, distintos, min/máx/média/desvio
  • Cardinalidade e amostras anonimizáveis
  • Histórico por tabela: série temporal de qualidade, scan a scan
02

Valida

Motor de regras, duplicados e drift a correr em cada scan. Tudo converge num score comparável.

  • 6 tipos de regra: not null, unicidade, padrão, intervalo, atualidade, contagem mínima
  • Duplicados exatos (hash) e fuzzy (ML), em clusters com nível de confiança
  • Drift de schema e de estatísticas face ao scan anterior
  • Score 0–100 por dataset, em 5 dimensões: completude, unicidade, validade, atualidade, consistência
03IA nativa · Claude

Otimiza

O Agente de IA analisa schema, problemas e padrões de uso — e devolve correções concretas, não conselhos vagos.

  • Recomendações com SQL gerado, pronto a rever e aplicar
  • Estimativa de poupança em € e % — storage, compute, horas
  • Análise de risco por alteração: safe ou breaking
  • Relatórios por persona: técnico, custo-benefício, digest executivo

Fluxo

Do zero ao primeiro relatório em três passos.

01

Liga

Acesso read-only com métodos oficiais dos vendors. Credenciais cifradas antes de tocarem no disco. Menos de 15 minutos até ao primeiro scan.

02

Analisa

Scans manuais ou agendados — diário, semanal ou mensal. Profiling, regras, duplicados e drift em cada execução. Alertas por severidade.

03

Otimiza

Sugestões acionáveis com SQL e impacto estimado. Relatórios por persona. Resolves, o score sobe — e o histórico prova.

Para quem

Uma plataforma, três leituras.

Cada stakeholder vê o que lhe interessa. Ninguém perde tempo a traduzir dashboards.

Pipelines eficientes, menos verificação manual

Engenheiro de Dados

  • Score por tabela e issue browser com drill-down
  • Clusters de duplicados: rever, fundir ou ignorar
  • Alertas de drift de schema e estatísticas
  • Relatórios de refatoração com SQL gerado

Meta: −60 a −70% de verificação manual

Custo-benefício e eficiência operacional

Gestor de Dados / Produto

  • Tendência de score, issues abertos vs resolvidos
  • Horas poupadas estimadas
  • Custo de má qualidade por dataset
  • Adoção das recomendações

Meta: priorizar com números, não com opiniões

Risco visível, eficiência financeira

Executivo (CFO/CTO)

  • Impacto financeiro total estimado, em euros
  • Poupança potencial de 15–25% em storage e compute
  • Digest de incidentes críticos: severidade e exposição
  • Ação recomendada para cada incidente

Meta: risco visível, ROI mensurável

Prova real

Ligámos a uma fonte pública. Sem preparar nada.

O arquivo aberto da OpenAQ — medições de qualidade do ar de sensores reais, num bucket S3 público — ligado em modo anónimo, sem conta e sem credenciais. O DataVault descobriu os ficheiros, correu o scan e devolveu o veredicto em meio minuto.

A mesma fonte está na galeria de fontes públicas da app — liga-a na tua conta gratuita e vê o mesmo resultado.

Experimentar com esta fonte

30

ficheiros descobertos como datasets

32 s

duração do scan completo

30

problemas encontrados e explicados

O que apareceu — sujidade genuína de sensores no mundo real:

  • Valores-sentinela (-999) misturados com medições válidas
  • Concentrações negativas de poluentes — fisicamente impossíveis
  • Ficheiros diários com buracos e colunas inconsistentes

O que faz hoje

O ciclo completo: detetar, explicar, corrigir, provar.

01

Anomalias sem regras

Volume, nulos e cardinalidade monitorizados contra o histórico (mediana+MAD) — sem configurar nada. Feedback de falso positivo silencia a métrica.

02

Diagnóstico de causa-raiz

Um clique e o agente cruza perfis, drift, scans falhados e linhagem para explicar a causa provável — com passos de verificação.

03

Correção em SQL e PySpark

Cada sugestão traz diagnóstico safe + correção breaking: ALTER TABLE, CHECK, dedup — em SQL e no equivalente PySpark para Spark/Databricks.

04

Consciência medallion

Bronze, Silver e Gold detetadas pelo nome — a estratégia de correção adapta-se: quarentena na Bronze, limpeza na Silver, contrato na Gold.

05

Linhagem e impacto

Dependências entre tabelas inferidas automaticamente: vês o que um problema afeta a jusante antes de ele chegar ao dashboard do board.

06

Prontidão para IA

Score AI-readiness por dataset — qualidade, estabilidade, privacidade (PII) e atualidade — antes de alimentar RAG ou modelos.

07

Alertas onde trabalhas

Slack, Teams, email e webhooks com severidade mínima por canal + digest semanal executivo.

08

Contratos e gate de CI

Export ODCS (Linux Foundation) por dataset e validação no pipeline: schema divergente ou score abaixo do mínimo chumbam o deploy.

09

FinOps de dados

Custo por dataset e desperdício em €/mês na vista executiva — a qualidade deixa de ser abstrata.

10

Agentes via MCP

Servidor MCP integrado: o Claude (ou outro agente) consulta datasets, issues e custos e pede diagnósticos — com as tuas permissões.

11

Documentos para RAG

Manuais e contratos em GCS/S3 analisados antes de indexar: PDFs sem texto, versões duplicadas do mesmo documento, dados pessoais e ficheiros que ninguém atualiza há anos.

12

Conformidade do AI Act

Dossiê do artigo 10.º alínea a alínea, com a evidência que medimos nos teus dados e as lacunas que faltam declarar. Pronto a anexar à documentação técnica.

13

Custo cruzado com qualidade

Gasto de compute lido do BigQuery, Databricks ou Snowflake ao lado do score: quanto do que pagas corre sobre dados que a medição diz estarem errados.

14

Correção com aprovação

Cada correção passa por proposta, aprovação e aplicação do teu lado — e o scan seguinte confirma se resolveu. Nunca escrevemos nas tuas fontes.

Conectores

Liga-se ao que já tens.

Warehouses, bases de dados operacionais, ficheiros e aplicações de negócio. Sempre read-only, sempre por métodos oficiais.

PostgreSQL
MySQL
Snowflake
BigQuery
Databricks
Google Cloud Storage
Amazon S3
CSV / Ficheiros
Salesforce
Dynamics 365
Microsoft Fabric
SAPRoadmap

Porquê diferente

Deteta — e propõe a correção.

As ferramentas enterprise dizem-te que há um problema, meses depois do kickoff. O open-source é grátis até contares as horas de engenharia. O DataVault faz as duas coisas que importam: encontra e resolve.

DimensãoEnterprise (Collibra, Informatica)Open-source DIY (Great Expectations, Soda)DataVault
Time-to-value16–24+ semanas de implementaçãoSemanas de setup, manutenção contínuaPrimeiro scan em menos de 15 minutos
CorreçãoDeteta e reporta. A correção fica contigoTestes falham. Alguém investiga e corrige à mãoPropõe a correção: SQL gerado, poupança em €, risco analisado
Custo realLicenças enterprise + consultoria de implementaçãoCusto de engenharia oculto: escrever e manter testesDesde 500€/mês, sem projeto de implementação
Visão multi-fontePor módulo, pago à parteUm repositório de testes por fonteWarehouses, BDs operacionais e SaaS numa só visão

Segurança

Os teus dados ficam onde estão.

Acesso read-only

O DataVault nunca escreve, move nem altera dados nas tuas fontes. Lê, analisa, reporta.

Métodos oficiais dos vendors

Drivers e APIs oficiais de cada plataforma. Sem scraping, sem atalhos.

Credenciais cifradas

Cifradas com Fernet antes de serem persistidas. Nunca aparecem em logs.

Amostras controladas

Os dados nunca saem da tua conta. As amostras usadas pela IA são limitadas e anonimizáveis.

Preços

Preços simples. Sem projeto de implementação.

Gratuito

0€

  • Uma fonte de dados
  • 25 datasets · 30 scans/mês
  • Motor de qualidade completo + sugestões IA de amostra
  • Sem cartão
Criar conta gratuita
Mais procurado

Team

490€/mês

  • 5 fontes · 500 datasets
  • Utilizadores ilimitados
  • Sugestões IA incluídas (teto do plano)
  • Contratos ODCS + gate de CI
  • Tokens de API e webhooks
Agendar demonstração

Business

1.190€/mês

  • 15 fontes · 2.000 datasets
  • Conformidade AI Act (art. 10.º)
  • Custo × qualidade com telemetria nativa
  • Análise de documentos para RAG
  • Teto de IA 4× e 2 anos de histórico
Agendar demonstração

Enterprise

Sob consulta

  • Volumes e fontes à medida
  • Deployment privado
  • DPA reforçado e SLA dedicado
  • Onboarding assistido
Falar connosco

Preços de lançamento, faturação anual (mensal +20%). A zona entre o open-source DIY e o enterprise (30k€+/ano) é onde vivemos — de propósito.

Vê o DataVault a trabalhar nos teus dados.

Demonstração de 30 minutos, com os teus dados ou com o nosso ERP de demonstração. Sais a saber o que ele encontraria na tua conta.

DataVault — Data Quality Intelligence · Praxis