Produto · Data Quality Intelligence
Os teus dados mentem-te. O DataVault descobre onde.
Transforma os teus dados no teu ativo mais fiável.
Ligas as tuas fontes em minutos, read-only. O DataVault faz profiling automático, valida regras, encontra duplicados e drift — e propõe a correção com SQL pronto e poupança estimada em euros.
DataVault
erp_demo · scan #1282/100
Score de qualidade
Agente IA · Recomendação
Fundir 214 duplicados fuzzy em clientes (confiança 0,94).
CREATE TABLE customers_clean AS SELECT DISTINCT ON (email) …
O problema
Quatro problemas que não vês. Até custarem dinheiro.
Verificar qualidade à mão não escala. Estes quatro padrões repetem-se em quase todas as empresas com dados em mais do que um sítio.
Proliferação multi-cloud
Três a cinco plataformas de dados por empresa. Nenhuma visão unificada de qualidade. Verificações manuais, plataforma a plataforma.
Duplicados e inconsistências
Métricas infladas, modelos de ML corrompidos, storage desperdiçado. Fuzzy matching à mão é impraticável.
Schema drift silencioso
Colunas novas, tipos alterados, picos de nulls partem pipelines sem aviso. PII exposta descoberta tarde demais.
Modelos de ML a degradar
Garbage in, garbage out. Encontrar a causa raiz à mão é lento, caro — e chega sempre depois do estrago.
72%
das empresas lutam com dados desconectados ou de má qualidade
>50%
do tempo dos especialistas vai para caçar erros em vez de criar valor
Como funciona
Descobre. Valida. Otimiza.
Não é monitorização passiva. O DataVault encontra os problemas — e propõe a correção.
Descobre
Auto-descoberta e profiling automático de todas as tabelas conectadas. Sem configuração coluna a coluna.
- Métricas por coluna: contagens, nulls, distintos, min/máx/média/desvio
- Cardinalidade e amostras anonimizáveis
- Histórico por tabela: série temporal de qualidade, scan a scan
Valida
Motor de regras, duplicados e drift a correr em cada scan. Tudo converge num score comparável.
- 6 tipos de regra: not null, unicidade, padrão, intervalo, atualidade, contagem mínima
- Duplicados exatos (hash) e fuzzy (ML), em clusters com nível de confiança
- Drift de schema e de estatísticas face ao scan anterior
- Score 0–100 por dataset, em 5 dimensões: completude, unicidade, validade, atualidade, consistência
Otimiza
O Agente de IA analisa schema, problemas e padrões de uso — e devolve correções concretas, não conselhos vagos.
- Recomendações com SQL gerado, pronto a rever e aplicar
- Estimativa de poupança em € e % — storage, compute, horas
- Análise de risco por alteração: safe ou breaking
- Relatórios por persona: técnico, custo-benefício, digest executivo
Fluxo
Do zero ao primeiro relatório em três passos.
01
Liga
Acesso read-only com métodos oficiais dos vendors. Credenciais cifradas antes de tocarem no disco. Menos de 15 minutos até ao primeiro scan.
02
Analisa
Scans manuais ou agendados — diário, semanal ou mensal. Profiling, regras, duplicados e drift em cada execução. Alertas por severidade.
03
Otimiza
Sugestões acionáveis com SQL e impacto estimado. Relatórios por persona. Resolves, o score sobe — e o histórico prova.
Para quem
Uma plataforma, três leituras.
Cada stakeholder vê o que lhe interessa. Ninguém perde tempo a traduzir dashboards.
Pipelines eficientes, menos verificação manual
Engenheiro de Dados
- Score por tabela e issue browser com drill-down
- Clusters de duplicados: rever, fundir ou ignorar
- Alertas de drift de schema e estatísticas
- Relatórios de refatoração com SQL gerado
Meta: −60 a −70% de verificação manual
Custo-benefício e eficiência operacional
Gestor de Dados / Produto
- Tendência de score, issues abertos vs resolvidos
- Horas poupadas estimadas
- Custo de má qualidade por dataset
- Adoção das recomendações
Meta: priorizar com números, não com opiniões
Risco visível, eficiência financeira
Executivo (CFO/CTO)
- Impacto financeiro total estimado, em euros
- Poupança potencial de 15–25% em storage e compute
- Digest de incidentes críticos: severidade e exposição
- Ação recomendada para cada incidente
Meta: risco visível, ROI mensurável
Prova real
Ligámos a uma fonte pública. Sem preparar nada.
O arquivo aberto da OpenAQ — medições de qualidade do ar de sensores reais, num bucket S3 público — ligado em modo anónimo, sem conta e sem credenciais. O DataVault descobriu os ficheiros, correu o scan e devolveu o veredicto em meio minuto.
A mesma fonte está na galeria de fontes públicas da app — liga-a na tua conta gratuita e vê o mesmo resultado.
Experimentar com esta fonte30
ficheiros descobertos como datasets
32 s
duração do scan completo
30
problemas encontrados e explicados
O que apareceu — sujidade genuína de sensores no mundo real:
- —Valores-sentinela (-999) misturados com medições válidas
- —Concentrações negativas de poluentes — fisicamente impossíveis
- —Ficheiros diários com buracos e colunas inconsistentes
O que faz hoje
O ciclo completo: detetar, explicar, corrigir, provar.
Anomalias sem regras
Volume, nulos e cardinalidade monitorizados contra o histórico (mediana+MAD) — sem configurar nada. Feedback de falso positivo silencia a métrica.
Diagnóstico de causa-raiz
Um clique e o agente cruza perfis, drift, scans falhados e linhagem para explicar a causa provável — com passos de verificação.
Correção em SQL e PySpark
Cada sugestão traz diagnóstico safe + correção breaking: ALTER TABLE, CHECK, dedup — em SQL e no equivalente PySpark para Spark/Databricks.
Consciência medallion
Bronze, Silver e Gold detetadas pelo nome — a estratégia de correção adapta-se: quarentena na Bronze, limpeza na Silver, contrato na Gold.
Linhagem e impacto
Dependências entre tabelas inferidas automaticamente: vês o que um problema afeta a jusante antes de ele chegar ao dashboard do board.
Prontidão para IA
Score AI-readiness por dataset — qualidade, estabilidade, privacidade (PII) e atualidade — antes de alimentar RAG ou modelos.
Alertas onde trabalhas
Slack, Teams, email e webhooks com severidade mínima por canal + digest semanal executivo.
Contratos e gate de CI
Export ODCS (Linux Foundation) por dataset e validação no pipeline: schema divergente ou score abaixo do mínimo chumbam o deploy.
FinOps de dados
Custo por dataset e desperdício em €/mês na vista executiva — a qualidade deixa de ser abstrata.
Agentes via MCP
Servidor MCP integrado: o Claude (ou outro agente) consulta datasets, issues e custos e pede diagnósticos — com as tuas permissões.
Documentos para RAG
Manuais e contratos em GCS/S3 analisados antes de indexar: PDFs sem texto, versões duplicadas do mesmo documento, dados pessoais e ficheiros que ninguém atualiza há anos.
Conformidade do AI Act
Dossiê do artigo 10.º alínea a alínea, com a evidência que medimos nos teus dados e as lacunas que faltam declarar. Pronto a anexar à documentação técnica.
Custo cruzado com qualidade
Gasto de compute lido do BigQuery, Databricks ou Snowflake ao lado do score: quanto do que pagas corre sobre dados que a medição diz estarem errados.
Correção com aprovação
Cada correção passa por proposta, aprovação e aplicação do teu lado — e o scan seguinte confirma se resolveu. Nunca escrevemos nas tuas fontes.
Conectores
Liga-se ao que já tens.
Warehouses, bases de dados operacionais, ficheiros e aplicações de negócio. Sempre read-only, sempre por métodos oficiais.
Porquê diferente
Deteta — e propõe a correção.
As ferramentas enterprise dizem-te que há um problema, meses depois do kickoff. O open-source é grátis até contares as horas de engenharia. O DataVault faz as duas coisas que importam: encontra e resolve.
| Dimensão | Enterprise (Collibra, Informatica) | Open-source DIY (Great Expectations, Soda) | DataVault |
|---|---|---|---|
| Time-to-value | 16–24+ semanas de implementação | Semanas de setup, manutenção contínua | Primeiro scan em menos de 15 minutos |
| Correção | Deteta e reporta. A correção fica contigo | Testes falham. Alguém investiga e corrige à mão | Propõe a correção: SQL gerado, poupança em €, risco analisado |
| Custo real | Licenças enterprise + consultoria de implementação | Custo de engenharia oculto: escrever e manter testes | Desde 500€/mês, sem projeto de implementação |
| Visão multi-fonte | Por módulo, pago à parte | Um repositório de testes por fonte | Warehouses, BDs operacionais e SaaS numa só visão |
Segurança
Os teus dados ficam onde estão.
Acesso read-only
O DataVault nunca escreve, move nem altera dados nas tuas fontes. Lê, analisa, reporta.
Métodos oficiais dos vendors
Drivers e APIs oficiais de cada plataforma. Sem scraping, sem atalhos.
Credenciais cifradas
Cifradas com Fernet antes de serem persistidas. Nunca aparecem em logs.
Amostras controladas
Os dados nunca saem da tua conta. As amostras usadas pela IA são limitadas e anonimizáveis.
Preços
Preços simples. Sem projeto de implementação.
Gratuito
0€
- Uma fonte de dados
- 25 datasets · 30 scans/mês
- Motor de qualidade completo + sugestões IA de amostra
- Sem cartão
Team
490€/mês
- 5 fontes · 500 datasets
- Utilizadores ilimitados
- Sugestões IA incluídas (teto do plano)
- Contratos ODCS + gate de CI
- Tokens de API e webhooks
Business
1.190€/mês
- 15 fontes · 2.000 datasets
- Conformidade AI Act (art. 10.º)
- Custo × qualidade com telemetria nativa
- Análise de documentos para RAG
- Teto de IA 4× e 2 anos de histórico
Enterprise
Sob consulta
- Volumes e fontes à medida
- Deployment privado
- DPA reforçado e SLA dedicado
- Onboarding assistido
Preços de lançamento, faturação anual (mensal +20%). A zona entre o open-source DIY e o enterprise (30k€+/ano) é onde vivemos — de propósito.
Vê o DataVault a trabalhar nos teus dados.
Demonstração de 30 minutos, com os teus dados ou com o nosso ERP de demonstração. Sais a saber o que ele encontraria na tua conta.