Pular para o conteúdo principal
Voltar para o blog
Arquitetura e dados
4 min de leitura

Não existe IA sem prontidão de dados

Problema de dado é pouco visível no início e composto no fim. Corrigir na origem parece desperdício e é a única coisa que evita o retrabalho grande.

Quando um projeto de IA não entrega o que prometeu, a conversa costuma girar em torno do modelo. Na maioria dos casos que eu vejo, o modelo era adequado. O que faltava era dado em condição de ser usado, e isso quase nunca aparece na proposta inicial.

O problema começa antes do primeiro experimento

Prontidão de dados não é sinônimo de volume. Empresa com dez anos de histórico pode estar menos pronta do que uma com dois, se nesses dez anos o significado dos campos mudou três vezes sem registro.

Um estudo de caso da Microsoft sobre engenharia de software para aprendizado de máquina descreve a gestão de dados como uma etapa que atravessa todo o ciclo, não como um passo inicial que se conclui. Coleta, limpeza, rotulagem e versionamento voltam a cada iteração, e times que tratam isso como tarefa de preparação subestimam o esforço de forma sistemática.

Cascatas de dados

A pesquisa sobre cascatas de dados, publicada pelo Google, descreve um padrão desconfortável: problemas de qualidade de dados são pouco visíveis no início e produzem efeitos compostos e negativos que só aparecem lá na frente, muitas vezes já em produção.

O que torna a cascata perigosa é a assimetria. O custo de corrigir na origem é baixo e o benefício é invisível, então ninguém prioriza. O custo de corrigir depois do modelo em produção é alto e o problema chega disfarçado de "o modelo está errando".

A implicação prática é direta: trabalho de dado feito cedo parece desperdício e é a única coisa que evita o retrabalho grande.

Quatro perguntas que revelam a prontidão real

Antes de qualquer projeto de IA, quatro perguntas separam a expectativa da realidade.

O dado existe de forma acessível? Existir num sistema legado sem API, ou dentro de PDFs digitalizados, é bem diferente de existir numa tabela consultável.

O significado é estável? Se o campo "status" teve três conjuntos de valores em cinco anos, o histórico só serve com tradução explícita.

A qualidade é conhecida? Não perfeita, conhecida. Saber que 12% dos registros têm o endereço vazio é utilizável. Não saber não é.

O uso é permitido? Base de origem, consentimento e finalidade precisam suportar o uso pretendido, sobretudo quando envolve dado pessoal.

Se qualquer resposta for "não sei", essa investigação é o primeiro entregável do projeto, não uma nota de rodapé.

Validação de dado é teste, não relatório

O trabalho sobre validação de dados para aprendizado de máquina, apresentado por pesquisadores do Google, defende um ponto que vale para qualquer aplicação de IA: erro de dado deve ser detectado automaticamente, na entrada do pipeline, contra um esquema esperado.

Na prática isso significa declarar expectativas e falhar quando elas quebram: tipo, intervalo de valores, obrigatoriedade, cardinalidade, distribuição aproximada. É o equivalente a um teste unitário, só que para o insumo em vez do código.

O ganho não é acadêmico. Sem validação, um sistema de origem que muda silenciosamente de formato degrada o resultado por semanas antes de alguém notar. Com validação, o pipeline para no primeiro lote estranho e alguém é avisado no mesmo dia.

Governança sem virar burocracia

O corpo de conhecimento de gestão de dados da DAMA organiza o assunto em domínios como qualidade, arquitetura, metadados e governança. É extenso, e ler o guia inteiro antes de começar é a maneira mais confiável de nunca começar.

O recorte mínimo que funciona para um projeto de IA são três coisas:

  • Dono definido por conjunto de dados, uma pessoa com nome, não uma área.
  • Dicionário vivo dizendo o que cada campo significa e quando o significado mudou.
  • Linhagem registrada, ou seja, de onde veio, que transformações sofreu e para onde foi.

Com esses três, a maior parte das perguntas de auditoria e de investigação já tem resposta.

Base de conhecimento tem exigência própria

Quando o projeto é de recuperação aumentada, a prontidão muda de natureza. O que importa passa a ser se o documento está atualizado, se há versões conflitantes circulando, se o texto sobrevive à extração e se a permissão do documento pode ser respeitada na busca.

Duas versões da mesma política, uma revogada e outra vigente, indexadas juntas, produzem um sistema que responde com confiança usando a regra errada. Nenhum ajuste de modelo corrige isso.

O que isso significa para o seu time

Antes de aprovar o próximo projeto de IA, faça uma avaliação de prontidão de duas semanas sobre os conjuntos que ele vai usar. Acesso, estabilidade de significado, qualidade medida e permissão de uso, com achados escritos.

Se a avaliação apontar problema sério, esse é o projeto real, e ele entrega valor mesmo sem IA: relatório confiável, integração possível, auditoria mais barata.

E coloque validação automática na entrada do pipeline desde o primeiro dia. É a peça mais barata de construir no começo e a mais cara de adicionar depois que o sistema já está em produção.

Referências

As fontes usadas neste texto, para você conferir e ir mais fundo.

  1. 1"Everyone wants to do the model work, not the data work": Data Cascades in High-Stakes AISambasivan et al. (Google Research, CHI), 2021
  2. 2Data Validation for Machine LearningBreck et al. (SysML), 2019
  3. 3Software Engineering for Machine Learning: A Case StudyAmershi et al. (Microsoft Research, ICSE), 2019
  4. 4DAMA-DMBOK: Data Management Body of KnowledgeDAMA International