Não existe IA sem prontidão de dados
Problema de dado é pouco visível no início e composto no fim. Corrigir na origem parece desperdício e é a única coisa que evita o retrabalho grande.
Quando um projeto de IA não entrega o que prometeu, a conversa costuma girar em torno do modelo. Na maioria dos casos que eu vejo, o modelo era adequado. O que faltava era dado em condição de ser usado, e isso quase nunca aparece na proposta inicial.
O problema começa antes do primeiro experimento
Prontidão de dados não é sinônimo de volume. Empresa com dez anos de histórico pode estar menos pronta do que uma com dois, se nesses dez anos o significado dos campos mudou três vezes sem registro.
Um estudo de caso da Microsoft sobre engenharia de software para aprendizado de máquina descreve a gestão de dados como uma etapa que atravessa todo o ciclo, não como um passo inicial que se conclui. Coleta, limpeza, rotulagem e versionamento voltam a cada iteração, e times que tratam isso como tarefa de preparação subestimam o esforço de forma sistemática.
Cascatas de dados
A pesquisa sobre cascatas de dados, publicada pelo Google, descreve um padrão desconfortável: problemas de qualidade de dados são pouco visíveis no início e produzem efeitos compostos e negativos que só aparecem lá na frente, muitas vezes já em produção.
O que torna a cascata perigosa é a assimetria. O custo de corrigir na origem é baixo e o benefício é invisível, então ninguém prioriza. O custo de corrigir depois do modelo em produção é alto e o problema chega disfarçado de "o modelo está errando".
A implicação prática é direta: trabalho de dado feito cedo parece desperdício e é a única coisa que evita o retrabalho grande.
Quatro perguntas que revelam a prontidão real
Antes de qualquer projeto de IA, quatro perguntas separam a expectativa da realidade.
O dado existe de forma acessível? Existir num sistema legado sem API, ou dentro de PDFs digitalizados, é bem diferente de existir numa tabela consultável.
O significado é estável? Se o campo "status" teve três conjuntos de valores em cinco anos, o histórico só serve com tradução explícita.
A qualidade é conhecida? Não perfeita, conhecida. Saber que 12% dos registros têm o endereço vazio é utilizável. Não saber não é.
O uso é permitido? Base de origem, consentimento e finalidade precisam suportar o uso pretendido, sobretudo quando envolve dado pessoal.
Se qualquer resposta for "não sei", essa investigação é o primeiro entregável do projeto, não uma nota de rodapé.
Validação de dado é teste, não relatório
O trabalho sobre validação de dados para aprendizado de máquina, apresentado por pesquisadores do Google, defende um ponto que vale para qualquer aplicação de IA: erro de dado deve ser detectado automaticamente, na entrada do pipeline, contra um esquema esperado.
Na prática isso significa declarar expectativas e falhar quando elas quebram: tipo, intervalo de valores, obrigatoriedade, cardinalidade, distribuição aproximada. É o equivalente a um teste unitário, só que para o insumo em vez do código.
O ganho não é acadêmico. Sem validação, um sistema de origem que muda silenciosamente de formato degrada o resultado por semanas antes de alguém notar. Com validação, o pipeline para no primeiro lote estranho e alguém é avisado no mesmo dia.
Governança sem virar burocracia
O corpo de conhecimento de gestão de dados da DAMA organiza o assunto em domínios como qualidade, arquitetura, metadados e governança. É extenso, e ler o guia inteiro antes de começar é a maneira mais confiável de nunca começar.
O recorte mínimo que funciona para um projeto de IA são três coisas:
- Dono definido por conjunto de dados, uma pessoa com nome, não uma área.
- Dicionário vivo dizendo o que cada campo significa e quando o significado mudou.
- Linhagem registrada, ou seja, de onde veio, que transformações sofreu e para onde foi.
Com esses três, a maior parte das perguntas de auditoria e de investigação já tem resposta.
Base de conhecimento tem exigência própria
Quando o projeto é de recuperação aumentada, a prontidão muda de natureza. O que importa passa a ser se o documento está atualizado, se há versões conflitantes circulando, se o texto sobrevive à extração e se a permissão do documento pode ser respeitada na busca.
Duas versões da mesma política, uma revogada e outra vigente, indexadas juntas, produzem um sistema que responde com confiança usando a regra errada. Nenhum ajuste de modelo corrige isso.
O que isso significa para o seu time
Antes de aprovar o próximo projeto de IA, faça uma avaliação de prontidão de duas semanas sobre os conjuntos que ele vai usar. Acesso, estabilidade de significado, qualidade medida e permissão de uso, com achados escritos.
Se a avaliação apontar problema sério, esse é o projeto real, e ele entrega valor mesmo sem IA: relatório confiável, integração possível, auditoria mais barata.
E coloque validação automática na entrada do pipeline desde o primeiro dia. É a peça mais barata de construir no começo e a mais cara de adicionar depois que o sistema já está em produção.
Referências
As fontes usadas neste texto, para você conferir e ir mais fundo.
- 1"Everyone wants to do the model work, not the data work": Data Cascades in High-Stakes AISambasivan et al. (Google Research, CHI), 2021
- 2Data Validation for Machine LearningBreck et al. (SysML), 2019
- 3Software Engineering for Machine Learning: A Case StudyAmershi et al. (Microsoft Research, ICSE), 2019
- 4DAMA-DMBOK: Data Management Body of KnowledgeDAMA International
Leia também
Do protótipo à produção: um pipeline de LLMOps
Se o prompt vive fora do controle de versão, você não consegue reproduzir um incidente. E custo por interação é requisito, não relatório de fim de mês.
Ler o artigoObservabilidade de features de IA: latência, custo e qualidade
Não existe contador de "resposta boa". A qualidade se observa por aproximação, e um painel sem esse eixo dá uma sensação de controle que não corresponde ao sistema.
Ler o artigoIA no desenvolvimento: o que os dados realmente mostram
Um estudo mediu 55,8% mais rápido. Outro mediu 19% mais lento. Os dois estão certos, e a diferença entre eles é a parte que importa.
Ler o artigo