Preservação não é só salvar um arquivo
A maioria das pessoas confunde preservar com fazer backup. São coisas diferentes. Backup é copiar dados para outro lugar. Preservação é garantir que esses dados continuem legíveis, acessíveis e utilizáveis daqui a cinco, dez, vinte anos. A diferença parece pequena até você tentar abrir um arquivo de 2007 num sistema atual e não conseguir. O conceito básico é simples, mas a execução raramente é. Preservação envolve uma cadeia inteira de decisões técnicas: formato do arquivo, metadados, migração, checksums, controle de integridade, políticas de retenção e infraestrutura de armazenamento. Se qualquer elo dessa cadeia falhar, você perdeu informação. Não a cópia. A informação em si.
Na prática, eu trabalhei com projetos de preservação digital para instituições que tinham terabytes de materiais importantes e nenhuma estratégia além de "deixa aqui no NAS". O problema não era o NAS. Era que os arquivos eram mayoritariamente em formatos proprietários obsoletos, sem metadados estruturados, e ninguém sabia qual versão de software havia gerado cada documento. Quando o suporte do software expirou, parte daquele acervo virou cinza digital.
O que é preservação e por que a confusão é comum
O que é preservação? É o conjunto de atividades que visam manter a acessibilidade e a autenticidade da informação ao longo do tempo, independentemente de mudanças tecnológicas. Isso inclui a Digital Preservation Coalition e o modelo OAIS, que define camadas de referência para arquitetura de repositórios confiáveis. Não é ferramenta. É processo. Muita gente acha que basta ter redundância. Espelhar discos, fazer RAID, subir pro cloud. Isso protege contra perda física. Não protege contra obsolescência de formato, corrupção silenciosa ou perda de contexto. Um arquivo corrompido em triplo backup continua corrompido em triplo backup.
Os pilares que realmente funcionam
Preservação eficaz se apoia em alguns pilares concretos. Vou listar sem rodeio, porque a teoria cheia de diagramas não ajuda quem tá no dia a dia. Formatos abertos e amplamente suportados. PDF/A para documentos, WAV para áudio, TIFF para imagens, CSV ou JSON para dados estruturados. Formatos fechados são uma loteria. Eu vi uma ONG perder anos de documentação porque tudo estava em formato de planilha de um software que deixou de ser desenvolvido em 2014. O workaround foi escrever um script de conversão manual lote a lote, o que levou três semanas e mesmo assim três arquivos não abriram direito por incompatibilidade de encoding.
Metadados robustos. Não adianta ter o arquivo bom se ninguém sabe o que ele é, quando foi criado, por quem, qual versão, qual foi a fonte original. Metadados como PREMIS (preservation metadata) são o padrão do setor. Eles registram eventos de preservação: quando o arquivo foi migrado, quando um checksum foi verificado, qual software foi usado. Sem isso, você não tem rastreabilidade. Checksums e verificação periódica. Cada arquivo deve ter um hash criptográfico calculado no momento da ingestão. MD5 já não é mais confiável contra colisão intencional, então use SHA-256. A verificação periódica — pelo menos trimestral, idealmente semestral — detecta bit rot antes que vire problema. Bit rot é aquele fenômeno chato onde bits mudam sozinhos no armazenamento sem aviso. Você só descobre quando tenta recuperar e o arquivo não abre.
Migração programada. Formatos evoluem. O que é padrão hoje pode não ser em dez anos. Ter um plano de migração definido com antecedência evita o pânico do ano em que o formato deixa de ser suportado. Migração não é só converter para um formato novo. É garantir que a conversão preserve a fidelidade e documente o processo nos metadados. Armazenamento hierárquico. Dados quentes, dados frios. Você não precisa manter tudo em SSD caro. Camadas de armazenamento com políticas claras de acesso reduzem custo sem sacrificar segurança. A regra prática: arquivos ativos em camada rápida, arquivos archivados em camada fria com cópias verificadas regularmente.
👉 Clique no botão abaixo para saber mais sobre o assunto!
O erro que ninguém conta
O maior erro que eu vejo em projetos de preservação é tratar o assunto como problema de TI. Não é. É problema de governança. Tecnologia se resolve com ferramenta. Preservação se resolve com decisão humana constante. Eu entrei num projeto onde a equipe técnica tinha feito tudo certo: repositório OAIS, metadados PREMIS, migração automática para PDF/A, checksums SHA-256 rodando semanalmente. O problema era que o responsável pelo projeto saiu, o novo responsável não sabia que existedaquilo, e em oito meses nenhuma verificação de integridade foi registrada. O sistema estava operacional mas ninguém validava se funcionava. Preservação sem responsabilidade humana é automação ociosa.
Outro problema prático: checksums. Muita gente calcula o hash na ingestão e nunca mais verifica. Isso é pior do que não calcular nada, porque dá falsa sensação de segurança. Se você vai verificar, tem que ter um calendário e um responsável. Senão, o checksum vira decoração.
Ferramentas que eu uso e recomendo
Preservica. É pago, mas é o padrão da indústria para instituições que levam o assunto a sério. Custa caro, então nem sempre é viável para menores. Archivematica. Open source, baseado em padrões OAIS, muito flexível. A curva de aprendizado é íngreme, mas uma vez configurado, ele automatiza ingestão, verificação, migração e emissão de metadados. Eu configurei um repositório pequeno com ele e reduzi o tempo de processamento de uma entrada que levava duas horas manualmente para cerca de doze minutos automatizados.
Droid plus Fixity. Combinação mais leve para quem precisa começar sem infraestrutura pesada. Droid identifica formatos. Fixity monitora integridade. Juntos resolvem 80% do que projetos pequenos precisam. Acessar o Archivematica: o download oficial fica em archivematica.org/en/download/. A documentação é sólida mas densa. Leitura obrigatória antes de tentar implantar.
Quando preservação não funciona
Vou ser direto: preservação não resolve tudo. Se o dado original foi mal gerado, com informações embutidas em formato proprietário e sem documentação, nenhuma ferramenta vai recuperar o que não existe. Se o orçamento é zero e não há ninguém responsável, o melhor que você tem é o mínimo viável: cópias em formatos abertos, checksums manuais e um registro simples em planilha com datas de verificação. Também não adianta preservar material que não vale a pena. Isso é impopular de dizer, mas é verdade. Você precisa decidir o que entra no repositório de preservação e o que fica de fora. Tentar preservar tudo é o caminho certo para não preservar nada.
A parte mais difícil de preservation digital não é técnica. É política. Quem decide o quê preservar, quem paga pela verificação anual, quem assume a responsabilidade quando algo dá errado. Resolver isso antes de configurar qualquer ferramenta é o que separa projeto que dura dez anos de projeto que vira bagunça em dois.