en
· 3 min de leitura

Ciência aberta precisa de infraestrutura chata

Ciência aberta não falha nos ideais. Falha em armazenamento, identificadores, uptime e na pessoa não paga que mantém o servidor vivo.

scienceinfra

Todo mundo na ciência concorda com ciência aberta em princípio. Compartilhe os dados, compartilhe o código, deixe os outros conferirem e construírem em cima. Aí você olha onde os dados compartilhados de fato moram: um site de laboratório num servidor de universidade que vai ser reorganizado ano que vem, um bucket na nuvem num financiamento que acaba em dezoito meses, um link num artigo que já devolve 404. O ideal está ótimo. O que falta é a infraestrutura, e ela falta porque é chata.

A lista chata

Identificadores persistentes que ainda resolvem em dez anos. Armazenamento com um modelo de financiamento que sobreviva ao edital. Backups que alguém de fato já restaurou. Formatos que um programa consegue ler sem licença de fornecedor. Uma API, para que as pessoas busquem dados sem clicar num portal. Controle de acesso para os dados que não podem ser totalmente abertos. Monitoramento, para que alguém saiba que a coisa caiu antes de um revisor descobrir. Uma pessoa, paga, cujo trabalho é esse.

Nada disso rende artigo. Tudo isso é necessário para que o artigo continue verificável.

O que eu já vi quebrar

Um dataset compartilhado que vivia como zip num drive pessoal. Quando o pós-doc saiu, o drive foi junto. Um repositório de código que não fixava nenhuma versão, e três anos depois nada instalava. Um banco público em que o esquema mudou sem versão e todo script na ponta passou a produzir números diferentes em silêncio. Um esquema de identificadores que era o número da linha da planilha, ou seja, cada reordenação redistribuía identidades. Já vi empresas perderem dinheiro com cada um desses padrões e corrigirem em um trimestre, porque dinheiro torna infraestrutura urgente. A ciência não tem uma força equivalente, então as mesmas falhas persistem por uma década.

Chato é qualidade

Em engenharia de produção, o maior elogio para uma infraestrutura é que ninguém pensa nela. Postgres é chato. Armazenamento de objetos é chato. CSV puro com esquema documentado é chato. Tudo isso ainda vai funcionar daqui a quinze anos, e ninguém vai precisar ser especialista para usar. A tentação em software de pesquisa é construir algo esperto, uma plataforma própria com formato próprio e um portal bonito. A coisa esperta precisa de um mantenedor, e mantenedores vão embora.

A regra que aplico é a mesma que uso com clientes: escolha a ferramenta mais chata que atende ao requisito, e gaste a criatividade na ciência.

A economia que ninguém financia

Infraestrutura é centro de custo sem publicação atrelada. Editais pagam pela descoberta, não pelo servidor que mantém a descoberta do ano passado acessível. É um problema estrutural e eu não tenho solução de política pública para ele. O que tenho é uma solução de engenharia: tornar a infraestrutura tão barata e tão padrão que o custo arredonde para zero. Um bucket bem organizado com checksums e um README custa quase nada. Um portal sob medida, não. O jeito de tornar a ciência aberta sustentável é baixar o custo operacional até ninguém precisar defendê-la.

O que um engenheiro pode oferecer

Passo meus dias fazendo sistemas que ficam no ar e continuam honestos para empresas. As mesmas habilidades se aplicam aqui sem modificação. Dados versionados, camadas brutas imutáveis, ambientes reprodutíveis, monitoramento de disponibilidade, interfaces documentadas. Não é trabalho glamouroso e é o trabalho em que sou melhor. Se a ciência aberta vai ser mais do que um slogan, alguém precisa assentar os canos, e prefiro que essa pessoa entenda o que acontece quando canos estouram.

Todo avanço precisa de validação, e validação precisa que os dados ainda estejam lá quando alguém for procurar. Infraestrutura chata é como eles continuam lá.