en
· 3 min de leitura

Dados cardiovasculares são um problema de sistemas

O coração produz mais tipos de dado do que quase qualquer órgão. Fazê-los concordar não é problema médico. É problema de integração.

sciencedata

Um eletrocardiograma é uma onda amostrada centenas de vezes por segundo. Um ecocardiograma é um vídeo com medidas que um humano digitou ao lado. Um perfil lipídico é um punhado de números de um laboratório, numa data que pode ou não bater com a consulta. Uma pressão arterial é um par de números, medido por uma enfermeira ou por um aparelho de pulso, em condições que ninguém registrou. Uma evolução clínica é texto livre. Um wearable produz frequência cardíaca a cada poucos segundos, por meses. Tudo isso é dado cardiovascular. Nenhum deles concorda sobre o que é uma linha.

O tempo é a primeira fronteira

Cada uma dessas fontes tem o próprio relógio. O ECG tem milissegundos. O laboratório tem data de coleta e data de resultado, que são diferentes. A evolução tem a hora em que o médico escreveu, não a hora em que a coisa aconteceu. O wearable tem o fuso do celular, que mudou quando o paciente viajou. Antes de fazer uma única pergunta científica que cruze duas fontes, você precisa decidir o que 'ao mesmo tempo' significa, e essa decisão é de engenharia com consequências científicas. Alinhe pelo relógio errado e você vai encontrar correlações que são artefatos do alinhamento.

Já auditei sistemas suficientes com bugs de fuso horário para saber que isso não é hipótese. É o jeito mais comum de dois datasets corretos se combinarem num errado.

A identidade é a segunda

Quem é esse paciente? O hospital tem um identificador, o laboratório tem outro, o aparelho tem um número de série amarrado a uma conta, o estudo tem um código anonimizado. Ligar tudo isso é necessário para a ciência e restrito por ética e por lei, o que significa que a própria ligação é um sistema: com chaves, auditado, com controle de acesso, reversível só por quem tem permissão de reverter. Erre a identidade numa direção e você funde duas pessoas. Erre na outra e divide uma pessoa em duas, o que corta a amostra pela metade e dobra o ruído sem ninguém perceber.

Ausência não é vazio

Um valor faltante num dataset cardiovascular raramente é aleatório. A troponina não foi dosada porque ninguém suspeitou de um evento. O eco não foi feito porque o paciente estava instável demais para ser movido. O wearable parou de gravar porque estava carregando, ou porque a pessoa estava internada. Cada lacuna carrega informação sobre o processo que a produziu, e qualquer análise que trate lacunas como neutras está medindo o processo, não o coração. O trabalho do engenheiro aqui não é imputar. É preservar o motivo da lacuna como dado, para que o cientista decida o que ela significa.

Unidades, versões e a reformatação silenciosa

Uma atualização de firmware muda como o aparelho filtra ruído. Um laboratório troca o ensaio e a faixa de referência se desloca. Um hospital migra o sistema de prontuário e um campo que era mmHg agora é uma string com a unidade dentro. Nada disso é anunciado ao pesquisador lá na ponta. Em software, chamaríamos isso de mudança incompatível numa API e exigiríamos uma nova versão. Em dados clínicos, acontece em silêncio, e a única defesa é registrar a versão de tudo, sempre, e conferir as distribuições quando elas derivam.

O que isso significa para quem constrói ferramentas

Quando as pessoas ouvem 'IA para ciência cardiovascular', imaginam o modelo. Eu imagino os longos meses de encanamento antes de um modelo poder ser confiado com qualquer coisa: alinhamento de tempo, resolução de identidade, rastreio de ausências, normalização de unidades, versionamento, proveniência em cada valor derivado. É nesse encanamento que os erros se escondem, e é onde passei a maior parte da carreira encontrando-os.

É também por isso que a ELUCENIA é construída com clínicos e cientistas, não para eles. Eles sabem o que o dado significa. Eu sei como ele quebra no caminho. Nenhum dos dois basta sozinho, e o campo merece os dois.