en
· 3 min de leitura

O humano no loop é uma decisão de design

Humano no loop não é checkbox para o slide de compliance. É uma interface, um fluxo e um orçamento que você precisa projetar.

aiscience

"Tem um humano no loop" é a frase que mais ouço quando um time apresenta uma feature de IA com consequências reais. Ela é dita para encerrar a discussão. Para mim, ela começa uma. Humano no loop é uma decisão de design com uma dúzia de subdecisões, e na maioria das vezes ninguém as tomou. O humano existe no diagrama de arquitetura como uma caixa chamada "revisão". Em produção, essa caixa é uma pessoa clicando em aprovar quarenta vezes por hora sem ler.

Não é um checkbox

Colocar uma pessoa entre o modelo e a consequência não torna o sistema seguro. Torna seguro apenas se a pessoa consegue de fato pegar o que o modelo erra. Isso exige três coisas que não acontecem por acaso: a pessoa vê a informação necessária para julgar, a pessoa tem tempo e incentivo para julgar, e o julgamento da pessoa muda o que acontece. Tire qualquer uma delas e o humano vira um carimbo com salário. Já auditei fluxos de aprovação em que o revisor tinha cota, média de dez segundos e nenhuma visão da fonte. O loop tinha um humano. O sistema não tinha revisão.

Três perguntas

Quando projeto uma etapa humana, pergunto para que serve o humano. É para pegar erros? Então ele precisa ver a evidência do modelo e a incerteza, não só a conclusão. É para assumir responsabilidade? Então a interface precisa deixar claro o que ele está assinando e registrar que assinou. É para ensinar o sistema? Então toda correção precisa voltar para o conjunto de evals e para a próxima versão. São trabalhos diferentes com interfaces diferentes. Um único botão de aprovar não serve bem a nenhum deles.

Onde o humano agrega valor

O humano deve ficar onde o julgamento dele é escasso e o do modelo é fraco, não espalhado por toda parte como seguro. Revisar mil extrações rotineiras é trabalho para código de validação e amostragem. Decidir se um caso incomum deve sobrepor a política é trabalho para uma pessoa. Bons designs roteiam por confiança e consequência: o modelo cuida sozinho da maioria confiante e de baixo risco, o código checa as propriedades mecânicas, e a pessoa recebe o pequeno conjunto em que o modelo está inseguro ou o resultado é irreversível, com tudo o que precisa para decidir. Isso é uma fila com prioridade, e pode ser medida como uma.

Interfaces para responsabilidade

A parte que a maioria dos times pula é o registro. Quem viu o quê, quando, e o que decidiu. Não para culpar, para aprender. Quando uma saída aprovada se mostra errada, a pergunta é se o revisor poderia ter sabido, e a resposta depende do que a interface mostrou. Se a interface escondeu a baixa confiança do modelo, a falha é do design, não da pessoa. Então registro o contexto completo de toda decisão humana, e periodicamente reviso as próprias decisões, porque taxa de aprovação perto de cem por cento não é sinal de modelo bom. É sinal de que o loop parou de girar.

Ciência

Isso não é abstrato para mim. A razão de eu estar construindo a ELUCENIA, uma cadeia médica e científica global para a descoberta, é que acredito que máquinas podem encurtar o caminho dos dados até a hipótese. Mas hipótese não é resultado. Toda hipótese precisa de evidência, todo avanço precisa de validação pelo método científico, e toda decisão precisa de um humano responsável por ela. Isso não são limites ao que a ferramenta pode fazer. É o que torna a ferramenta confiável o suficiente para ser usada. O humano no loop é o design. O modelo é o assistente.