Artigos sobre reliability
13 artigos de Felipe Guedes sobre reliability: System Design, arquitetura, engenharia full stack, auditoria e IA em produção.
- SLO para um time de cinco pessoasVocê não precisa de time de SRE para ter SLO. Precisa de um número, uma janela e uma regra para quando errar.
- Projete a falha antes da funcionalidadeO caminho feliz qualquer um escreve. O sistema de verdade é o que acontece quando ele quebra, e é isso que se projeta primeiro.
- O custo real de um retryRetries adicionam carga bem na hora em que o sistema está mais fraco. Backoff, jitter, orçamento e breakers evitam a amplificação.
- Alucinação é propriedade do sistema, não bug do modeloO modelo gera texto plausível. Se o plausível vira falso na frente do usuário depende do sistema que você construiu em volta dele.
- Os três primeiros alertas que todo sistema precisaAntes de dashboard, antes de SLO, antes de tudo: três alertas que pegam a maioria das quedas e quase nunca mentem.
- Error boundaries de ponta a pontaError boundary não é um componente React. É uma decisão sobre onde a falha para, tomada em cada camada, do clique até o banco.
- Projetando para a dependência lenta, não para a mortaDependência morta falha rápido. A lenta lota seus pools e te derruba. Bulkheads, deadlines, fallbacks e p99.
- Back-pressure é feature, não bugUm sistema que diz "agora não" é mais saudável do que um que aceita tudo e cai. Construa o caminho da recusa.
- Um checklist de degradação graciosa para times de produtoDecida de propósito o que o usuário vê quando recomendações, busca, pagamento ou banco falham. Um checklist para times de produto.
- Leia o tratamento de erros primeiroBlocos catch são onde um time escreveu o que teme e o que escolheu ignorar. Leia-os antes de qualquer outra coisa.
- Um template de post-mortem que produz mudançaA maioria dos post-mortems é bem escrita e não muda nada. O template decide qual tipo você vai escrever.
- Backup que você nunca restaurou é hipóteseBackup é uma afirmação sobre o futuro. Só o restore transforma ele em fato.
- Timeout é a resiliência mais barata que você vai comprarSem timeout significa infinito. Como eu defino connect, read e orçamento total para uma dependência lenta não derrubar tudo.