Tag: AI engineering
-

LLM gateway, não só API gateway: a política que decide quem atende cada request
LLM gateway não é só API gateway com outro nome. A política de roteamento com gatilho, trava de fallback e teto de gasto por classe. -

Latência, qualidade, custo e confiabilidade: o mapa do stack de inferência
Latência, qualidade, custo e confiabilidade: os quatro eixos que todo knob do stack de inferência move, com preços e limites verificados em 2026. -

Context engineering, não só prompts longos
Os quatro modos de falha de contexto e as táticas que mantêm agentes de IA confiáveis, além do prompt. -

O efeito snowball: por que a mensagem 50 pesa 6x na janela de contexto
Cada mensagem pesa mais na janela de contexto. A fórmula do custo quadrático e um HUD de statusline pra ver a bola de neve crescer.
