Tag: custo de LLM
-

Kill switch de agente: o circuit breaker que não espera o erro chegar
Kill switch de agente: a matriz de disparo com os cinco sinais que param um agente em loop, com config de gateway e regra de rearme. -

Prompt caching via API: a alavanca de custo que mora no formato do prompt
Prompt caching via API: escrever custa 25% a mais, ler custa 10%. O layout de prompt que vira economia real na Anthropic, OpenAI e Gemini. -

Cost attribution por feature, workflow e tenant: de qual bolso saiu cada token
Cost attribution de LLM: o contrato de atribuição que amarra cada request a feature, workflow e tenant, do gateway ao relatório por tenant. -

Token budget por agente: o rate limiter que protege o seu orçamento
Token budget por agente: rate limit de provedor controla taxa, não gasto. Como impor teto de custo por request, sessão, agente e tenant.
