🪙 Como não desperdiçar tokens em modelos de linguagem

Se você usa ativamente modelos de linguagem como Claude ou GPT, certamente já notou como os limites de tokens se esgotam rapidamente. Isso é especialmente verdadeiro para modelos premium, como o Opus 4.6, cujo uso é limitado mesmo em assinaturas pagas. O problema é que a cada requisição, todo o histórico da conversa é enviado, e quanto mais longo ele for, mais tokens são consumidos. Mas há uma maneira de economizar.

Tente fazer um resumo conciso. Em determinado ponto da conversa com o modelo (por exemplo, no meio do diálogo), peça a ele que formule um resumo em formato markdown. Esse resumo deve conter todas as informações-chave para que outro agente possa continuar a conversa do mesmo ponto. Em seguida, abra um novo agente, cole esse resumo e faça a próxima pergunta. O novo diálogo começará com um histórico mínimo, mas com o contexto preservado 👍

👩‍💻 Data Flow