IA aplicada

10 maneiras de economizar tokens de IA no CLI, no desktop e na nuvem

Dez formas de gastar menos tokens em Codex, Claude Code, Grok e outros agentes: Caveman, RTK, Headroom, Graphify, jCodeMunch, LSP, TokenShift, gateways, ferramentas pouco vistas e planos subsidiados como OpenCode Go.

Assistir ao vídeo original no YouTube
Thumbnail do vídeo: 10 Maneiras de Economizar Tokens de Inteligência Artificial

Ninguém gosta de pagar token no atacado nem de estourar o limite semanal no Codex, no Claude Code, no Grok e nos outros agentes. O gasto some no output verboso, no dump de terminal, no agente que lê o repositório inteiro e na API avulsa. Dá para cortar isso no CLI, no app de desktop e na nuvem. São dez caminhos. Dá para juntar vários. Em alguns fluxos a conta chega perto de 99% a menos — o número é da ferramenta, não uma promessa universal.

A economia começa no que o modelo escreve e no que ele lê. Caveman encurta a resposta. RTK comprime a saída de terminal. Headroom, Graphify, índice MCP e LSP evitam que o agente mastigue arquivo demais. Gateway com cache e failover segura o trabalho quando um modelo acaba. O corte mais bruto, nesta época, ainda é o plano subsidiado: Codex, Grok, MiniMax e OpenCode Go entregam mais token do que a API avulsa pelo mesmo dinheiro.

Onde o token some
Output longo, terminal, grep no repositório inteiro
Camadas para cortar
Skill, proxy local, grafo, LSP, gateway, plano
O que eu não vendi no escuro
Ferramenta sem estrela, paga e não testada

Por que o limite semanal some tão rápido

Agente de código não conversa como chat. Ele lista diretório, abre arquivo, roda teste, cola log, pensa em voz alta e só então escreve a correção. Cada uma dessas voltas é token de entrada e de saída. O limite semanal do Codex ou do Claude Code morre nisso, não no “olá”.

As dez opções abaixo se misturam. Instale as que cabem no seu fluxo. Eu não vou fazer tutorial de instalação neste texto: na maior parte dos casos você copia o link do GitHub ou do site oficial, manda para a própria IA e pede para instalar completo, sem faltar peça, e já deixar na memória para usar sozinho. Antes de colar qualquer repositório, olhe as estrelas. Muita estrela não prova segurança, mas repositório morto com onze estrelas pede desconfiança.

1. Caveman: menos palavra, menos output

A primeira ferramenta a maior parte das pessoas já conhece: é uma skill. Você pode até inventar a sua no mesmo naipe, do zero. O Caveman, quando você conversa com a IA, faz ela responder igual homem das cavernas — pouquíssimas palavras. Você gasta menos token de saída. Ela também evita narrar tudo que está acontecendo no meio do processo, porque o pensamento em voz alta também é output.

O repositório que eu mostrei está bem mais complexo do que da primeira vez que eu vi. Parece que ganhou função extra e continua sendo atualizado. A promessa clássica da skill é economizar até 65% dos tokens de saída. Isso não é o mesmo que 65% da fatura inteira: o grosso do agente ainda é contexto de arquivo. Mesmo assim, para quem deixa o modelo escrever novela, o corte é real.

Instalação, no meu fluxo, é mandar o link e pedir para a IA instalar direito em todo lugar que ela já usa skill. Depois você testa uma tarefa curta e vê se a resposta veio magra sem perder o fato.

  1. Abra o repositório oficial do Caveman no GitHub e confira estrelas e data de commit.
  2. Copie a URL e peça ao agente para instalar a skill por completo, inclusive memória e ativação automática.
  3. Rode uma tarefa pequena e compare o tamanho da resposta com o modo normal.
  4. Se a skill ficar no caminho de uma explicação longa que você precisa, desligue só naquela conversa.

2. RTK: Rust Token Killer no terminal

RTK significa Rust Token Killer. Quando você manda um comando para a IA, o software intercepta a linha de comando, coloca o RTK no lugar e comprime o que voltaria para o modelo. Git status, log, teste, listagem: o agente não precisa de 155 linhas se 3 resolvem.

A economia anunciada chega a 90% nessas execuções de terminal. Mesmo que você ache que não usa terminal com IA, o agente usa. Abrir navegador, aplicar patch, rodar script — passa pelo shell. Por isso o RTK compensa mesmo para quem “só conversa” com o app. O binário é Rust, sem dependência pesada, e o jeito mais simples é prefixar o comando (rtk git status) ou deixar o hook do agente chamar sozinho.

3. Headroom: proxy, cache e dashboard

Headroom — o reconhecimento de fala do vídeo vira “Red Room” ou “redo”, mas o produto é Headroom. Foi feito por engenheiro que estava na Netflix. É proxy, biblioteca, MCP e compressão local. Ele até inclui o RTK no meio. A página fala em economia grande em JSON (na faixa de 60% a 95%) e um corte menor no tráfego típico de agente de código.

Eu não consegui fazer funcionar direito. Não analisei a fundo. Mesmo assim o dashboard, depois de instalado, mostra o quanto caiu no cache e no proxy. No meu caso a economia estava baixa porque neste mês eu estou no Grok, não no Codex. O gráfico não mente: se você não passa o tráfego pelo proxy, não há milagre.

Recomendo olhar com calma, não instalar no piloto automático e cobrar o resultado no painel, não no marketing do README.

  • Proxy local na frente do agente
  • Compressão de JSON, log e arquivo antes de chegar no modelo
  • MCP e biblioteca para plugar em fluxo próprio
  • Dashboard com economia recente — só conta o que realmente passou pelo Headroom

4. Graphify: grafo de conhecimento no lugar do grep

Graphify transforma o projeto num grafo de conhecimento que a IA consome. Em vez de navegar arquivo por arquivo, ela consulta o grafo para achar função, módulo, relação. Não fica limitado a código: dá para grafo de PDF, imagem e vídeo.

O fluxo que funciona: instalar, pedir para a IA configurar em toda memória e em todo agente, para cada mensagem ler o grafo em vez de vasculhar o disco. Depois de modificar arquivo, ela refaz o grafo. Sistema simples. Economia grande porque o modelo para de reler o site inteiro a cada pergunta. No meu monorepo isso é regra: um grafo por site, atualizado depois de mudança de código.

  1. Instale o Graphify no projeto (o pacote público é graphifyy; o comando no terminal é graphify).
  2. Gere o mapa inicial só de código e peça ao agente para consultar o grafo antes de abrir arquivo em massa.
  3. Depois de cada lote de edição, rode a atualização do grafo para ele não mentir sobre o que você acabou de mudar.

5. Índice do repositório: MCP e jCodeMunch

jCodeMunch (no vídeo o áudio come o nome) funciona um pouco mais online. Ele cria um MCP do seu repositório. Função, classe, símbolo: entrega o pedaço certo em vez do arquivo inteiro. A faixa anunciada chega a 95% de token na exploração de código.

Eu ainda não testei. Serve mais para quem já vive em código — inclusive JavaScript, que é o jeito moderno de fazer web. A lógica é a mesma do Graphify com outro recorte: índice de símbolo, não grafo editorial. Se o agente está lendo mil linhas para achar uma função, este é o tipo de ferramenta que corta a faca.

6. LSP: diagnóstico sem varrer o projeto no escuro

Servidor LSP, Language Server Protocol. Não é LCP. O OpenCode oferece esse servidor: você ativa e ele integra com o projeto. O LSP ajuda o agente a achar e corrigir problema com diagnóstico do servidor de linguagem, em vez de examinar o repositório de maneira errada.

É plugin de inteligência de código de verdade, anterior ao hype de agente. Analisa o código e entrega para a IA um caminho mais curto. Dá para ligar pelo OpenCode ou por outra ferramenta que já fale LSP. Vale pesquisar o protocolo em si, porque não é invenção do mundo da IA — é o mesmo tipo de feedback que o editor já usa para sublinhar erro.

7. TokenShift e otimização em tempo real

Num artigo de “dez maneiras de economizar token” eu esbarrei no TokenShift. Não analisei a fundo a maioria das ferramentas daquela lista, e várias são desconhecidas demais para eu recomendar. O TokenShift, pelo site, governa token, analisa gasto e serve como endpoint. São 17 técnicas de otimização em tempo real. A lógica parece a do Headroom: várias formas de reduzir a média.

A economia citada no material que eu vi era cerca de 21%. Foco em programação. Ferramenta paga. Por ser paga, eu não recomendo como primeiro passo. Tem opção open source na lista que cobre o mesmo pedaço do problema.

8. Gateways de IA: cache, OpenRouter, Cloudflare e failover

Gateway de IA é um portão. Você paga para a empresa do meio; ela entrega o modelo. OpenRouter é o exemplo óbvio. Cloudflare AI Gateway também. O artigo que eu abri ainda citava Kong AI Gateway e GPTCache. A maior parte daquela lista era, no fundo, gateway ou cache na frente da API.

Essas camadas costumam ter cache, otimização e troca automática de modelo quando o token de um acaba. Isso evita o trabalho morrer no meio. Muita gente não vê vantagem no OpenRouter e prefere assinar a inteligência direto. Só que aí você joga fora failover, cache e o restante do que o gateway já traz. Se você paga API avulsa, passar por um gateway não é firula — é o lugar onde o token repetido deixa de ser cobrado de novo.

  • OpenRouter: um catálogo, uma chave, roteamento entre provedores
  • Cloudflare AI Gateway: cache, log e limite na frente da sua própria conta de modelo
  • Kong AI Gateway: governança de tráfego de LLM em cima do Kong
  • GPTCache: cache semântico open source para consulta repetida

9. Ferramenta pouco vista e auto-reflexão — com desconfiança

Pesquisando para o vídeo eu achei um Autoreflex feito por brasileiro: o agente autorreflete na situação para reduzir consumo. Eu não testei. Fico receoso. Tinha cerca de 11 estrelas. Mesmo que o autor seja de confiança, outra pessoa pode ter injetado coisa no fork. O repositório já estava uns quatro meses sem atualizar. Relevância hoje: duvidosa.

O ponto não é aquela peça específica. É que o GitHub está cheio de economia de token que não viralizou. Vale investigar, vale criar a sua. A maioria das ferramentas desta lista nasceu da própria IA junto com o programador, várias em Rust. Pouca estrela, porém, não é atalho — é risco. Eu não instalo isso no piloto automático.

10. A melhor economia: não pagar o token cheio

A décima maneira é não pagar token na tabela da API. As inteligências estão subsidiadas. No mês passado, no Codex, eu gastei mais de 24 bilhões de tokens. Se fosse pagar isso no preço atual da API da OpenAI, passaria de US$ 50 mil. Eu paguei cerca de R$ 1.000 — o plano de uns US$ 200. Se você acha o plano caro, você não faz ideia de quanto ainda compensa por causa de reset e limite semanal.

Claude Code, para mim, é o mercenário: não é tão subsidiado assim. Grok, neste momento, está no time do teto alto. MiniMax, no plano deles, promete da ordem de 1 bilhão de tokens por um valor ilusório de US$ 20. Isso economiza mais do que Caveman e RTK somados, porque você nem entra na tabela da API.

Se a necessidade é API barata, o OpenCode Go, na época desta gravação, dava cerca de US$ 60 de uso por US$ 10 (primeiro mês mais baixo, na casa dos US$ 5). Lá entram modelos chineses fortes e baratos, como DeepSeek Flash, com pontuação boa e gasto baixo. Um plano de US$ 10 do OpenCode, nesse recorte, dura praticamente o mês. Eu tenho link de indicação: você ganha saldo extra e eu também ganho. Não precisa. A conta oficial já é 60 por 10.

O momento é agora, antes de o preço da inteligência subir de novo. Ferramenta mirabolante ajuda. Plano subsidiado resolve o mês.

Na sequência

  1. Ative Caveman ou uma skill equivalente para cortar output e narração inútil.
  2. Coloque RTK na frente dos comandos de terminal que o agente mais dispara.
  3. Se for usar Headroom, confirme economia no dashboard; se o proxy não estiver no caminho, o número é teatro.
  4. Gere e atualize o Graphify (ou outro índice) para o agente parar de ler o repositório inteiro.
  5. Ligue LSP no OpenCode ou no editor para diagnóstico sem grep cego.
  6. Se paga API, passe por OpenRouter ou Cloudflare AI Gateway com cache e failover.
  7. Gaste primeiro o teto do plano subsidiado (Codex, Grok, MiniMax, OpenCode Go) antes de abrir a API avulsa.

Onde isso quebra

Somar as porcentagens do README (65% + 90% + 95%) e achar que a fatura vai a zero. Cada corte atua numa fatia diferente.

Instalar repositório com pouca estrela e meses sem commit só porque promete auto-reflexão.

Pagar TokenShift como primeiro passo, sendo que RTK, Caveman e Graphify são de graça.

Assinar a API direta e abrir mão de cache e failover de um gateway.

Achar que plano de US$ 200 é caro sem converter o mesmo volume na tabela da API — 24 bilhões de tokens no Codex não cabem em cartão pessoal.

Perguntas frequentes

Caveman economiza token de entrada ou só de saída?

O efeito clássico é na saída: resposta curta e menos narração do processo. A skill que eu mostrei já estava mais complexa do que na primeira versão e pode cortar leitura também, mas o número de 65% que eu cito no vídeo é o da proposta original de output. Não trate isso como 65% da fatura inteira.

RTK e Headroom fazem a mesma coisa?

Não. RTK comprime saída de comando de terminal. Headroom é proxy mais largo — JSON, arquivo, MCP, dashboard — e pode incluir RTK no caminho. Eu uso e confio mais no RTK; o Headroom eu ainda não fiz funcionar direito.

Graphify substitui o jCodeMunch?

São recortes diferentes. Graphify vira o projeto inteiro (código, PDF, imagem) num grafo consultável. jCodeMunch indexa símbolo via MCP e entrega pedaço de arquivo. Eu uso Graphify no dia a dia; jCodeMunch eu ainda não testei.

OpenCode Go vale mais a pena do que Caveman?

São camadas distintas. Caveman reduz o que cada chamada escreve. OpenCode Go, na época desta gravação, vendia cerca de US$ 60 de uso por US$ 10, com DeepSeek Flash e outros modelos leves. Se você paga API cheia, o plano subsidiado costuma ganhar de qualquer skill. Dá para usar os dois.

Posso economizar 99% de verdade?

Em fluxos específicos — explorar repositório pelo índice em vez de ler tudo, ou comprimir JSON enorme — as ferramentas anunciam até 95% ou 99% naquela fatia. No mês inteiro, misturando chat, diff e modelo caro, o número real é menor. O corte mais honesto que eu tive no Codex foi o subsídio do plano, não o somatório dos READMEs.

Quem está no Super Grok Heavy com Cursor Ultra incluso ainda precisa desses cortes: o texto sobre Grok Heavy e o Ultra incluso mostra onde cada limite mora. Se o projeto acumula chave de API de gateway em gateway, vale o cuidado de evitar acúmulo de chaves de API em projetos de IA.