As últimas semanas tenho usado ativamente o omp - https://github.com/can1357/oh-my-pi

É uma interface de terminal - como o claude code, que permite conectar várias assinaturas de IA diferentes e escolher automaticamente a necessária no momento certo, economizando muitos tokens.
Por exemplo, você pode conectar o openai codex, claude code e cursor. No config, há nove funções integradas: default, slow, plan, smol, task, tiny, vision, commit, advisor.
default - é o modelo que carrega ao iniciar o aplicativo e interage com você; slow - é um modelo inteligente, usado quando é necessário pensar em algo, como arquitetura ou realizar uma revisão; task - é o modelo principal para resolver tarefas principais; commit - é o modelo para gerar commits, e assim por diante.
Atualmente, meu config está assim:
- default - openai-codex/gpt5.6-sol
- task - anthropic/claude-opus-5-1
- commit - cursor/gpt-5.4-mini
- smol - openai-codex/gpt-5.5
E então, quando começamos a resolver uma tarefa, o omp cria um plano e divide iterativamente as tarefas em subtarefas. As subtarefas principais serão resolvidas pelo opus, subtarefas leves, como encontrar algo no código, serão resolvidas pela função smol no gpt-5.5, e o commit será escrito pelo gpt-5.4-mini do cursor, que quase não custa nada.
Além disso, você pode conectar seus modelos locais e delegar a eles algumas funções.
⠀
Em uma semana, pelo menos, senti que parei de ultrapassar os limites das assinaturas - os limites são usados de forma planejada e tudo se encaixa na janela semanal, embora o ritmo de desenvolvimento tenha aumentado muito na última semana. Em breve, quero conectar o qwen local para tarefas super simples e ver quantos tokens esse sistema economiza em algumas semanas.