Последние пару недель активно для работы использую omp - https://github.com/can1357/oh-my-pi

Это терминальный интерфейс - как claude code, который позволяет подключать несколько разных ai-подписок и автоматически выбирать нужную в нужный момент, чем сильно экономит токены.
Например, можно подцепить openai codex, claude code и cursor. В конфиге при этом есть девять встроенных ролей: default, slow, plan, smol, task, tiny, vision, commit, advisor.
default - это модель, которая загружается при старте приложения и общается с тобой; slow - умная модель, которой работа передается в случае если нужно над чем-то подумать, например архитектурой, или провести ревью; task - основная модель для решения основных задач; commit - модель для генерации коммита, и так далее.
У меня сейчас стоит такой конфиг:
- default - openai-codex/gpt5.6-sol
- task - anthropic/claude-opus-5-1
- commit - cursor/gpt-5.4-mini
- smol - openai-codex/gpt-5.5
И затем когда мы начинаем решать какую-то задачу, omp составляет план и итеративно разбивает задачи на подзадачи. Основные базовые подзадачи будет решать opus, легкие подзадачи, вроде найти что-то в коде - будет решать роль smol на gpt-5.5, коммит будет писать gpt-5.4-mini из курсора, которая почти ничего не стоит.
При этом можно подцепить и свои локальные модели и делегировать им какие-то роли.
⠀
За неделю, по ощущениям, как минимум я перестал пробивать потолки подписок - планомерно расходуются лимиты и в недельное окно все укладывается, хотя темп разработки за прошедшую неделю сильно вырос. В ближайшее время хочу подцепить для супер-простых задач локальный qwen и посмотреть, сколько через пару недель токенов такая система сэкономит.