Нет, не потому, что первая плохо справляется. Скорее наоборот.

После прошлого поста ещё поигрался с настройками запуска и контекст удалось поднять до 164к токенов.
Можно запускать и на 192к, но там уже придётся жертвовать весами кэша. Этого я пока не хочу.

Проблема заключается в другом.

Один вызов модели съедает всю доступную VRAM. А это значит, что запуск двух сессий одновременно на одной карте невозможен.

Но для схемы автономной работы, которую я хочу собрать, нужны как раз две сессии, чтобы разделить систему на два уровня.

Первая сессия — архитектор.
Следит за общей целью и стратегией, декомпозирует работу и формирует задачи примерно под 150к токенов контекста.

Вторая — исполнитель.
Получает конкретную задачу, работает с кодом и возвращает результат.

Сейчас роль архитектора всё ещё приходится отдавать облачной модели.

Купил видеокарту, чтобы меньше зависеть от облака, называется?