Нет, не потому, что первая плохо справляется. Скорее наоборот.
После прошлого поста ещё поигрался с настройками запуска и контекст удалось поднять до 164к токенов.
Можно запускать и на 192к, но там уже придётся жертвовать весами кэша. Этого я пока не хочу.
Проблема заключается в другом.
Один вызов модели съедает всю доступную VRAM. А это значит, что запуск двух сессий одновременно на одной карте невозможен.
Но для схемы автономной работы, которую я хочу собрать, нужны как раз две сессии, чтобы разделить систему на два уровня.
Первая сессия — архитектор.
Следит за общей целью и стратегией, декомпозирует работу и формирует задачи примерно под 150к токенов контекста.
Вторая — исполнитель.
Получает конкретную задачу, работает с кодом и возвращает результат.
Сейчас роль архитектора всё ещё приходится отдавать облачной модели.
Купил видеокарту, чтобы меньше зависеть от облака, называется?