ping

Промпт, которым обычно проверяешь, не отвалилась ли модель. Может VPN тупит, может что-то программно сломалось и т.д.

Знаете, сколько контекстного окна отжирает этот промпт из одного слова у Гермеса? 20 тысяч токенов.
Карл! Двадцать тысяч токенов!

Ещё 40 тысяч легко отжирает среднестатистическая задача уровня ~"создай новый LXC и привяжи к нему домен на Traefik". Из них около 70% это внутренние инструменты Гермеса.

Какие-то сутки назад 60 тысяч токенов контекста для меня были ничем. Просто шутка какая-то. Это меньше 10% контекстного окна в 1 млн токенов у DeepSeek.

Знаете, какое контекстное окно у моей локальной LLM сейчас? 96 тысяч токенов.

60 тысяч — это уже 2/3. Пора вызывать compress, по сути.

В общем, всё оказалось не так радужно.

Надо менять harness (агента, управляющего моделью) на более минималистичного, но при этом более требовательного к обслуживанию и настройке. Ревностно выкидывать ненужные тулзы, скилы и mcp.

И, походу, задумываться над покупкой второй RTX 3090 ??

--

? - интересно про локальную LLM, пиши ещё.
? - это всё и так было понятно!
? - поддержать автора лайкосиком.