Короткий ответ: вполне серьёзную локальную альтернативу большим облачным LLM. Цена удовольствия: нужно вникать.

Параметры запуска, кванты, софт, архитектура, инфраструктура и тонны тестов.

Большие LLM дают комфорт, где голова этим не загружена. Но если хочешь LLM локально, придётся погрузиться.

Ради чего?

Сейчас я тестирую Qwen3.8-27B в кванте Q4_K_S.

Да, квантование не "бесплатное": на сложных задачах поведение модели может отличаться от оригинала. Но разница остаётся достаточно небольшой, чтобы получить очень близкую к полной модели версию, которая целиком помещается в 24 ГБ VRAM вместе с большим контекстом.

Цифры на практике:

~1135 токенов/с при обработке промпта;
С минимальным контекстом генерация ~40 токенов в секунду;
~153k: ~20 tok/s;
~194k: ~18 tok/s.

При доступном контекстном окне в 208 тысяч токенов.

То есть б/у игровая видеокарта 2020 года сегодня позволяет локально гонять 27B-модель с 200к контекстом на вполне комфортной скорости для кодинг-агента.

Что это за Квен такой?

По ряду бенчмарков Qwen3.8-27B находится недалеко от Claude Opus 4.6 Max:

+ SWE-bench Pro: 61.7 у Qwen против 53.4 у Opus;
+ Terminal-Bench 2.1: 73.0 против 78.2;
+ LiveCodeBench v6: 90.3 против 88.8;

Конечно, нельзя делать вывод "Qwen лучше Opus" или что модели эквивалентны в реальной работе.

Но сам факт!

Локальная модель сопоставима с одной из самых мощных облачных LLM. И всё это крутится на б/у 3090 за 75к.

Остаётся ограничение по небольшому контекстному окну... Но это уже тема для следующего поста.

Устраивайтесь поудобнее, зовите друзей?

---

Источники:

Видео о Qwen3.8-27B:
https://youtu.be/fkEfPLu4UyI?si=ha8kBo6Q9jgIH6mi

Сравнение Qwen3.8-27B с Claude Opus 4.6 Max:
https://huggingface.co/Qwen/Qwen3.8-27B

Сравнение квантов Qwen3.8-27B с оригинальными BF16-весами:
https://huggingface.co/AtomicChat/Qwen3.8-27B-GGUF