Короткий ответ: вполне серьёзную локальную альтернативу большим облачным LLM. Цена удовольствия: нужно вникать.
Параметры запуска, кванты, софт, архитектура, инфраструктура и тонны тестов.
Большие LLM дают комфорт, где голова этим не загружена. Но если хочешь LLM локально, придётся погрузиться.
Ради чего?
Сейчас я тестирую Qwen3.8-27B в кванте Q4_K_S.
Да, квантование не "бесплатное": на сложных задачах поведение модели может отличаться от оригинала. Но разница остаётся достаточно небольшой, чтобы получить очень близкую к полной модели версию, которая целиком помещается в 24 ГБ VRAM вместе с большим контекстом.
Цифры на практике:
~1135 токенов/с при обработке промпта;
С минимальным контекстом генерация ~40 токенов в секунду;
~153k: ~20 tok/s;
~194k: ~18 tok/s.
При доступном контекстном окне в 208 тысяч токенов.
То есть б/у игровая видеокарта 2020 года сегодня позволяет локально гонять 27B-модель с 200к контекстом на вполне комфортной скорости для кодинг-агента.
Что это за Квен такой?
По ряду бенчмарков Qwen3.8-27B находится недалеко от Claude Opus 4.6 Max:
+ SWE-bench Pro: 61.7 у Qwen против 53.4 у Opus;
+ Terminal-Bench 2.1: 73.0 против 78.2;
+ LiveCodeBench v6: 90.3 против 88.8;
Конечно, нельзя делать вывод "Qwen лучше Opus" или что модели эквивалентны в реальной работе.
Но сам факт!
Локальная модель сопоставима с одной из самых мощных облачных LLM. И всё это крутится на б/у 3090 за 75к.
Остаётся ограничение по небольшому контекстному окну... Но это уже тема для следующего поста.
Устраивайтесь поудобнее, зовите друзей?
---
Источники:
Видео о Qwen3.8-27B:
https://youtu.be/fkEfPLu4UyI?si=ha8kBo6Q9jgIH6mi
Сравнение Qwen3.8-27B с Claude Opus 4.6 Max:
https://huggingface.co/Qwen/Qwen3.8-27B
Сравнение квантов Qwen3.8-27B с оригинальными BF16-весами:
https://huggingface.co/AtomicChat/Qwen3.8-27B-GGUF
