JUST · AI инженерные заметки Внедрение под ключ
Главная / Темы / Локальные LLM на своём железе: скорость, память, цена

Локальные LLM на своём железе: скорость, память, цена

Локальная модель — это не «бесплатно» и не «медленно». Это другой обмен: вы платите не за токены, а за своё железо и за своё время. Ниже — что получилось у нас, когда мы прогнали Qwen3 и эмбеддинги прямо на своей машине.

10 857показов в месяц по этому кластеру запросов (Wordstat, РФ, 24.09.2026)
5раздела с замерами на нашем железе
2наших разбора по теме

Сколько токенов в секунду даёт локальная модель

Мерили на одной рабочей станции: 12 ядер, 30 ГБ RAM, одна видеокарта 12,5 ГБ VRAM. Модель Qwen3 14B в квантовании Q4_K_M, запуск через ollama.

Что мерилиРезультатУсловия
Декод — генерация ответа34,3 ток/с200 токенов за 10,4 с
Префилл — чтение входа1051 ток/с3657 токенов за 3,48 с
Префилл на длинном входе560 ток/с16 000 токенов, 29 с только на чтение
Эмбеддинги bge-m310 908 символов/спачка 200 текстов, 17 490 символов за 1,60 с
Модель поменьше: Qwen3 4B94–98 ток/сно холодный старт 27–46 с на загрузку

Что это значит на практике. Короткий ответ на 200 токенов — около десяти секунд. Длинный документ на 16 тысяч токенов — полминуты только на то, чтобы модель его прочитала, ещё до первого слова ответа. Для рутины этого хватает, для интерактивного чата с большим контекстом — уже нет.

Чтение входа дороже генерации — и это меняет архитектуру

Обратите внимание на разрыв: вход читается в 30 раз быстрее, чем генерируется ответ. Значит узкое место — не «модель медленная», а то, сколько текста вы ей подсунули. Практический вывод мы сделали такой: не пихать в промпт весь документ целиком, а сначала отобрать нужные куски (поиском или правилами) и отдавать модели только их.

Замер. На входе 16 тысяч токенов только чтение занимает 29 секунд. Тот же вопрос по отобранному куску в 2 тысячи токенов проходит чтение за пару секунд. Разница — в отборе, а не в модели.

VRAM, контекст и почему 64K локально не влезает

Видеопамяти 12,5 ГБ. Сама модель в Q4 занимает около 9 ГБ, остальное — контекст и кэш. Отсюда следствие, которое проверено живьём: расширить рабочее окно Qwen3 14B до 64 тысяч токенов на этой машине нельзя — не хватает памяти по двум независимым причинам сразу. Модель, у которой окно 8 192 токена, просто отказывается стартовать в агенте, требующем 64K.

Уменьшить окно тоже не выход: если резать кэш до 8-битного, качество проседает заметнее, чем хотелось бы. Мы пробовали — и вернулись к варианту полегче: меньшая модель на этой роли.

Держать много моделей — не то же, что много экземпляров

Когда мы считали, сколько будет стоить обслуживать несколько заказчиков сразу на своём железе, вышла арифметика: один инстанс агента с моделью — около 9,3 ГБ на клиента. Два таких уже не влезают в 12,5 ГБ. Поэтому модели держим общие — один ollama на всех, — а раздельными делаем только рабочие пространства. Иначе память кончается раньше, чем клиенты.

Почему мы всё равно держим внешнего провайдера

Локальная модель у нас есть, и она работает. Но основным каналом остаётся внешний — по замеру, а не по привычке:

КаналЗадержкаЦенаРоль
Внешний провайдер решений225 мс$0,04 за 1 млн входных токеновосновной, 772 вызова обошлись в 8 центов
Локальная модель решений, 322M243 мс0 ₽ — своё железорезерв на случай, когда внешние каналы недоступны

Разница в скорости — меньше двадцати миллисекунд, а по цене внешний канал выходит в центы за сотни вызовов. Локальная модель оправдана как страховка и как площадка для работы с закрытыми данными, но экономии в лоб она не даёт: железо уже куплено, а электричество и время дешевле не становятся.

Отдельная история — когда нужна именно локальность: персональные данные, коммерческая тайна, требования «ничего не покидает контур». Там выбор делается не по токенам в секунду.

Частые вопросы

Хватит ли одной видеокарты на 12 ГБ для локальной LLM?

На 14B в квантовании Q4 — да, около 9 ГБ под саму модель, остальное контекст и кэш. Для двух клиентов с раздельными моделями — нет: по нашему расчёту выходит 9,3 ГБ на экземпляр.

Почему локальная модель не всегда дешевле облака?

Железо уже куплено, но задержка чтения длинного входа и стоимость времени никуда не деваются. По нашему замеру внешний канал решений обошёлся в 8 центов за 772 вызова при задержке 225 мс, локальная модель того же класса — 243 мс.

Можно ли поднять окно контекста до 64K локально?

На нашем железе — нет, упирается в память по двум независимым причинам. Обходной путь — модель поменьше, но как «голова» агента она слабее.

Разборы по теме

все статьи →

Спрос, под который собрана страница

Мы не пишем «под ключ» и не обещаем позиций. Показываем, из чего собрана тема: частотность запросов из Wordstat, снятая 24.09.2026 по России.

Запрос Показов/мес
локальные llm3 928
ollama модели2 757
qwen ollama1 197
локальная ollama838
локальная llm модель753
ollama нейросеть515
лучшие локальные llm352
локальный запуск llm304
локальные llm 2026109
лучшие локальные llm модели104

Источник: Яндекс Wordstat, регион Россия, снято через API 24.09.2026. Цифры округлены провайдером до сотен.

Нужна не справка, а работа

Если задача — внедрение, а не чтение: напишите, разберём и скажем, стоит ли это делать вообще. Замеры под вашу задачу делаем до сметы.