Локальная модель решений: 243 миллисекунды на CPU и ноль рублей
Модель, которая не пишет текст, а выбирает из вариантов и ставит вероятность. Поставили локально и прогнали на настоящих задачах, а не на демо из документации.
Локальная модель — это не «бесплатно» и не «медленно». Это другой обмен: вы платите не за токены, а за своё железо и за своё время. Ниже — что получилось у нас, когда мы прогнали Qwen3 и эмбеддинги прямо на своей машине.
Мерили на одной рабочей станции: 12 ядер, 30 ГБ RAM, одна видеокарта 12,5 ГБ VRAM. Модель Qwen3 14B в квантовании Q4_K_M, запуск через ollama.
| Что мерили | Результат | Условия |
|---|---|---|
| Декод — генерация ответа | 34,3 ток/с | 200 токенов за 10,4 с |
| Префилл — чтение входа | 1051 ток/с | 3657 токенов за 3,48 с |
| Префилл на длинном входе | 560 ток/с | 16 000 токенов, 29 с только на чтение |
| Эмбеддинги bge-m3 | 10 908 символов/с | пачка 200 текстов, 17 490 символов за 1,60 с |
| Модель поменьше: Qwen3 4B | 94–98 ток/с | но холодный старт 27–46 с на загрузку |
Что это значит на практике. Короткий ответ на 200 токенов — около десяти секунд. Длинный документ на 16 тысяч токенов — полминуты только на то, чтобы модель его прочитала, ещё до первого слова ответа. Для рутины этого хватает, для интерактивного чата с большим контекстом — уже нет.
Обратите внимание на разрыв: вход читается в 30 раз быстрее, чем генерируется ответ. Значит узкое место — не «модель медленная», а то, сколько текста вы ей подсунули. Практический вывод мы сделали такой: не пихать в промпт весь документ целиком, а сначала отобрать нужные куски (поиском или правилами) и отдавать модели только их.
Видеопамяти 12,5 ГБ. Сама модель в Q4 занимает около 9 ГБ, остальное — контекст и кэш. Отсюда следствие, которое проверено живьём: расширить рабочее окно Qwen3 14B до 64 тысяч токенов на этой машине нельзя — не хватает памяти по двум независимым причинам сразу. Модель, у которой окно 8 192 токена, просто отказывается стартовать в агенте, требующем 64K.
Уменьшить окно тоже не выход: если резать кэш до 8-битного, качество проседает заметнее, чем хотелось бы. Мы пробовали — и вернулись к варианту полегче: меньшая модель на этой роли.
Когда мы считали, сколько будет стоить обслуживать несколько заказчиков сразу на своём железе, вышла арифметика: один инстанс агента с моделью — около 9,3 ГБ на клиента. Два таких уже не влезают в 12,5 ГБ. Поэтому модели держим общие — один ollama на всех, — а раздельными делаем только рабочие пространства. Иначе память кончается раньше, чем клиенты.
Локальная модель у нас есть, и она работает. Но основным каналом остаётся внешний — по замеру, а не по привычке:
| Канал | Задержка | Цена | Роль |
|---|---|---|---|
| Внешний провайдер решений | 225 мс | $0,04 за 1 млн входных токенов | основной, 772 вызова обошлись в 8 центов |
| Локальная модель решений, 322M | 243 мс | 0 ₽ — своё железо | резерв на случай, когда внешние каналы недоступны |
Разница в скорости — меньше двадцати миллисекунд, а по цене внешний канал выходит в центы за сотни вызовов. Локальная модель оправдана как страховка и как площадка для работы с закрытыми данными, но экономии в лоб она не даёт: железо уже куплено, а электричество и время дешевле не становятся.
Отдельная история — когда нужна именно локальность: персональные данные, коммерческая тайна, требования «ничего не покидает контур». Там выбор делается не по токенам в секунду.
На 14B в квантовании Q4 — да, около 9 ГБ под саму модель, остальное контекст и кэш. Для двух клиентов с раздельными моделями — нет: по нашему расчёту выходит 9,3 ГБ на экземпляр.
Железо уже куплено, но задержка чтения длинного входа и стоимость времени никуда не деваются. По нашему замеру внешний канал решений обошёлся в 8 центов за 772 вызова при задержке 225 мс, локальная модель того же класса — 243 мс.
На нашем железе — нет, упирается в память по двум независимым причинам. Обходной путь — модель поменьше, но как «голова» агента она слабее.
Модель, которая не пишет текст, а выбирает из вариантов и ставит вероятность. Поставили локально и прогнали на настоящих задачах, а не на демо из документации.
Десять участков работы с LLM в продукте — и что на каждом происходит у нас на самом деле: с цифрами цены, задержки и качества, а не пересказом чужих статей.
Мы не пишем «под ключ» и не обещаем позиций. Показываем, из чего собрана тема: частотность запросов из Wordstat, снятая 24.09.2026 по России.
| Запрос | Показов/мес |
|---|---|
| локальные llm | 3 928 |
| ollama модели | 2 757 |
| qwen ollama | 1 197 |
| локальная ollama | 838 |
| локальная llm модель | 753 |
| ollama нейросеть | 515 |
| лучшие локальные llm | 352 |
| локальный запуск llm | 304 |
| локальные llm 2026 | 109 |
| лучшие локальные llm модели | 104 |
Источник: Яндекс Wordstat, регион Россия, снято через API 24.09.2026. Цифры округлены провайдером до сотен.
Если задача — внедрение, а не чтение: напишите, разберём и скажем, стоит ли это делать вообще. Замеры под вашу задачу делаем до сметы.
Одно письмо, когда выходит новая статья или замер: разборы поломок, цифры цены и задержки, инструменты. Без рассылок «о нас» и без продаж. Отписаться можно ответом на любое письмо.