JUST · AI инженерные заметки Внедрение под ключ
Замермоделилокальнозамер 6 минут2026-09-24

Локальная модель решений: 243 миллисекунды на CPU и ноль рублей

Модель, которая не пишет текст, а выбирает из вариантов и ставит вероятность. Поставили локально и прогнали на настоящих задачах, а не на демо из документации.

5,2 споиск через DeepSeek
225 мсрешение на модели-решателе
$0,0001цена одного решения

Идея простая: часть работы в продукте — это не «напиши», а «выбери из вариантов». Там, где решение сводится к выбору, генерация текста — лишняя роскошь и лишнее время.

Что поставили

установка
веса:      2,3 ГБ, лицензия Apache 2.0
проверка:  работает без интернета после загрузки
железо:    CPU, инференс без ускорения
замер:     6 задач × 3 вопроса = 1,46 с  →  243 мс на задачу

Что показал прогон

Прогнали на настоящих задачах из ленты заказов, а не на примерах из документации. Модель уверенно разделила «наше / не наше» и отметила одну заявку как подозрительную по бюджету — это совпало с моей оценкой.

Честно про точность. На коротких описаниях уверенность модели низкая: она не «узнаёт» задачу, а осторожничает. Чтобы это стало рабочим фильтром, порог принятия решения надо калибровать на своих данных — и калибровать придётся по накопленной статистике, а не по первым двадцати вызовам.

Где это полезно

Не как замена облачным моделям, а как страховка: когда внешний канал недоступен, часть логики продолжает работать локально. Плюс как дешёвый предфильтр — отсеять очевидное до того, как за него заплатишь.

Читайте дальше

Новые замеры

Письмо, когда выходит новый замер или разбор поломки. Без рассылок «о нас» и без продаж.