Проектиране на специализирани модели за решения: Маршрутизация на заявки и дистилация с ниска латентност

Архитектура на модели за решения тип Система 1 за ултрабърза маршрутизация. Снимка: Nish Tahir Blog
В продължение на години индустрията се опитваше да реши всеки възможен софтуерен проблем чрез една и съща чукова парадигма: изпращане на заявка към гигантски генеративен езиков модел и налагане на структуриран JSON изход (Structured Outputs) [1]. Този подход обаче носи колосални разходи, висока латентност (често между 500 и 2000 милисекунди) и ненужно хабене на електроенергия за тривиални въпроси като „Този имейл спам ли е?“ или „Към кой отдел да насоча този тикет?“ [1].
В изключително практичен и задълбочен анализ софтуерният инженер Ниш Тахир представя алтернативна инженерна философия: създаване на собствени специализирани модели за решения (Decision Models), функциониращи като бърза интуитивна „Система 1“ с латентност под 10 милисекунди [1].
Природата на Системата 1: Вероятности вместо токени
Фундаменталната разлика между класическия езиков модел и модела за решения се крие в изходния слой на невронната мрежа в машинното обучение [1]. Авторегресивните модели генерират думи една по една, пресмятайки вероятности върху речник от 100 000 токена на всяка стъпка. За да извлекат просто „Да“ или „Не“, те трябва да активират милиарди параметри в сложен цикъл на внимание.
Моделът за решения на Тахир работи по коренно различен начин. Той използва лек енкодер (като ModernBERT или дистилиран RoBERTa), чийто финален слой извежда директен вероятностен вектор (Softmax) единствено върху предварително дефинирания набор от валидни действия [1]. Няма генерация на текст, няма парсване на JSON и няма халюцинации. Отговорът е строго калибрирана математическа вероятност, получена с едно единствено преминаване през мрежата за по-малко от 8 милисекунди.
Дистилация на знания и каскадна маршрутизация
За да се обучи такъв модел без ръчно етикетиране на милиони примери, Тахир прилага дистилация на модели [1]. Голям граничен модел (като Claude 3.5 Sonnet или GPT-4o) се използва като „учител“, генериращ качествени синтетични етикети и меки вероятности върху специфични корпоративни данни. След това малкият 100-милионен модел се дообучава върху тези данни.
Този подход формира гръбнака на модерната архитектура за маршрутизация (Model Routing) [1]. Малкият модел застава на входа на API шлюза (API Gateway). В 90% от случаите той класифицира заявката незабавно с висока увереност и я изпълнява локално на стандартен процесор без нужда от GPU. Само в редките случаи на гранична несигурност заявката се ескалира към скъпия граничен LLM.
Икономически и оперативни ползи
Постигането на дълбока оптимизация на латентността чрез тесни модели за решения води до драматично свиване на оперативните разходи в облака – често с над 95% [1]. Освен финансовия ефект, системите придобиват детерминистично поведение и предвидими споразумения за ниво на обслужване (SLA), които са абсолютно задължителни за финансови трансакции, телекомуникации и промишлена автоматизация.
Бъдещето на софтуерната архитектура не е в монолитните гиганти, а в хармоничното съчетание: бърза, евтина и надеждна Система 1 за ежедневните автоматизирани рефлекси, подкрепена от дълбока Система 2 само за истински сложните интелектуални дилеми.

Инфографика: Светни.ме
Източници
[1]: Build your own decision model - Nish Tahir Blog & Hacker News