Strata постигна 100 токена/сек с 125-милиардния Qwen 3.8 на потребителска карта RTX 4090

Публикувано от Svetni.me Editorial на 4 октомври 2026 г.

Графичен процесор NVIDIA RTX и хардуерна архитектура
Снимка: The Decoder / NVIDIA

В общността с отворен код избухна истинска сензация след публикуването на проекта Strata — революционен софтуерен двигател за невронни изводи, който позволява изпълнението на колосалния 125-милиарден модел /pages/qwen-3-8.html Flash Next със скорост от 100 токена в секунда върху единична потребителска графична карта NVIDIA GeForce RTX 4090 с 24 GB VRAM [1].

До този момент изпълнението на модели с подобни мащаби изискваше корпоративни сървъри с четири или осем карти NVIDIA H100 или A100 на обща стойност над 150 000 долара. Пробивът на /pages/strata.html разбива дългогодишния мит, че супермоделите със смеси от експерти (Mixture of Experts - MoE) са физически недостъпни за потребителския хардуер.

Архитектура на хибридната 2.5-битова квантизация и DMA стрийминг

Успехът на инженерите зад Strata почива на два взаимно допълващи се инженерни стълба:

  1. Неравномерна хибридна квантизация (/pages/quantization.html): Вместо да компресира целия модел с фиксирана битова ширина, Strata прилага адаптивен подход. Критичните слоеве за внимание (attention layers) и първите проекции се запазват при 4-битова прецизност, докато огромните разредени матрици на експертите се компресират до 2-битов формат с прецизно калибрирани скалиращи коефициенти. Това осигурява ефективна средна резолюция от 2.5 бита на параметър, запазвайки 98.4% от точността на базовия модел.
  2. Директен PCIe 5.0 DMA стрийминг: 125-милиардният Qwen 3.8 активира само малка част от своите експерти за всеки конкретен токен. Strata използва собствен предсказващ рутер, който прогнозира кои експерти ще бъдат необходими в следващите слоеве и ги зарежда асинхронно директно от системната DDR5 оперативна памет през шината PCIe без междинни копия в паметта на процесора.

Специализираните нискостепенни ядра, написани директно на /pages/cuda.html, декомпресират теглата „в полет“ директно в регистрите на графичния процесор, елиминирайки задръстванията в пропускателната способност на паметта.

Нова ера за локалните автономни интелигентни системи

Постижението на Strata има колосални последици за екосистемата на /pages/local-inference.html. Софтуерните разработчици, стартъпите и финансовите анализатори вече могат да разполагат с интелигентност от граничен клас на обикновена настолна работна станция за 2000 долара.

Това прави възможна обработката на свръхчувствителни юридически казуси, пациентски досиета и патентован софтуерен код в режим на пълна офлайн изолация, без заплащане на стотици долари за облачни API токени.

Дългосрочни системни и макроикономически последици

Появата на Strata е класически пример за това как софтуерната изобретателност може да подкопае изкуствения хардуерен дефицит, поддържан от производителите на чипове. През последните три години полупроводниковите гиганти агресивно фрагментираха пазара, ограничавайки обема на паметта в потребителските карти до 24 GB, за да принудят корпоративните клиенти да купуват сървърни ускорители с десетократно по-високи надценки. Архитектури като Strata доказват, че при интелигентно управление на шините и асинхронно стриймване на експерти, потребителският силиций притежава напълно достатъчен изчислителен потенциал за обслужване на фундаментални модели.

В макроикономически план това открива пътя към децентрализация на AI инфраструктурата. Когато милиони потребителски компютри по света могат да изпълняват 125-милиардни модели с интерактивна скорост, зависимостта на глобалната индустрия от централизираните облачни монополи започва да се пропуква. Локалното изпълнение премахва латентността на мрежовия пренос, изолира потребителите от промени в ценовата политика на доставчиците и осигурява технологична устойчивост на цивилизацията дори в условията на геополитически блокади или сривове в глобалните оптични магистрали.

Инфографика: Архитектура на високоскоростния софтуерен двигател Strata
Инфографика: Хардуерен пайплайн за 2.5-битова декомпресия и DMA стрийминг в RTX 4090.

Източници

  1. GitHub: Niko1221/Strata - Run Qwen 3.8 Flash Next on consumer hardware