Qwen3.8-Flash-Next: Преглед на архитектурата Qwen4 с фокус върху ценовата ефективност

Публикувано от Svetni.me Editorial на 27 август 2026 г.

Qwen3.8-Flash-Next Architecture
Изображение: Svetni.me / ИИ генерирано изображение

На 26 август 2026 г. китайският технологичен гигант Alibaba представи Qwen3.8-Flash-Next – експериментален модел с отворени тегла (open-weight), който демонстрира ключови иновации от следващото поколение архитектура Qwen4. Този модел е създаден с цел постигане на максимална изчислителна и ценова ефективност, като същевременно се стреми да достигне или надмине производителността на значително по-големи и скъпи модели. В официалната публикация на разработчиците [1] и в придружаващия аналитичен доклад [2] се подчертава, че моделът променя правилата на играта по отношение на изчислителната икономия. [1], [2]

Архитектурна революция: Смес от експерти и иновативно управление на паметта

Qwen3.8-Flash-Next е базиран на архитектурата смес от експерти (Mixture of Experts - MoE). Моделът разполага със 125 милиарда (125B) общи параметри (без да се включва слоят за N-gram влагане), но за обработката на всеки отделен токен се активират само 6 милиарда (6B) от тях. Този подход осигурява огромна производителност при изключително ниска консумация на изчислителни ресурси в сравнение с монолитните модели.

Най-съществената технологична иновация в модела е неговият 51B N-gram Embedding слой. Този слой функционира като гигантска локална таблица за търсене (lookup table) или „речник на фрази“, който съхранява често срещани текстови групи и фрази. Вместо да се съхранява в скъпата и ограничена графична памет (GPU VRAM), този слой е оптимизиран да се зарежда и изпълнява директно от системната RAM или SSD дисковете на сървъра. Това разтоварване на GPU паметта драстично намалява изискванията към хардуера за поддръжка на модела, като спестява ценна памет без значително забавяне на изчислителния процес. [1]

Qwen3.8-Flash-Next Architecture Specifications
Изображение: Svetni.me / ИИ генерирана инфографика

Хибридно внимание и безкраен контекст

Другата голяма новост в Qwen3.8-Flash-Next е неговият уникален хибриден механизъм за внимание (Hybrid Attention). Вместо да използва стандартния механизъм на внимание върху всички слоеве, моделът разпределя задачите по два начина:

  1. Gated DeltaNet (GDN) върху 3/4 (75%) от слоевете. Тази технология компресира миналата история на разговора, което напълно елиминира растежа на т.нар. KV cache (Key-Value Cache) – един от най-големите проблеми при обработката на дълги текстове.
  2. Qwen Sparse Attention (QSA) върху останалите 1/4 (25%) от слоевете. QSA работи на ниво микро-блокове, като оптимизира времето за обработка на заявки и намалява закъснението (latency) при работа с изключително дълги контексти.

Благодарение на тази комбинация, моделът поддържа нативен контекстен прозорец от 262,144 токена, който лесно може да бъде разширен до 1,000,000 (1M) токена чрез алгоритъма YaRN. Това го прави идеален за анализ на цели книги, огромни бази от код или сложни технически документи. [1], [2]

Управление на потока и ефективност на обучението

За да се координира правилното протичане на информацията в разширените му слоеве, Qwen3.8-Flash-Next използва технологията Gated Residual (GR). Този метод за контрол и модулация управлява информационния поток през разширените резидуални потоци (residual streams), като по този начин балансира стабилността и качеството на обучението.

Ефектът от всички тези иновации върху производствените разходи е поразителен. Обучението на Qwen3.8-Flash-Next струва едва 1/9 от цената на обучението за предходния модел Qwen3.7-Plus. За сравнение, Qwen3.7-Plus има 397 милиарда общи параметри и активира цели 17 милиарда параметри на токен – почти три пъти повече от активираните параметри на Flash-Next. Тази огромна разлика показва как оптимизирането на архитектурата може да генерира много по-голяма мощност с малка част от разходите. [1]

Превъзходство в бенчмарковете срещу водещите западни модели

Въпреки експерименталния си характер и фокуса си върху ниската цена, Qwen3.8-Flash-Next показва изключително добри резултати в сравнителните тестове. Alibaba публикува данни, които сравняват модела директно с Claude-4.6-Opus на Anthropic и DeepSeek-V4-Flash на конкурентната китайска фирма.

Резултатите показват, че Qwen3.8-Flash-Next превъзхожда Claude-4.6-Opus в критични области:

  • SWE-bench Pro: +9.1 точки разлика в полза на Qwen3.8-Flash-Next (62.5 спрямо 53.4 точки). Този бенчмарк оценява способността на моделите автономно да откриват и поправят грешки в реални софтуерни проекти.
  • JobBench: +20 точки разлика спрямо Claude (55.7 спрямо 35.7 точки). Тестът измерва ефективността при изпълнение на задачи от професионални работни процеси.
  • AndroidWorld: +22.5 точки преднина за Qwen, което показва отлична способност за навигация и работа с операционни системи.
  • MathVision: +25.1 точки предимство, потвърждаващо високия му капацитет за визуално-математическо мислене.

Моделът се представя изключително силно и в тестовете за програмиране като LiveCodeBench v6 (91.9 точки) и научно мислене като GPQA Diamond (91.7 точки), където се конкурира наравно или побеждава по-големи модели. Единствено при тестове, изискващи изключително сложни интердисциплинарни проблеми (като Humanity's Last Exam), по-старият, но мащабен модел Claude Opus 4.6 запазва леко превъзходство. Налице са също така версии с отворени тегла, достъпни в платформата на Hugging Face, което позволява на изследователската общност да тества решенията му локално. [1], [2]

Облачно внедряване, ценообразуване и влияние върху пазара

Официалната производствена версия на модела вече е внедрена в Qwen Cloud под името Qwen3.8-Flash. Тя предлага поддръжка на 1M контекстен прозорец по подразбиране и разполага с вградени инструменти за търсене и разработка.

Ценообразуването на този модел е изключително агресивно и оказва силен натиск върху водещите световни доставчици на ИИ услуги:

  • Входящи токени (Input): 0.16 USD за милион токена.
  • Изходящи токени (Output): 0.47 USD за милион токена.

За сравнение, тази цена е приблизително 12 пъти по-ниска от цената за ползване на водещия модел от същата фамилия – Qwen3.8-Max (който струва 2.00 USD за вход и 6.00 USD за изход на милион токена). Тази разлика прави модела на Alibaba един от най-достъпните в своя клас, поставяйки в изключително трудна позиция западни компании като OpenAI и Anthropic. Конкуренцията в областта на "токен икономиката" принуждава компаниите непрекъснато да намаляват цените на своите модели (както се вижда от последните отстъпки на OpenAI за гамата GPT-5.6), което е от полза за крайните разработчици, но наманява маржовете на печалба за ИИ лабораториите. [2]

Бъдещето на изчислителната ефективност

Qwen3.8-Flash-Next доказва, че бъдещето на изкуствения интелект не се състои просто в безкрайното увеличаване на размера на моделите. Чрез иновативни архитектурни решения, като разтоварване на тежките параметри в системната памет и комбинация от различни видове внимание (GDN и QSA), Alibaba демонстрира, че е възможно да се създадат модели, които са едновременно мощни и икономически изгодни за поддръжка. Спецификациите, представени в този преглед на Qwen4, вероятно ще очертаят посоката за развитие на цялата индустрия през следващите години. [1]

Източници

  1. Qwen Blog: Qwen3.8-Flash-Next Architecture Preview
  2. The Decoder: Alibaba releases Qwen3.8-Flash-Next, targeting "ultimate cost efficiency"