Hetzner навлиза в AI Inference пазара: Първи поглед към техния нов API

Публикувано от Svetni.me Editorial на 24 юли 2026 г.

Германският хостинг гигант Hetzner направи изненадващ и стратегически ход, представяйки свой собствен експериментален – и за момента напълно безплатен – API за inference. Тази стъпка бележи важен крайъгълен камък за компанията, известна в технологичните среди със своята безкомпромисна ценова ефективност и прагматичен подход към изграждането на ИТ инфраструктура. Новата услуга има потенциала да промени динамиката на пазара за open-source-ai модели, предлагайки жизнеспособна алтернатива на утвърдените cloud доставчици, които често налагат високи маржове.

Експерименталният API и архитектурата на поддържания модел

В настоящия момент услугата е в тестова фаза и се предоставя безплатно на потребителите. API-то на Hetzner, достъпно на inference.hetzner.com/api/v1, е напълно съвместимо със стандарта на OpenAI. Това архитектурно решение е ключово, тъй като позволява на разработчиците безпроблемно да мигрират своите съществуващи приложения, без да се налага да пренаписват сложна логика за интеграция.

За старта на тази амбициозна услуга, Hetzner са избрали да фокусират ресурсите си върху един конкретен, но изключително мощен модел: Qwen/Qwen3.6-35B-A3B-FP8. Това е усъвършенствана версия от популярната серия qwen3. Техническите спецификации на този модел го правят идеален кандидат за ефективен хостинг. Той е базиран на mixture-of-experts (MoE) архитектура, която променя правилата на играта при обработката на заявки.

Как работи Mixture of Experts (MoE) в Qwen 3.6?

За да разберем защо изборът на този модел е толкова стратегически, трябва да навлезем в дълбочината на MoE архитектурата. При традиционните (dense) модели, всеки генериран токен изисква изчисления, преминаващи през всички налични параметри. При MoE, слоевете на невронната мрежа съдържат множество подмрежи, наречени "експерти", и специален механизъм за маршрутизиране (routing mechanism).

Въпреки че Qwen 3.6 разполага с общ капацитет от 35 милиарда параметъра (което му осигурява огромна база от знания и капацитет за сложно логическо разсъждение), маршрутизиращият механизъм активира само 3 милиарда параметъра за обработката на всеки отделен токен. Това означава, че моделът комбинира интелектуалната мощ и огромния контекстен прозорец от 262 хиляди токена на голям модел, със скоростта на inference и ниските изчислителни разходи, характерни за малък модел с 3 милиарда параметъра.

Ролята на FP8 Квантизацията

Друг критичен фактор за ефективността е използваната quantization (квантизация) във формат FP8. Ако модел с 35 милиарда параметъра се зареди в стандартна 16-битова точност (FP16), той би изисквал над 70 GB видео памет (VRAM) само за съхранение на теглата. Това е обем, който надхвърля възможностите на повечето единични графични карти за работни станции.

Използването на 8-битова (FP8) квантизация намалява този отпечатък наполовина – до около 38 GB. Това позволява на модела да се побере комфортно в паметта на работни станции от висок клас, оставяйки достатъчно свободна VRAM за поддържането на масивен KV кеш (Key-Value cache), необходим за обработката на заявки с дължина до 262K токена.

Интеграция и скрити функции за разработчици

Удобството при интеграцията е забележително. Разработчиците могат просто да подменят базовия URL адрес и API ключа в своя съществуващ Python код, използващ стандартния OpenAI SDK:

from openai import OpenAI

# Инициализиране на клиента с Hetzner API
client = OpenAI(
    base_url="https://inference.hetzner.com/api/v1",
    api_key="hetzner-experimental" # Ключът е произволен по време на експерименталната фаза
)

response = client.chat.completions.create(
    model="Qwen/Qwen3.6-35B-A3B-FP8",
    messages=[{"role": "user", "content": "Обясни в детайли MoE архитектурата."}],
)
print(response.choices[0].message.content)

В допълнение, технологичната общност бързо откри недокументиран параметър enable_thinking. Чрез подаване на този флаг в конфигурационното поле extra_body, потребителите могат ръчно да включват или изключват генерирането на така наречените "разсъждаващи" (reasoning) токени. Тази гъвкавост предоставя ценен контрол върху процеса на генерация, позволявайки фина настройка според специфичните нужди на приложението.

Бенчмарк резултати и производителност

Резултатите от първоначалните тестове на производителността са повече от обещаващи. Според ранни бенчмаркове, медианното време за първи токен (TTFT - Time To First Token) възлиза на впечатляващите 153 милисекунди. Още по-забележителна е скоростта на генериране, която достига стабилни нива от около 224 изходни токена в секунда. Тази скорост е конкурентна на утвърдени специализирани доставчици на AI услуги, което доказва, че хардуерната конфигурация и софтуерната оптимизация на Hetzner работят в перфектен синхрон.

Икономика на мащаба и GPU мултиплексиране

Пазарът на LLM inference все повече се превръща в стока (commodity), при която маржовете се свиват, а ценовата ефективност става основен диференциатор. Тук изпъква стратегическото предимство на Hetzner. Компанията дължи успеха си на брутална ефективност при закупуването, оперирането и поддръжката на хардуер.

Модели на GPU използване
Изображение: Svetni.me / Авторско изображение

Чрез въвеждането на споделен API, Hetzner реализира концепцията за "GPU мултиплексиране" (GPU multiplexing). В традиционния модел, ако организация наеме нает gpu сървър (bare-metal dedicated server), тя плаща за хардуера 24/7, дори когато той бездейства между заявките. В контраст, споделената Inference архитектура позволява на Hetzner да обедини своите сървъри в единен изчислителен клъстер. Те разпределят разходите за обслужване сред хиляди паралелни API заявки от различни потребители, поддържайки хардуерната утилизация близо до 100%. Тази ефективност потенциално би позволила на Hetzner да предложи едни от най-ниските цени на токен в индустрията, когато услугата премине в платена фаза.

Хардуерен анализ и бъдещи предизвикателства

Въпреки оптимистичния старт, анализът на хардуерния капацитет разкрива ключови предизвикателства. Към момента публичното портфолио на Hetzner е фокусирано върху графични карти от клас работни станции. Примери за това са RTX 4000 SFF Ada с 20 GB памет и мощната RTX PRO 6000 Blackwell Max-Q с 96 GB памет. Тези карти са перфектно позиционирани за обслужване на ефективни модели като 35-милиардния Qwen с FP8 квантизация.

Проблемът възниква, когато се разгледат нуждите на масивните "frontier" модели. За да се обслужва модел от ранга на GLM-5, който разполага със зашеметяващите 754 милиарда параметъра, са необходими специализирани сървърни клъстери, базирани на карти от най-висок клас като NVIDIA B200 или B300. Отвъд самите карти, тези масивни модели изискват високоскоростни връзки за комуникация между възлите (high-bandwidth interconnections), като NVLink или InfiniBand, с каквито графичните карти за работни станции не разполагат.

Това поставя Hetzner пред сериозен стратегически избор: дали да продължат да доминират нишата на високоефективните, средни по размер модели, където тяхното ценово предимство е ненадминато, или да направят масивни капиталови инвестиции в сървърни GPU клъстери от най-висок клас. Независимо от пътя, който изберат, този експериментален API демонстрира категорично, че традиционните инфраструктурни играчи бързо се адаптират към новата реалност на AI революцията.

Източници:

  • Sliplane. (2026). Hetzner Inference API First Look. [Блог публикация: sliplane.io/blog/hetzner-inference].