vLLM
vLLM е популярна библиотека с отворен код за високопроизводително и икономично обслужване (serving) на големи езикови модели (LLMs). Разработена първоначално в UC Berkeley, тя е известна с внедряването на технологията PagedAttention, която оптимизира управлението на KV Cache в графичната памет (VRAM), предотвратявайки фрагментацията и подобрявайки пропускателната способност на системите.
Споменавания в статии
- Зловредният код PoeLLM атакува открити Ollama и vLLM сървъри за копаене на криптовалута
- AI суверенитет: преговори с технологичните гиганти и обещанието на цялостния отворен стек
- Подобряване на скоростта и цената при Qwen3-TTS: Оптимизациите на Nari Labs
- Защо отвореният код е от съществено значение за изкуствения интелект
- Локално обслужване на LLM в Netflix: Архитектура, предизвикателства и решения
- Пълно компресиране на контекст в голям мащаб: Новата ера на LCLM