Kapa.ai представи Company Knowledge Bench: Стандарт за оценка на корпоративни RAG системи

Снимка: Kapa.ai Engineering
Водещата платформа за техническа поддръжка и документационни асистенти Kapa.ai представи „Company Knowledge Bench“ (CKB) – първия стандартизиран независим бенчмарк за стриктна оценка на системи за търсене с обогатено извличане (RAG) в реална корпоративна среда [1].
Инициативата адресира най-болезнения проблем на съвременните корпоративни чатботове: склонността на векторните бази данни да извличат остаряла информация и уверено да цитират отпаднали софтуерни версии и противоречиви инструкции от фирмената документация.
Анатомия на корпоративното объркване: Къде се проваля класическият RAG
Повечето съществуващи стандарти за оценка (benchmarking) тестват RAG системи върху статични енциклопедични текстове (като Wikipedia), където фактите рядко се променят драматично от ден на ден. В реалния софтуерен бизнес обаче документите непрекъснато еволюират:
- Времева деградация (Temporal Decay): Когато една компания пусне версия 3.0 на своето API, старата документация за версия 1.0 продължава да съществува в хранилищата. Обикновеното семантично търсене често извлича старата инструкция само защото тя съвпада по ключови думи с въпроса на потребителя.
- Противоречиви източници на истина: Разминавания между официалните ръководства, разговорите в Slack и бележките по поддръжката често объркват езиковите модели.
- Многостъпково извличане (Multi-hop Reasoning): За да отговори правилно на сложен клиентски казус, системата често трябва да съпостави информация от три различни файла – архитектурна схема, ценова листа и споразумение за ниво на обслужване (SLA).
„Досега всеки доставчик на векторни бази твърдеше, че неговият алгоритъм има 99% точност, защото тестваха върху елементарни въпроси. CKB е първият безмилостен тест, който симулира реалния хаос в корпоративната документация,“ заяви техническият директор на Kapa.ai [1].
Резултати от бенчмарка: Провал на чисто векторното търсене
Публикуваните първоначални резултати върху 50 000 реални инженерни казуса разкриват изненадващи изводи:
- Чистото векторно търсене е недостатъчно: Традиционните алгоритми за косинусово сходство (dense embeddings) постигат едва 42% точност при въпроси, изискващи разграничаване на остарели API версии.
- Триумф на хибридното търсене: Системите, комбиниращи класическо търсене по ключови думи (BM25) с плътни вектори и повторно класиране (re-ranking) с крос-енкодери, подобряват точността с над 34%.
- Възходът на граф-базирания RAG: Най-високи резултати постигат архитектури, използващи графове на знанието (Knowledge Graphs), които експлицитно моделират връзките между софтуерните компоненти и техния жизнен цикъл.
Стратегически препоръки за бизнеса
Появата на CKB задава нова дефиниция за зрялост в корпоративния AI. Ерата на наивните POC (proof-of-concept) демонстрации приключи. Компаниите вече разполагат с количествен инструмент, чрез който да изискват гаранции от доставчиците на бази данни и да интегрират автоматизирани тестове за регресия в своите софтуерни конвейери.
В свят, в който грешна инструкция в поддръжката може да причини милионни загуби на корпоративни клиенти, прецизното извличане на знание се превръща в критичен актив за сигурността и репутацията на технологичния бизнес.

Инфографика: Методология на тестване и сравнителни резултати при различните RAG архитектури според Kapa.ai CKB