Архитектура за наблюдаемост в Netflix: граф на знанието и AI агенти при 38 милиона събития в секунда

Публикувано от Svetni.me Editorial на 9 октомври 2026 г.

Архитектура за наблюдаемост в Netflix: граф на знанието и AI агенти при 38 милиона събития в секунда
Снимка: Prasanna Vijayanathan / Renzo Sanchez-Silva / InfoQ / Netflix

В задълбочена техническа презентация за InfoQ инженерите на стрийминг платформата Netflix Прасана Виджаянатан и Ренцо Санчес-Силва разкриха радикалното препроектиране на своята система за наблюдаемост (observability), която обработва астрономическия обем от над 38 милиона събития в секунда [1].

Компанията напълно изостави традиционните статични прагове за алармиране, заменяйки ги с динамичен граф на знанието (knowledge graph) и автономни работни потоци, задвижвани от модели на Claude, които локализират скрити каскадни повреди за секунди [1].

Инфографика за архитектурата за наблюдаемост в Netflix чрез AI агенти
Инфографика: Светни.ме

Провалът на класическия мониторинг при хипермащаб

При архитектура, състояща се от хиляди микроуслуги, работещи върху десетки хиляди облачни инстанции в множество географски региона, класическите методи за мониторинг се оказват безсилни. Когато дадена критична услуга забави отговорите си, това предизвиква лавина от хиляди вторични аларми в свързаните системи, парализирайки дежурните инженери с непосилен шум от известия (alert fatigue).

Инженерите на Netflix осъзнаха, че метриките сами по себе си не носят семантичен смисъл без разбиране на топологичните връзки между услугите, версиите на кода и физическите клъстери.

Оперативната онтология като фундамент за разбиране

Решението е изграждането на цялостна оперативна онтология в графова база от данни. Всеки микросървис, база данни, кеш сървър, gRPC крайна точка и скорошен canary деплоймънт се представят като взаимносвързани възли в графа.

Тази структура се захранва непрекъснато с данни от разпределеното трасиране, позволявайки на системата да визуализира реалния път на потребителския трафик и мигновено да идентифицира в кой възел се е появило първоначалното блокиране.

Дълбок технически анализ: Claude като автономен диагностик в AIOps

Кулминацията на новата архитектура е интеграцията на специализирани AI агенти в рамките на корпоративната парадигма за AIOps. Когато алгоритмите за откриване на аномалии регистрират отклонение, агентът получава контекст от онтологичния граф и автономно стартира серия от целенасочени диагностични заявки.

Моделът извлича съответните трасировки, сравнява грешките в логовете с скорошни промени в Git и формулира структурирано обяснение на първопричината за инцидента. Времето за откриване и локализиране на повреди (MTTD) е намалено с над 60%, доказвайки, че бъдещето на поддръжката на сложни облачни инфраструктури зависи от способността на автономни агенти да навигират семантични графи на знанието.

Източници

[1]: Presentation: Ontology‐Driven Observability: Building the E2E Knowledge Graph at Netflix Scale - InfoQ