Бенчмаркове за оценка на AI агенти (Agent Benchmarks)
Бенчмарковете за AI агенти са стандартизирани тестови среди, измерващи способността на автономните системи да планират, разсъждават, използват инструменти и постигат сложни цели в реални или симулирани софтуерни среди.
Еволюция от статични тестове
- Преход от текстови въпроси към интерактивни среди: Тестване в реални операционни системи, браузъри и конзоли.
- Измерване на устойчивостта на грешки: Способност на агента да се самокоригира при получаване на грешка от компилатор или API.
- Метрики за ефективност: Измерване не само на успеха, но и на броя изразходвани токени и време за изпълнение.