GRPO
GRPO (Group Relative Policy Optimization) е алгоритъм за обучение с подсилване (reinforcement learning), използван за фини настройки на големи езикови модели и генеративни системи. Алгоритъмът оптимизира стратегиите за генериране чрез сравнителна оценка на групи от възможни резултати, което подобрява стабилността на обучението и намалява отклоненията. В контекста на препоръчителните системи като GenPage, варианти на GRPO се използват за оптимизиране на дългосрочната потребителска ангажираност и стойността на цялата страница.