Подравняване на изкуствения интелект (AI Alignment)
Подравняването на изкуствения интелект (AI Alignment) е научно изследователско направление, насочено към гарантиране, че целите, поведението и моралните критерии на AI системите съответстват напълно на човешките ценности и намерения.
То включва техники за обучение с подсилване от човешка обратна връзка (RLHF), конституционен AI, автоматизирано червено отборно тестване и разработване на математически защитни бариери.