Подравняване на изкуствения интелект (AI Alignment)

Подравняването на изкуствения интелект (AI Alignment) е научно изследователско направление, насочено към гарантиране, че целите, поведението и моралните критерии на AI системите съответстват напълно на човешките ценности и намерения.

То включва техники за обучение с подсилване от човешка обратна връзка (RLHF), конституционен AI, автоматизирано червено отборно тестване и разработване на математически защитни бариери.

Споменавания в статии