Подравняване на модели (Model Alignment)

Подравняването на модели (Model Alignment) е процесът по осигуряване, че целите, поведението и резултатите на изкуствения интелект съответстват на човешките ценности и намерения.

То включва техники за предотвратяване на измами, премахване на вредни инструкции и запазване на кооперативно поведение при автономни агенти.

Споменавания в статии