Механистична интерпретируемост (Mechanistic Interpretability)

Механистична интерпретируемост (Mechanistic Interpretability) е научно направление в изкуствения интелект, насочено към разгадаване на вътрешната структура и тегла на дълбоките невронни мрежи чрез аналогичен подход на обратно инженерство (reverse engineering). Изследователите използват инструменти като линейни сонди (linear probes), редки автоенкодери (sparse autoencoders) и лещи на логитите (logit lenses), за да изолират конкретни семантични признаци (features) в активационното пространство и да анализират как моделът формира вътрешните си представяния.

Споменавания в статии