Обучение чрез подкрепление (Reinforcement Learning)
Обучението чрез подкрепление (Reinforcement Learning - RL) е дял от машинното обучение, при който интелигентен агент се учи да взема решения чрез взаимодействие със среда. Агентът получава награди или наказания за своите действия, като целта е да максимизира кумулативната награда с течение на времето. В контекста на езиковите модели, RL се използва за фина настройка на поведението (напр. чрез RLHF) или за обучение на специализирани модели като „проводници“ (conductors), които се учат да координират други модели.
Споменавания в статии
- GenPage: Netflix Заменя Традиционните Препоръчителни Системи с Генеративен Изкуствен Интелект
- Qwen-AgentWorld: Alibaba представи първите езикови световни модели за захранване на ИИ агенти
- Рискът, който никой не моделира: ИИ измества експертите, от които трябва да се учи
- Sakana AI обучи 7B модел да управлява GPT-5, Claude 4 и Gemini 2.5