Обучение чрез подкрепление (Reinforcement Learning)
Обучението чрез подкрепление (Reinforcement Learning - RL) е дял от машинното обучение, при който интелигентен агент се учи да взема решения чрез взаимодействие със среда. Агентът получава награди или наказания за своите действия, като целта е да максимизира кумулативната награда с течение на времето. В контекста на езиковите модели, RL се използва за фина настройка на поведението (напр. чрез RLHF) или за обучение на специализирани модели като „проводници“ (conductors), които се учат да координират други модели.
Споменавания в статии
- Xiaomi оглави отворените модели с MiMo-V2.6-Pro на фона на спор с Anthropic
- От асистиращ към нативен изкуствен интелект: Тим О'Райли за новата операционна система на предприятието
- Роякът от агенти на OpenAI и хакът на Hugging Face: Разбор на ситуацията
- GenPage: Netflix Заменя Традиционните Препоръчителни Системи с Генеративен Изкуствен Интелект
- Qwen-AgentWorld: Alibaba представи първите езикови световни модели за захранване на ИИ агенти
- Рискът, който никой не моделира: ИИ измества експертите, от които трябва да се учи
- Sakana AI обучи 7B модел да управлява GPT-5, Claude 4 и Gemini 2.5