Големи езикови модели (Large Language Models)
Големите езикови модели (Large Language Models - LLM) представляват архитектури за изкуствен интелект, обучени върху огромни обеми текстови и мултимодални масиви. Базирани предимно на невронни мрежи от тип Transformer, те притежават способността да обработват, генерират и разсъждават върху текст, машинен код и структурирана информация.
Основни принципи на развитие
- Параметри и мащаб: Моделите варират от компактни дестилирани версии до гигантски системи с трилиони параметри, използващи смесица от експерти (Mixture-of-Experts).
- Обучение чрез подкрепление: За привеждане в съответствие с човешките инструкции и решаване на сложни логически задачи се прилага интензивно обучение чрез подкрепление (RL).
- Дихотомия на достъпа: Екосистемата се развива паралелно между водещи комерсиални проприетарни API платформи и модели с отворени тегла (Open Source), даващи пълна независимост на изследователите и бизнеса.