Скалиране на езикови модели (LLM Scaling)

Скалирането на езикови модели (LLM Scaling) описва емпиричните закони, свързващи изчислителната мощ, обема на данните и броя параметри с точността на невронната мрежа.

В ерата след GPT-4 фокусът на скалирането се измества от предварителното обучение към времето за разсъждение (Test-Time Compute) и агентното търсене.

Споменавания в статии