DeepSeek представи DSec: Еластична изчислителна архитектура за мащабиране на разпределено обучение

Снимка: DeepSeek HPC Cluster / arXiv
Иновативната изследователска лаборатория DeepSeek публикува детайлен научен доклад, представящ DSec (DeepSeek Elastic Compute) – революционна архитектура за динамично и отказоустойчиво управление на гигантски GPU клъстери [1]. Разработката решава един от най-скъпите проблеми в съвременното машинно обучение: честите апаратни сривове при продължително обучение на модели с трилиони параметри [1].
При конвенционалните системи за разпределен софтуерен инженеринг дефектът на един-единствен ускорител в клъстер от 50 000 чипа спира целия тренировъчен процес, изисквайки 20 до 30 минути за зареждане на последната контролна точка (checkpoint) [1]. DSec премахва тази неефективност, позволявайки „гореща замяна“ на дефектирали възли за по-малко от секунда, без прекъсване на общите изчисления [1].

Инфографика: Светни.ме
Еластично преконфигуриране на комуникационната топология
В основата на DSec стои динамичен комуникационен протокол, който непрекъснато следи закъсненията в мрежовите комутатори и интелигентно пренасочва потоците от данни между графичните процесори [1]. Системата засича признаци на деградация в паметта с висока пропускателна способност (HBM) и изолира компрометираните платки, преди те да предизвикат срив в ядрото [1].
Това позволява поддържането на рекордна степен на използване на изчислителния капацитет (MFU над 92%), спестявайки милиони долари от изхабена електроенергия и празен ход на сървърите [1].
Технологичен суверенитет и достъпност на ресурсите
Публикуването на DSec затвърждава репутацията на DeepSeek като водещ пионер в инфраструктурните иновации [1]. Архитектурата е проектирана да работи успешно и върху разнороден (хетерогенен) хардуер, което има ключово значение за държавите, стремящи се към технологичен суверенитет в условията на глобални експортни ограничения върху най-новите полупроводници [1].
Източници: