This survey reviews systems for efficient large language model training on distributed infrastructure. It covers accelerators, networks, storage, scheduling, parallelism, computation, communication, memory optimization, and reliability during long training runs.
Jiangfei Duan, Shuo Zhang, Zerui Wang, Lijuan Jiang, Wenwen Qu, Qinghao Hu, Guoteng Wang, Qizhen Weng, Hang Yan, Xingcheng Zhang, Xipeng Qiu, Dahua Lin, Yonggang Wen, Xin Jin, Tianwei Zhang, Peng Sun