Publications

Jet-Long: Efficient Long-Context Extension with Dynamic Bifocal RoPE.
Zeppelin: Balancing Variable-length Workloads in Data Parallel Large Model Training.
Scaling Large Vision-Language Model RL Training via Efficient Load Balancing.
Semantic-Aware Scheduling for GPU Clusters with Large Language Models.
RL in the Wild: Characterizing RLVR Training in LLM Deployment.
PackMamba: Efficient Processing of Variable-Length Sequences in Mamba Training.
Efficient Training of Large Language Models on Distributed Infrastructures: A Survey.
SchedMate: Large Language Models are DL Scheduling Enhancers.
Characterization of Large Language Model Development in the Datacenter.