SPES Pretrained models for paper "Pretraining A Large Language Model using Distributed GPUs: A Memory-Efficient Decentralized Paradigm" zjr2000/SPES-9B Text Generation • 9B • Updated May 6 • 10 zjr2000/SPES-7B Text Generation • 7B • Updated May 6 • 8 zjr2000/SPES-2B Text Generation • 2B • Updated May 6 • 10
SPES Pretrained models for paper "Pretraining A Large Language Model using Distributed GPUs: A Memory-Efficient Decentralized Paradigm" zjr2000/SPES-9B Text Generation • 9B • Updated May 6 • 10 zjr2000/SPES-7B Text Generation • 7B • Updated May 6 • 8 zjr2000/SPES-2B Text Generation • 2B • Updated May 6 • 10