QianDong Pi

Results 1 issues of QianDong Pi

将基于lora训练后的模型量化后,使用Python Binding的方式将模型封装部署,随着请求数量(数据量万级)的增加,GPU显存为不断增加,有什么好的方式释放显存呢?