QianDong Pi
Results
1
issues of
QianDong Pi
将基于lora训练后的模型量化后,使用Python Binding的方式将模型封装部署,随着请求数量(数据量万级)的增加,GPU显存为不断增加,有什么好的方式释放显存呢?