本地大模型显存估算整理

整理本地部署大模型时权重、KV Cache、上下文长度与显存占用之间的关系。

为什么要单独算显存

模型参数量只是第一步,真正部署时还要考虑量化方式、上下文长度、KV Cache 和运行时开销。

一个简单的估算框架

先估算权重,再估算 KV Cache,最后给运行时留下余量。不同推理框架的占用会有所差异,因此最终仍应以实测为准。

还需要补充的内容

后续把不同量化方式下的实测数据补进来,并区分 llama.cpp、vLLM 等不同运行方式。

相关主题