本地大模型显存估算整理
实践 所思 AI|本地LLM|模型部署整理本地部署大模型时权重、KV Cache、上下文长度与显存占用之间的关系。
为什么要单独算显存
模型参数量只是第一步,真正部署时还要考虑量化方式、上下文长度、KV Cache 和运行时开销。
一个简单的估算框架
先估算权重,再估算 KV Cache,最后给运行时留下余量。不同推理框架的占用会有所差异,因此最终仍应以实测为准。
还需要补充的内容
后续把不同量化方式下的实测数据补进来,并区分 llama.cpp、vLLM 等不同运行方式。