8G 显存能跑什么大模型?把量化等级、显存账和 CPU 卸载一次讲清

手里是 8G 显存的卡,想本地跑大模型 ,第一个问题几乎都一样:到底能跑多大?
先把结论放前面:8G 显存不是不能跑,是必须选对量化等级,并且把「上下文长度 」当成一种要花显存的资源来管。只盯着参数量,一定会踩坑。## 一、先把显存账算清楚:钱花在哪三处本地推理的显存占用,永远是这三块相加:模型权重 + KV Cache + 运行时开销。1. 模型权重:权重显存 ≈ 参数量 × 每个参数的字节数。FP16 每参数约 2 字节,7B 就要 14~16GB;Q8_0 约 1 字节,7B 约 7~8GB;Q4_K_M 约 0.6 字节,7B 约 4.5~5GB。同一张 8G 卡,有人说能跑 7B、有人说只能跑 3B,差的就是量化等级。2. KV Cache:随上下文长度线性增长。最容易被忽略:很多人把 7B 的 Q4 权重塞进去(约 5GB),以为还剩 3GB 很宽裕,然后把上下文开到 32K,KV Cache 直接吃掉 1~2GB 以上,再叠加桌面占用,就开始爆。3. 运行时开销:推理框架、CUDA 上下文、碎片,通常要留 0.5~1GB。不留,就会在「刚好放得下」的时候随机 OOM。## 二、8G 卡的实用舒适区更实用的表述是:8G 卡上,7B 级 + Q4 量化 + 8K~16K 上下文,是能长期稳定跑的区间。14B 的 Q4 权重约 8.5GB,已经超过显存本身,必须靠 CPU 卸载,速度会明显掉。## 三、显存不够时的四个确定性手段按「收益 / 代价」排序:1. 降量化等级:Q8_0 转 Q4_K_M,权重显存大致砍掉一半,质量损失通常可接受。2. 砍上下文长度:把 num_ctx 从 32K 降到 8K,KV Cache 立刻按比例下降。3. KV Cache 量化:把 KV 自身也量化成 Q8,能再省一截。4. 部分层卸载到 CPU:用速度换显存,注意内存带宽会变成新瓶颈。调参顺序建议:先砍上下文 → 再降量化 → 最后才 offload。前三步都是无损或近无损地省显存,offload 才会真正掉速度。## 四、买卡前先回答这 4 个问题1. 用途是什么?只做对话、写作、代码补全 ,8G 够用,别加预算。2. 要不要长上下文 / 多模态 / 批量并发?只要有一个要,直接跳过 8G,看 16G 起。3. 是笔记本卡还是桌面卡?笔记本的 8G 还要受整机功耗与散热限制。4. 跑的是不是「必须本地」的活?数据敏感性没到必须隔离的程度,云端 API 通常更省事。## 自查清单- 目标模型参数量 × 量化字节数,是否小于「显存 − 1GB」?- 上下文设为多少?对应的 KV Cache 占用是否估算过?- 是否给运行时留了 0.5~1GB?- 显存不够时,是否按「砍上下文 → 降量化 → offload」的顺序调?- 是否真的需要 8G 以上?还是只是被「参数量越大越好」带偏了?显存管理本质上是一道减法题:先明确你必须保住什么(质量、上下文、速度),剩下的才是可以省的部分。
————————————————
版权声明:本文为CSDN博主「信可维」的原创文章,遵循CC 4.0 BY-SA版权协议,转载请附上原文出处链接及本声明。
原文链接:https://blog.csdn.net/2601_96557149/article/details/166725737

上一篇 跨网文件摆渡
下一篇 Windows10 桌面运维常见故障及解决办法