ARTICLE · INTELLIGENCE

战地情报 · 详情页

来自尧图项目组的一线实战观察与深度解析

8G 显存能跑什么大模型?把量化等级、显存账和 CPU 卸载一次讲清

8G 显存能跑什么大模型?把量化等级、显存账和 CPU 卸载一次讲清 手里是 8G 显存的卡想本地跑大模型第一个问题几乎都一样到底能跑多大先把结论放前面8G 显存不是不能跑是必须选对量化等级并且把「上下文长度」当成一种要花显存的资源来管。只盯着参数量一定会踩坑。## 一、先把显存账算清楚钱花在哪三处本地推理的显存占用永远是这三块相加模型权重 KV Cache 运行时开销。1. 模型权重权重显存 ≈ 参数量 × 每个参数的字节数。FP16 每参数约 2 字节7B 就要 14~16GBQ8_0 约 1 字节7B 约 7~8GBQ4_K_M 约 0.6 字节7B 约 4.5~5GB。同一张 8G 卡有人说能跑 7B、有人说只能跑 3B差的就是量化等级。2. KV Cache随上下文长度线性增长。最容易被忽略很多人把 7B 的 Q4 权重塞进去约 5GB以为还剩 3GB 很宽裕然后把上下文开到 32KKV Cache 直接吃掉 1~2GB 以上再叠加桌面占用就开始爆。3. 运行时开销推理框架、CUDA 上下文、碎片通常要留 0.5~1GB。不留就会在「刚好放得下」的时候随机 OOM。## 二、8G 卡的实用舒适区更实用的表述是8G 卡上7B 级 Q4 量化 8K~16K 上下文是能长期稳定跑的区间。14B 的 Q4 权重约 8.5GB已经超过显存本身必须靠 CPU 卸载速度会明显掉。## 三、显存不够时的四个确定性手段按「收益 / 代价」排序1. 降量化等级Q8_0 转 Q4_K_M权重显存大致砍掉一半质量损失通常可接受。2. 砍上下文长度把 num_ctx 从 32K 降到 8KKV Cache 立刻按比例下降。3. KV Cache 量化把 KV 自身也量化成 Q8能再省一截。4. 部分层卸载到 CPU用速度换显存注意内存带宽会变成新瓶颈。调参顺序建议先砍上下文 → 再降量化 → 最后才 offload。前三步都是无损或近无损地省显存offload 才会真正掉速度。## 四、买卡前先回答这 4 个问题1. 用途是什么只做对话、写作、代码补全8G 够用别加预算。2. 要不要长上下文 / 多模态 / 批量并发只要有一个要直接跳过 8G看 16G 起。3. 是笔记本卡还是桌面卡笔记本的 8G 还要受整机功耗与散热限制。4. 跑的是不是「必须本地」的活数据敏感性没到必须隔离的程度云端 API 通常更省事。## 自查清单- 目标模型参数量 × 量化字节数是否小于「显存 − 1GB」- 上下文设为多少对应的 KV Cache 占用是否估算过- 是否给运行时留了 0.5~1GB- 显存不够时是否按「砍上下文 → 降量化 → offload」的顺序调- 是否真的需要 8G 以上还是只是被「参数量越大越好」带偏了显存管理本质上是一道减法题先明确你必须保住什么质量、上下文、速度剩下的才是可以省的部分。
RELATED READING

延伸阅读

更多一线实战笔记与深度复盘,助您持续精进