用 2080 Ti 跑本地大模型的实践
我有一块 2080 Ti,11G 显存。在本地跑大模型这件事上,这个配置很微妙:能跑,但每一分显存都要精打细算。这篇文章记录我用下来的真实体验和取舍。
先明确边界
11G 显存意味着什么?直接说结论:
- 7B 模型,Q4 量化,可以舒服地跑,上下文窗口开大一点也能接受
- 13B 模型,Q4 量化,勉强,生成速度会明显下降,上下文稍长就显存告急
- 更大的模型,基本告别本地推理,只能走 API
这个边界是所有决策的前提。认清它之后,很多纠结就消失了:你不会再幻想本地跑一个 70B,也不会在 7B 和 13B 之间反复横跳,选型标准变得很明确,任务难度决定模型大小。
关于量化的理解
最初我只知道”量化能省显存”,直到显存不够用,才真正去搞懂量化在干什么。
量化本质上是把权重从高精度压到低精度。FP16 到 INT8 是砍一半,再到 INT4 再砍一半。代价是精度损失,收益是显存占用和推理速度。这里有个关键认知:量化损失的精度,在实际任务里往往感知不到,尤其是写代码、总结文本这类任务。真正影响体验的是上下文长度和速度,而不是那一点精度差异。
所以我现在的用法:代码和推理类任务用稍高一点的量化,日常对话和总结用激进一点的量化。显存是硬约束,量化等级就是调节旋钮。
速度感受
7B 模型 Q4 量化下,生成速度大概能到每秒十几到二十几个 token,取决于模型和上下文长度。这个速度是什么概念呢?读起来基本流畅,没有明显的卡顿感,但你能感觉到它在”一个字一个字往外蹦”。
刚开始会觉得慢,用久了反而习惯了,甚至有点喜欢这个节奏:本地模型不会打断你,不会审查你,它就在那儿,随时待命。而且断网也能用,这对我这种喜欢折腾的人来说是刚需。
它改变了什么
有了本地模型之后,我的工作流变了。一些私密的内容、不想过 API 的文本处理,都丢给本地模型。虽然能力比不上云端的大模型,但”数据不出本机”这个属性,在某些场景下是压倒性的优势。
我现在的架构是混合的:日常高强度任务走 API,隐私敏感和实验性质的任务走本地。两条线互不干扰,显存占用我自己心里有数。
最后给同样用 2080 Ti 的朋友一个建议:别追求大,追求合适。7B 的本地模型,配合好的提示词和工具链,能覆盖你 80% 的需求。剩下的 20%,交给云端,不丢人。