AI 问答库

私有化部署大模型需要什么服务器配置?

一句话回答

先按显存倒推,其他都次要。经验公式:权重显存 ≈ 参数量 × 每参数字节数 × 1.2(FP16 每参数约 2 字节,INT4 约 0.5),再留出随并发与上下文长度增长的 KV cache。所以 70B 稠密模型 FP16 下需 150GB 级显存,必须多卡;INT4 量化后可压到 40GB 级。CPU 纯推理能跑,但只适合单人低频。

关键要点

  • 01显存是唯一硬门槛。CPU 核数、系统内存、硬盘几乎从不是推理瓶颈 —— 装得下就能跑,装不下再快的 CPU 也没用。
  • 02量化是最有效的降本手段。INT8/INT4 能把显存砍到 1/2–1/4,代价是可控的精度损失,但必须用自己的业务评测集验收,不能只看公开榜单。
  • 03MoE 模型(Qwen 3.x、DeepSeek V4、GLM-5.x 的 MoE 线)每次只激活一小部分参数,算得快,但显存要按总参数量准备,不能按激活参数算。
  • 04并发数决定 KV cache,进而决定实际机型。10 人内部试用和 500 人在线是两台完全不同的机器,同一个模型也是。
  • 05还要留出模型之外的资源:向量库、嵌入模型、重排模型、以及至少一份可回滚的旧版本权重,这些加起来往往再占几百 GB 存储。

按模型规模倒推硬件

下表按 2026 年 8 月常见开源推理栈的经验值给出,只算权重显存,不含 KV cache,用于选型初筛。真正的选型必须按你的目标并发数与上下文长度实测 —— 在 128K 长上下文、高并发场景下,KV cache 可能超过权重本身。

模型规模FP16 权重显存(约)INT4 量化后(约)典型单机配置适合场景
7B–8B(Llama 4 与 Qwen 3.x 的小尺寸线)约 16 GB约 6 GB单张 24GB 消费级或专业卡部门试点、文档摘要、轻量 RAG
14B–32B(Qwen 3.x 中尺寸、GLM-5.x 蒸馏线)约 32–70 GB约 10–20 GB1–2 张 48GB 专业卡企业级 RAG、客服辅助、结构化抽取
70B 稠密(Llama 4 稠密线及同级)约 150 GB约 40 GB4–8 卡整机,单卡 48–80GB全公司主力推理、代码助手、复杂推理任务
千亿级 MoE(DeepSeek V4、GLM-5.x 满血线)数百 GB 至 TB 级仍需数百 GB多机多卡集群 + 高速互联对外高并发业务、多业务线共用平台

显存到底怎么算

分两部分。权重部分:参数量 × 每参数字节数,再乘约 1.2 的余量给激活值和框架开销。FP16 每参数 2 字节、INT8 约 1 字节、INT4 约 0.5 字节。举例:32B 模型 FP16 约 32×2×1.2 ≈ 77GB,INT4 约 32×0.5×1.2 ≈ 19GB。KV cache 部分:随「并发请求数 × 上下文 token 数」线性增长,长上下文或高并发时这块能轻松超过权重。实践做法是先按权重选卡,再把预留的 KV cache 空间当作并发上限的调节旋钮 —— 显存不够时优先降并发或降上下文,而不是换更小的模型。

显卡之外还要看什么

系统内存建议不低于总显存,加载权重时要过内存。存储用 NVMe,单个模型文件几十到几百 GB,加上向量库、嵌入模型和一份可回滚的旧权重,1–2TB 是起步。多卡机要看卡间互联带宽 —— 同样 8 张卡,走 PCIe 还是走高速片间互联,长上下文下的吞吐差距明显。供电与散热常被低估:多卡整机满载数千瓦,普通办公机柜往往撑不住,机房改造要提前排期。最后是网络:RAG 场景里模型只是一环,向量库、文档服务、鉴权网关都要一起规划,别把机器买回来才发现没地方放数据库。

适用边界

什么情况下本答案不成立

  • 表中显存为权重估算,不含 KV cache。长上下文(如 128K)与高并发场景下 KV cache 可能超过权重本身,实际选型必须按目标并发与上下文长度实测,不能直接照抄表格。
  • 显存数字随推理框架、量化方案与是否启用分页注意力类优化而变化,本文按 2026 年 8 月常见开源推理栈的经验值给出,仅用于选型初筛。
  • 量化一定会掉点,掉多少取决于任务类型 —— 结构化抽取通常较稳,长链推理与数学题更敏感。必须用自己的业务评测集验收,公开榜单分数不能外推。
  • 国产加速卡与主流 NVIDIA 生态在算子覆盖、推理框架支持与长上下文优化上仍有差异,同样的标称显存不等于同样的可用性能,采购前应要求实机压测。

同义问法

  • 跑 70B 大模型需要多少显存?
  • 本地部署大模型显卡怎么选?
  • 私有化 LLM 服务器配置清单长什么样?
  • 没有 GPU 能跑大模型吗?
  • 大模型推理需要几张卡?
撰写YGG 臻星科技解决方案团队发布2026-08-01最近复核2026-08-01