AI 问答库
一句话回答
先按显存倒推,其他都次要。经验公式:权重显存 ≈ 参数量 × 每参数字节数 × 1.2(FP16 每参数约 2 字节,INT4 约 0.5),再留出随并发与上下文长度增长的 KV cache。所以 70B 稠密模型 FP16 下需 150GB 级显存,必须多卡;INT4 量化后可压到 40GB 级。CPU 纯推理能跑,但只适合单人低频。
下表按 2026 年 8 月常见开源推理栈的经验值给出,只算权重显存,不含 KV cache,用于选型初筛。真正的选型必须按你的目标并发数与上下文长度实测 —— 在 128K 长上下文、高并发场景下,KV cache 可能超过权重本身。
| 模型规模 | FP16 权重显存(约) | INT4 量化后(约) | 典型单机配置 | 适合场景 |
|---|---|---|---|---|
| 7B–8B(Llama 4 与 Qwen 3.x 的小尺寸线) | 约 16 GB | 约 6 GB | 单张 24GB 消费级或专业卡 | 部门试点、文档摘要、轻量 RAG |
| 14B–32B(Qwen 3.x 中尺寸、GLM-5.x 蒸馏线) | 约 32–70 GB | 约 10–20 GB | 1–2 张 48GB 专业卡 | 企业级 RAG、客服辅助、结构化抽取 |
| 70B 稠密(Llama 4 稠密线及同级) | 约 150 GB | 约 40 GB | 4–8 卡整机,单卡 48–80GB | 全公司主力推理、代码助手、复杂推理任务 |
| 千亿级 MoE(DeepSeek V4、GLM-5.x 满血线) | 数百 GB 至 TB 级 | 仍需数百 GB | 多机多卡集群 + 高速互联 | 对外高并发业务、多业务线共用平台 |
分两部分。权重部分:参数量 × 每参数字节数,再乘约 1.2 的余量给激活值和框架开销。FP16 每参数 2 字节、INT8 约 1 字节、INT4 约 0.5 字节。举例:32B 模型 FP16 约 32×2×1.2 ≈ 77GB,INT4 约 32×0.5×1.2 ≈ 19GB。KV cache 部分:随「并发请求数 × 上下文 token 数」线性增长,长上下文或高并发时这块能轻松超过权重。实践做法是先按权重选卡,再把预留的 KV cache 空间当作并发上限的调节旋钮 —— 显存不够时优先降并发或降上下文,而不是换更小的模型。
系统内存建议不低于总显存,加载权重时要过内存。存储用 NVMe,单个模型文件几十到几百 GB,加上向量库、嵌入模型和一份可回滚的旧权重,1–2TB 是起步。多卡机要看卡间互联带宽 —— 同样 8 张卡,走 PCIe 还是走高速片间互联,长上下文下的吞吐差距明显。供电与散热常被低估:多卡整机满载数千瓦,普通办公机柜往往撑不住,机房改造要提前排期。最后是网络:RAG 场景里模型只是一环,向量库、文档服务、鉴权网关都要一起规划,别把机器买回来才发现没地方放数据库。
适用边界
同义问法