LOCAL AI COMPATIBILITY

让模型,找到合适的电脑

从具体模型与运行条件出发,把理论估算和真实实测分开看。

分享我的实测

设置运行条件

量化文件、框架版本与驱动会影响实际占用。vLLM 的 KV 预分配可能高于估算;MLX 使用对应格式转换权重。

这台设备可以尝试的模型

4 组配置

Qwen3-8B

32 GB 显存 · Qwen3-8B · Q4_K_M · 8K
尚未验证
理论占用6.3 GiB
扣除系统余量后29.4 GiB 可用
实测速度暂无足够实测

理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。

依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发

Qwen3-14B

32 GB 显存 · Qwen3-14B · Q4_K_M · 8K
尚未验证
理论占用10.0 GiB
扣除系统余量后29.4 GiB 可用
实测速度暂无足够实测

理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。

依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发

Qwen3-32B

32 GB 显存 · Qwen3-32B · Q4_K_M · 8K
尚未验证
理论占用20.8 GiB
扣除系统余量后29.4 GiB 可用
实测速度暂无足够实测

理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。

依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发

DeepSeek-R1-Distill-Llama-8B

32 GB 显存 · DeepSeek-R1-Distill-Llama-8B · Q4_K_M · 8K
尚未验证
理论占用6.2 GiB
扣除系统余量后29.4 GiB 可用
实测速度暂无足够实测

理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。

依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发
查看估算方法与适用范围

权重 = 参数量 × 位数 ÷ 8;低位量化额外计入 12% 元数据。KV Cache = 2 × 层数 × KV 头数 × head dimension × 上下文 × 并发 × 2 字节。框架开销取权重的 10%(vLLM 为 18%),最低 1 GiB。

这里使用 FP16 KV Cache,不假定缓存量化。所有结果只适用于推理,不适用于训练。MLX / vLLM 对模型、格式及驱动的支持应以对应版本文档为准。暂不假定多卡显存可以直接相加。

查看模型架构来源