LOCAL AI COMPATIBILITY
让模型,找到合适的电脑。
从具体模型与运行条件出发,把理论估算和真实实测分开看。
设置运行条件
量化文件、框架版本与驱动会影响实际占用。vLLM 的 KV 预分配可能高于估算;MLX 使用对应格式转换权重。
这台设备可以尝试的模型
4 组配置Qwen3-8B
24 GB 显存 · Qwen3-8B · Q4_K_M · 8K理论占用6.3 GiB
扣除系统余量后22.1 GiB 可用
实测速度暂无足够实测
理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。
依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发
Qwen3-14B
24 GB 显存 · Qwen3-14B · Q4_K_M · 8K理论占用10.0 GiB
扣除系统余量后22.1 GiB 可用
实测速度暂无足够实测
理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。
依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发
Qwen3-32B
24 GB 显存 · Qwen3-32B · Q4_K_M · 8K理论占用20.8 GiB
扣除系统余量后22.1 GiB 可用
实测速度暂无足够实测
理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。
依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发
DeepSeek-R1-Distill-Llama-8B
24 GB 显存 · DeepSeek-R1-Distill-Llama-8B · Q4_K_M · 8K理论占用6.2 GiB
扣除系统余量后22.1 GiB 可用
实测速度暂无足够实测
理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。
依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发
查看估算方法与适用范围
权重 = 参数量 × 位数 ÷ 8;低位量化额外计入 12% 元数据。KV Cache = 2 × 层数 × KV 头数 × head dimension × 上下文 × 并发 × 2 字节。框架开销取权重的 10%(vLLM 为 18%),最低 1 GiB。
这里使用 FP16 KV Cache,不假定缓存量化。所有结果只适用于推理,不适用于训练。MLX / vLLM 对模型、格式及驱动的支持应以对应版本文档为准。暂不假定多卡显存可以直接相加。
查看模型架构来源