LOCAL AI COMPATIBILITY
让模型,找到合适的电脑。
从具体模型与运行条件出发,把理论估算和真实实测分开看。
设置运行条件
量化文件、框架版本与驱动会影响实际占用。vLLM 的 KV 预分配可能高于估算;MLX 使用对应格式转换权重。
ESTIMATED MEMORY
理论估算Qwen3-8B · Q4_K_M
6.3 GiB预计模型运行占用
模型权重(含量化元数据)4.3 GiB
KV Cache(FP16)1.0 GiB
框架与运行开销1.0 GiB
设备可用量另减:统一内存至少 4 GiB 或 15%,显存至少 1 GiB 或 8%。估算日期:2026-09-07。
设备匹配结果
4 组配置Mac mini M4
24 GB 统一内存 · Qwen3-8B · Q4_K_M · 8K理论占用6.3 GiB
扣除系统余量后20.0 GiB 可用
实测速度暂无足够实测
理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。
依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发
Mac mini M4 Pro
64 GB 统一内存 · Qwen3-8B · Q4_K_M · 8K理论占用6.3 GiB
扣除系统余量后54.4 GiB 可用
实测速度暂无足够实测
理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。
依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发
GeForce RTX 4090
24 GB 显存 · Qwen3-8B · Q4_K_M · 8K理论占用6.3 GiB
扣除系统余量后22.1 GiB 可用
实测速度暂无足够实测
理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。
依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发
GeForce RTX 5090
32 GB 显存 · Qwen3-8B · Q4_K_M · 8K理论占用6.3 GiB
扣除系统余量后29.4 GiB 可用
实测速度暂无足够实测
理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。
依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发
查看估算方法与适用范围
权重 = 参数量 × 位数 ÷ 8;低位量化额外计入 12% 元数据。KV Cache = 2 × 层数 × KV 头数 × head dimension × 上下文 × 并发 × 2 字节。框架开销取权重的 10%(vLLM 为 18%),最低 1 GiB。
这里使用 FP16 KV Cache,不假定缓存量化。所有结果只适用于推理,不适用于训练。MLX / vLLM 对模型、格式及驱动的支持应以对应版本文档为准。暂不假定多卡显存可以直接相加。
查看模型架构来源