LOCAL AI COMPATIBILITY

让模型,找到合适的电脑

从具体模型与运行条件出发,把理论估算和真实实测分开看。

分享我的实测

设置运行条件

量化文件、框架版本与驱动会影响实际占用。vLLM 的 KV 预分配可能高于估算;MLX 使用对应格式转换权重。

ESTIMATED MEMORY

DeepSeek-R1-Distill-Llama-8B · Q4_K_M

理论估算
6.2 GiB预计模型运行占用
模型权重(含量化元数据)4.2 GiB
KV Cache(FP16)1.0 GiB
框架与运行开销1.0 GiB

设备可用量另减:统一内存至少 4 GiB 或 15%,显存至少 1 GiB 或 8%。估算日期:2026-09-07

设备匹配结果

4 组配置

Mac mini M4

24 GB 统一内存 · DeepSeek-R1-Distill-Llama-8B · Q4_K_M · 8K
尚未验证
理论占用6.2 GiB
扣除系统余量后20.0 GiB 可用
实测速度暂无足够实测

理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。

依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发

Mac mini M4 Pro

64 GB 统一内存 · DeepSeek-R1-Distill-Llama-8B · Q4_K_M · 8K
尚未验证
理论占用6.2 GiB
扣除系统余量后54.4 GiB 可用
实测速度暂无足够实测

理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。

依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发

GeForce RTX 4090

24 GB 显存 · DeepSeek-R1-Distill-Llama-8B · Q4_K_M · 8K
尚未验证
理论占用6.2 GiB
扣除系统余量后22.1 GiB 可用
实测速度暂无足够实测

理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。

依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发

GeForce RTX 5090

32 GB 显存 · DeepSeek-R1-Distill-Llama-8B · Q4_K_M · 8K
尚未验证
理论占用6.2 GiB
扣除系统余量后29.4 GiB 可用
实测速度暂无足够实测

理论上可完整容纳;实际速度、稳定性与长上下文表现需在该设备上验证。

依据:具体架构参数 + 权重、KV Cache 与运行开销公式 · 1 用户并发
查看估算方法与适用范围

权重 = 参数量 × 位数 ÷ 8;低位量化额外计入 12% 元数据。KV Cache = 2 × 层数 × KV 头数 × head dimension × 上下文 × 并发 × 2 字节。框架开销取权重的 10%(vLLM 为 18%),最低 1 GiB。

这里使用 FP16 KV Cache,不假定缓存量化。所有结果只适用于推理,不适用于训练。MLX / vLLM 对模型、格式及驱动的支持应以对应版本文档为准。暂不假定多卡显存可以直接相加。

查看模型架构来源