数据截至 2026 年 8 月,综合 Hugging Face 模型卡、LMSYS Arena、Open LLM Leaderboard 及多家实测评测整理。

为什么考虑本地部署?
三年前,”本地大模型”基本等于”质量打折”。这个前提在 2026 年已经不成立了:
- 能力差距基本抹平:开源权重模型在推理、代码等主流基准上与 GPT-5、Gemini 3 级别的闭源模型差距已缩小到个位数百分比;在信息抽取、分类、工具调用等任务上几乎零差距。DeepSeek V3.2、GLM-5、5 在部分推理基准上甚至反超 GPT-5。
- 硬件门槛大幅降低:一张 24GB 的消费级显卡(RTX 3090/4090)就能以 4-bit 量化跑 32B 级别模型,吞吐可达 30 tokens/s 左右;Mac Studio(64GB+ 统一内存)可以流畅运行 DeepSeek V4 Flash 这类模型。
- 成本与合规优势:高频调用场景下,自建推理通常几个月内即可收回成本,远低于按 token 计费的 API 开支;医疗、金融等受监管行业还能实现完全离网(air-gapped)部署,数据不出内网。
综合推荐榜(按硬件档位)
旗舰级(多卡 / 服务器级,80GB+ 显存)
| 模型 | 架构 | 亮点数据 | 许可证 | 适合场景 |
| DeepSeek V4 Pro | 1.6T 总参 / 49B 激活 (MoE) | SWE-bench Verified 80.6%,GSM8K 96.0%,LiveCodeBench 93.5%,1M 上下文 | MIT | 数学、科研、复杂推理,本地模型能力天花板 |
| GLM-5.2(智谱) | 稀疏注意力 MoE | GPQA Diamond 91.2%,1M 稳定上下文,IndexShare 注意力使 1M 上下文每 token FLOPs 降低 2.9 倍 | MIT | 长链路 Agent、编码,2026 年多家评测中自托管编码榜第一 |
| Kimi K2.6 / K2.7 Code(月之暗面) | 1T 总参 / 32B 激活 (MoE) | SWE-bench 80.2%,2M 上下文,Agentic 能力最强之一 | Apache 2.0 | 超长文档分析、多步工具调用 Agent |
| Qwen3 235B-A22B | MoE / 22B 激活 | LiveCodeBench 89%,约 132GB 显存 (Q4) | Apache 2.0 | 企业级 Agent 与复杂编码 |
| Llama 4 Scout(Meta) | 109B 总参 / 17B 激活 (MoE) | 10M(千万级)token 上下文,开源模型中最长;原生多模态;Q4 需约 55–64GB | Llama Community | 整个代码库/书籍级语料一次性输入 |


单卡甜点级(24GB 显存,RTX 3090/4090)——多数人的最佳选择
| 模型 | 亮点数据 | 许可证 | 适合场景 |
| Qwen3.5 27B / Qwen3.6 27B(阿里) | MMLU-Pro 86.1%,SWE-bench Verified 最高 77.2%,LiveCodeBench 83.9%,262K 上下文,原生支持文本/视觉/音频、201 种语言,Q4 约 18GB | Apache 2.0 | 2026 年单卡通用首选,多语言能力尤其突出 |
| Gemma 4 31B(Google) | MMLU-Pro 85.2%,LiveCodeBench 80.0%,Codeforces ELO 2150(竞赛编程专家级),支持视觉 + 可开关的思考模式,Q4 约 20GB | Gemma 许可(可商用) | 单卡综合质量与编码兼顾 |
| DeepSeek V4 Flash | 284B 总参 / 13B 激活,Q4 约 24GB,4090 上约 28 tokens/s;推理质量与 V4 Pro 差距在 5% 以内 | MIT | 想要接近旗舰推理能力但只有一张卡 |
| Qwen3 32B | 首创混合思考模式(/think 与 /no_think 切换),36 万亿 token 训练,128K 上下文 | Apache 2.0 | 需要推理深度可控的通用场景 |
轻量级(8–16GB 显存 / 笔记本)
| 模型 | 亮点数据 | 许可证 | 适合场景 |
| Phi-4-reasoning 14B(微软) | AIME 2024 得分 75.3%(reasoning-plus 版 AIME 2025 达 81.3%),超过 70B 级的 DeepSeek-R1,约 9GB 内存 | MIT | 小硬件上的数学/推理怪兽 |
| Gemma 4 12B | MMLU-Pro 77.2%,单位参数效率同级最高,Q4 仅约 6.6GB,128K 上下文 | Gemma 许可 | RTX 3090 以下显卡、日常问答与文档摘要 |
| Mistral Small 3.2 24B / Mistral Nemo 12B | Nemo 12B 在 8GB 显存即可运行,128K 上下文 + 函数调用 | Apache 2.0 | 中端机的长文档处理与本地 Agent |
| Qwen3.5 9B | 本周期 Hugging Face 下载量最大的开源权重模型,量化与微调生态最全 | Apache 2.0 | 笔记本/边缘设备默认选项 |
| gpt-oss-20b(OpenAI) | 21B 参数可装进 16GB 显存,OpenAI 首次放出的开放权重 | Apache 2.0 | 想要”最省心”的生产部署 |
按需求场景怎么选
- 写代码:首选 GLM-5.2(自托管编码榜首)或 Kimi K2.7 Code;单卡场景选 Gemma 4 31B(Codeforces ELO 2150)或 5-Coder 32B(HumanEval 92.9%,依然是开源编码单项冠军之一)。
- 数学 / 硬核推理:DeepSeek V4 Pro(GSM8K 96.0%);小硬件上 Phi-4-reasoning 14B 无出其右。
- 超长上下文:Llama 4 Scout(10M token)一骑绝尘;其次是 Kimi K2.6(2M)和 GLM-5.2 / DeepSeek V4(1M)。
- 多语言(尤其中文):5 系列,中、日、韩、阿语接近母语水平,且工具调用格式与 OpenAI 完全兼容。
- 多模态(视觉/音频):5 27B(文本+视觉+音频三模态)、Qwen3-VL-235B(图表/截图/UI 理解)、Llama 4 Scout(原生图像理解)。
- Agent / 工具调用:GLM-5.2(Tau2-Bench 89.7%)、Kimi K2 系列(长工具链稳定性好)、MiMo-V2-Flash(高吞吐低延迟,适合流水线式 Agent)。
- 8GB 以下的极限场景:Gemma 4 12B、Mistral Nemo 12B、5 9B。
运行工具推荐
| 工具 | 特点 |
| Ollama | 上手最简单,一行命令拉取模型(如 ollama run qwen3.5:27b),自带 OpenAI 兼容接口 |
| LM Studio | Windows/Mac 图形界面,适合不想碰命令行的用户 |
| vLLM | 生产部署吞吐最高,适合团队服务化 |
| llama.cpp | CPU 与低显存环境的最后兜底,GGUF 量化生态的核心 |
量化建议:日常使用选 Q4(4-bit)量化即可,质量损失很小;显存实在不够再退到 Q3,但会有可感知的质量下降。经验法则:所需显存 ≈ 参数量 × 0.6~0.7(Q4 情况下,32B 模型约 20GB)。
快速决策表
| 你的硬件 | 推荐模型 |
| 8GB 显存 | Gemma 4 12B / Mistral Nemo 12B |
| 16GB 显存 | gpt-oss-20b / Phi-4-reasoning 14B |
| 24GB 显存(4090/3090) | Qwen3.5 27B(通用)/ Gemma 4 31B(编码)/ DeepSeek V4 Flash(推理) |
| 64GB 统一内存(Mac Studio) | Llama 4 Scout / DeepSeek V4 Flash |
| 单张 80GB(H100) | gpt-oss-120b / Nemotron 3 Super |
| 多卡 / 192GB+ | DeepSeek V4 Pro / GLM-5.2 / Kimi K2.6 |
一句话总结:2026 年的默认答案是——单卡用户选 Qwen3.5 27B(Apache 2.0、多模态、多语言、生态最全);有服务器资源就上 GLM-5.2(编码/Agent)或 DeepSeek V4 Pro(推理天花板);小设备选 Gemma 4 12B。
实际案例:ThinkPad P16 Gen 1 该跑什么模型?
机器配置:i9-12950HX / 128GB 内存 / RTX A5500 Laptop(16GB 显存,Ampere 架构)。这台机器的特点是”显存中等、内存巨大”——128GB 内存是关键资产,让很多看似跑不动的模型通过 GPU + 内存混合卸载(llama.cpp / LM Studio 均支持)变得可用。
推荐方案(按优先级)
- 主力日常:gpt-oss-20b 或 Phi-4-reasoning 14B(全量上显卡,速度最快)
- gpt-oss-20b(21B,MXFP4 约 13GB)可以完整放进 16GB 显存,全 GPU 推理,预计 40+ tokens/s,原生支持工具调用,是最省心的主力选择。
- Phi-4-reasoning 14B(约 9GB)全量上卡后余量充足,数学/推理能力超过不少 70B 级模型,适合分析类工作。
- 质量优先:Qwen3.5 27B(Q4 + 少量层卸载)——质量/体验平衡点上的最佳选择
Q4 约需 18GB,略超 16GB 显存。解决办法:用 llama.cpp / LM Studio 把末尾几层卸载到内存(128GB 内存完全无压力),或选 IQ4_XS 量化直接压进显存。预计 10–18 tokens/s,换来单卡档最强的通用能力、262K 上下文、视觉+音频多模态和顶级中文能力。
- 大内存专属玩法:MoE 模型走内存卸载
- 128GB 内存最大的价值在于跑”总参数大、激活参数小”的 MoE 模型——激活参数小意味着即使部分权重走内存带宽(DDR5 双通道约 76GB/s),速度也能接受:
- gpt-oss-120b(117B 总参 / 5.1B 激活,MXFP4 约 60GB):专家层放内存、注意力层放显卡,预计 8–15 tokens/s,相当于把单卡 H100 级别的能力搬上了笔记本。
- 5-35B-A3B(35B 总参 / 3B 激活):Q4 约 20GB,大部分权重可上显卡,激活参数极小所以吞吐高,是多语言 + 工具调用场景的效率之选。
- 不建议硬上的
- DeepSeek V4 Flash(284B 总参,Q4 约 160GB):超过 128GB 内存上限,放弃。
- Llama 4 Scout(Q4 约 55–64GB):内存勉强装得下,但 17B 激活参数走内存带宽只有约 2–4 tokens/s,实用性差。
- 任何 70B+ 稠密模型:激活参数太大,速度不可用。
配置要点速查
| 项目 | 建议 |
| 推理工具 | LM Studio(Windows 图形界面,上手快)或 Ollama(命令行 + OpenAI 兼容 API);极限调优用 llama.cpp |
| 量化档位 | 优先 Q4_K_M / MXFP4;显存差一点时用 IQ4_XS,尽量避免降到 Q3 |
| 上下文长度 | 16GB 显存跑 27B 模型时别开满上下文,8K–32K 足够日常,避免 KV cache 挤爆显存 |
| 驱动 / CUDA | A5500 Laptop 为 Ampere 架构(sm_86),主流推理框架全部支持,保持驱动更新即可 |
一句话结论:日常主力用 gpt-oss-20b(全显卡、最快),追求质量上 Qwen3.5 27B(少量层卸载),想体验”准旗舰”能力就利用 128GB 内存跑 gpt-oss-120b 的 MoE 卸载方案。
参考链接:模型排行榜
权威排行榜(建议定期查看,排名每月都在变)
- LMArena(原 LMSYS Chatbot Arena),最有公信力的人类盲测投票排行榜,分文本/代码/视觉多个榜
- Hugging Face Open LLM Leaderboard,开源模型基准跑分总榜,可按任务类型筛选
- SWE-bench 官方榜单,编码/工程能力的事实标准,看”谁最会修 bug”就看它
- Artificial Analysis,模型质量 × 速度 × 价格的综合对比,含自托管成本测算
- Ollama 模型库,按下载量排序,反映真实社区热度,一键拉取
本文数据参考的 2026 年评测文章
- Best Local LLMs in 2026 — LocalAI Run 按 VRAM 档位排名的本地模型年度榜单
- Best Local LLMs of 2026 — Apidog,4090 与 Mac Studio 实测,含 DeepSeek V4 安装指南
- Best Open-Weight LLMs 2026 — Context Studios,参数、上下文、许可证逐一核实的自托管指南
- Best Self-Hosted LLMs in 2026 — Onyx,按硬件层级(4090 / 单 H100 / 集群)的实测排名
- Best Open-Source AI Models 2026 — AI Productivity,六大开源模型横向对比,含许可证商用分析
- Best Open Source LLMs — Respan,生产环境实测视角的开源模型六强(2026 年 7 月更新)



