器→工具, 开源项目

本地 LLM 模型应该怎么选?

钱魏Way · · 2 次浏览

数据截至 2026 年 8 月,综合 Hugging Face 模型卡、LMSYS Arena、Open LLM Leaderboard 及多家实测评测整理。

为什么考虑本地部署?

三年前,”本地大模型”基本等于”质量打折”。这个前提在 2026 年已经不成立了:

  • 能力差距基本抹平:开源权重模型在推理、代码等主流基准上与 GPT-5、Gemini 3 级别的闭源模型差距已缩小到个位数百分比;在信息抽取、分类、工具调用等任务上几乎零差距。DeepSeek V3.2、GLM-5、5 在部分推理基准上甚至反超 GPT-5。
  • 硬件门槛大幅降低:一张 24GB 的消费级显卡(RTX 3090/4090)就能以 4-bit 量化跑 32B 级别模型,吞吐可达 30 tokens/s 左右;Mac Studio(64GB+ 统一内存)可以流畅运行 DeepSeek V4 Flash 这类模型。
  • 成本与合规优势:高频调用场景下,自建推理通常几个月内即可收回成本,远低于按 token 计费的 API 开支;医疗、金融等受监管行业还能实现完全离网(air-gapped)部署,数据不出内网。

综合推荐榜(按硬件档位)

旗舰级(多卡 / 服务器级,80GB+ 显存)

模型 架构 亮点数据 许可证 适合场景
DeepSeek V4 Pro 1.6T 总参 / 49B 激活 (MoE) SWE-bench Verified 80.6%,GSM8K 96.0%,LiveCodeBench 93.5%,1M 上下文 MIT 数学、科研、复杂推理,本地模型能力天花板
GLM-5.2(智谱) 稀疏注意力 MoE GPQA Diamond 91.2%,1M 稳定上下文,IndexShare 注意力使 1M 上下文每 token FLOPs 降低 2.9 倍 MIT 长链路 Agent、编码,2026 年多家评测中自托管编码榜第一
Kimi K2.6 / K2.7 Code(月之暗面) 1T 总参 / 32B 激活 (MoE) SWE-bench 80.2%,2M 上下文,Agentic 能力最强之一 Apache 2.0 超长文档分析、多步工具调用 Agent
Qwen3 235B-A22B MoE / 22B 激活 LiveCodeBench 89%,约 132GB 显存 (Q4) Apache 2.0 企业级 Agent 与复杂编码
Llama 4 Scout(Meta) 109B 总参 / 17B 激活 (MoE) 10M(千万级)token 上下文,开源模型中最长;原生多模态;Q4 需约 55–64GB Llama Community 整个代码库/书籍级语料一次性输入

单卡甜点级(24GB 显存,RTX 3090/4090)——多数人的最佳选择

模型 亮点数据 许可证 适合场景
Qwen3.5 27B / Qwen3.6 27B(阿里) MMLU-Pro 86.1%,SWE-bench Verified 最高 77.2%,LiveCodeBench 83.9%,262K 上下文,原生支持文本/视觉/音频、201 种语言,Q4 约 18GB Apache 2.0 2026 年单卡通用首选,多语言能力尤其突出
Gemma 4 31B(Google) MMLU-Pro 85.2%,LiveCodeBench 80.0%,Codeforces ELO 2150(竞赛编程专家级),支持视觉 + 可开关的思考模式,Q4 约 20GB Gemma 许可(可商用) 单卡综合质量与编码兼顾
DeepSeek V4 Flash 284B 总参 / 13B 激活,Q4 约 24GB,4090 上约 28 tokens/s;推理质量与 V4 Pro 差距在 5% 以内 MIT 想要接近旗舰推理能力但只有一张卡
Qwen3 32B 首创混合思考模式(/think 与 /no_think 切换),36 万亿 token 训练,128K 上下文 Apache 2.0 需要推理深度可控的通用场景

轻量级(8–16GB 显存 / 笔记本)

模型 亮点数据 许可证 适合场景
Phi-4-reasoning 14B(微软) AIME 2024 得分 75.3%(reasoning-plus 版 AIME 2025 达 81.3%),超过 70B 级的 DeepSeek-R1,约 9GB 内存 MIT 小硬件上的数学/推理怪兽
Gemma 4 12B MMLU-Pro 77.2%,单位参数效率同级最高,Q4 仅约 6.6GB,128K 上下文 Gemma 许可 RTX 3090 以下显卡、日常问答与文档摘要
Mistral Small 3.2 24B / Mistral Nemo 12B Nemo 12B 在 8GB 显存即可运行,128K 上下文 + 函数调用 Apache 2.0 中端机的长文档处理与本地 Agent
Qwen3.5 9B 本周期 Hugging Face 下载量最大的开源权重模型,量化与微调生态最全 Apache 2.0 笔记本/边缘设备默认选项
gpt-oss-20b(OpenAI) 21B 参数可装进 16GB 显存,OpenAI 首次放出的开放权重 Apache 2.0 想要”最省心”的生产部署

按需求场景怎么选

  • 写代码:首选 GLM-5.2(自托管编码榜首)或 Kimi K2.7 Code;单卡场景选 Gemma 4 31B(Codeforces ELO 2150)或 5-Coder 32B(HumanEval 92.9%,依然是开源编码单项冠军之一)。
  • 数学 / 硬核推理DeepSeek V4 Pro(GSM8K 96.0%);小硬件上 Phi-4-reasoning 14B 无出其右。
  • 超长上下文Llama 4 Scout(10M token)一骑绝尘;其次是 Kimi K2.6(2M)和 GLM-5.2 / DeepSeek V4(1M)。
  • 多语言(尤其中文)5 系列,中、日、韩、阿语接近母语水平,且工具调用格式与 OpenAI 完全兼容。
  • 多模态(视觉/音频):5 27B(文本+视觉+音频三模态)、Qwen3-VL-235B(图表/截图/UI 理解)、Llama 4 Scout(原生图像理解)。
  • Agent / 工具调用:GLM-5.2(Tau2-Bench 89.7%)、Kimi K2 系列(长工具链稳定性好)、MiMo-V2-Flash(高吞吐低延迟,适合流水线式 Agent)。
  • 8GB 以下的极限场景:Gemma 4 12B、Mistral Nemo 12B、5 9B。

运行工具推荐

工具 特点
Ollama 上手最简单,一行命令拉取模型(如 ollama run qwen3.5:27b),自带 OpenAI 兼容接口
LM Studio Windows/Mac 图形界面,适合不想碰命令行的用户
vLLM 生产部署吞吐最高,适合团队服务化
llama.cpp CPU 与低显存环境的最后兜底,GGUF 量化生态的核心

量化建议:日常使用选 Q4(4-bit)量化即可,质量损失很小;显存实在不够再退到 Q3,但会有可感知的质量下降。经验法则:所需显存 ≈ 参数量 × 0.6~0.7(Q4 情况下,32B 模型约 20GB)。

快速决策表

你的硬件 推荐模型
8GB 显存 Gemma 4 12B / Mistral Nemo 12B
16GB 显存 gpt-oss-20b / Phi-4-reasoning 14B
24GB 显存(4090/3090) Qwen3.5 27B(通用)/ Gemma 4 31B(编码)/ DeepSeek V4 Flash(推理)
64GB 统一内存(Mac Studio) Llama 4 Scout / DeepSeek V4 Flash
单张 80GB(H100) gpt-oss-120b / Nemotron 3 Super
多卡 / 192GB+ DeepSeek V4 Pro / GLM-5.2 / Kimi K2.6

一句话总结:2026 年的默认答案是——单卡用户选 Qwen3.5 27B(Apache 2.0、多模态、多语言、生态最全);有服务器资源就上 GLM-5.2(编码/Agent)或 DeepSeek V4 Pro(推理天花板);小设备选 Gemma 4 12B。

 

实际案例:ThinkPad P16 Gen 1 该跑什么模型?

机器配置:i9-12950HX / 128GB 内存 / RTX A5500 Laptop(16GB 显存,Ampere 架构)。这台机器的特点是”显存中等、内存巨大”——128GB 内存是关键资产,让很多看似跑不动的模型通过 GPU + 内存混合卸载(llama.cpp / LM Studio 均支持)变得可用。

推荐方案(按优先级)

  1. 主力日常:gpt-oss-20b 或 Phi-4-reasoning 14B(全量上显卡,速度最快)
  • gpt-oss-20b(21B,MXFP4 约 13GB)可以完整放进 16GB 显存,全 GPU 推理,预计 40+ tokens/s,原生支持工具调用,是最省心的主力选择。
  • Phi-4-reasoning 14B(约 9GB)全量上卡后余量充足,数学/推理能力超过不少 70B 级模型,适合分析类工作。
  1. 质量优先:Qwen3.5 27B(Q4 + 少量层卸载)——质量/体验平衡点上的最佳选择

Q4 约需 18GB,略超 16GB 显存。解决办法:用 llama.cpp / LM Studio 把末尾几层卸载到内存(128GB 内存完全无压力),或选 IQ4_XS 量化直接压进显存。预计 10–18 tokens/s,换来单卡档最强的通用能力、262K 上下文、视觉+音频多模态和顶级中文能力。

  1. 大内存专属玩法:MoE 模型走内存卸载
  • 128GB 内存最大的价值在于跑”总参数大、激活参数小”的 MoE 模型——激活参数小意味着即使部分权重走内存带宽(DDR5 双通道约 76GB/s),速度也能接受:
  • gpt-oss-120b(117B 总参 / 5.1B 激活,MXFP4 约 60GB):专家层放内存、注意力层放显卡,预计 8–15 tokens/s,相当于把单卡 H100 级别的能力搬上了笔记本。
  • 5-35B-A3B(35B 总参 / 3B 激活):Q4 约 20GB,大部分权重可上显卡,激活参数极小所以吞吐高,是多语言 + 工具调用场景的效率之选。
  1. 不建议硬上的
  • DeepSeek V4 Flash(284B 总参,Q4 约 160GB):超过 128GB 内存上限,放弃。
  • Llama 4 Scout(Q4 约 55–64GB):内存勉强装得下,但 17B 激活参数走内存带宽只有约 2–4 tokens/s,实用性差。
  • 任何 70B+ 稠密模型:激活参数太大,速度不可用。

配置要点速查

项目 建议
推理工具 LM Studio(Windows 图形界面,上手快)或 Ollama(命令行 + OpenAI 兼容 API);极限调优用 llama.cpp
量化档位 优先 Q4_K_M / MXFP4;显存差一点时用 IQ4_XS,尽量避免降到 Q3
上下文长度 16GB 显存跑 27B 模型时别开满上下文,8K–32K 足够日常,避免 KV cache 挤爆显存
驱动 / CUDA A5500 Laptop 为 Ampere 架构(sm_86),主流推理框架全部支持,保持驱动更新即可

一句话结论:日常主力用 gpt-oss-20b(全显卡、最快),追求质量上 Qwen3.5 27B(少量层卸载),想体验”准旗舰”能力就利用 128GB 内存跑 gpt-oss-120b 的 MoE 卸载方案。

参考链接:模型排行榜

权威排行榜(建议定期查看,排名每月都在变)

  • LMArena(原 LMSYS Chatbot Arena),最有公信力的人类盲测投票排行榜,分文本/代码/视觉多个榜
  • Hugging Face Open LLM Leaderboard,开源模型基准跑分总榜,可按任务类型筛选
  • SWE-bench 官方榜单,编码/工程能力的事实标准,看”谁最会修 bug”就看它
  • Artificial Analysis,模型质量 × 速度 × 价格的综合对比,含自托管成本测算
  • Ollama 模型库,按下载量排序,反映真实社区热度,一键拉取

本文数据参考的 2026 年评测文章

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注