1-bit LLM 为何意义重大
大型语言模型(LLM)普遍过于庞大,需要昂贵的硬件才能运行,普通用户既难以负担,也无法保护隐私。而 1-bit AI(三元模型)正在改变这一局面——它能让近年顶级水平的 AI 模型直接运行在你的手机上。

什么是1-bit LLM?
传统 AI 模型由大量参数(权重)组成,这些数值通常需要 16 位甚至 32 位浮点数来存储。而三元模型(Ternary Model)将每个参数简化为只有三种取值:+1、0、-1。
存储三个值理论上需要 log₂(3) ≈ 1.58 个比特,因此这类模型也被称为 “1.58-bit” 模型——”1-bit AI” 是它的通俗叫法。

为什么精度重要?一个直观例子:如果神经元只能回答”是/否”(+1/-1),那么”有尾巴”和”没有翅膀”这两个信号权重相同,模型容易把猫误认为狗;但允许更精细的数值(如 +0.2、+0.3),模型就能学会”有尾巴”的参考价值不如”没有翅膀”那么确定。三元模型的巧妙之处在于:用极少的比特,在大规模网络中重建出足够的表达能力。
技术原理:乘法如何变成加减法
1-bit AI 的核心突破不在”压缩”本身,而在原生训练(train from scratch)。两条路线的差异决定了模型的天花板:
| 路线 | 做法 | 结果 |
| 事后量化(PTQ) | 把训练好的全精度模型强行压缩到低比特 | 性能严重下降,低比特下基本不可用 |
| 原生训练 / 量化感知训练(QAT) | 从一开始就在前向传播中施加三元约束,反向传播仍以全精度流动梯度,让网络在”粗糙语言”中学会表达 | 在保持性能的同时获得全部效率优势(BitNet、Ternary Bonsai 的路线)
|

激活值:真正的硬骨头
权重降到 1-bit 相对容易,但激活值(activations)的量化一直是难题——低位宽的激活值容易引入量化误差,尤其是其中的异常值(outliers)。为此研究界持续迭代:
- BitNet b1.58(2024-2025):三元权重 + 8 位激活值(58A8 配置),采用 absmean 权重量化 + 每 token 的 absmax 激活量化 + SubLN 归一化稳定训练;FFN 使用 ReLU² 激活函数提升稀疏性,位置编码采用 RoPE。
- BitNet a4.8(08):激活值降至 4 位,并支持 3 位 KV cache。
- BitNet v2(07):全 4 位激活值 + 稀疏化策略,进一步逼近”全低比特”目标。
核心优势:小、快、省、强

体积大幅缩小
一个 200 亿参数的模型:16-bit 需要 40 GB,1-bit 只需 2.5 GB。原本需要昂贵服务器才能运行的模型,现在可以直接放进 iPhone(6-12 GB 内存)里。微软开源的 BitNet b1.58 2B4T(20 亿参数、4 万亿 token 训练)非嵌入内存占用仅 0.4 GB,约为同类全精度模型的 1/5 ~ 1/12。
速度极快
- cpp 推理框架:ARM CPU 提速 1.37×–5.07×,x86 CPU 提速 2.37×–6.17×;2026 年 1 月的内核更新又叠加了 1.15×–2.1×。
- 单个 CPU 即可运行100B 参数模型,速度达每秒 5-7 个 token——相当于人的阅读速度。
- Ternary Bonsai 8B 在M4 Pro 上 82 token/秒(约为同规模 16-bit 模型的 5 倍),在 iPhone 17 Pro Max 上 27 token/秒;Bonsai 27B 在 iPhone 17 Pro 上约 11 token/秒,在 RTX 5090 上可达 163 token/秒。
- 附件中记录的实测:作者在 M3 Max MacBook 上跑三元模型达到234 token/秒(约 175 词/秒),远超 ChatGPT/Claude 云端约 50 token/秒的体验。
速度快的两个根本原因:一是数据量小,内存带宽压力骤减;二是三元模型中的矩阵乘法本质上变成了加减运算,计算量大减。
能耗大幅降低
相比全精度模型,1-bit 模型的能耗可降低 85%–96%。BitNet b1.58 的 CPU 推理能耗仅 0.028 焦耳/token;Ternary Bonsai 8B 在 M4 Pro 上为 0.105 mWh/token,iPhone 17 Pro Max 上为 0.132 mWh/token,能效约为 16-bit 对手的 3-4 倍。
性能媲美全精度
BitNet b1.58 在语言模型困惑度和下游任务上与同等参数量、同等训练数据的 FP16/BF16 Transformer 相匹敌。以 Ternary Bonsai 8B 为例(六项基准平均分):
| 模型 | 内存占用 | 平均分 | 说明 |
| Qwen3 8B(全精度) | 16.38 GB | 79.3 | 同参数级最强基线 |
| Ternary Bonsai 8B | 1.75 GB | 75.5 | 内存仅 1/9,性能保留约 95% |
| 1-bit Bonsai 8B | 1.15 GB | 70.5 | 极致压缩档 |
| Llama 3.1 8B | 16.06 GB | 67.1 | 被 1/9 体积的三元模型反超 |
| GLM 4 9B | 18.80 GB | 65.7 | — |
基准:MMLU Redux / MuSR / GSM8K / HumanEval+ / IFEval / BFCLv3(来源:PrismML 官方基准表)
技术挑战:光鲜背后的未解之谜
| 挑战 | 现状 |
| 理论基础尚不清晰 | 研究者承认尚未完全理解为什么极简化的三元权重能让模型表现如此出色——”大规模 1-bit 训练为何奏效的理论基础仍是一个未解之谜”。 |
| 激活值量化难题 | 激活值中的异常值(outliers)对低位量化构成重大挑战,BitNet v2 等新架构正在攻关,但仍是研究热点。 |
| “1-bit 墙”限制 | 极端压缩下存在隐藏瓶颈:每个参数仍需保留符号位(+/-),构成进一步压缩的理论下限。 |
| 规模与上下文窗口 | 1-bit 模型在整体规模和长上下文”记忆”方面尚无法与最大的全精度模型竞争。 |
| 工具调用能力退化 | 据 2026 年 7 月对 Bonsai 27B 的第三方分析,极端量化下退化最严重的能力恰是工具调用(tool calling)——而这正是”模型成为 Agent 而非聊天机器人”的关键技能。 |
| 训练稳定性 | 原生三元训练极其不稳定,对激活异常值敏感,容易导致训练崩溃;依赖 SubLN 等专门设计来稳定。 |
发展时间线:从论文到口袋

其中 PrismML 值得专门一提:这家加州理工学院(Caltech)背景的创业公司于 2026 年 3 月走出隐身状态,获得 Khosla Ventures、Cerberus 等机构 1625 万美元种子轮融资,四位创始人均为 Caltech 博士。其技术可将模型体积压缩至全精度版本的 1/14,内存降低超 90%,推理速度最高提升 8 倍;据早期报道,苹果已就”在 iPhone 上直接运行更大模型”与其进行过探索性接触。
关键辨析:”0.8B” 和 “1-bit” 是两个维度
很多人会混淆参数量(0.8B、2B、4B…)与精度(1-bit、16-bit)。它们一个描述”模型有多少个参数“,一个描述”每个参数用几比特存储“,共同决定内存:模型内存占用 ≈ 参数量 × 每参数比特数

四个维度的本质区别
| 维度 | 小参数(如 0.8B)=砍人 | 小精度(1-bit)=砍精度 |
| 压缩本质 | 直接减少网络宽度与深度,物理上”砍掉大脑区域”,智力上限被锁死 | 保留完整网络骨架,只把信号粒度变粗糙;27B 三元模型的潜力远高于 0.8B 全精度模型 |
| 性能瓶颈 | 计算量(FLOPs)——受限于芯片算力 | 内存带宽——27B 也只需 3-4GB,普通 CPU / 手机即可跑快 |
| 实现难度 | 成熟;缺点是能力下降明显、幻觉严重 | 极高;需原生训练,训练不稳定、对激活异常值敏感 |
| 知识保留 | “物理空间”有限,事实性知识极少 | 参数量庞大(8B/27B),记忆容量依然可观,只是回答时略”结巴” |
终极结论——不是二选一,而是”乘法效应”:最前沿的方向是”大参数 + 小精度”。先做大参数保证智力,再用 1-bit 技术把它做小保证普惠。我们正在告别”为了省内存而砍智商”的时代,进入”高智商且体格轻盈”的时代。PrismML 将这一思路提炼为核心指标——智能密度(Intelligence Density):每单位内存/算力/能耗所能交付的推理能力。
应用场景与产业影响
1-bit AI 的低资源消耗使其特别适合:
- 端侧设备,智能手机、智能家居、工业传感器——离线可用、数据不出设备。
- 实时移动应用,语音助手、智能客服等低延迟交互场景,响应接近零延迟。
- 具身机器人,在资源受限的机器人上部署推理能力,功耗预算极其敏感。
- 家电与汽车,未来可能部署在电饭煲、冰箱或车载系统中。
更深远的意义:设备端学习
因为模型运行在你自己的设备上,它可以真正地本地训练,学习你的偏好并永久记住——这就是”设备端适应”(on-device adaptation)。这与目前 AI 公司的”记忆”功能截然不同:后者只是把信息塞进提示词里,一旦上下文清空,模型就”忘了”;而设备端学习是真正的个性化。
产业格局冲击:数据中心算力本就紧张,无法满足所有人的需求;而小型模型对大多数任务已经足够,且基本免费(只消耗设备电量)。这对苹果等消费硬件公司是重大利好(A18 Pro 已提供 38 TOPS 神经算力,未来芯片甚至可能内置”三元计算单元”),对依赖云端算力按 token 收费的 AI 公司则构成挑战。
上手指南:现在就能体验 1-bit AI
在线 Demo:即刻体验
- 微软 BitNet b1.58 2B4T 官方 Demo:https://bitnet-demo.azurewebsites.net/,也可在 Microsoft Foundry 模型目录中体验。
- PrismML Bonsai 系列:官方提供无需配置的 Google Colab 笔记本。
- WebGPU 浏览器版:webml-community 社区在 Hugging Face Spaces 提供浏览器内直接运行的 Bonsai 1.7B Demo(仅约 290MB)。
开源模型:本地部署

配套工具
- cpp:微软官方 1-bit LLM 推理框架,支持 CPU 与 GPU,ARM 提速 1.37×–5.07×,x86 提速 2.37×–6.17×。
- Bonsai-demo:PrismML 的演示仓库,支持 Mac / Linux / Windows。
- systems:针对 AMD Strix Halo 平台的 1-bit 推理引擎。
- MLX:Apple Silicon 上的原生运行时,Bonsai 的 MLX 格式对 M 系列芯片有专门优化。
选型建议:追求极致轻量便捷 → Bonsai 1.7B WebGPU Demo;本地 CPU 运行 → BitNet b1.58 2B4T + bitnet.cpp;Apple Silicon 设备 → Bonsai MLX 格式;追求更强性能 → Ternary Bonsai 8B / 27B。
结语:从云端到边缘的迁徙
1-bit AI 正在引领一场从云端向边缘端迁移的变革。BitNet 确立了新的扩展定律——模型越大,1-bit 带来的效率提升越显著。未来的趋势是:参数规模不再一味追求超大(因为会撞上算力墙),而是”先做大参数保证智力,再用 1-bit 把它做小保证普惠”。
不到两年前的顶级 AI 智能,现在可以装进你的口袋。对普通用户而言,这意味着更私密、更快速、更廉价的 AI 体验正在成为现实;对行业而言,衡量 AI 的新标尺正在从”参数规模”转向智能密度。





