买手机时销售会说「这颗芯片 NPU 算力 XX TOPS,端侧能跑大模型」。听起来很唬人,但TOPS 高不等于体验好——真正决定你能跑什么模型、跑得多顺的,是另外几件事。
先把三个参数讲明白,再看怎么选。

参数一:NPU 算力(TOPS)——决定「快不快」
TOPS 是芯片每秒能做的万亿次运算,衡量的是推理速度。它影响的是「一句话生成要等几秒」,但不决定「能不能跑某个模型」。厂商爱拿它当卖点,因为数字好看、还能逐年翻倍。
参数二:内存(RAM)——决定「能不能跑」
这是最容易被忽略、也最关键的一项。端侧模型要常驻内存,内存不够,模型根本加载不起来,算力再高也没用。粗略对应:4-bit 量化下,7B 模型约需 4GB 左右常驻,更大的模型需要 8GB 乃至更多。想让手机流畅跑端侧模型,内存比 TOPS 更值得看。
参数三:模型大小与量化——决定「跑得动什么」
模型不是越大越好,而是要看厂商适配了哪一档。常见的端侧档位大致是:小模型(1B–3B)做输入预测、摘要;中模型(7B 级)做对话、写作;再往上就得交给云端。
| 档位 | 典型内存 | 端侧能跑的模型 | 实际体验 |
|---|---|---|---|
| 入门 | 8GB | 1B–3B 小模型 | 输入法联想、简单摘要、通话转写 |
| 主流 | 12GB | 7B 级(4-bit 量化) | 本地对话、写作润色、图片消除 |
| 旗舰 | 16GB 及以上 | 7B–13B(量化) | 较长文本理解、多轮对话更稳 |
选购建议:别被 TOPS 带偏
- 先看内存:想真正用上本地大模型,12GB 起步,16GB 更从容;
- 再看厂商适配:同样 16GB,厂商有没有把模型压进系统层、输入法/相册/录音里能不能直接用,比纸面算力更重要;
- 最后看 TOPS:它决定快慢,在前两项达标的前提下越大越好。
还有一个现实:重活永远在云端。长文档、复杂推理、最新模型能力,端侧追不上,最终还是要把请求发出去——这一点我们在 《端侧大模型崛起》里拆过端侧与云端的分工边界。想看具体机型的形态差异,可参考我们的 折叠屏四强对比。
想自己上手对比不同模型的端侧/云端表现,可以在 拓瑞智能 trui88.com 用一把 API Key 调通 GPT-6、Claude、DeepSeek,按用量计费、一个后台统一切换,先在云端把效果跑通,再判断哪些值得下沉到手机本地。注册即送体验额度。
发表回复