问题
2024 年起大批用户购入 AI PC 笔记本(如 Microsoft laptop7 的 Snapdragon X Elite、Lenovo Xiaoxin 14 AI 的 Ryzen 8845H),但在这些机器上用 Ollama 跑本地大模型时只能用 CPU,NPU 和 Adreno GPU 完全闲置。一位用户写道:「I just got a Microsoft laptop7, the AIPC, with Snapdragon X Elite, NPU, Adreno GPU. It is an ARM based system.」另有用户直接在 Ollama 仓库开 issue 请求支持 AMD Ryzen NPU,并指出 Linux 驱动(amd/xdna-driver)已经开源可用。两个 issue 分别有 45 和 66 条评论,说明这不是个别人的抱怨,而是 AI PC 早期用户的共同痛点:花了 NPU 的钱,本地推理却享受不到加速,速度慢、续航差。
目标用户
全球范围内购入 2024 款 AI PC 笔记本的开发者与 AI 爱好者:Microsoft laptop7(Snapdragon X Elite)用户和 Ryzen AI 笔记本(如 Lenovo Xiaoxin 14 AI、Ryzen 8845H 机型)用户。市场处于爆发初期——AI PC 是 2024 年各厂商主推品类,出货量快速增长,但目前仍是早期尝鲜人群,规模有限但增长快。
解决方案
- NPU 加速推理引擎:针对 Snapdragon X Elite NPU/Adreno GPU 和 AMD Ryzen NPU(借助已开源的 amd/xdna-driver)做本地 LLM 推理,AI 的角色是把 GGUF/ONNX 模型自动量化、编译成 NPU 可执行格式并调度到加速器上。
- Ollama 兼容 API:暴露与 Ollama 相同的本地 REST API,让现有工具链(客户端、LangChain 等)零改动切换。
- 一键模型转换:内置常用小模型(3B-8B)的预转换版本,用户开箱即用,无需手动处理量化与算子兼容。
- 加速器自动回退:NPU 跑不了的层自动回退到 GPU/CPU,保证任何模型都能出结果。
- 性能/功耗面板:展示 NPU vs CPU 的 tokens/s 与功耗对比,把「你的 AI PC 终于像 AI PC」变成可感知的价值。
为什么是现在
- 2024 年 AI PC 集中上市:Microsoft laptop7(Snapdragon X Elite)等 ARM Windows 机型开始进入用户手中,信号中用户刚买到机器就发现 NPU 用不上。
- 加速栈首次就绪:AMD 的 Ryzen NPU Linux 驱动已开源(amd/xdna-driver),Qualcomm 也为 X Elite 提供了 NPU SDK,做第三方加速工具的基础设施刚刚齐备。
- 主流工具存在空窗:Ollama 在 ARM Windows 和 Linux 上均未支持这些 NPU,issue 热度高(合计 111 条评论)但官方尚未交付,正是第三方切入的窗口期。
- 本地模型使用习惯已养成:这些用户已经在用 Ollama 跑本地 LLM,只是缺加速路径,教育成本几乎为零。
MVP 范围
第一版只做 Windows on ARM(Snapdragon X Elite)一个平台:内置 1-2 个已转换好的小模型(如 3B 级),提供 Ollama 兼容的本地 API 和简单的性能/功耗对比面板。不做 AMD 平台、不做多模型管理、不做模型训练或云端同步、不做 Linux 版。
风险
- 平台依赖风险(最高):产品价值完全建立在 Qualcomm QNN、AMD xdna 等厂商闭源 SDK 之上,SDK 变动、文档缺失会直接卡住开发。
- 上游补位风险:Ollama 或 llama.cpp 官方随时可能原生支持这些 NPU(issue 已有数百条评论和高热度),届时独立产品价值归零。
- 技术风险:NPU 量化算子覆盖不全,很多模型结构跑不通,调试成本高。
- 变现风险:目标用户是习惯免费开源工具的开发者,付费意愿信号为零。
- 碎片化风险:需要同时覆盖 ARM Windows 和 x86 Linux 两套完全不同的加速栈,工作量翻倍。
已有产品
| 产品 | 定位 | 价格 |
|---|---|---|
| Ollama | 当前最流行的本地 LLM 运行工具,但在 ARM Windows 和 Linux 上均未支持 NPU 加速,用户被迫只用 CPU 推理。 | — |
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
GitHub Issues · ollama/ollama6月28日功能请求▲ 6845 条评论
“I just got a Microsoft laptop7, the AIPC, with Snapdragon X Elite, NPU, Adreno GPU. It is an ARM based system.”
Ollama does not use the Snapdragon X Elite NPU or Adreno GPU on ARM Windows AI PCs, so local LLM inference doesn't run on the accelerator hardware.原文
GitHub Issues · ollama/ollama6月20日功能请求▲ 14666 条评论
“Do you will to add AMD Ryzen NPU support to Ollama on Linux and Windows? If anything, AMD Ryzen NPU driver for Linux is already available on Github:”
Ollama 目前不支持 AMD Ryzen NPU,用户希望可以在 Linux 和 Windows 上利用 Ryzen AI 笔记本电脑运行本地大语言模型。原文