OneLastIdea

小显存用户的大模型专家流式加载引擎

把放不进显存的开源 MoE 模型塞进消费级 GPU 或 Mac,靠按需加载专家权重把大模型跑起来。

  • API / 基础设施
  • B2B
  • 全球
  • 难度 4/5
  • 启动 $500–5k
  • MVP 约 10 周

问题

在消费级或准专业级硬件上跑开源大模型的用户,正被“模型比硬件大”卡住:流行的开源权重模型大到塞不进手头的 GPU(HN Launch 帖,191 分、97 评论);ollama 用户在 GitHub Issue 中抱怨它不支持把 MoE 权重卸载到 CPU 降 VRAM,而 llama.cpp 已经支持(73 分、41 评论);Mac 用户则受限于 8-16 GB 统一内存。共性痛点是:新出的 MoE 模型总参数量大但每 token 只激活一小部分专家,现有工具没有充分利用这一点,导致用户要么换硬件,要么放弃本地部署。痛感中等(均为 3/5),更像“被卡住的技术爱好者刚需”而非付费级痛点。

目标用户

在消费级/准专业级硬件上自托管开源模型的开发者与重度爱好者:小显存 GPU 用户(ollama / llama.cpp 用户群)、8-16 GB 内存的 Mac 用户。市场定性看不小——ollama 相关 Issue 有 73 分 / 41 评论,HN 帖 191 分 / 97 评论,说明关注者众多;但这是一个习惯于免费开源工具的群体,付费转化存疑。

解决方案

核心功能:

  • 专家流式加载:将 MoE 模型的 routed experts 存放在 RAM 或磁盘,仅按路由选择即时加载,使“比显存更大的模型”能在单卡上运行。
  • 路由感知预取:根据当前层路由预测下一层可能需要的专家,提前从 SSD 读入,掩盖存储延迟。
  • 分层配置:类似 OLLAMA_MOE_OFFLOAD 的 FULL / PARTIAL / NONE 策略,让用户在显存、内存、磁盘之间手动权衡。
  • 一键跑大模型:面向 8-16 GB Mac 和小显存 GPU 用户的预配置方案(模型 + 加载策略打包)。

AI 扮演的角色:产品本身就是本地大模型推理基础设施——AI 模型是服务的对象,路由预测(预测下哪些专家会被激活)是可引入 ML 的优化点。

为什么是现在

MoE 开源模型(如 Qwen3.6-35B-A3B)总参数量大、单 token 激活量小,使“只加载被选中的专家”首次在技术上可行;llama.cpp 刚合入 MoE 层 CPU 卸载支持(#15077),而 ollama 尚未跟进,社区在追赶这一能力缺口;同时 SSD / 统一内存带宽的提升让流式加载有实用价值。窗口在于:主流易用工具(ollama 一类)还没把这个能力产品化。

MVP 范围

做: 选定 1-2 个主流开源 MoE 模型(如 Qwen3.6-35B-A3B),实现 GPU-RAM-SSD 三级存储的专家流式加载与路由感知预取,给出可量化的 tokens/s 与延迟数据,提供开箱即用的 CLI 或对 llama.cpp/ollama 的补丁/包装层。 不做: 不追求支持所有模型架构,不做训练或微调,不做云端推理服务,不承诺通用加速(只针对“模型大于显存”这一场景)。

风险

技术风险:专家预取命中率决定可用性,路由预测不准时 SSD 随机读会让生成速度劣化到不可用;需要针对每个模型架构做适配,工程量大。 平台依赖:深度绑定 llama.cpp / MLX / ollama 的生态,上游一个 PR(如 ollama 官方实现 MoE offload)就能让你的工作归零。 替代品风险:显存降价、量化技术进步或更小的稠密模型都可能让“模型放不进显存”这个问题本身消失。 变现风险:目标用户是开源工具的重度使用者,付费意愿信号为零。

已有产品

产品定位价格
Ollama最流行的本地模型运行工具之一,尚缺 MoE offload 支持,GitHub Issue 有 73 分热度—
AiiStream Q3.6已发布的专家流式加载方案,把 routed experts 放在 SSD 上按需读取—
llama.cpp已支持将 MoE 层加载到 CPU 以降低 VRAM 占用(ggml-org/llama.cpp#15077)—

信号证据

这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。

  1. Hugging Face 论坛 · Show and Tell10月1日新品发布▲ 00 条评论

    “I got Qwen3.6-35B-A3B running on a 16 GB M5 MacBook Air by keeping the routed experts on SSD and reading only the ones selected by the MoE router.”

    Running large MoE models like Qwen3.6-35B-A3B on consumer Macs with only 8-16 GB of RAM is possible by streaming only the selected MoE experts from SSD with prefetching.原文

  2. Hacker News · Launch HN9月30日痛点▲ 19497 条评论

    “Expert streaming: store experts on RAM or disk and load them just-in-time. This lets you run models bigger than what otherwise would fit on your GPU.”

    Popular open-weight models are too large to fit on a given GPU, limiting what users can run locally.原文

  3. GitHub Issues · ollama/ollama8月7日投资方向▲ 7341 条评论

    “Now ggml-org/llama.cpp#15077 already support to load model with moe layers into CPU to reduce the VRAM usage.”

    ollama lacks support for offloading MoE weights to CPU to reduce VRAM usage, which llama.cpp already supports.原文

这个 Idea 怎么样?

相似的 Idea

  • 53

    本地 LLM 玩家的 GPU 显存适配与选型助手

    输入模型、量化档位与上下文长度,预估显存占用、推荐量化方案并生成 Ollama/llama.cpp 命令。

    3 条信号,2 个来源,最近 前天

    开发者工具
    • API / 基础设施
    • B2B
    • 全球
    • 难度 2/5
    • 启动 < $500
    • MVP 约 3 周
  • 41

    本地 GGUF 模型一键运行工具:省去开发者配置之苦

    让 Apple Silicon 开发者在 transformers 生态内直接加载运行 GGUF 量化模型,获得接近 llama.cpp 的性能,无需切换工具链。

    2 条信号,2 个来源,最近 11天前

    开发者工具
    • API / 基础设施
    • Prosumer
    • 全球
    • 难度 3/5
    • 启动 < $500
    • MVP 约 6 周
  • 54

    本地小模型开发者的混合决策 Agent 框架

    让小型本地模型只做推理,结构与验证交给确定性 kernel,本地 agent 更可靠。

    3 条信号,2 个来源,最近 昨天

    开发者工具
    • API / 基础设施
    • B2B2C
    • 全球
    • 难度 3/5
    • 启动 < $500
    • MVP 约 5 周

本页内容由 AI 根据公开讨论整理,最后更新于 9分钟前。发现错误或需要下架原文,请看这里。