OneLastIdea

自托管 LLM 玩家的任务级模型路由代理

自托管用户按任务类型/工作区自动路由到不同模型,标题用小模型、子代理用便宜模型,省时省钱。

  • API / 基础设施
  • B2B
  • 全球
  • 难度 3/5
  • 启动 < $500
  • MVP 约 5 周

问题

在 Open WebUI 和 AnythingLLM 上自托管多个本地/外部模型的用户,无法为不同任务分配不同模型:Open WebUI 的内置子代理"currently inherit the model used by the active parent chat",被迫使用昂贵的父会话模型;后台任务"only lets you specify 1 local and/or external model to cover all tasks",用户要么用小模型导致 web search/retrieval query 质量差,要么用会话模型做标题生成"overkill and slow";AnythingLLM 用户连接两台 Ollama 服务器时必须在设置里手动切换。痛点是成本浪费、速度慢和手动操作的摩擦,但均为 pain 2 的中低强度问题。

目标用户

自托管 Open WebUI / AnythingLLM 的个人开发者和团队管理员,通常同时运行多个本地模型(如 DeepSeek R1 + 小型任务模型)或多台 Ollama 服务器。这是一个随本地 LLM 自托管兴起而增长的小众开发者群体,规模有限但技术活跃。

解决方案

核心是一个 OpenAI 兼容的模型路由代理,插在自托管 UI(Open WebUI/AnythingLLM)和多个模型后端之间:

  • 任务级路由规则:按任务类型(标题生成、web search query 生成、子代理等)指定目标模型,每条规则可选"Current Model"回退
  • 多实例 provider 管理:同一 provider 的多个服务器(如两台 Ollama)可同时在线,按工作区/线程路由
  • AI 在其中的角色:代理利用规则而非模型本身,可内置智能默认(自动探测任务类型并匹配最便宜够用的模型)
  • 成本/延迟看板:显示每类任务的实际 token 消耗和响应延迟,让省钱效果可见

为什么是现在

信号显示自托管用户已普遍同时运行多个本地与外部模型(如 DeepSeek R1 与小型任务模型并存),模型选择空间变大,才产生了"不同任务该用不同模型"的精细化路由需求;此前单一模型时代不存在这个问题。但这些请求都是 2025 年中至今的功能请求,尚无产品级响应,时机成立但紧迫性一般。

MVP 范围

第一版:本地部署的 OpenAI 兼容代理,支持 (1) 按任务类型(标题生成、搜索 query 生成、子代理)配置目标模型;(2) 每条规则支持"Current Model"透传选项;(3) 同一 provider 多实例(如两台 Ollama 服务器)的命名管理与按工作区路由;(4) 简单的规则配置文件或 Web 设置页。不做:不做聊天 UI 本身、不做 RAG/知识库、不做模型训练或量化。

风险

平台依赖是最大风险:三个需求都指向 Open WebUI 和 AnythingLLM 自身,属于其路线图内的功能补齐,一旦官方实现(Open WebUI 已有相关 issue 在讨论),独立产品价值归零。付费意愿为零、pain 偏低,商业化路径不明。技术上需兼容多家 provider 的 API 差异(本地 Ollama、外部 API、DeepSeek R1 等)。

信号证据

这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。

  1. GitHub Issues · open-webui/open-webui7月27日功能请求▲ 186 条评论

    “Built-in sub-agents currently inherit the model used by the active parent chat.”

    Open WebUI admins cannot configure a dedicated, cheaper model for built-in sub-agents, which inherit the expensive parent chat model.原文

  2. GitHub Issues · Mintplex-Labs/anything-llm10月5日功能请求▲ 123 条评论

    “AnythingLLM currently seems to allow only one instance of a given LLM Provider to be connected at a time. If I want to connect multiple instances, I have to change it in the settings.”

    AnythingLLM only allows one instance of a given LLM provider to be connected at a time, so users with multiple servers (e.g. two Ollama servers) can't route different workspaces or threads to different instances.原文

  3. GitHub Issues · open-webui/open-webui7月2日功能请求▲ 139 条评论

    “Right now it only lets you specify 1 local and/or external model to cover all tasks.”

    Open-WebUI only lets users configure a single task model for all background tasks, so users can't assign different models per task like title generation or web search query generation.原文

这个 Idea 怎么样?

相似的 Idea

  • 47

    自托管用户的本地 LLM API 网关

    让端点写死为 api.openai.com 的开源工具,无需改代码就能直连 LM Studio、LocalAI 等本地模型。

    3 条信号,2 个来源,最近 29个月前

    开发者工具
    • 桌面 App
    • B2C
    • 全球
    • 难度 3/5
    • 启动 < $500
    • MVP 约 5 周
  • 58

    n8n 企业用户的 AI Assistant 网关代理

    让企业自托管 n8n 的 AI Assistant 接入内部 LLM 网关,注入自定义 header 并把用量归属到真实用户。

    5 条信号,1 个来源,最近 3天前

    开发者工具
    • API / 基础设施
    • B2B
    • 全球
    • 难度 2/5
    • 启动 < $500
    • MVP 约 3 周
  • 59

    AI 编程用户的 MCP 权限审批网关

    在 AI 编程代理与 MCP 服务器之间加一层网关,按工作区和按服务器强制只读或写操作逐条审批,防止生产仓库被误改。

    5 条信号,2 个来源,最近 3天前

    开发者工具
    • 桌面 App
    • B2B
    • 全球
    • 难度 3/5
    • 启动 $500–5k
    • MVP 约 8 周

本页内容由 AI 根据公开讨论整理,最后更新于 16分钟前。发现错误或需要下架原文,请看这里。