问题
本地跑大模型的用户(Ollama 社区)目前只能方便地运行文本模型。想在本地做图像理解时,只能等 Ollama 官方支持新模型——有用户在 GitHub Issues 中请求支持刚发布的 Janus-Pro-7B,理由是 "performing great with OCR"(261 赞、56 评论);另有用户请求 "extend support for text to image models"(113 赞)。想在本地做文生图,则需要完全另一套工具(ComfyUI、diffusers 等),上手门槛和心智负担都高。痛点是真实但中等强度(pain: 3):用户在等官方,而不是没有替代方案。
目标用户
已在本地跑开源模型的技术型用户:开发者、极客、注重隐私的 OCR/图像处理爱好者。以 Ollama 庞大的本地模型用户群为基数,两个相关 Issue 分别有 261 和 113 的互动分,说明这个子需求有明确但不算巨大的受众。
解决方案
核心功能:
- Ollama 式的极简安装与命令行:
pull/run多模态模型,屏蔽底层依赖 - 图像理解:拖入图片即可 OCR、视觉问答(首发支持 Janus-Pro-7B 等视觉模型)
- 本地文生图:统一体验下调用开源文生图模型
- 硬件检测与模型推荐:根据本机显存/内存推荐可跑的模型
- 简单 API/本地服务,方便接入其他工具
AI 的角色: 产品本体是本地多模态模型的运行时与管理层,AI 能力直接来自托管的视觉/文生图模型。
为什么是现在
信号显示多模态模型刚迎来可用性拐点:Janus-Pro-7B 于 2025 年 1 月发布且 "performing great with OCR",把图像理解压到了 7B 级别、可在消费级硬件本地运行;同时 Ollama 的流行已经养成了用户"本地一条命令跑模型"的习惯,缺口集中在多模态这一块。
MVP 范围
第一版做: 桌面端应用,一键拉取并运行多模态本地模型;支持图片输入理解(OCR、视觉问答)和本地文生图;提供模型管理与硬件检测。明确不做: 模型训练或微调、云端推理、复杂 Agent 编排、与 Ollama 的深度 API 兼容。
风险
平台依赖与替代风险: Ollama 官方随时可能自己补上多模态支持(两个 Issue 本身就是在向 Ollama 提需求),届时差异化空间被压缩。付费风险: 两个信号均无付费意愿(willingness_to_pay: none),本地模型用户对开源免费有强预期,商业化路径不清。技术风险: 视觉与文生图模型对显存要求高,消费级硬件适配和推理性能是硬工程。生态风险: 多模态模型迭代极快,产品需要持续跟进模型支持。
已有产品
| 产品 | 定位 | 价格 |
|---|---|---|
| Ollama | 被请求扩展的本地模型运行时本身,是其用户群最直接的替代与平台风险来源 | — |
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
GitHub Issues · ollama/ollama1月27日功能请求▲ 26156 条评论
“Just announced and performing great with OCR https://huggingface.co/deepseek-ai/Janus-Pro-7B”
Users want Ollama to support the Janus-Pro-7B vision model.原文
GitHub Issues · ollama/ollama10月13日功能请求▲ 11324 条评论
“It would be great if we can extend support for text to image models.”
Users want Ollama to support text-to-image models in addition to text models.原文