问题
在本地用 Ollama 部署多模态模型(如 CLIP)的开发者,发现 Ollama 的 REST API 无法为图片生成 embeddings。有开发者在 GitHub Issue 中写道:
目标用户
使用 Ollama 构建需要图文混合 embedding 的本地 AI 应用开发者(如本地知识库、图片搜索、语义检索工具的开发者)。
解决方案
核心功能
- 提供 REST API,接收文本或图片输入,调用本地多模态模型(如 CLIP)生成 embedding
- 保持与 Ollama
/api/embeddings兼容的接口风格(可选 images 字段),降低迁移成本 - 支持本地模型加载,与 Ollama 环境无缝集成或独立运行
- 提供简单的模型管理和版本选择(针对不同多模态嵌入模型)
MVP 范围
第一版:一个独立的轻量 API 服务,支持通过 REST 接口对文本和图片调用 CLIP 等多模态模型生成 embeddings,接口设计参考 Ollama 风格。不包括:模型训练、分布式部署、云端托管。
风险
技术风险:Ollama 官方可能很快在原生 API 中加入该能力(Issue 已有回应),使该方案失去存在基础。 平台依赖:依赖 Ollama 的生态和用户习惯,若 Ollama 改动接口或自带功能,产品即被绕过。 付费意愿:两条信号都显示 willingness_to_pay 为 none,且请求者明确表示愿意自己贡献代码实现,说明用户更可能等待上游修复而非付费。
已有产品
| 产品 | 定位 | 价格 |
|---|---|---|
| Ollama | 上游平台本身,缺口一旦被官方填补,机会即消失 | — |
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
GitHub Issues · ollama/ollama6月26日功能请求▲ 7117 条评论
“It seems I'm not able to find a REST API endpoint for generating embeddings for an image, in other words, providing functionality for using models like CLIP which can take both text and images as input.”
Ollama's REST API lacks an endpoint for generating embeddings for images, so multimodal embedding models like CLIP can't be used.原文
GitHub Issues · ollama/ollama5月9日功能请求▲ 6712 条评论
“I can add an `"images"` field in requests to `/api/generate` when using a multi-modal model, why can't I do the same for requests to `/api/embeddings`?”
Ollama's /api/embeddings endpoint doesn't support image inputs, unlike /api/generate which accepts images with multi-modal models.原文