问题
两条信号都指向同一类新能力:开源多模态视觉语言模型(如 ZDTaichu5.0-9B,支持图文输入、视频理解和 agent 能力)和可在『one forward pass』内对屏幕、照片、视频给出带校准置信度答案的模型正在出现。做 GUI Agent 或视觉语言应用的开发者,此前需要拼接多步 pipeline(OCR + 截图解析 + LLM 推理)来判断屏幕状态,延迟高且答案不可校准。但需要坦率说明:本卡信号均为模型/能力发布,而非用户在社区里表达的具体痛点,问题强度是从能力反推的,未经验证。
目标用户
开发 GUI 自动化 Agent、RPA 增强、视觉语言应用的开发者和小团队。信号中明确提到的目标用户是『building GUI agents or vision-language applications』的开发者;市场规模只能定性判断(多模态 Agent 是活跃方向),无量化数据支撑。
解决方案
- 截图/视频问答 API:输入屏幕截图、录屏片段和自然语言问题(如“这个页面上的提交按钮可点吗”),单次调用返回结构化答案。
- 置信度校准输出:借鉴 System One 决策模型思路,每个答案附带校准过的置信分数,供 Agent 决策是否继续或求助人工。
- 本地/私有化部署:基于 ZDTaichu5.0-9B 等开源模型,支持中英文,数据不出内网。
- Agent 场景模板:内置常见 GUI 判断任务(页面状态判断、元素存在性检查、操作前后校验)的 prompt 与评测集。
- AI 角色:核心是开源多模态视觉语言模型的推理与封装,团队做的是工程化、校准和易用性,而非训练模型。
为什么是现在
两条信号显示:ZDTaichu5.0-9B 已开源发布,原生支持图文、视频理解和 agent 能力;Qwen 相关项目演示了单次前向传播即可对屏幕/视频给出带校准置信度的答案。开源多模态能力刚达到可用水位且免费,是做封装工具的窗口期。
MVP 范围
第一版:本地部署 9B 级开源多模态模型,提供截图/短视频 + 自然语言问题的 API,返回结构化答案与置信度分数,附 10 个 GUI Agent 场景示例。不做:浏览器或桌面的完整自动操控闭环、跨平台 UI 元素树解析、模型微调服务。
风险
- 需求未验证:信号只有两条模型发布动态,没有真实用户抱怨或付费意愿,可能做出无人需要的封装。
- 平台依赖与被上游吞噬:Qwen 等模型方随时可能把同类能力直接产品化,封装层价值被抹平。
- 技术风险:置信度校准在分布外截图上可能严重失真,9B 级模型对复杂 UI 的理解上限有限。
- 开源迭代快:底层模型几个月一换代,工程投入需要持续跟随。
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
GitHub · 新的 LLM 项目9月27日新能力▲ 109
“🚀🚀 A multimodal System One decision model that gives calibrated answers to typed questions about screens, photos, video and text in one forward pass.”
A multimodal model gives calibrated answers to typed questions about screens, photos, video and text in a single forward pass.原文
Hugging Face · 热门模型9月4日新能力▲ 2572
“Task: image-text-to-text”
ZDTaichu5.0-9B is a released open multimodal vision-language model supporting image-text-to-text tasks with video understanding and agent capabilities.原文