问题
做视频问答(Video QA)和多模态检索的开发者遇到同一个痛点:视觉语言模型(VLM)能回答关于小时级视频的问题,但逐帧处理整段视频"prohibitively expensive",而问题证据通常"only spans a few seconds"(signal 2)。另一方面,做文本-视频检索的工程师被单一方面的重要性标准和全局文本嵌入导致的跨模态错位困扰(signal 1)。两条信号都指向同一件事:长视频里大部分帧是冗余的,需要聪明的选择性观察。目前的变通办法是专家手工搭建并反复调试 video agent harness,"slow build-and-test cycles"(signal 2),门槛高且难以复用。
目标用户
构建视频问答、视频检索、视频分析应用的算法工程师和独立开发者;用 VLM 做长视频理解的产品团队。市场规模无法从信号判断——两条均为 arXiv 论文,指向的是研究方向而非已验证的付费人群。
解决方案
- 问题感知的关键帧选择:根据用户问题动态决定看哪些帧、看多细(帧级/patch 级),而非固定采样,参考 MMTI 的多维度显著性思路。
- 多粒度查询分解:把查询拆成句子、帧、patch 三个层级再与视频交互,缓解跨模态错位。
- 可演进的 agent harness:用 MCTS + 多保真验证自动演化视频观察策略,替代专家手工调 harness,参考 VidHarness 思路。
- 成本可视化:输出"用了多少帧、省了多少钱、答案置信度",让开发者直接看到相对逐帧处理的节省。
- AI 角色:核心是 VLM + 帧选择/检索策略本身,AI 既是被优化的对象也是执行答案生成的引擎。
为什么是现在
两条 2026-10 的信号共同显示:VLM 已能处理小时级视频但逐帧成本过高(signal 2),而学界刚刚给出可落地的解法——多维显著性选帧(MMTI)与自动演化的选择性观察 harness(VidHarness)。这些论文思路尚未变成开发者可直接调用的工具,是抢先工程化的窗口。
MVP 范围
第一版:提供 Python SDK/API,输入长视频与用户问题,输出(1)候选关键帧/片段集合,(2)带引用片段的 VLM 答案与所用帧数、估算成本对比。只覆盖单视频单问答场景,固定一种 VLM 后端,提供标准评测脚本。
不做:视频编辑、批量视频管理、多模态训练服务、私有化部署;不承诺在学术基准上超越 MMTI 或 VidHarness。
风险
- 研究风险:MMTI、VidHarness 都是论文级方法,在生产视频(低质、多场景、长尾问题)上的泛化未知。
- 平台依赖:核心成本来自第三方 VLM API,价格下降或厂商原生提供智能帧选择会让工具失去存在意义。
- 基准绑架:LongVideoBench、Video-MME 等学术基准分数好不代表用户真实场景(如监控、会议录像)表现好。
- 付费方模糊:信号全部来自论文,无任何付费意愿或真实用户痛点帖佐证,可能只是研究需求而非产品需求。
- 竞争:VLM 厂商、视频平台、开源 harness 框架都可能快速跟进。
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
arXiv cs.CV10月1日新能力
“Vision-language models (VLMs) can answer questions about hour-long videos, but processing every frame is prohibitively expensive, even though the evidence for a question usually spans only a few seconds.”
Processing every frame of hour-long videos with vision-language models is prohibitively expensive, even though the evidence for a question usually spans only a few seconds.原文
arXiv cs.IR10月1日新能力
“To address these issues, we propose MMTI, a method that jointly mitigates visual redundancy and enables multi-grained text-video interaction to achieve accurate multi-grained semantic alignment.”
Text-video retrieval methods rely on single-aspect visual importance criteria and global text embeddings, causing cross-modal misalignment.原文