问题
构建 RAG 系统的开发者和研究人员面对一个庞大且权衡不清晰的检索设计空间: dense 检索、重排序、RRF 融合、agentic retrieval、ColBERTv2 late interaction 等变体在真实规模的领域语料上的取舍
目标用户
在科研文献或私有领域语料上构建 RAG 系统的开发者、算法工程师和小型研究团队。信号未提供市场规模数据,但 RAG 是当前 LLM 应用的主流架构之一,该人群持续增长;付费意愿不明。
解决方案
- 领域语料接入:支持批量导入科研文献/私有文档,自动切块与建索引
- 策略矩阵:内置 dense 检索、重排序(可接入 CLM-v0.1-8B)、RRF 融合、agentic retrieval、late interaction 等多种管线
- LLM-as-a-judge 评测:统一的自动化评测协议,输出可横向对比的指标报告
- 选型建议:根据用户语料规模与查询类型,给出推荐检索配置及参数
- 可复现实验:评测代码与结果可导出,便于团队内部沉淀
AI 角色:重排序与验证由开源 8B 对比学习模型承担,评测环节使用 LLM-as-a-judge 自动打分。
为什么是现在
两个新信号同时出现:一是开源 8B 对比学习重排序模型(CLM-v0.1-8B)可直接用作 verifier/reranker,重排序组件的获取成本大幅下降;二是最新研究公开了六种检索策略在真实规模科研语料上的受控对比结果与代码、数据集,选型知识从经验猜测变成了可复现的基准,做工具的时机成熟。
MVP 范围
做:一个可本地部署的评测管线——用户挂载自己的领域文档集(优先支持科研文献格式),内置 6 种检索策略(dense、rerank、RRF 融合、agentic retrieval、ColBERTv2 late interaction 等),跑完后输出统一指标的对比报告,并给出推荐配置。不做:不训练自有模型、不托管用户数据、不做通用问答产品、不覆盖非文本模态。
风险
需求风险:证据主要来自能力型信号(模型发布、论文),而非真实用户的痛点抱怨,可能
信号证据
这张卡片依据的原始讨论。摘录保持原文,点“原文”查看上下文。
arXiv cs.IR10月1日新能力
“In this work, we present a controlled comparison of six retrieval strategies for scientific question answering:”
The design space of RAG retrieval pipelines is large and the trade-offs between variants are not well understood, especially on domain-specific corpora at realistic scale.原文
Hugging Face · 热门模型9月21日新能力▲ 633
“Task: text-ranking”
A new 8B contrastive learning model for text ranking, available as a verifier and reranker for agents.原文