科技团队构建检索系统的方式正在快速演变。AI编程工具Cursor近期宣布放弃基于向量嵌入的代码搜索,转而完全依赖grep与索引搜索;其他团队也在用Jev等新型模型替换传统的重排序器。在AI Agent依赖的各类知识中,企业知识是至关重要的一类,涵盖文档、工单、聊天记录、内部Wiki和代码等来源。然而,由于缺乏在真实数据上衡量检索表现的手段,多数团队无法判断哪种检索方案在自己的数据上效果最佳。Kapa是一个企业知识索引平台,用户接入各类数据源后,平台将其整合为统一可搜索的知识库,任何Agent都可以查询它以获取所需上下文。检索是该平台的核心能力,团队会不断调整和迭代检索方案。为了评估自身系统,Kapa构建了Company Knowledge Bench基准测试:从真实生产数据中标注了1000个评估用例,专门衡量检索系统在杂乱真实企业数据上的表现。文章详细介绍了该基准的工作机制,对几种常见检索实现进行了评分,并公布了各方案在查询得分与单次查询耗时上的对比结果,为行业提供了少有的真实场景检索评测参考。
事件分析
核心观点:向量嵌入并非银弹,检索评测正从学术基准转向真实脏数据,这将成为Agent基础设施竞争的新分水岭。
原文链接:Hacker News

评论前必须登录!
立即登录 注册