特工们不会像人类一样搜索 他们每课时都会发出上百个查询,需要从片段的关联性上有条理地提取,并且比完美的顶端结果更关心p95的耐久性.
Keenable围绕这些制约因素构建了一个搜索API,并配有100B+页面专有索引,类似SQL的查询界面,以及针对类似代理的工作量持续设定基准.
创始人(Amazon AGI网络定位,Yandex搜索线索)打赌,当代理商成为网络数据的主要消费者时,将已存在的搜索API包装不会剪切.
该架构揭示了当您优化机器呼叫器而不是人类眼球时会有什么变化.
为什么代理搜索需要不同的Plumbing Human搜索优化前三个结果,并容忍500ms的差异.
Agent search在紧接回回路中运行,每个查询块都会在下游工具呼叫.
合同会移: 查询卷: 代理每次任务发布10-100x的查询量比人类每次会话 Latency 预算: p95 事项,因为代理将工具调用序列化; 尾端耐用化合物跨多步工作流程 计算:代理分析结构化数据,不是蓝色链接; 用于人类点击的关联分数与提取成功不相符合 查询模式: 代理使用精确的过滤器(日期范围,域限制,schema提示),人类很少指定为人流量处理代理工作量所构建的传统搜索API.
费率限额假定零星查询。
定价等级惩罚大量方案准入。
关联性模型优化了在代理环境下不存在的接触度量衡. 100B-Page指数决策Keenable维持自己的爬行和指数,而不是包接Google,Bing,或Brave.
这是昂贵的,但解锁了控制: Crawl策略:代理商需要关于以人类为中心的爬行者不优先的优势域的新数据.
专有爬行可以瞄准高通源(工作板,定价页,事件上市)并用代理驱动的时间表来重新爬行,而不是PageRank的加权间隔.
Index schema:人类搜索指数优化,用于片段提取和关键词匹配.
代理搜索需要在索引时间取出结构化字段(打印日期,作者,价格,位置),而不是查询时间.
该索引成为一个可查询的数据库,而不是一个排序的文档存储.
即时控制:自有索引表示与存储共位查询处理.
第三方API包装器增加了网络hop和速率限制的不可预测性.
Keenable报告美国东部的<250ms p95, 因为整个堆栈运行在同一区域。
成本结构:按规模,API包装经济分出.
如果代理工作流程每个用户发送1000个查询,而你向上游供应商支付每1K个查询的5美元,那么在任何其他基础设施成本之前,每个查询会花费5美元.
专有指数转换为固定的爬行和服务成本,以摊还所有查询。
取舍:你现在负责爬行礼貌,重复检测,垃圾邮件过滤,以及索引新鲜.
您需要 petabyte 大小存储和分布式查询处理 。
这只有在代理查询量证明固定成本合理的情况下才有意义.
SQL-like Query 界面 Keenable 曝光一个类似 SQL 的语法用于网络查询.
代理以明确的过滤器和预测构建查询,而不是关键字串: 这改变了管弦乐合同。
传统的搜索 APIs 返回排序列表;代理 剖析片段,并希望 LLM 提取正确的字段 。
类似 SQL 的查询返回搜索引擎处理提取时的结构化记录.
Orchestration impact:代理商可以使用不同的滤波器发出平行的查询,而不是通过相接结果进行活化.
定价比较机构可能运行: 这与本来是相继的 LLM 要求解析无结构片断的类似。
失败模式:在SQL类查询与页面结构不相匹配时,会硬性失败.
如果索引时间不正确提取, 查询返回空结果而不是降低 gr