趋势解读:Perplexity's "Search as Code" lets AI models write,评估 LLM Agent 表现
Perplexity推出"Search as Code"新架构,让AI模型编写Python脚本来执行搜索,而非调用固定API,在复杂研究任务中可降低85%的token使用量,并显著提升准确率。
原贴
查看原文原文
中文翻译
在Perplexity的新"Search as Code"架构中,模型不调用现成的搜索API,而是编写自己的搜索工作流程作为Python代码。该公司承诺更精确的结果和更低的token使用量。
任何看过AI智能体处理复杂研究任务的人都会看到同样的模式。模型编写一个查询,搜索API返回结果列表,模型读取它们,然后编写下一个查询。这个循环重复,往往连续多次。
Perplexity在一份新技术报告中称此为瓶颈。今天的搜索引擎是为想要整齐蓝色链接列表的人类构建的,但对于试图在几分钟内运行数百次搜索的AI智能体来说,这种设置过于僵化。智能体只能调整搜索词;其他一切都是黑箱。
"Search as Code"(SaC)改变了这一动态。不是调用API,而是模型编写一个自定义Python脚本来运行搜索。该脚本在安全沙箱中运行,从Perplexity的搜索后端拉取数据。检索、过滤、去重和重排序等基本操作被封装为简单的SDK函数。
该架构分为三层。顶层是模型,它理解任务并决定搜索策略。中间是运行代码的沙箱。底层是"Agentic Search SDK",它将Perplexity的搜索引擎拆分为独立的、可混合匹配的函数。
标准搜索API仍然存在,用于快速问题。但对于困难的研究,模型可以深入得多。它可以同时发起并行查询,以编程方式过滤掉噪音,并将相关结果拉入上下文窗口。据Perplexity称,这就是胜利所在。
标准搜索管道会因过滤逻辑被锁定而用垃圾填满智能体的上下文窗口。当智能体编写自己的过滤器时,上下文保持精简,模型在长时间的研究过程中保持方向感。
为了展示这在现实世界中的效果,Perplexity在一个混乱的网络安全任务上进行了测试。一个智能体必须追踪200个2023年至2025年间发布的严重软件漏洞(CVE)。对于每个漏洞,它需要找到官方供应商公告、受影响的软件以及修补该漏洞的确切版本。新闻报道或博客文章不算数。
使用SaC,模型编写了一个三阶段脚本。它针对Mozilla或Google等特定供应商的安全公告格式运行了定制化的并行搜索。接下来,它扫描自己的发现,发现缺口,并运行针对性的后续查询。最后,它使用一个模式验证CVE、产品和修复版本是否全部对齐。
它成功了。Perplexity称智能体完成了任务,同时比其标准管道少用了85%的token。竞争系统获得不到四分之一的数据正确。Perplexity声称SaC在五个基准测试中的四个上击败了OpenAI的Responses API和Anthropic的Managed Agents等竞争对手。最大的差距在"WANDR"上,这是Perplexity自己为广泛研究任务设置的基准,计划很快发布。
当然,对于自我报告的基准要持保留态度,但与Perplexity自己旧架构的比较显示出了清晰、巨大的性能飞跃。Perplexity将SaC视为更大趋势的一部分。传统软件依赖于确定性指令。前沿模型在token空间中添加推理。最强大的系统结合两者:模型负责策略,确定性运行时负责批处理和过滤,搜索基础设施作为I/O层。
核心信息
Perplexity推出"Search as Code"新架构,让AI模型编写Python脚本来执行搜索,而非调用固定API,在复杂研究任务中可降低85%的token使用量,并显著提升准确率。
- Perplexity推出Search as Code架构,模型自写搜索脚本
- 相比传统API,SaC降低85% token消耗
- 在CVE追踪任务中准确率远超竞品
- 代表推理+确定性代码结合的趋势
- 沙箱运行代码,平衡灵活性与安全性
成为会员查看完整内容
你已经看到了这篇内容的前置整理,剩余深度部分仅对会员开放。