Artificial Analysis 搜索指数给 OpenAI Web Search 打出 74 分
OpenAI Web Search 首次登榜 Artificial Analysis 搜索指数即取得 74 分,比未开启搜索的 GPT-5.6 Luna(33 分)高出 41 分。这一成绩让 OpenAI 在该指数的供应商中位列第 5,在 26 款受测产品中排在第 7,与 You.com (highlights)、Nimble (standard) 和 Exa (auto) 并列,落后于 Perplexity 各版本(77 至 80 分)、Octen(77 分)、Parallel advanced 以及 Brave LLM context(75 分)。
在各子项评测基准中,OpenAI Web Search 在事实性基准 AA-Omniscience 上排名最高,准确率为 72%,在 26 个版本中位列第 3,比 73% 的 Firecrawl 低 1 个百分点。在测试跨连续搜索多跳推理能力的 BrowseComp 上,其得分为 73.5%,排名第 13,落后于得分在 85% 至 87% 之间的 Octen 和 Perplexity 各版本。
测试在单次 Responses API 调用中完成,使用中等推理强度与中等搜索上下文的 GPT-5.6 Luna。OpenAI Web Search 包含搜索结果在内,每项任务大约计费 4 万个输入 token,而 Perplexity low 为 12.5 万个。总体任务成本平均约为 0.05 美元,低于榜单上 25 种 Search API 配置中的 17 种。OpenAI 对每 1,000 次 web_search 调用收费 10 美元,检索到的搜索内容按模型输入 token 计费。