Hassan 发布 GeoGuess Bench,用于评估 AI 模型的 GeoGuessr 定位表现
Hassan 发布了基准测试 GeoGuess Bench,用于评估 AI 模型在地理定位游戏 GeoGuessr 中的表现。该测试向各模型提供 210 张全球各地的照片,要求其预测拍摄地点,并根据预测位置与实际位置的距离进行评分。
测试结果显示,Claude Opus 5.5 成绩高于 Fable 5.1,位列榜首。开源模型也表现出较高的成本效益:Muse Glimmer 30B 以低约 45 倍的成本超越了 GPT 6 Astra,GLM 5.3 Flash 则以约五分之一的成本达到了与 GPT 6.1 Sol 相当的表现。完整排行榜与预测记录已在 [GeoGuess Bench](http://geoguessbench.com) 公布,代码托管于 [GitHub](http://github.com/Nutlope/geoguessbench)。