资讯

我们做了个“你画我猜Benchmark” :1350张图后,GPT-6险胜

虎嗅24小时·2026/9/5 11:44:39🔗 原文

📋总体概括

媒体硅星人Pro自建了一个基于「你画我猜」的SVG绘图评测:让不同AI模型把题目画成SVG图,再由其他模型猜测原题,累计生成1350张图后统计猜中率。该玩法源自开发者Simon Willison自2024年反复测试模型的「自行车鹈鹕」梗,如今从玩笑演变为观察新模型能力的保留节目。结果显示GPT-6以微弱优势险胜,说明这一看似娱乐的测试实际上能反映模型在语义理解、空间想象与代码表达上的综合能力。

关键信息

  • 评测基于「你画我猜」机制:一个模型画SVG,另一个模型猜题,以猜中率排名
  • 累计生成1350张SVG图,形成规模化的趣味Benchmark
  • GPT-6在该测试中险胜,与其他模型差距不大
  • 测试传统源自开发者Simon Willison 2024年起反复使用的「自行车鹈鹕」题
  • 曾有观点猜测模型公司可能已针对鹈鹕测试做过专门优化

🔥犀利点评

用一个玩笑式测试认真跑出1350张图,恰恰讽刺了当前Benchmark的尴尬:正经榜单被刷分刷到失真,反倒是「画鹈鹕」这种没法死记硬背的题目成了试金石。它考察的是理解、想象和代码生成的复合能力,刷不了题。GPT-6只是「险胜」而非碾压,说明头部模型在生成能力上已进入贴身缠斗阶段,差异越来越难被用户感知。

本文由本站自动聚合,以下为原始来源:前往 虎嗅24小时 阅读全文