产业观察

卢伟冰谈小米18 Pro涨价:大家会觉得合理;剪映发布 Hub 及 AI 助手「小映」;苹果或 10 月推出智能家居设备|极客早知道

极客公园·2026/9/21 01:01:53🔗 原文

📋总体概括

B站9月20日上线「AI无限竞技场」大模型测评榜,由各领域UP主基于真实工作流、专业应用与趣味脑洞自主命题,对上百个大模型进行同题实测,涵盖代码、推理、协作、知识等主题。首轮榜单中GPT-6 Astra在10个UP主测评中登顶,击败GLM-5.3拿下榜首次数冠军,前5名中国产大模型占3席;榜单覆盖DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、MiniMax等主流模型,排名实时更新并持续开放UP主报名。区别于传统跑分,这一众测模式强调真实场景表现,或为用户选模型提供更接地气的参考。

关键信息

  • B站于9月20日上线AI无限竞技场大模型测评榜,由UP主对上百个大模型进行真实场景实测
  • GPT-6 Astra在10个UP主测评中登顶,击败GLM-5.3获得榜首次数冠军
  • 首轮榜单前5名中国产大模型占据3席
  • 测评不限主题维度,涵盖代码、推理、协作、知识等,采用UP主自主命题同题PK
  • 榜单覆盖DeepSeek、Kimi、Claude、豆包、千问等主流模型,实时更新并面向全站UP主开放

🔥犀利点评

大模型榜单多得让人麻木,B站这招聪明在于把裁判权交给UP主——真实工作流里的翻车与惊艳,比刷榜跑分诚实得多。但众测榜单的天花板也明显:样本质量参差、样本量靠UP主用爱发电,能否长期抗住刷榜和恰饭软文,才是它能活多久的关键。GPT-6 Astra登顶不意外,国产占3席才是真正值得盯的信号。

本文由本站自动聚合,以下为原始来源:前往 极客公园 阅读全文