产业观察
卢伟冰谈小米18 Pro涨价:大家会觉得合理;剪映发布 Hub 及 AI 助手「小映」;苹果或 10 月推出智能家居设备|极客早知道
📋总体概括
B站9月20日上线「AI无限竞技场」大模型测评榜,由各领域UP主基于真实工作流、专业应用与趣味脑洞自主命题,对上百个大模型进行同题实测,涵盖代码、推理、协作、知识等主题。首轮榜单中GPT-6 Astra在10个UP主测评中登顶,击败GLM-5.3拿下榜首次数冠军,前5名中国产大模型占3席;榜单覆盖DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、MiniMax等主流模型,排名实时更新并持续开放UP主报名。区别于传统跑分,这一众测模式强调真实场景表现,或为用户选模型提供更接地气的参考。
⚡关键信息
- ▸B站于9月20日上线AI无限竞技场大模型测评榜,由UP主对上百个大模型进行真实场景实测
- ▸GPT-6 Astra在10个UP主测评中登顶,击败GLM-5.3获得榜首次数冠军
- ▸首轮榜单前5名中国产大模型占据3席
- ▸测评不限主题维度,涵盖代码、推理、协作、知识等,采用UP主自主命题同题PK
- ▸榜单覆盖DeepSeek、Kimi、Claude、豆包、千问等主流模型,实时更新并面向全站UP主开放
🔥犀利点评
大模型榜单多得让人麻木,B站这招聪明在于把裁判权交给UP主——真实工作流里的翻车与惊艳,比刷榜跑分诚实得多。但众测榜单的天花板也明显:样本质量参差、样本量靠UP主用爱发电,能否长期抗住刷榜和恰饭软文,才是它能活多久的关键。GPT-6 Astra登顶不意外,国产占3席才是真正值得盯的信号。
📰 相关资讯(与本文相关的其他资讯)
本文由本站自动聚合,以下为原始来源:前往 极客公园 阅读全文 →