资讯

RTX 4060 跑 35B 模型,每秒 39 Token?伯克利、MIT 联手开源 FreeToken

InfoQ中文·2026/9/5 17:00:00🔗 原文

📋总体概括

伯克利与MIT团队联合开源推理加速框架FreeToken,宣称在消费级显卡RTX 4060上以每秒39 Token的速度运行350亿参数大模型。这一成绩意味着百元级显卡也能承载此前需要数据中心级硬件才能流畅运行的模型规模,若技术路径经社区复现验证,将显著降低大模型本地部署与端侧推理的门槛。

关键信息

  • 伯克利与MIT联合团队开源推理加速框架FreeToken
  • 在RTX 4060消费级显卡上实现35B参数大模型运行
  • 推理速度达到每秒39 Token,接近可用的流式输出体验
  • 技术若被复现,将大幅降低大模型本地化部署的硬件成本

🔥犀利点评

消费级显卡跑35B大模型,这卖点足够抓眼球,但39 Token每秒的真实成色才是关键——大概率是量化压缩加投机解码的组合拳,用输出质量或稳定性换速度。业界这类『 impressive benchmark 』见得多了,论文数字与实际部署之间往往隔着复现难度这条鸿沟。建议先等社区在真实负载下跑一遍再激动,不过开源本身值得点赞:推理降本已是当前最卷也最实的赛道。

本文由本站自动聚合,以下为原始来源:前往 InfoQ中文 阅读全文