资讯🔥7.0

万字详解GPT-6 Astra,Sebastian Raschka带你读懂循环Transformer与隐藏的思维链

华尔街见闻·2026/9/15 02:17:10🔗 原文

📋总体概括

OpenAI 新旗舰 GPT-6 Astra 发布前后,因被曝采用循环深度(looped transformer)架构、可能使部分推理过程不可见而引发 AI 安全争议。OpenAI 首席科学家 Jakub Pachocki 出面澄清,称当前前沿模型计算图深度与 GPT-4 差距仍在两倍以内,并反对奔向不可监控性的竞赛。随后 Sebastian Raschka 发表万字长文,系统讲解循环 Transformer 与隐藏思维链的技术原理,为混乱的舆论提供了技术层面的拆解。

关键信息

  • The Information 援引内部消息称 GPT-6 Astra 采用循环深度/循环 Transformer 设计,可能让部分乃至全部推理过程不可见
  • OpenAI 首席科学家 Jakub Pachocki 亲自澄清,强调避免由混乱报道引发的不可监控性竞赛
  • Pachocki 透露包括 Astra 在内的当前前沿模型,计算图深度与 GPT-4 的差距仍在两倍以内
  • 《Build a Large Language Model (From Scratch)》作者 Sebastian Raschka 发万字长文,摊开讲解循环深度技术细节

🔥犀利点评

这事最讽刺的地方在于:争议的核心不是技术,而是不可见性。循环深度本身是提高算力复用效率的正经架构演进,真正让安全圈炸锅的是「推理过程藏起来」这个副产品——链式思维可读性恰恰是当前对齐的主要抓手。Pachocki 用「计算图深度差距不到两倍」灭火,等于侧面承认架构确实变了但没变那么夸张。行业真正要回答的问题是:当隐藏计算越来越深,审计模型思维的能力必须同步跟上,否则每家都会以架构之名收窄监督窗口。

本文由本站自动聚合,以下为原始来源:前往 华尔街见闻 阅读全文