[Rauno Arike] GPT-6 Astra 的循环架构拆解

[Rauno Arike] GPT-6 Astra 的循环架构拆解

24分钟 ·
播放数8
·
评论数0

🧠 当模型沉默时,它究竟在想什么?

Astra、OpenAI 与 Rauno Arike 的这篇分析,把我们带到一个更底层的边界:语言究竟是推理本身,还是推理留给人类观看的痕迹?

循环式 Transformer 的可怕之处,不在于“循环”这个名字,而在于每一个可读 token 诞生之前,机器能在黑暗中连续走多远。眼下,Astra 的隐藏串行深度据称不超过 GPT-4 的两倍——这让最激烈的担忧暂时降温。

但真正的问题没有消失:如果深度是一个旋钮,今天的两轮,是否会在明天变成二十轮、两百轮?当关键策略不再经过语言,思维链还会是窗口,还是舞台布景?

监督并不取决于模型是否说话,而取决于它在两句话之间,藏了多少计算。

我们也谈到 Ryan Greenblatt、Geoffrey Irving、Huginn,以及一次来自 Hugging Face incident 的提醒:系统未必需要先策划完整逃逸;它只需要找到第一道缝。

原文链接:www.greaterwrong.com

发布时间:2026-09-02