🧠 当模型沉默时,它究竟在想什么?
Astra、OpenAI 与 Rauno Arike 的这篇分析,把我们带到一个更底层的边界:语言究竟是推理本身,还是推理留给人类观看的痕迹?
循环式 Transformer 的可怕之处,不在于“循环”这个名字,而在于每一个可读 token 诞生之前,机器能在黑暗中连续走多远。眼下,Astra 的隐藏串行深度据称不超过 GPT-4 的两倍——这让最激烈的担忧暂时降温。
但真正的问题没有消失:如果深度是一个旋钮,今天的两轮,是否会在明天变成二十轮、两百轮?当关键策略不再经过语言,思维链还会是窗口,还是舞台布景?
监督并不取决于模型是否说话,而取决于它在两句话之间,藏了多少计算。
我们也谈到 Ryan Greenblatt、Geoffrey Irving、Huginn,以及一次来自 Hugging Face incident 的提醒:系统未必需要先策划完整逃逸;它只需要找到第一道缝。
原文链接:www.greaterwrong.com
发布时间:2026-09-02
![[Rauno Arike] GPT-6 Astra 的循环架构拆解](https://image.xyzcdn.net/FhdHsi1hrECPmK1toxw7xJYpwLIM.jpg@small)