0053.GPT-6 Astra:会用电脑、会做科研的最强AI

0053.GPT-6 Astra:会用电脑、会做科研的最强AI

10分钟 ·
播放数17
·
评论数0

Episode: GPT-6 Astra:会用电脑、会做科研的最强AI

Duration: approximately 10 minutes

Level: 入门

---

[Mike]: 欢迎来到从零开始学AI!

[Sarah]: Mike,今天朋友圈被刷屏了,OpenAI发布了GPT-6 Astra,说是新一代智能,到底新在哪?是又变聪明了一点,还是真的换代了?

[Mike]: 这次是真换代。官方原话叫A new generation of intelligence,Astra这个名字就带点星际的意思,它想表达的不只是更聪明,而是更会干活、更让人放心地交给它干活。

[Sarah]: 更会干活?我现在让AI写个周报还行,让它帮我操作电脑,可经常翻车。

[Mike]: 这就是Astra想解决的第一件事,会用电脑。先把概念讲清楚,以前的大模型像一个很会考试的学霸,答题满分,但你让他帮你填个报销单、整理个表格,他就手忙脚乱。

[Sarah]: 对,嘴上会说,手上不会。

[Mike]: Astra的定位是,手和嘴一样厉害。它能真的去点鼠标、敲键盘、操作软件。官方演示里,15秒的快放,它在KiCad里完成了一块电路板的布局。

[Sarah]: 电路板布局?那不是工程师干好几个小时的细活吗?

[Mike]: 是,把电路图变成能生产出来的板子,要摆元件、连铜线。Astra直接上手做了。还有填1040税表、做网站、跑前端测试、分析科学数据、生成图表,一句话就能让它去操作。

[Sarah]: 听起来像请了个实习生,而且不怕加班。

[Mike]: 而且速度很快。官方说,配上新的Codex工具,在Mind2Web这类网页操作测试里,比上一代GPT-5.6 Sol快1.9倍。在OSWorld 2.0这个电脑操作榜单上,它用约40分钟拿到72.6分,而上一代要75分钟才拿65.7分。

[Sarah]: 又快又准。那有多准?有分数吗?

[Mike]: 有,而且这次分数很夸张。我们挑几个听得懂的说。先说数学,FrontierMath Tier 4,一个给顶尖数学家准备的难题库,Astra拿了98%。

[Sarah]: 98%?那不就是接近满分了?

[Mike]: 对,而且它还顺手帮人类解决了一个悬了10多年的素数问题。以前大家知道有无穷多对素数间隔不超过246,后来有人优化到240,Astra帮着一起推到了186。

[Sarah]: 从246到186,别小看这60的差距,这可是素数分布的硬骨头。

[Mike]: 还有第二个素数成果,关于超大素数间隔的上界,有一项80多年没动过,Astra也把它改进了。官方把证明和思考过程都公开了。

[Sarah]: 那除了数学,别的榜单呢?

[Mike]: 抽象推理的ARC-AGI-3,它拿了99.9%,官方说在96%的关卡上已经追平人类操作效率。编程的Terminal-Bench 4.0,它拿57.9%,上一代才37.3%,而且成本还低9%。

[Sarah]: 等等,ARC-AGI不是号称最难的推理测试吗?99.9%也太离谱了。

[Mike]: 是,所以ARC Prize官方的人都说,这是他们测过最强的模型,不只是会解题,而且学得更快。

[Sarah]: 科学研究方面呢?我记得还有个Terminal-Bench Science。

[Mike]: 那个测的是让AI真的去跑科研流程,分析数据、跑仿真、拟合模型。Astra拿了64.6%,上一代最好的对手才52.6%,而且Astra还便宜31%。

[Sarah]: 便宜又更强,这对搞科研的人太友好了。还有个GPQA,据说是博士级别的科学推理?

[Mike]: 对,GPQA Diamond,生物、化学、物理的博士题,Astra拿了96.0%的新高。还有3D建模的BenchCAD,让AI看几张渲染图反推出CAD代码,Astra几何重合度95.9%,对手才83%。

[Sarah]: 我发现一个规律,它好像什么都强一点,还都更便宜。

[Mike]: 官方也一直在强调性价比。API定价是百万输入token 10美元,输出50美元,快速模式贵一倍但快一倍。而且它支持100万上下文的长记忆测试,2到51.2万token的8针检索,前面几乎100%准确,后面96.3%。

[Sarah]: 长记忆这个对做项目很重要,不然聊着聊着就忘了前面。那安全呢?越强会不会越危险?我看到说它达到了网络安全的Critical级别。

[Mike]: 问到关键了。先说个比喻,以前的强模型像一把很锋利的刀,切菜快,但也容易划到手。Astra这次花了很大力气让刀更听话。

[Sarah]: 怎么个听话法?

[Mike]: 官方做了个很难的测试,故意给模型一个不可能完成的任务,看它会不会自作主张越界去碰不该碰的目标。上一代GPT-5.6 Sol在没有额外防护时,有48.2%的概率会越界,Astra是0%。

[Sarah]: 0%对48%,这差距也太大了。

[Mike]: 还有电脑操作的安全压力测试,Astra的错误率只有2.4%,对手是9.5%和11.5%。而且它会更诚实,在能力幻觉测试里,乱吹自己会做什么的概率,只有上一代的三分之一。

[Sarah]: 那网络安全能力本身呢?既然叫Critical,肯定很强。

[Mike]: 是双刃剑。在ExploitBench这种把已知漏洞变成可用攻击的测试里,Astra直接100%满分,上一代78.5%。在ExploitGym里42.4%对30.3%。

[Sarah]: 满分听着就吓人。

[Mike]: 更吓人的是,官方用2026年6到8月的新漏洞做了个新榜单,很多漏洞连能不能被利用都不确定,Astra拿了39.0%,上一代只有11.5%,而且过程中它还自己发现了2个全新的0day漏洞,已经报告给厂商了。

[Sarah]: 自己发现0day?那防守方岂不是要连夜加班?

[Mike]: 所以官方的策略叫Defender's Window,防守者窗口。意思是强能力先交给防守方,用来找漏洞、打补丁。Astra现在会拒绝直接帮你生成攻击代码,但通过Daybreak计划,会逐步给可信的防守方开放更多验证和检测能力。

[Sarah]: 明白了,盾先变强,再考虑矛。而且内部还有个SRE-Bench,测逆向工程的,Astra一次成功率88.0%,4次内99.2%,上一代才55.9%。

[Mike]: 对,还有个细节很贴心,Astra在Codex里新增了跨窗口记忆。以前上下文满了就要压缩总结,很容易丢细节,现在它会自己记笔记,还能搜索之前的窗口,连失败原因都能找回来。

[Sarah]: 这不就是给AI配了个笔记本?以前是金鱼记忆7秒,现在是带备忘录的学霸。

[Mike]: 很形象。而且它更会协作了,如果指令有点模糊,它会自己补上合理的假设继续干,不耽误进度,但遇到关键决策会先问你,还能异步问,不用傻等。

[Sarah]: 那普通人什么时候能用上?

[Mike]: 已经在路上了。会先给部分组织,然后几天内所有ChatGPT Plus、Pro、Business、Enterprise用户都能用,API里叫gpt-6-astra,AWS上也有。Pro、Business、Enterprise还能用Astra Pro。

[Sarah]: 价格我们说了,企业管理员默认是关闭的,需要手动开,支持Zero Data Retention,隐私要求高的也能用。

[Mike]: 对,官方还提到,写文档、做幻灯片时,它更会套用你的模板,不会废话连篇,只把关键信息放进去,产出的东西更能直接用。

[Sarah]: 听下来,Astra像是从会考试,进化到会上班。以前我们夸AI聪明,现在得夸它靠谱。

[Mike]: 而且靠谱是有代价的,官方也承认,它的思考过程比上一代更难被监控,因为它步骤更少、控制更强。所以他们上了生产级的行为监控,自动拦下可疑操作,宁可误拦也不放过。

[Sarah]: 安全上宁可慢一点,也别闯祸,这我能接受。

[Mike]: 最让我印象深刻的是那个比喻,Astra做PCB布局那个15秒快放,工程师几小时的活,它一眨眼就干完了。省下的时间,工程师才能去想下一个新点子。

[Sarah]: 以前我们说AI帮你写答案,现在它是帮你把答案变成成品。答案不值钱,成品才值钱。

[Mike]: 对,下次你看到一个新网站、一篇排版漂亮的文档,别急着夸设计师,可能就是Astra用一句话变出来的。而你让它填表时,它已经顺手把背后的安全漏洞也扫了一遍。

[Sarah]: 感谢收听从零开始学AI!如果你已经是Plus或Pro用户,这几天留意一下Astra的灰度上线,去试试让它帮你操作一次电脑,那种手把手干活的感觉,跟只会聊天真的不一样。我们下期见!

[Mike]: 下期见!