0052.Gemini 3.8 Flash双发:编程提速,安全补洞

0052.Gemini 3.8 Flash双发:编程提速,安全补洞

11分钟 ·
播放数8
·
评论数0

Episode: Gemini 3.8 Flash双发:编程提速,安全补洞

Duration: approximately 11 minutes

Level: 入门

---

[Mike]: 欢迎来到从零开始学AI!

[Sarah]: Mike,我最近看AI新闻都看晕了,6周内连发3个Flash版本,这次9月2日又来了个Gemini 3.8,双发?谷歌是在搞手机系统更新吗?

[Mike]: 哈哈,很像。但这次双发有点特别,一次发了两个,Gemini 3.8 Flash和Gemini 3.8 Flash Cyber,一个管干活,一个管抓贼。

[Sarah]: 管干活和管抓贼?先说管干活的Flash到底是什么?

[Mike]: 好,先把概念讲清楚。大家听过AI模型越大越聪明,对吧?但聪明往往意味着又贵又慢。

[Sarah]: 就像请个院士来帮你写周报,厉害但太浪费了。

[Mike]: 对,所以谷歌做了Flash这个系列,定位是主力干活的快马。便宜、跑得快,但这次要证明,快马也能干重活。

[Sarah]: 这次3.8有什么不一样?

[Mike]: 官方说,这是目前推理和编程最强的Flash,但速度和价格跟3周前的3.7 Flash一模一样。百万输入token只要0.75美元,输出3.75美元,这个优惠价到2026年12月31日,明年才涨到1.5和7.5美元。

[Sarah]: 等等,6周发3次,价格还不涨,能力却变强了?怎么做到的?

[Mike]: 核心是个新训练思路,叫长程Agent循环。不是只喂数据,而是让模型自己像打磨作品一样,反复评估、挑错、再改进,循环很多轮。

[Sarah]: 就像让AI自己当自己的老师,不断批改作业?

[Mike]: 很像。而且这次专门用网络安全这种最难的领域来磨它,结果编程和推理能力顺带一起提上来了。

[Sarah]: 那效果怎么样?真的能跟那些又大又贵的顶级模型掰手腕吗?

[Mike]: 在一个叫DeepSWE v1.1的长程编程测试里,3.8 Flash能从头到尾自主解决复杂工程问题,分数超过了大部分更大、更贵的顶级模型,但成本只是零头。

[Sarah]: 长程编程是什么意思?跟平时让AI写一段代码有什么区别?

[Mike]: 平时写代码是问一句答一句,发个函数就完了。长程是像一个真正的程序员,接一个需求,中间要自己拆任务、查资料、调工具、试错、改bug,可能要跑几十步。

[Sarah]: 懂了,以前是计件工人,现在是能独立负责一个项目的工程师。

[Mike]: 对,谷歌把它叫agentic workflows,就是Agent自主工作流。3.8 Flash还特别适配企业里的专业活,在金融Agent测试Vals Finance Agent V2和法律Agent测试Harvey's Legal Agent Benchmark上都超过了3.7和其他顶级模型。

[Sarah]: 还有个54.9%的分数是什么?

[Mike]: 是HLE-Verified,测的是跨学科多步推理,科学、人文、专业领域都要考,3.8 Flash拿了54.9%,说明它不偏科。

[Sarah]: 怎么做到的?偷偷用了更多算力吗?

[Mike]: 被你猜中了。官方的解释很诚实,3.8 Flash就是更用功。遇到难题,它会多想几步,多调几次工具,自然就要多用一些token。

[Sarah]: 那不就是用时间换质量?

[Mike]: 对,所以它提供了不同努力等级。赶时间就用低努力,省token;要质量就让它多想一会。如果只想省钱,继续用3.7 Flash也完全没问题。

[Sarah]: 有没有好玩的例子,证明它真的更会干活了?

[Mike]: 有,而且都是用一句话就生成的。在谷歌的Antigravity里,一句提示词就做出一个巫师城堡3D游戏,里面的解谜、环境叙事和纹理都是用Nano Banana生成的。

[Sarah]: 一句话就做个游戏?

[Mike]: 还有一句提示词做出能在DOS系统里跑的谷歌地图,能查地点、找路线、看街景。还有用美国地质调查局真实数据做的地形剖面图,实时的。

[Sarah]: 还有一个我记得,硬件拆解的?

[Mike]: 对,Hardware Anatomy,在AI Studio里用Three.js做的,能把一个硬件设备按比例拆开,分层、爆炸图、滑动查看,教科书级别的3D可视化。

[Sarah]: 听起来管干活这个确实能干。那管抓贼的Cyber又是怎么回事?

[Mike]: 这就是双发的第二位主角,Gemini 3.8 Flash Cyber。它跟普通Flash是同一个大脑,但专门为网络安全调优的,而且更放开了一些安全限制。

[Sarah]: 为什么要单独做一个?直接让普通版去抓漏洞不行吗?

[Mike]: 因为安全能力很特殊。如果给所有人开放太强的攻防能力,坏人也能用。所以谷歌只通过一个叫Fairwind Program的计划,开放给可信的防守方,比如政府、关键基础设施、软件维护方。

[Sarah]: 明白了,手术刀只给医生,不给路人。

[Mike]: 这个比喻很准。Cyber的核心就两件事,找漏洞和打补丁。

[Sarah]: 先说找漏洞,厉害在哪?

[Mike]: 在业界标准测试CyberGym上,3.8 Flash Cyber找漏洞的能力超过了上一代3.5 Flash Cyber,也超过了很多更大的顶级模型。

[Sarah]: CyberGym只测C和C++吧?会不会太窄?

[Mike]: 谷歌自己也这么想,所以又做了一个内部测试,覆盖20种编程语言、更复杂的真实代码库,找各种各样的漏洞。结果成功率超过70%,比上一代高一大截。

[Sarah]: 70%在20种语言里,这个很夸张了。那打补丁呢?找到漏洞不会修也白搭。

[Mike]: 打补丁测的是CWE-Bench,专门看能不能自动生成正确的修复代码。3.8 Flash Cyber一次就成功的比例是47.2%,而一个顶级大模型的最好成绩是47.8%。

[Sarah]: 差0.6个点,好像没赢啊?

[Mike]: 关键是成本。达到几乎一样的准确率,Cyber的成本要低得多,在性价比那个曲线上,它已经站在最前面了。谷歌特意说,他们优先做修复,而不是去做攻击性的利用。

[Sarah]: 这思路挺正的,帮防守方抢时间。那真实世界里有用吗?

[Mike]: 已经在谷歌内部用了。Chrome安全团队说,3.8 Flash Cyber给Chrome漏洞生成的正确补丁数量,是其他更大商业模型的2.6倍。

[Sarah]: 2.6倍,这差距很大了。

[Mike]: 还有Wiz公司,在他们的内部渗透测试里,Cyber的召回率高了7.5%到9.7%,但成本反而低了2.3到5.2倍。

[Sarah]: 省钱又更准,防守方最爱这个。

[Mike]: 最夸张的是谷歌云的漏洞研究团队,用3.8 Flash Cyber在不到2小时内就找到一个关键的基础漏洞,而平时这种发现要花好几个月。

[Sarah]: 2小时对几个月,这不就是把大海捞针变成了磁铁吸针?

[Mike]: 很形象。还有个隐藏的进步是防提示词注入。就是防止坏人用一句隐藏指令骗AI干坏事。在Gray Swan的那个攻击测试里,3.8的抗注入能力也大幅提升了。

[Sarah]: 所以普通Flash是给大家的快马,Cyber是给守门人的盾牌。那普通人怎么用上?

[Mike]: 开发者可以去Google Antigravity玩Agent工作流,或者在Google AI Studio、Android Studio、Stitch里直接调用Gemini API,文档都更新了。

[Sarah]: 企业和普通用户呢?

[Mike]: 企业在Gemini Enterprise里就能用。普通用户如果是Google AI Pro和Ultra订阅,在Gemini App、谷歌搜索的AI Mode,还有Google Sheets里已经能用上3.8 Flash了。

[Sarah]: Cyber要怎么申请?

[Mike]: 去Fairwind Program官网申请,deepmind.google/fairwind-program,审核通过的防守方才能拿到。

[Sarah]: 听下来我有个感觉,以前我们总觉得安全就是把门锁得更紧,现在是给守门人配了个能2小时扫完全楼的机器人。

[Mike]: 而且这个机器人平时还能帮你写代码、做3D模型、跑金融分析。最有意思的是,谷歌说让它变强的方法,就是让它去学最难的防守。

[Sarah]: 就像让一个学生去做最难的奥数题,结果回来发现普通考试都变简单了?

[Mike]: 对。以后你手机上那个又快又便宜的助手,背后可能是个练过抓黑客功夫的高手。只是它平时不说,你让它写个表格,它就好好写表格。

[Sarah]: 那下次再听到6周3更,就不觉得是催更了,是这个快马在偷偷练功。

[Mike]: 没错。下次如果你的AI助手秒回了一个很复杂的表格,别忘了,它可能刚刚才在后台帮Chrome补了个漏洞。

[Sarah]: 感谢收听从零开始学AI!如果你是开发者或做安全的小伙伴,不妨去AI Studio试试3.8 Flash,或者去看看Fairwind Program。我们下期见!

[Mike]: 下期见!