Episode: 9月16日AI日报:Gemini 3.8 Live领衔语音爆发
Duration: approximately 9 minutes
Level: 入门
---
[Mike]: 欢迎来到从零开始学AI!先问你一个问题,如果你话还没说完,AI就已经听懂,还能插话接上,你觉得是方便,还是有点吓人?
[Sarah]: 又方便又吓人吧。今天可是热闹了,9月16日的日报一共13条,光语音相关的就来了四条,像约好了一样。
[Mike]: 对,先把菜单报一下。最重的是Google DeepMind发布Gemini 3.8 Live,还有个会深度思考的版本。然后是阶跃星辰的StepAudio 3系列,一口气发了五个。
[Sarah]: 还有生数科技的Vidu S2,数字人实时聊天加视频实时改。加上第三方榜单,OpenAI的GPT-Live-1拿了语音对话第一。
[Mike]: 配菜也硬。Perplexity自己造数据库,一年最多省1亿美元。Google还发了个能离线用的翻译小模型。
[Sarah]: 按老规矩,先讲概念,再聊新闻。第一个概念,什么是实时语音对话?
[Mike]: 打个比方,它像同声传译。不是等你说完一整段再翻译,而是边听边想,边想边说,还得允许你随时打断。
[Sarah]: 跟平时打字聊天不一样?打字可以等,对方说完你再慢慢回。
[Mike]: 对,打字能等,语音不能等。停顿超过1秒,人就觉得卡了。所以模型得做到三件事,听得快、想得快、说得自然,还不能抢话抢得太难看。
[Sarah]: 第二个概念,Extended Thinking,深度思考版本,这是什么意思?
[Mike]: 就是快思考和慢思考的区别。问今天天气怎么样,秒回就行。让你规划一次三天两夜的旅行,还得订票查路线,那就得多想一会儿。
[Sarah]: 所以一个模型配两个档?简单的直接答,复杂的慢慢想?
[Mike]: 就是这个意思。Gemini 3.8 Live主打近实时语音对话,Extended Thinking版本专门啃复杂任务。一个人,两副牌,看菜下饭。
[Sarah]: 概念齐了,进入主菜。Google这次具体发了什么?
[Mike]: 发了两个近实时语音对话模型,定位很清楚,语音智能体和复杂任务执行。官方博客是9月15日深夜发的,日报今天收录。
[Sarah]: 语音智能体,听着有点玄。是不是就是能打电话办事的那种AI?
[Mike]: 差不多。比如你说帮我约个理发,AI直接开口跟店员聊时间,还能应对对方的追问。以前是文字转语音硬读,现在是全程用语音思考。
[Sarah]: 第二道主菜,阶跃星辰的StepAudio 3,一口气五个,是哪五个?
[Mike]: Realtime、ASR、TTS、Gen和Music。拆开讲就明白了,ASR负责听懂,TTS负责说话,Realtime是全程对话,Gen和Music一个搞声音生成,一个搞音乐。
[Sarah]: 一条龙啊,从耳朵到嘴都包了。还说在Artificial Analysis榜单上多款全球第一?
[Mike]: 对,已经在阶跃开放平台上线了。榜单第一这个说法是官方口径,具体分榜单可以去原文核对。但一次发五个,确实是冲着语音全家桶去的。
[Sarah]: 第三条,第三方裁判来了。Artificial Analysis的语音对话榜,OpenAI的GPT-Live-1以81.5分登顶?
[Mike]: 没错,用的是Astra后端加中等推理强度。第二名是Grok Voice Think Fast 2.0 High,81.3分,只差0.2分。
[Sarah]: 0.2分,这不就是一个身位的差距吗?第三名呢?
[Mike]: 第三是Sol后端配置的同一模型,80.1分。等于前三里,OpenAI自己占了两个,中间夹着一个Grok。今天语音赛道是真挤。
[Sarah]: 我发现个规律,越是大家都发语音,越需要这种第三方榜。你自己说第一不算,跑分才算?
[Mike]: 对,就像运动会,总得有个秒表。榜单不能全信,但能看出谁在第一梯队。今天的第一梯队,全是语音。
[Sarah]: 第四条,Vidu S2。这个我熟,生数科技做视频的,这次发了Avatar和Editing两个模型?
[Mike]: 对,Avatar管数字人实时交互,你说话,屏幕里的人直接开口回你。Editing管视频流实时编辑,边播边改。
[Sarah]: 边播边改是什么意思?像直播时换背景那样吗?
[Mike]: 比那更狠。比如视频里的人正走着,你说把背景换成雪山,画面直接就变了,不用停下来重新生成。还探索了面向VR头显的实时空间视频。
[Sarah]: 空间视频,就是戴上头显能前后左右看的那种?
[Mike]: 对,普通视频是平的,空间视频是有进深的。你转头,画面跟着变。Vidu等于把实时从语音一路做到了视频。
[Sarah]: 四条语音过完,换个口味。Perplexity自己造数据库CobbleDB,一年最多省1亿美元?
[Mike]: 这条我最喜欢。Perplexity CEO自己宣布的,用自研的键值数据库替代AWS的DynamoDB,专门扛快速网页抓取。
[Sarah]: 键值数据库,听着好硬核。能不能用人话讲讲?
[Mike]: 就是个超级仓库, key是门牌号,value是货。你报门牌,它秒把货扔出来。网页抓取就是不停存网页、取网页,仓库一慢,全线都慢。
[Sarah]: 数据呢?真省了1亿美元吗?
[Mike]: 官方说法是每年最多省1亿美元,这是上限口径。硬数字是延迟,热存储批量读取,P50从31.4毫秒降到5.60毫秒,官方研究称快了约5倍。
[Sarah]: 从30多毫秒到5毫秒,眨眼要100多毫秒,这已经比眨眼快20倍了。最离谱的是,两个人加数百个智能体,两个月干完?
[Mike]: 对,两名工程师带着数百个持续运行的智能体,两个月搭完核心。以前是人带着工具干,现在是人带着一群AI干。
[Sarah]: 剩下的咱们快过一遍。Google说语言技术覆盖300多种语言,86%人口,还发了TranslateGemma?
[Mike]: 对,轻量开源翻译模型,支持55种语言,能离线跑。手机没网也能翻,这对很多地方太重要了。
[Sarah]: Claude给小企业加了43个工作流和27个集成,Shopify、Salesforce都在里面,安装超90万次?
[Mike]: 而且默认是审批模式,发送、发布、付款都得人点头。今秋还在10个美国城市办免费工作坊,挺会抓小老板的心。
[Sarah]: Vercel把销售团队从10人压到1.25人,靠AI销售智能体,年成本才几千美元?
[Mike]: 90%自动化了。1.25人这个数字很有意思,等于一个人全职加一个人兼职,剩下全是AI在干。
[Sarah]: 还有两条偏严肃的。OpenAI的莉莉计划,时薪超50美元的人工审核真实聊天记录?
[Mike]: 404 Media曝光的,内部代号莉莉计划。看的是匿名化后的记录,评回复切不切题,有没有AI腔和谄媚味。机器要学得像人,还得人先来当裁判。
[Sarah]: 另一条,Anthropic和OpenAI提议协调放缓前沿开发,Cohere CEO等人质疑动机?
[Mike]: 对,Dario Amodei呼吁协调放缓,还想要反垄断豁免,Sam Altman和Elon Musk表示同意。批评者觉得,这到底是为安全,还是为拉开差距,值得打个问号。
[Sarah]: 13条过完,收一下。今天最吵的是四个语音选手,最安静却最省钱的是那个自己盖仓库的。
[Mike]: 你这么一数,我发现个好玩的。台上四个都在比谁更会说话,台下Perplexity一句话不说,直接把仓库账单砍掉1亿美元。
[Sarah]: 会说话很重要,会算账也一样重要。下次你跟语音AI聊得正开心,可以想一下,它每回你一句,背后有多少个仓库在转。
[Mike]: 感谢收听从零开始学AI,把这期转给那个还在用打字跟AI聊天的朋友吧。
[Sarah]: 明天见!下一期日报,咱们继续一组一组过,保证每条都听得懂。
