章节时间戳
00:00 开场
00:58 精讲:Gradium 的 Neil Zeghidour 解析全双工语音交互
03:40 精讲:Google Cloud Blog 讲解 GKE 上的 Agent Substrate 隔离与恢复
06:20 精讲:Claude Blog 介绍 Salesforce 在 Claude 中的权限内协作
08:54 重点 4–6:StepAudio 3、Pinterest Manas、APXInf
10:39 重点 7–10:Hermes、AI 化学模拟、Claude Small Business、OpenAI 语音模式
13:02 结语
★ 精讲一 | 你的语音智能体还只是对讲机 — Neil Zeghidour,Gradium [视频]
00:58|来自 AI Engineer|BestBlogs 评分 89
Gradium 负责人从语音交互的演进解释全双工为何关键:现有语音模型多在听与说之间轮换,难以处理附和与重叠表达。团队主张让轻量语音界面负责自然对话,将推理和工具调用交给后台文本模型,借此平衡实时感、智能能力与部署成本。
★ 精讲二 | Agent Substrate 现已在 GKE 上可用
03:40|来自 Google Cloud Blog|BestBlogs 评分 90
Google 推出可运行于 GKE 的开源 Agent Substrate,把智能体执行环境与机器管理拆开:运行时以微型虚拟机或 gVisor 隔离代码,并通过网络网关约束访问。它会在空闲时保存沙箱状态、释放算力,再按需恢复;文章的重点是为大量长生命周期智能体兼顾安全、低延迟和资源利用。
★ 精讲三 | Salesforce 接入 Claude:销售与客服工作流
06:20|来自 Claude Blog|BestBlogs 评分 88
Anthropic 与 Salesforce 发布测试版插件,让销售人员在既有权限内把账户、商机和销售管道带入 Claude。它可汇集 CRM、邮件和 Slack 的会前信息,生成跟进内容并提出记录更新;写入 Salesforce 前仍由销售人员确认,适合观察权限边界与人工审批如何落地。
重点 4–10
08:54 继续阅读七篇重点内容
阶跃发布语音大模型 StepAudio 3,拿下多个全球第一!
08:54|来自 阶跃星辰|BestBlogs 评分 90
阶跃星辰发布 StepAudio 3 系列模型,包括实时交互、语音识别、文本转语音、音频生成和音乐创作,其中多款模型在 Artificial Analysis 榜单中位列全球第一,展现出在内容理解、实时交互和音频创作方面的领先能力。
从内存饥渴的 HNSW 到量化 SPANN:Pinterest Manas 平台的技术演进
08:54|来自 InfoQ|BestBlogs 评分 85
Pinterest 的 Manas 搜索平台通过对 HNSW 和 IVF 索引应用标量量化与乘积量化、转向基于 SSD 的 SPANN 服务,并试点多向量后期交互检索,大幅削减了内存成本。
无问芯穹联合清华、上交正式开源具身端侧推理引擎 APXInf,Pi 0.5 性能 SOTA
08:54|来自 量子位|BestBlogs 评分 86
无问芯穹开源具身端侧推理引擎 APXInf,凭借 Rust 运行时与 FP8 量化实现 Jetson Thor 26 ms 延迟、38.46 Hz 频率,兼顾性能、稳定与快速模型接入。
用 1393 个 Agent 重构 Hermes 代码库:削减 34.4% 的实践复盘
08:54|来自 meng shao(@shao__meng)|BestBlogs 评分 91
Nous Research 让开源 Agent Hermes 重构自身代码库,派出 1393 个子 Agent,将超百万行非测试 Python 代码削减 34.4%,并公开了编排、验证与故障恢复的完整机制。
1300 万天压到 0.25 秒!分子之心用 AI 把化学反应拍成电影,成果登 Science 子刊
08:54|来自 新智元|BestBlogs 评分 86
分子之心自研反应性机器学习力场 QuantaMind 以接近 DFT 的精度和经典分子动力学的速度,在万原子级体系上完整模拟酶催化循环,将十万原子反应体系单步耗时从千万天量级压缩到 0.25 秒,成果登上 Science Advances。
Claude for Small Business:新工作流、集成与培训
08:54|来自 Claude Blog|BestBlogs 评分 88
Claude for Small Business 扩展了其服务,包括 43 个工作流和 27 个与热门商务工具的新集成,使小型企业主能够自动化后台任务并推动增长。此次更新还引入了一系列免费的现场研讨会和合作伙伴网络研讨会,帮助用户上手使用新功能。
语音智能体不只会说话:Charlie Guo 谈三种可混用模式与原生实时音频 | OpenAI [视频]
08:54|来自 AI Engineer|BestBlogs 评分 86
OpenAI 开发者体验负责人 Charlie Guo 指出语音智能体不必口头回复,梳理可混用的语音到语音、语音到动作与事件到语音三种模式,并说明原生实时音频与 GPT Realtime 2 如何解锁更丰富、更可及的产品。
相关链接
· 本期早报在线阅读:www.bestblogs.dev
· 你的语音智能体还只是对讲机 — Neil Zeghidour,Gradium [视频]:www.bestblogs.dev
· Agent Substrate 现已在 GKE 上可用:www.bestblogs.dev
· Salesforce 接入 Claude:销售与客服工作流:www.bestblogs.dev
· 阶跃发布语音大模型 StepAudio 3,拿下多个全球第一!:www.bestblogs.dev
· 从内存饥渴的 HNSW 到量化 SPANN:Pinterest Manas 平台的技术演进:www.bestblogs.dev
· 无问芯穹联合清华、上交正式开源具身端侧推理引擎 APXInf,Pi 0.5 性能 SOTA:www.bestblogs.dev
· 用 1393 个 Agent 重构 Hermes 代码库:削减 34.4% 的实践复盘:www.bestblogs.dev
· 1300 万天压到 0.25 秒!分子之心用 AI 把化学反应拍成电影,成果登 Science 子刊:www.bestblogs.dev
· Claude for Small Business:新工作流、集成与培训:www.bestblogs.dev
· 语音智能体不只会说话:Charlie Guo 谈三种可混用模式与原生实时音频 | OpenAI [视频]:www.bestblogs.dev
关于 BestBlogs
BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。


