EP22 · GLM-5.1/Muse Spark/Anthropic 托管智能体 · 04.09 早报BestBlogs

EP22 · GLM-5.1/Muse Spark/Anthropic 托管智能体 · 04.09 早报

12分钟 ·
播放数26
·
评论数0

## 今日精讲

01:04 GLM-5.1 开源:支持 8 小时独立工作的长程任务模型

智谱正式开源旗舰模型 GLM-5.1,提出以「有效工作时长」作为衡量智能体能力的新标准,可在无人干预下持续 8 小时自主规划、执行并自我进化。模型在 SWE-bench Pro 等权威基准上刷新全球纪录,并展示了 8 小时从零构建 Linux 桌面系统、655 次迭代将向量数据库性能提升 6.9 倍等典型案例。这标志着开源模型从「单次代码生成」正式跨入「主动系统优化」阶段。

来自 智谱

03:25 介绍 Muse Spark:迈向个人超级智能的规模化之路

Meta 超级智能实验室发布 Muse 系列的首款模型 Muse Spark,目标是「个人超级智能」。这是一个原生多模态模型,支持工具使用、视觉思维链,以及一种独特的「沉思模式」(Contemplating Mode),通过多智能体编排来对标前沿推理模型。Meta 披露其预训练效率相比 Llama 4 Maverick 提升 10 倍,采用了一种新的「思维压缩」技术来优化推理 Token,并引入包含第三方评估意识审计在内的安全评估流程。

来自 AI at Meta Blog

05:20 扩展托管智能体:将「大脑」与「双手」解耦

Anthropic 工程团队拆解了托管智能体背后的架构原则:把会话日志、控制框架与沙箱虚拟化,让 LLM「大脑」独立于执行环境「双手」运行,从耦合的「宠物」式基础设施走向解耦的「牲畜」式模型。这一调整带来三个显著收益:通过推迟沙箱配置将首字延迟(TTFT)降低 60-90%、通过把凭证留在沙箱外提升安全性、以及让大脑或双手单点故障时仍能恢复而不丢失会话状态。

来自 Anthropic Engineering

## 速览

07:45 更多值得关注的内容

· DHH 的全新编程方式 [视频] — The Pragmatic Engineer

· The Batch:吴恩达谈语音 AI 及行业重大转向 — DeepLearning.AI

· 反馈飞轮 — Martin Fowler

· AI 智能体的状态化延续:为什么传输层现在至关重要 — InfoQ

· AI 智能体时代 | Box CEO Aaron Levie 做客 The a16z Show [视频] — a16z

· 从混乱到编排:真正有效的多智能体协同模式 [视频] — AI Engineer

· 为什么以及如何沙箱化 AI 生成的代码?[视频] — AI Engineer

## 相关链接

· GLM-5.1 开源:支持 8 小时独立工作的长程任务模型:www.bestblogs.dev

· 介绍 Muse Spark:迈向个人超级智能的规模化之路:www.bestblogs.dev

· 扩展托管智能体:将「大脑」与「双手」解耦:www.bestblogs.dev

· DHH 的全新编程方式 [视频]:www.bestblogs.dev

· The Batch:吴恩达谈语音 AI 及行业重大转向:www.bestblogs.dev

· 反馈飞轮:www.bestblogs.dev

· AI 智能体的状态化延续:为什么传输层现在至关重要:www.bestblogs.dev

· AI 智能体时代 | Box CEO Aaron Levie 做客 The a16z Show [视频]:www.bestblogs.dev

· 从混乱到编排:真正有效的多智能体协同模式 [视频]:www.bestblogs.dev

· 为什么以及如何沙箱化 AI 生成的代码?[视频]:www.bestblogs.dev

· BestBlogs: bestblogs.dev