EP39 · DeepSeek V4 / 理解债 / Agent 产品设计 · 04.26 早报BestBlogs

EP39 · DeepSeek V4 / 理解债 / Agent 产品设计 · 04.26 早报

21分钟 ·
播放数43
·
评论数0

今日精讲

DeepSeek V4 报告太详尽了!484 天换代之路全公开

今日精讲 ①:量子位逐条对照 DeepSeek V4 技术报告。V4-Pro 1.6T 参数 / 49B 激活,V4-Flash 284B / 13B,1M 上下文标配,单 token FLOPs 砍到 V3.2 的 27%、KV cache 只剩 10%。架构动了三处:mHC(流形约束超连接)把残差流约束到双随机矩阵的 Birkhoff polytope 上,谱范数硬上限不爆炸;CSA / HCA 混合稀疏注意力交替叠加,CSA 先压再选 top-k、HCA 直接 128 倍硬压做全局信号;Muon 主优化器接管绝大多数参数,AdamW 只留给 embedding 和 RMSNorm。后训练把传统 mixed RL 换成 OPD(On-Policy Distillation)+ 三档推理强度。Codeforces rating 3206 反超 GPT-5.4 的 3168,HLE 仍落后 Claude Opus 4.6 约三到六个月。结尾贡献者名单上带星号的离职者还在——「484 天后,我们谦卑地分享这份爱心的劳动」。

来自 量子位

AI 编程的失控临界点:理解债、上下文衰减与独立开发者的新天花板

今日精讲 ②:周云龙把 2025 年四份研究做成了独立开发者的清醒剂。METR 招募 16 位平均仓库 22000+ stars 的资深 OSS 开发者跑 246 个真实任务——AI 让他们慢了 19%,但他们仍坚信自己快了 20%,主客观偏差整整 39 个百分点;Carnegie Mellon × GitClear 圈复杂度 +40% 且无法被代码量增长解释,Veracode 45% AI 代码不通过基础安全测试,CodeRabbit 严重缺陷密度是人类 1.7 倍,Lovable 1645 个应用里 10.3% 含严重漏洞。文章给「理解债」下了定义——审阅吞吐之外多接受的每一行 AI 代码就是给项目加的复利雷区,比技术债更阴险,因为「你不知道自己不知道」。给出 Spec-Driven Development 的真正使用区间(MVP 走向生产、单人变小团队、稳定栈引入新栈),并按四阶段把「AI 不得触碰」清单具体化:核心算法、安全边界、数据一致性、线上出过事故的模块。

来自 InfoQ 中文

为 Agent 设计产品

今日精讲 ③:Ramp 工程师 Teddy Riker 写了篇被宝玉翻译的「为 Agent 设计产品」。三个数据先抛出来——过去三个月里 Ramp MCP 周活用户涨了 10 倍,Salesforce 上周宣布 Headless 360 把 27 年历史的 CRM 平台所有能力暴露成 API/MCP 工具/CLI,TDX 大会一口气放出 100+ 工具技能,回答了那个生死命题:当 AI 智能体能推理、规划、执行时,公司还需要带 GUI 的 CRM 吗?文章把「调用方智能体到底需要什么才能成功」拆成三件事。一是主动喂规范,对照范例:Notion 的 notion-create-pages 工具描述里强制智能体先 fetch notion://docs/enhanced-markdown-spec,从来不出格式错误;Slack MCP 反例则陷入「修格式比手写还累」。二是建反馈闭环:Ramp 给每次 MCP 调用强制传 rationale 解释意图,单独发反馈工具让智能体主动报告卡点,再用 context seed 字段在工具调用里捕捉早期上下文。

来自 宝玉的分享

速览

更多值得关注的内容 · “我把所有模型都换成了 DeepSeek V4”:月账单降 90%,效果还更好 — InfoQ 中文

· elasticpp:重塑 Elasticsearch 查询性能的 C++ 内核引擎 — 阿里技术

· 从 Hy3 preview 看 AI 下半场:单位智能时代的一次工程答卷 — 腾讯研究院

· AI 涌现能力的五个层级——AI 训练师的亲笔记录 — 人人都是产品经理

· Agent Harness Engineering:从模型到智能落地的工程范式 — meng shao(@shao__meng)

· GPT-5.5 翻译实测:乔治·奥威尔经典名篇《我为什么写作》 — 宝玉 (@dotey)

· 涨价进行时:九个行业的账本 — 晚点 LatePost

更多推荐

今天额外值得一读的六条

· 深度解读 DeepSeek V4,看清 Benchmark 之外的三个范式级创新 — 腾讯科技

· DeepSeek V4 重磅开源!首次打通华为 Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权 — InfoQ 中文

· DeepSeek-V4 预览版发布:迈入百万上下文普惠时代 — ginobefun(@hongming731)

· MDN 新前端的内部机制 — 前端早读课

· OpenAI 发布 GPT-5.5:更聪明且高效,同步上线 Codex — 宝玉 (@dotey)

· 微软 Microsoft 365 Copilot 全线默认开启「智能体模式」 — 宝玉 (@dotey)

相关链接

· DeepSeek V4 报告太详尽了!484 天换代之路全公开:www.bestblogs.dev

· AI 编程的失控临界点:理解债、上下文衰减与独立开发者的新天花板:www.bestblogs.dev

· 为 Agent 设计产品:www.bestblogs.dev

· “我把所有模型都换成了 DeepSeek V4”:月账单降 90%,效果还更好:www.bestblogs.dev

· elasticpp:重塑 Elasticsearch 查询性能的 C++ 内核引擎:www.bestblogs.dev

· 从 Hy3 preview 看 AI 下半场:单位智能时代的一次工程答卷:www.bestblogs.dev

· AI 涌现能力的五个层级——AI 训练师的亲笔记录:www.bestblogs.dev

· Agent Harness Engineering:从模型到智能落地的工程范式:www.bestblogs.dev

· GPT-5.5 翻译实测:乔治·奥威尔经典名篇《我为什么写作》:www.bestblogs.dev

· 涨价进行时:九个行业的账本:www.bestblogs.dev

· 深度解读 DeepSeek V4,看清 Benchmark 之外的三个范式级创新: www.bestblogs.dev

· DeepSeek V4 重磅开源!首次打通华为 Ascend,也没丢掉英伟达,百万上下文夺回国产模型话语权:www.bestblogs.dev

· DeepSeek-V4 预览版发布:迈入百万上下文普惠时代:www.bestblogs.dev

· MDN 新前端的内部机制:www.bestblogs.dev

· OpenAI 发布 GPT-5.5:更聪明且高效,同步上线 Codex:www.bestblogs.dev

· 微软 Microsoft 365 Copilot 全线默认开启「智能体模式」:www.bestblogs.dev

· BestBlogs: bestblogs.dev