EP119 · AINMM 五级成熟度模型、田渊栋论人类判断力、Ai2 Shippy 智能体构建 · 07-16 早报BestBlogs

EP119 · AINMM 五级成熟度模型、田渊栋论人类判断力、Ai2 Shippy 智能体构建 · 07-16 早报

12分钟 ·
播放数47
·
评论数0

BestBlogs 早报海报

章节时间戳

  • 00:00 开场

  • 00:46 精讲:大淘宝技术 AINMM 五级模型,量化 AI 原生研发差距,Harness 比 Agent 更重要

  • 02:57 精讲:田渊栋访谈,自进化 AI 已接管大量代码,人类判断力与深层理解是最后护城河

  • 05:04 精讲:Ai2 海事智能体 Shippy 面对高风险决策,用确定性专用 CLI 喂给不确定的 agent

  • 07:21 速览:GPT-Red、Cursor 飞轮、Qwen 语音、Claude Code 协同编辑、Sal Khan 传统行业

  • 09:39 补充阅读:Meta 广告、AI 语音欺诈、AI MediaKit、HSCodeComp 基准、vivo Vue 重构

  • 11:09 结语

★ 精讲一 | AINMM:存量生产级工程向 AI Native 演进的五级成熟度模型

00:46|来自 大淘宝技术

大淘宝技术借鉴 CMMI 思想提出 AINMM,把 AI Native 研发能力分成 ML1 已感知到 ML5 持续优化五级,明确面向存量生产级工程。模型围绕上下文工程、能力封装、验证回路、协作契约、自进化五个过程域做雷达图打分,把模糊自评转成可量化的差距识别。作者用挽单系统实测,总分从 30 涨到 48、由 ML1 走到 ML2,并强调 Harness 比 Agent 更重要,框架本身不是银弹。

★ 精讲二 | 目前架构下,自进化后的 AI 也无法替代人类的判断力|田渊栋

02:57|来自 腾讯科技

这是腾讯科技《沸腾之下》对田渊栋的长访:他长期在 Meta FAIR 做前沿 AI 研究,2026 年联合创办 Recursive AI。文中先列出 RSI 进展:Claude 已接管 Anthropic 内部超 80% 的代码,Mythos 在训练代码优化上实现 52 倍加速。但田渊栋判断,人类最后的护城河是无法结构化外化的「深层理解」与判断力(Taste):AI 擅长模式匹配却缺乏对新结构的即时理解,做不出相对论式的概念突破,skill 蒸馏也只能触及表层流程。

★ 精讲三 | 从构建 Shippy 中学到的智能体构建经验

05:04|来自 Hugging Face - Blog

Ai2 的 Skylight 团队分享海事智能体 Shippy 的架构:场景是高风险决策,答错可能让巡逻船跑错方向。他们把 agent 拆成 soul(系统提示词定边界)、skills(同 Claude Code 的 markdown 技能)、config(OpenClaw 跑 Claude Opus 4.6)。最关键的一条经验是用确定性专用 CLI 喂给不确定的 agent——早期让它直接拼 API 时,踩了一连串分页、几何编码的坑。沙箱上每用户开独立 K8s 会话,评测也由领域专家写 rubric、LLM 裁判逐项打分。

速览

07:21 更多值得关注的内容

· GPT-Red:解锁自我改进以增强鲁棒性 — OpenAI News

· Cursor 如何通过递归模型改进打造训练飞轮 [视频] — AI Engineer

· Qwen-Audio-3.0-Realtime 如何让语音交互「懂倾听,更聪明」? — 通义实验室

· AI 真的自己商量着把事办了,Agent 社会化的破冰时刻 — 非凡产研

· Claude Code 引入公开共享与多人协同编辑,并通过 Claude Tag 实现 — ClaudeDevs(@ClaudeDevs)

· 10000 小时人类数据,练出全球首个全身移动操作隐式世界动作模型 — 机器之心

· Khan Academy CEO Sal Khan:AI 真正的机会藏在被忽视的传统行业 [视频] — Silicon Valley Girl

补充阅读

09:39 今天额外值得一读的几条

· 探索用于 Meta 广告深层漏斗优化的分层兴趣表示 — Engineering at Meta

· 三秒盗窃:为什么 AI 语音欺诈能够超越所有防御 — Hacker News

· 让 Agent 成为音视频工作台:AI MediaKit CLI + Skill 发布 — 字节跳动技术团队

· 不要让 Claude 给自己的作业打分 — Towards Data Science

· 阿里荣膺 ACL 2026 最佳资源论文 | HSCodeComp 揭开智能体「分层规则应用」的能力鸿沟 — 阿里技术

· AI 编码实战 | 0 行手写代码,2 天重构 2 万行 Vue 项目 — vivo 互联网技术

相关链接

· 本期早报在线阅读:www.bestblogs.dev

· AINMM:存量生产级工程向 AI Native 演进的五级成熟度模型:www.bestblogs.dev

· 目前架构下,自进化后的 AI 也无法替代人类的判断力|田渊栋:www.bestblogs.dev

· 从构建 Shippy 中学到的智能体构建经验:www.bestblogs.dev

· GPT-Red:解锁自我改进以增强鲁棒性:www.bestblogs.dev

· Cursor 如何通过递归模型改进打造训练飞轮 [视频]:www.bestblogs.dev

· Qwen-Audio-3.0-Realtime 如何让语音交互「懂倾听,更聪明」?:www.bestblogs.dev

· AI 真的自己商量着把事办了,Agent 社会化的破冰时刻:www.bestblogs.dev

· Claude Code 引入公开共享与多人协同编辑,并通过 Claude Tag 实现:www.bestblogs.dev

· 10000 小时人类数据,练出全球首个全身移动操作隐式世界动作模型:www.bestblogs.dev

· Khan Academy CEO Sal Khan:AI 真正的机会藏在被忽视的传统行业 [视频]:www.bestblogs.dev

· 探索用于 Meta 广告深层漏斗优化的分层兴趣表示:www.bestblogs.dev

· 三秒盗窃:为什么 AI 语音欺诈能够超越所有防御:www.bestblogs.dev

· 让 Agent 成为音视频工作台:AI MediaKit CLI + Skill 发布:www.bestblogs.dev

· 不要让 Claude 给自己的作业打分:www.bestblogs.dev

· 阿里荣膺 ACL 2026 最佳资源论文 | HSCodeComp 揭开智能体「分层规则应用」的能力鸿沟:www.bestblogs.dev

· AI 编码实战 | 0 行手写代码,2 天重构 2 万行 Vue 项目:www.bestblogs.dev

关于 BestBlogs

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

关注我们