EP146 · 阿里开源复盘、专用执行模型、Switchyard · 08-12 早报BestBlogs

EP146 · 阿里开源复盘、专用执行模型、Switchyard · 08-12 早报

13分钟 ·
播放数38
·
评论数0

章节时间戳

  • 00:00 开场

  • 00:47 精讲:阿里技术复盘开源代码评审的工程与社区协作

  • 03:16 精讲:NVIDIA 解释专用执行模型的设计与部署

  • 05:35 精讲:LangChain 测算 Switchyard 路由的成本与准确率

  • 08:04 速览:FDE、Gemini、智能体成本与评测、昇腾、TDD

  • 10:21 补充阅读:Daybreak、金融工作流、DeepSeek 定价、生物 AI、Ling 3.0

  • 11:53 结语

★ 精讲一 | 连续五天登上 GitHub Trending 首页的思考

据阿里技术团队原文,open-code-review 在两个月内获得 20k star,并连续 5 天登上 GitHub Trending。更值得借鉴的是,团队用 All in Code 让 Agent 参与开发、评审和发版,同时以 200 个 PR 的评测集与人工决策守住核心链路;README 也从千行压到两百行,把上手路径缩至五分钟。

00:47|来自 阿里技术|BestBlogs 评分 92

★ 精讲二 | NVIDIA Nemotron 3.5 Lightning 为长期运行的智能体提供快速、精准的专用任务执行

Nemotron 3.5 Lightning 不是替代前沿模型,而是面向常驻智能体执行层的 30B MoE:每次仅激活 3B 参数,处理工具调用、结果校验等高频任务。NVIDIA 还开放权重、数据和训练配方,为专用小模型的本地部署与成本评估提供了可复现起点与路径。

03:16|来自 NVIDIA Technical Blog|BestBlogs 评分 91

★ 精讲三 | 您的智能体有多少次调用实际上需要前沿模型?

LangChain 在 145 个多步任务上测试 Switchyard:30B 模型承担 93% 的调用,路由方案比全用 Claude Opus 4.8 便宜 74%,准确率低约 6 个百分点。文章还将判别器成本和模型价差写进计算公式,给出五次运行的波动,并提醒约 700 毫秒的判别延迟不适合短任务;是否划算仍要用自己的工作负载验证。

05:35|来自 LangChain Blog|BestBlogs 评分 91

速览

08:04 更多值得关注的内容

· E248|一个「催发货」AI 要跑通 260 步,和阿里瓴羊朋新宇聊聊中国式 FDE [播客] — 来自 硅谷 101 · BestBlogs 评分 91

· Gemini 应用月活用户突破 10 亿 — 来自 Sundar Pichai(@sundarpichai) · BestBlogs 评分 90

· 考虑使用 ACE?我们可以用更少的 Token 实现同样的效果 — 来自 Hugging Face - Blog · BestBlogs 评分 92

· AI 评测还在看准确率?数据科学早就用因果推断做归因分析了 — 来自 大淘宝技术 · BestBlogs 评分 91

· 100 万美元 Token 不限量实验:团队更累、AI 成本超人、组织 0→1 是效率突破点 — 来自 宝玉(@dotey) · BestBlogs 评分 90

· 华为 AI 芯片来时的路 — 来自 腾讯科技 · BestBlogs 评分 90

· 智能体循环中的 TDD:形式主义还是实际价值? — 来自 Martin Fowler · BestBlogs 评分 89

补充阅读

10:21 今天额外值得一读的几条

· 将前沿网络安全模型交付至更可信的掌控之中 — 来自 OpenAI News · BestBlogs 评分 86

· Model ML 使用 GPT‑5.6 Sol 更高效完成金融工作 — 来自 OpenAI News · BestBlogs 评分 87

· DeepSeek 为什么敢涨价? — 来自 腾讯科技 · BestBlogs 评分 90

· 🔬生物 AI 范式转变 - Matthew McPartlon & Neil Patil,Chai Discovery — 来自 Latent.Space · BestBlogs 评分 88

· 蚂蚁百灵 Ling-3.0-flash 开源:仅激活 5.1B,对齐上一代 1T 级旗舰 — 来自 魔搭 ModelScope 社区 · BestBlogs 评分 89

相关链接

· 本期早报在线阅读:www.bestblogs.dev

· 连续五天登上 GitHub Trending 首页的思考:www.bestblogs.dev

· NVIDIA Nemotron 3.5 Lightning 为长期运行的智能体提供快速、精准的专用任务执行:www.bestblogs.dev

· 您的智能体有多少次调用实际上需要前沿模型?:www.bestblogs.dev

· E248|一个「催发货」AI 要跑通 260 步,和阿里瓴羊朋新宇聊聊中国式 FDE [播客]:www.bestblogs.dev

· Gemini 应用月活用户突破 10 亿:www.bestblogs.dev

· 考虑使用 ACE?我们可以用更少的 Token 实现同样的效果:www.bestblogs.dev

· AI 评测还在看准确率?数据科学早就用因果推断做归因分析了:www.bestblogs.dev

· 100 万美元 Token 不限量实验:团队更累、AI 成本超人、组织 0→1 是效率突破点:www.bestblogs.dev

· 华为 AI 芯片来时的路:www.bestblogs.dev

· 智能体循环中的 TDD:形式主义还是实际价值?:www.bestblogs.dev

· 将前沿网络安全模型交付至更可信的掌控之中:www.bestblogs.dev

· Model ML 使用 GPT‑5.6 Sol 更高效完成金融工作:www.bestblogs.dev

· DeepSeek 为什么敢涨价?:www.bestblogs.dev

· 🔬生物 AI 范式转变 - Matthew McPartlon & Neil Patil,Chai Discovery:www.bestblogs.dev

· 蚂蚁百灵 Ling-3.0-flash 开源:仅激活 5.1B,对齐上一代 1T 级旗舰:www.bestblogs.dev

关于 BestBlogs

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

关注我们