EP118 · Qwen 推理、小模型意图、NVIDIA 推理挑战 · 07-15 早报BestBlogs

EP118 · Qwen 推理、小模型意图、NVIDIA 推理挑战 · 07-15 早报

13分钟 ·
播放数33
·
评论数0

BestBlogs 早报海报

章节时间戳

  • 00:00 开场

  • 00:43 精讲:Google 拆解 Qwen 3.5 在 Ironwood 上的推理瓶颈

  • 03:02 精讲:支付宝用黄金用例推动小模型意图识别上线

  • 05:28 精讲:NVIDIA 从 Kaggle 挑战复盘推理评测方法

  • 07:38 速览:Airbnb 评测、Vercel 路由、DSL 与 Agent 工程

  • 10:08 补充阅读:本地 LLM 成本、Seedream、Agent 协作、ChatGPT 前端

  • 11:52 结语

★ 精讲一 | 系统工程手册:在 Ironwood (TPU7x) 上优化 Qwen 3.5-397B MoE

00:43|来自 Google Developers Blog

Google 性能团队用 Roofline 分析定位 Qwen 3.5 的预填充与解码瓶颈,再组合 Attention DP、Expert Parallelism 与 JAX/Pallas 内核,把模型拆成可复用模块并建立硬件感知成本模型。文章展开分片、集合通信和内存布局的取舍,最终让解码密集负载提升约 3.1 倍、预填充密集负载提升约 4.7 倍,给出从硬件边界到服务性能的系统优化路径。

★ 精讲二 | 一个小模型意图识别系统的 5 天进化实录|支付宝 618

03:02|来自 阿里技术

阿里技术这份 618 复盘从一线工程约束出发:团队在 4 小时内完成模型选型,因资源交付风险最终采用 Qwen3-8B;随后用 52 条人工审查的黄金用例、训练/测试切分和规则加 LLM 双轨评分迭代系统提示词。它最可复用的部分,是把业务边界、评测反馈与上线取舍连成闭环。

★ 精讲三 | 排行榜的经验:5,000+ 名 Kaggle 选手教会我们如何提升 AI 推理能力

05:28|来自 NVIDIA Technical Blog

NVIDIA 的 Kaggle 推理挑战把模型、硬件、基准和提交约束固定下来,让 5,000 多名参赛者集中比较训练数据、推理轨迹、token 预算和评测方法。文章总结的重点不是单个技巧,而是在受限 LoRA、私榜和问题类型拆分下,如何把推理能力改进做成可验证的工程流程。

速览

07:38 更多值得关注的内容

· 从几周到一天:我们如何让 LLM 评估足够快以便进行迭代 — The Airbnb Tech Blog

· 开放权重模型占比激增至 29% 的产出量,代币单价持平 — Vercel News

· DSLs 实现 LLM 的可靠应用 — Martin Fowler

· 极致量化,近三千亿参数 Hy3 单卡即可部署 — 腾讯混元

· 从 Coder 到 Designer:电商团队数据研发的 Harness Engineering 实践 — 阿里技术

· 命令行 AI 编程智能体的采用与影响 — Hacker News

· AI 与职业这三年:震荡、规律与职业群像 — 腾讯研究院

补充阅读

10:08 今天额外值得一读的几条

· 运行本地 LLM 的实际成本究竟是多少?(以每百万 Token 的欧元成本进行衡量) — Towards Data Science

· Seedream 5.0 Pro 测评:图像编辑门槛爆降 — 歸藏的 AI 工具箱

· AI 真的自己商量着把事办了,Agent 社会化的破冰时刻 — 非凡产研

· Claude Code 引入公开共享与多人协同编辑,并通过 Claude Tag 实现 — ClaudeDevs(@ClaudeDevs)

· ChatGPT 网页版逆向工程全解析:十亿级用户背后的前端架构与性能哲学 — 前端早读课

· 论文秀 Live#42 | ICML 2026 论文解读 — 蚂蚁技术 AntTech

相关链接

· 本期早报在线阅读:www.bestblogs.dev

· 系统工程手册:在 Ironwood (TPU7x) 上优化 Qwen 3.5-397B MoE:www.bestblogs.dev

· 一个小模型意图识别系统的 5 天进化实录|支付宝 618:www.bestblogs.dev

· 排行榜的经验:5,000+ 名 Kaggle 选手教会我们如何提升 AI 推理能力:www.bestblogs.dev

· 从几周到一天:我们如何让 LLM 评估足够快以便进行迭代:www.bestblogs.dev

· 开放权重模型占比激增至 29% 的产出量,代币单价持平:www.bestblogs.dev

· DSLs 实现 LLM 的可靠应用:www.bestblogs.dev

· 极致量化,近三千亿参数 Hy3 单卡即可部署:www.bestblogs.dev

· 从 Coder 到 Designer:电商团队数据研发的 Harness Engineering 实践:www.bestblogs.dev

· 命令行 AI 编程智能体的采用与影响:www.bestblogs.dev

· AI 与职业这三年:震荡、规律与职业群像:www.bestblogs.dev

· 运行本地 LLM 的实际成本究竟是多少?(以每百万 Token 的欧元成本进行衡量):www.bestblogs.dev

· Seedream 5.0 Pro 测评:图像编辑门槛爆降:www.bestblogs.dev

· AI 真的自己商量着把事办了,Agent 社会化的破冰时刻:www.bestblogs.dev

· Claude Code 引入公开共享与多人协同编辑,并通过 Claude Tag 实现:www.bestblogs.dev

· ChatGPT 网页版逆向工程全解析:十亿级用户背后的前端架构与性能哲学:www.bestblogs.dev

· 论文秀 Live#42 | ICML 2026 论文解读:www.bestblogs.dev

关于 BestBlogs

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

关注我们