
章节时间戳
开场
精讲:Google 拆解 Qwen 3.5 在 Ironwood 上的推理瓶颈
精讲:支付宝用黄金用例推动小模型意图识别上线
精讲:NVIDIA 从 Kaggle 挑战复盘推理评测方法
速览:Airbnb 评测、Vercel 路由、DSL 与 Agent 工程
补充阅读:本地 LLM 成本、Seedream、Agent 协作、ChatGPT 前端
结语
★ 精讲一 | 系统工程手册:在 Ironwood (TPU7x) 上优化 Qwen 3.5-397B MoE
|来自 Google Developers Blog
Google 性能团队用 Roofline 分析定位 Qwen 3.5 的预填充与解码瓶颈,再组合 Attention DP、Expert Parallelism 与 JAX/Pallas 内核,把模型拆成可复用模块并建立硬件感知成本模型。文章展开分片、集合通信和内存布局的取舍,最终让解码密集负载提升约 3.1 倍、预填充密集负载提升约 4.7 倍,给出从硬件边界到服务性能的系统优化路径。
★ 精讲二 | 一个小模型意图识别系统的 5 天进化实录|支付宝 618
|来自 阿里技术
阿里技术这份 618 复盘从一线工程约束出发:团队在 4 小时内完成模型选型,因资源交付风险最终采用 Qwen3-8B;随后用 52 条人工审查的黄金用例、训练/测试切分和规则加 LLM 双轨评分迭代系统提示词。它最可复用的部分,是把业务边界、评测反馈与上线取舍连成闭环。
★ 精讲三 | 排行榜的经验:5,000+ 名 Kaggle 选手教会我们如何提升 AI 推理能力
|来自 NVIDIA Technical Blog
NVIDIA 的 Kaggle 推理挑战把模型、硬件、基准和提交约束固定下来,让 5,000 多名参赛者集中比较训练数据、推理轨迹、token 预算和评测方法。文章总结的重点不是单个技巧,而是在受限 LoRA、私榜和问题类型拆分下,如何把推理能力改进做成可验证的工程流程。
速览
更多值得关注的内容
· 从几周到一天:我们如何让 LLM 评估足够快以便进行迭代 — The Airbnb Tech Blog
· 开放权重模型占比激增至 29% 的产出量,代币单价持平 — Vercel News
· DSLs 实现 LLM 的可靠应用 — Martin Fowler
· 极致量化,近三千亿参数 Hy3 单卡即可部署 — 腾讯混元
· 从 Coder 到 Designer:电商团队数据研发的 Harness Engineering 实践 — 阿里技术
· 命令行 AI 编程智能体的采用与影响 — Hacker News
· AI 与职业这三年:震荡、规律与职业群像 — 腾讯研究院
补充阅读
今天额外值得一读的几条
· 运行本地 LLM 的实际成本究竟是多少?(以每百万 Token 的欧元成本进行衡量) — Towards Data Science
· Seedream 5.0 Pro 测评:图像编辑门槛爆降 — 歸藏的 AI 工具箱
· AI 真的自己商量着把事办了,Agent 社会化的破冰时刻 — 非凡产研
· Claude Code 引入公开共享与多人协同编辑,并通过 Claude Tag 实现 — ClaudeDevs(@ClaudeDevs)
· ChatGPT 网页版逆向工程全解析:十亿级用户背后的前端架构与性能哲学 — 前端早读课
· 论文秀 Live#42 | ICML 2026 论文解读 — 蚂蚁技术 AntTech
相关链接
· 本期早报在线阅读:www.bestblogs.dev
· 系统工程手册:在 Ironwood (TPU7x) 上优化 Qwen 3.5-397B MoE:www.bestblogs.dev
· 一个小模型意图识别系统的 5 天进化实录|支付宝 618:www.bestblogs.dev
· 排行榜的经验:5,000+ 名 Kaggle 选手教会我们如何提升 AI 推理能力:www.bestblogs.dev
· 从几周到一天:我们如何让 LLM 评估足够快以便进行迭代:www.bestblogs.dev
· 开放权重模型占比激增至 29% 的产出量,代币单价持平:www.bestblogs.dev
· DSLs 实现 LLM 的可靠应用:www.bestblogs.dev
· 极致量化,近三千亿参数 Hy3 单卡即可部署:www.bestblogs.dev
· 从 Coder 到 Designer:电商团队数据研发的 Harness Engineering 实践:www.bestblogs.dev
· 命令行 AI 编程智能体的采用与影响:www.bestblogs.dev
· AI 与职业这三年:震荡、规律与职业群像:www.bestblogs.dev
· 运行本地 LLM 的实际成本究竟是多少?(以每百万 Token 的欧元成本进行衡量):www.bestblogs.dev
· Seedream 5.0 Pro 测评:图像编辑门槛爆降:www.bestblogs.dev
· AI 真的自己商量着把事办了,Agent 社会化的破冰时刻:www.bestblogs.dev
· Claude Code 引入公开共享与多人协同编辑,并通过 Claude Tag 实现:www.bestblogs.dev
· ChatGPT 网页版逆向工程全解析:十亿级用户背后的前端架构与性能哲学:www.bestblogs.dev
· 论文秀 Live#42 | ICML 2026 论文解读:www.bestblogs.dev
关于 BestBlogs
BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。


