EP188 · Parag 谈搜索补偿、Erina 用实验改进智能体、Roland 构建产品循环 · 09-27 早报BestBlogs

EP188 · Parag 谈搜索补偿、Erina 用实验改进智能体、Roland 构建产品循环 · 09-27 早报

14分钟 ·
播放数23
·
评论数0

章节时间戳

  • 00:00 开场

  • 01:01 精讲:Parag Agrawal 谈智能体搜索与内容补偿

  • 04:02 精讲:Erina Karati 用实验评估长时程智能体

  • 06:53 精讲:Roland Gavrilescu 谈智能体产品的改进循环

  • 09:51 重点 4–6:Claude 九圈振幅、Skydio 无人机、Perplexity CobbleDB

  • 11:30 重点 7–10:GEPA 反思优化、Morph GPU、Dyna Robotics、千问 AI 平台

  • 13:32 结语

★ 精讲一 | Parag Agrawal 谈智能体搜索、内容补偿与未来网络入口 [视频]

01:01|来自 20VC with Harry Stebbings|BestBlogs 评分 90

前 Twitter CEO、Parallel 创始人 Parag Agrawal 判断,智能体频繁使用网络会重塑搜索成本。他解释如何让搜索先筛掉无关信息,节省模型推理开销,并提出按智能体获益向内容所有者付费。访谈还谈到持续监测网页变化的推送式搜索,可帮助读者理解开放网络的新商业模式。

★ 精讲二 | 长时程智能体需要实验,而不只是提示词 — Erina Karati [视频]

04:02|来自 AI Engineer|BestBlogs 评分 90

Erina Karati 以 Supercell 的多智能体游戏村庄说明,角色会在传递传闻时丢失来源,甚至把不确定说成确定。她提出用可控场景、运行轨迹和多维评分评估整段行为,只保留通过护栏的小幅策略改动。芒果促销案例已有改善,但她没有宣称系统获得普遍提升;这套方法可供长时程智能体借鉴。

★ 精讲三 | 「循环才是产品」:Roland Gavrilescu 谈智能体产品如何持续进化 [视频]

06:53|来自 AI Engineer|BestBlogs 评分 90

Roland Gavrilescu 主张把运行、验证与反馈的循环视为智能体产品核心:将失败模式沉淀为评测,将重复行为沉淀为技能和提示词,再用可版本化的方案复用。招聘案例说明如何由人校准判断标准,并用实际用户反馈检验改动。他还强调衡量有价值的工作与成本;这些是方法主张,尚非通用效果的证明。

重点 4–10

09:51 继续阅读七篇重点内容

Claude 计算出 N=4 超杨-米尔斯理论中的九圈振幅

09:51|来自 Anthropic Research|BestBlogs 评分 86

Claude Science 用既有 bootstrap 与 form-factor 方法计算出 N=4 超杨-米尔斯理论的九圈振幅,Lance Dixon 独立核验了结果。原文作者强调,Claude 在较少外部科学指导下完成复杂计算,但方法本身没有突破计算极限,宋何团队也同期取得相关结果。

一名操作员,多架无人机:深入 Skydio 自主飞行技术栈 — Suchet Bargoti,Skydio [视频]

09:51|来自 AI Engineer|BestBlogs 评分 87

Skydio 的 Suchet Bargoti 现场展示一名操作员同时操作三架无人机,并介绍支撑多机任务的自主技术栈:高可靠性目标、飞行数据反馈循环、地图式世界模型、遮挡下的目标跟踪,以及边缘与云端协作的视觉语言模型智能体。

Perplexity 自研 CobbleDB 取代 DynamoDB,查询延迟降低 5 倍并削减云存储成本

09:51|来自 InfoQ|BestBlogs 评分 85

Perplexity 以 Rust 编写的分布式键值存储 CobbleDB 取代核心搜索服务中的 DynamoDB;据其工程数据,批量读取延迟约降至原来的五分之一,整体存储费用至少降低 20%。

用反思击败强化学习:GEPA 与 Optimize Anything [视频]

09:51|来自 AI Engineer|BestBlogs 评分 89

Lakshya A. Agrawal 介绍了 GEPA 的反思式提示优化方法与 Optimize Anything,指出执行轨迹中的文本反馈能够改进提示词、智能体运行框架及其他可评分产物,而且所需样例远少于仅依赖奖励的优化方法。

自动化研究如何让模型提速 3 倍:Morph 的 GPU 优化实践|Tejas Bhakta [视频]

09:51|来自 AI Engineer|BestBlogs 评分 88

Tejas Bhakta 介绍了如何由人类选定优化方向、提供准确的硬件与模型背景,再借助兼顾正确性和性能的基准测试,让智能体搜索 GPU kernel 的实现方案;他也提醒,过于狭窄的目标会诱发指标投机,而成功的 kernel 与裸机优化叠加后,据称可带来 3 倍提速。

机器人演示容易,可靠落地很难——Dyna Robotics 如何训练商用级通用机器人策略 [视频]

09:51|来自 AI Engineer|BestBlogs 评分 86

Dyna Robotics 联合创始人 Jason Ma 介绍数据金字塔、推理模型与世界动作模型,以及通过奖励模型和人工参与的主动学习改进机器人策略。其微调后的 Dyna-1 在餐巾折叠的 24 小时试验中达到 99.4% 成功率;他还分别展示餐厅部署、经任务微调的萨克拉门托洗衣店毛巾折叠、CoRL 2025 陌生环境演示和红牛活动应用。

为 Agent 而生,千问 AI 平台发布全新服务方式

09:51|来自 阿里云开发者|BestBlogs 评分 85

千问 AI 平台在云栖大会发布面向 Agent 的全新服务方式,通过 Qwen 共创计划与 AI Arena 引入真实场景反馈优化模型,并推出 Skills、CLI 及支付宝合作的安全支付机制,旨在让云服务更易被 Agent 理解、调用与管理。

相关链接

· 本期早报在线阅读:www.bestblogs.dev

· Parag Agrawal 谈智能体搜索、内容补偿与未来网络入口 [视频]:www.bestblogs.dev

· 长时程智能体需要实验,而不只是提示词 — Erina Karati [视频]:www.bestblogs.dev

· 「循环才是产品」:Roland Gavrilescu 谈智能体产品如何持续进化 [视频]:www.bestblogs.dev

· Claude 计算出 N=4 超杨-米尔斯理论中的九圈振幅:www.bestblogs.dev

· 一名操作员,多架无人机:深入 Skydio 自主飞行技术栈 — Suchet Bargoti,Skydio [视频]:www.bestblogs.dev

· Perplexity 自研 CobbleDB 取代 DynamoDB,查询延迟降低 5 倍并削减云存储成本:www.bestblogs.dev

· 用反思击败强化学习:GEPA 与 Optimize Anything [视频]:www.bestblogs.dev

· 自动化研究如何让模型提速 3 倍:Morph 的 GPU 优化实践|Tejas Bhakta [视频]:www.bestblogs.dev

· 机器人演示容易,可靠落地很难——Dyna Robotics 如何训练商用级通用机器人策略 [视频]:www.bestblogs.dev

· 为 Agent 而生,千问 AI 平台发布全新服务方式:www.bestblogs.dev

关于 BestBlogs

BestBlogs 是 AI 驱动的私人阅读助手,帮助你发现真正适合你的高质量内容,关注你感兴趣的来源和主题,每天生成一份更适合自己的「我的早报」,欢迎体验和关注我们。

关注我们