本期要点
· Langfuse 联合创始人 Marc Klingen 讲智能体如何从"人工驱动的追踪—评估闭环"走向"AI 自动驱动的闭环"
· 人类只需守住两个位置:对齐数据集、审核修复方案;其余繁琐劳动交给 AI
· 在线追踪与离线评估必须打通,否则数据集与生产脱节,基准测试看着像真的其实是假的
· 过去一个月的新变化:AI 开始维护评估标准和数据集——但不审核就会制造垃圾内容
· 演示:变更日志撰写器自己发现"术语泄漏、清晰度低",先重定义衡量标准,再改实现
· 回测显示 v2 候选在"面向用户语言"上有正向差值,同时格式合规与事实准确性未退化
· 代价可逆才敢放开自动化:这个智能体只提合并请求,从不直接发布到生产环境
· 数据层的要求变了:从写入密集转向读取密集,历史追踪要长期全量保留、不采样
