083.AI 排障为什么会自信地答错

083.AI 排障为什么会自信地答错

22分钟 ·
播放数33
·
评论数0

本期要点

· 本期解读一场关于"生产环境排障智能体"的分享,讲者是 Cleric 联合创始人兼 CTO Willem Pienaar。

· 【本期要点】

· 1. 生产环境排障和写代码最大的差别:开发环境有测试、有编译报错,做错马上有反馈;线上没有任何考官,只有四面八方的噪声。

· 2. 更麻烦的是,大模型被训练成"果断给出一个答案",而排障需要的恰恰是怀疑、不确定、多假设再逐个排除——两者天生冲突。

· 3. 四种典型翻车:把原因当成症状、不知道什么是正常所以见一个算一个、分层智能体只上报结论导致上层误判、被过去的状态锚定。

· 4. 五种"给 AI 造信号"的手法:一次生成多条假说、先算基线再谈异常、用依赖图谱给断言挑刺、引入时间维度、往上递证据链而不是只递结论。

· 5. 仿真结果分化明显:局部故障上各家工具差别不大;原因和症状不在同一个服务里的分布式故障,差距最大。

· 6. 代价是成本明显上升——同时跑五六条假说会烧掉大量算力,换来的是人不必一直守在循环里。

· 7. 真正的闭环在"校准":让 90% 的自信真的等于 90% 的准确,这个信号才值得信。

· 8. 下一步的方向是把生产环境攒下的基线、系统图谱和本体带回开发环境,在部署之前就预测故障。

· 本节目为第三方演讲的转述解读,仅代表嘉宾与评论者观点,不构成任何投资建议。