070.生成式 AI 上线后,光看延迟和报错还不够

070.生成式 AI 上线后,光看延迟和报错还不够

22分钟 ·
播放数43
·
评论数0

本期要点

· 传统监控的「黄金信号」(延迟、错误、流量、饱和度)只回答系统在不在跑,回答不了生成式 AI 应用跑得好不好。

· 成本失控的三个典型陷阱:上下文 token 蠕变(窗口从 4K 扩到 132K 可能带来 8 倍成本)、模型漂移(换用更强的模型单次成本可高 15 倍)、缓存缺失(有时 70% 的支出是重复付费)。

· 成本归因的核心是「强制给所有调用打标签」,四个维度:功能级、用户级、模型级、端点级。

· 安全监控的四项红线:提示词注入率、个人身份信息检出率(目标 0%)、内容审核评分、越狱尝试(目标 100% 阻断)。

· 质量监控的五个指标:幻觉率、相关性评分、用户满意度(目标 85% 以上正面反馈)、答案完整性(由模型担任裁判)、RAG 检索质量。

· 落地姿势:不是抛弃老指标,而是在黄金信号之上叠加成本、安全、质量三层,做的是加法。