本期要点
· 评测到底是干什么的:它不是打分表或排行榜,而是一套用来回答"关于你的 AI 系统的问题"的机制,把"我觉得还行"换成"我跑了多少用例、哪一项涨了、哪一项跌了"
· 评测由四个部分组成且顺序不能乱:数据集、任务、评分体系、实验;任意一种"数据集+任务+评分"的配置就等于一次实验,所以"跑评测"本质是"跑多个实验再对比"
· 最危险的失败是"静默退化":2025 年 4 月 OpenAI 一次模型更新把模型变谄媚、诚实度悄悄下降,不报错、不崩溃、界面照常,只能靠系统性测试抓到
· 实测对比:把开源代码仓库的检索环节做端到端评测,向量检索与智能体式检索准确率打平,但智能体式方案的成本约为前者四倍
· 核心结论:换一条技术路线不一定换来更高准确率,可能只换来一张四倍账单;要判断"贵在哪",必须先把内部过程看清楚
· 讲者主动交代局限:每个任务只跑一次、实现偏弱、样本只有 20 条——一份让人信得过的评测,要把边界和分数一起交出来
· 上手建议:从线上真实日志里抽 10 到 20 条先跑起来,先把"日志→数据集→实验→改动→线上"这个闭环转起来
