EP113:能被 Benchmark衡量的工作,都不应该是你的创业方向AI西经东译

EP113:能被 Benchmark衡量的工作,都不应该是你的创业方向

14分钟 ·
播放数174
·
评论数0

本文《The Untrainable》分析了 2026 年中期 AI 投资领域普遍存在的“绝望感”——即认为除了底层模型实验室(如 Anthropic)和算力供应商(如 Nvidia)之外,一切建立在 AI 之上的应用都是极易被吸收的“薄包装”。然而,深入分析表明,这种观点忽略了真实世界中价值产生的核心逻辑。

核心结论如下:

  • 可测量性陷阱: 基准测试(Benchmarks)能够衡量的任务(即可读工作)正迅速成为商品,而真正的商业价值存在于那些“不可读”的、无法通过训练轻易习得的私人数据和复杂现实中。

  • 组织速度 vs. 技术速度: AI 的能力增长极快,但企业组织的变革、信任的建立和问责制的落实却受到人类物理时间的限制。

  • 吸收前沿: 模型实验室确实在吸收应用层的功能(如检索、工具使用),但拥有私人真相、特定领域标准定义权和深入客户工作流的企业将建立起持久的护城河。

  • 意图的稀缺性: 智能正在商品化,但“决定构建什么”的意图和对复杂结果的法律问责,是算力无法取代的稀缺资源。


1. 软件工程的误读:基准测试与现实的差距

投资者普遍认为 AI 模型将彻底取代软件工程,但实际数据显示了更复杂的图景。

  • 生产力悖论: MIT 的研究指出,尽管最新的编程代理使代码编写量增加了约 180%,但实际交付(Ship)的代码量仅增长了约 30%。这表明编写代码已变得廉价,但确保代码正确并符合复杂系统要求的环节依然由人类主导。

  • 基准测试的局限: 编译器和测试套件是免费的验证器,这使得编程代理在基准测试中表现卓越。然而,基准测试无法衡量代码是否适用于拥有十年历史、充满未记录逻辑和脆弱部署管线的旧代码库。

  • 慢速护城河: 复杂系统的正确性无法通过排行榜读取,只能通过在现实世界中长期运行来验证。正如 Noam Brown 所言,评估一个代理一年跨度表现的唯一可靠方法就是运行它一年。这种时间成本是资本无法压缩的护城河。


2. 价值的象限:可读性与私有真相

根据任务的饱和度(Saturated)和答案的公开性,可以将工作划分为不同的价值区域:


3. 吸收前沿与应用层的防御

底层实验室正在不断扩大其功能边界,试图吞噬应用层的“脚手架”(Scaffolding)。

  • 吸收机制: 检索、路由、工具调用、甚至推理策略,正逐渐被拉入模型权重中。

  • 应用层的策略:

    • 深度翻译: 应用层的价值在于将公司的私有现实“翻译”给模型,并提供行动工具。

    • 专注性优势: 通用代理为了应对一切场景而成本高昂,而专注特定工作流的应用可以优化成本并保留利润。

    • 结果定价: 领先的公司(如 Sierra、Cognition)不再按代币收费,而是按结果收费(如解决客户问题、性能保证)。这要求应用必须深入系统内部并拥有定义“完成”的权力。


4. 无法跨越的壁垒:权限、信任与问责

即便模型智能超过人类,某些领域依然存在算力无法攻克的“锁”与“闩”。

  • 环境之锁(权限): AI 必须被授予进入银行生产系统或医疗记录的权限。这种信任建立在安全审查、合同约束和长期的关系之上。

  • 用户之闩(习惯与信任): 例如,OpenEvidence 之所以成功,是因为它已进入医生的日常习惯,这种信任是基于关系的,而非梯度下降(Gradient Descent)所能习得。

  • 法律问责: 模型无法承担法律责任,无法在答案错误时被起诉。最终必须有人对 AI 的行为签字负责。

  • 定义的权力: 谁定义了“好”的标准,谁就掌握了话语权。法律领域的 Harvey 或医疗领域的 OpenEvidence 正在通过建立行业基准来确立权威。


5. 结论:寻找“不可训练”的价值

在 AI psychosis(精神官能症)蔓延的背景下,理解价值的转移方向至关重要:

  1. 向不可读性靠拢: 避开那些可以被轻易衡量和训练的通用任务。

  2. 深入私人现实: 价值正滑向模型无法触及的少数地方——即具有历史积累的、私有的、非结构化的真实环境。

  3. 重新承保(Underwriting): 在特定任务上使用私有数据和评估体系,训练出的专用模型可以在关键环节击败通用模型。

  4. 意图决定胜负: 模型可以执行指令,但无法告知什么值得构建。找到尚未被发现的用途,比拥有更多算力更具防御性。

最终洞察: 基准测试得分的提升实际上是“价值即将归零”的领土图谱。真正的幸存者是那些能够进入复杂系统、从事“不体面”的翻译工作、并最终定义行业标准的企业。