今天的这篇的主题是:The Harness Effect: How Orchestration Design Sets the Token Economics of Enterprise Agentic AI
Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。
如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。
联系小助手微信:seventy3_podcast(加群/投稿论文)
Summary
当今 Agentic AI(智能体 AI)的开发建立在“Token 极值化”(token maxing)之上:即通过消耗 Token 来换取能力——更长推理链(reasoning traces)、更多轮次、更宽泛的工具载荷(tool payloads)、更庞大的重放上下文(replayed contexts)——导致每个任务消耗的 Token 数增长速度超过了任务本身的价值。单 Token 价格的下降掩盖了这一模式;总支出依然在上升。
我们认为,应对 Token 极值化的关键杠杆是 Harness(调度/治理框架):即负责组装上下文、暴露工具、排列轮次顺序、委派工作并承载企业级可观测性与治理的编排层(orchestration layer)。我们通过一项控制变量实验将其独立评估:在 22 个锁定的评估任务、6 个基础模型(Claude Sonnet 4.6、Gemini 3.1、Gemini Flash 3.5、Qwen 3.6、GLM 5.1、Palmyra X6)下,仅改变编排层——对比冻结的传统生产循环与 Writer Agent Harness。
在保持模型不变的情况下,该 Harness 使单任务混合成本降低了 41%($0.21 -> $0.12),中位数耗时(wall-clock)缩短了 44%(48s -> 27s),单任务 Token 消耗减少了 38%(14.2k -> 8.8k),同时任务完成质量保持相当(0.78 -> 0.81,在该样本量下具方向性指示意义)。效率提升具有模型无关性(model-invariant)——每个模型的成本均有所降低(33%–61%);而质量提升则依赖于模型本身的能力:模型的质量增益与其基线能力呈近乎完美的正相关(r=0.99, n=6),我们将这一现象称为 Harness 杠杆效应(harness leverage)。每美元质量比提升了 82%;每百万 Token 完成的任务数从 54.9 增至 92.0。
在该工作负载下,编排层对单任务成本的影响甚至超过了整个模型菜单的全部价差。我们在编排层对 Token 经济学进行了形式化(包括 Prompt 缓存下的有效输入价格),详细阐述了该效应背后的六大机制家族(从缓存形态规范到失效支出治理),在相同维度上对比了六种广泛使用的 Agent 系统,并论证了 Harness 是唯一能够将其效率成倍叠加到企业运行的每一个模型(无论是现有还是未来模型)之上的组件。
原文链接:arxiv.org

