【第737期】提示词引起的编码代理效能损耗研究-请反复确认竟让AI贵18倍Seventy3

【第737期】提示词引起的编码代理效能损耗研究-请反复确认竟让AI贵18倍

19分钟 ·
播放数0
·
评论数0

今天的这篇的主题是: Same Task, Different Work: Prompt-Induced Waste in Coding Agents A Preregistered Study of Reasoning, Tools, and Harnesses

Seventy3 是一档借助 NotebookLM 解读前沿论文的播客——不是念摘要,也不是泛泛而谈,而是让 AI 帮你把论文掰开揉碎,说人话。我们蹲在人工智能、大模型、机器人算法、crypto 这几个领域,每期挑一篇值得关注的工作,用对话的方式聊给你听。你可以在通勤路上听,做实验的时候听,也可以当背景音放着,让新知识自然地长进脑子里。

如果你正在做有意思的研究,想让更多人看到——不管你是博士生、独立研究者还是实验室的博士后——把论文发给我们,我们帮你用 AI 做一期深度解读,让你的工作被更多同路人发现。

联系小助手微信:eccstartup(加群/投稿论文)

Summary

代码智能体(coding-agent)的效率不能仅凭 Token 数量或模型价格来表征。端到端成本和任务成功率共同取决于提示词语义、推理开销(inference effort)、框架策略(harness policy)、模型、任务难度、工具使用、上下文管理以及供应商的计费方式。对照实验表明,提示词的措辞可以在不改变任务的前提下改变推理与验证行为;额外的推理开销虽然能对困难任务有所帮助,但也会在不产生任何效益的情况下增加成本;并且当框架发生变化时,某项效率干预措施的价值也可能随之改变。这些结果表明,提示词、推理开销和框架是相互作用的实验因素,而非彼此独立的控制变量。我们将效率建模为由智能体轨迹所引发的“单个成功任务的成本”。Token 和缓存数量是该轨迹的度量指标,而非充分的优化目标。因此,智能体评估应当在控制决定轨迹生成方式的系统变量的同时,测量成功率和端到端成本。

原文链接:arxiv.org