💡 今日思考:
今天这几条放在一起看,我更在意的不是又多了多少模型,而是Agent开始真正碰到“执行环境”这件事。
DeepSeek把Harness从WebUI推向桌面,微软直接把Copilot做成可以长期运行的Autopilot;另一边,国内又在补太空算力、边缘芯片和AI企业出海的支付基础设施。AI要真正替人做事,最后一定要接触电脑、文件、网络、支付和外部工具,而不是永远待在聊天框里。
但OpenAI这次披露也把另一面摆得很清楚:Agent拥有的手越长,权限控制就越重要。以前模型答错一句话,最多需要重新生成;以后一个能够自主调用工具的Agent如果判断错了,可能真的会上传文件、修改数据或访问不该访问的服务。
所以接下来评价Agent,我觉得除了“能不能做”,还要多问一句:“它能做到什么程度,我又能不能随时看见和叫停它?”

