而现在的AI Agent,也面临着同样的困境,当模型越来越好,能不能把好用对地方,反而成了问题。
华尔街投行杰富瑞,最近对八款中美主流的AI Agent做了一次有意思的实测,让它们做了一堆打工人日常要干的活,查文件写摘要、上网搜数据做对比、操控浏览器..结果出来的时候,很多人都震惊了,综排名top的,并不是脑子最聪明的模型。
在这次实测中,阿里的qwenwork位居榜首,Claude Cowork其次,Codex第三。qwenwork背后的Qwen 3.8 Max,在模型智能体中排第四。而在模型智能体中排名最高的Claude Opus 5,对应的Agent产品并没有比它高。
问题在哪?杰富瑞给出的解释是一个叫Harness的概念。指的是包裹在模型外面的整套管理系统。它一共有六个层面,如何给模型派活、提供背景信息、允许用什么工具、权限边界是什么、干完了如何反馈纠错、多智能体如何协调。模型再聪明,没有这套机制就像天才员工没电脑、没KPI、没反馈,照样出不了好活。
报告还做了个对照实验,同一个模型,只换Harness,表现得分能差出18个百分点。九组对比里有六组的排名会因为Harness不同直接翻转。
在同一时间,摩根士丹利从财务角度拆了阿里云AI业务的账。在自建GPU租出去、租别人算力再转租、卖模型服务这三条路里,MaaS最亮眼,毛利率76%以上,营业利润率53%,ROIC约19%,两年半回本。比美国巨头差一截,但在中国同行里已经很能打了。
两件事拼在一起,能看出AI竞争逻辑正在变。以前比谁家模型参数多、智商高,现在和未来的竞争,是谁能在合理成本下,把模型、工程、场景捏合成稳定好用的产品。用户不关心模型排第几,他们关心的是这个Agent能不能把活干完、干好,以及干完活到底要花多少钱。
这里还有个容易被忽视的点,光比Token单价是不行的。因为有些模型看着便宜,但干活啰嗦、来回调工具,完成一个任务的总花费反而更高。所以单任务执行成本可能比Token价格更有参考价值。
千问办公这次能登顶,底层模型Qwen 3.8 Max的价格就比GPT-5.6 Sol便宜了70%多。当然光便宜没用,还得能干好活。从结果看,它两头都占了,这才是关键。
AI华尔街投行qwenwork摩根士丹利实测结果






