}


作者 | 郑敏芳

办公Agent正式进入模型聚合大战。

8月14日晚间,千问办公宣布上线智谱GLM-5.3和DeepSeek V4 Pro两款模型,用户可以在产品首页的“前沿模型”档位直接选择使用。

就在同一天,百度文库网盘通用智能体GenFlow正式启用中文名“库库AI”,并推出独立桌面端,其模型池同样包含DeepSeek、智谱GLM等外部模型。

无独有偶,腾讯WorkBuddy、字节TRAE Work都已经内置多家第三方大模型。

从腾讯、字节到阿里、百度,国内头部厂商的办公Agent正在不约而同走向模型聚合模式

过去大模型产品争的是“谁家的模型更强”,到了办公Agent阶段,竞争逻辑开始出现变化:先把不同模型放进同一个工作台,让更多用户愿意把真实工作交进来。

只有用户真正用起来,写作、表格分析、PPT制作等真实工作流持续进入Agent,平台才有机会积累任务拆解、工具调用、失败恢复和用户纠正等反馈,并反过来打磨Harness,形成数据飞轮。

但下一道题也会随之出现:同一项任务究竟该调用哪个模型。路由由此成为聚合路线需要继续解决的问题。


踏入同一条河流

目前千问办公对外展示的“前沿模型”数量并不算多,除了自家的千问模型,外部模型主要是GLM-5.3和DeepSeek V4 Pro。

但千问办公明确表示三款前沿模型发布后都快速完成了接入,“这个节奏,我们会一直保持下去”。

这意味着,千问办公的内置模型池后续还会继续扩张。

相比之下,腾讯WorkBuddy已经形成了更大的内置模型池,不仅包括混元Hy3,还有智谱GLM、MiniMax、Kimi和DeepSeek等多个系列。

字节旗下TRAE Work也走在类似方向上。目前产品端可见的模型已经包括字节Seed系列、智谱GLM、DeepSeek以及千问等模型;

百度刚刚推出独立端的库库AI,同样引入了DeepSeek、智谱GLM等外部模型。

四家产品的共同点已经相当明显:办公Agent不再把自己的能力完全绑定在一家模型上。

原因在于,对办公Agent来说,现阶段比把每一次模型调用都留给自家模型更重要的是先让用户真正用起来。

当Agent开始搜索网页、打开文档、分析Excel、制作PPT、调用软件,并与用户来回修改一项工作时,都会留下更完整的执行过程:模型如何拆解任务、调用了哪些工具、哪一步失败、用户在哪一步进行了纠正,以及最终什么结果被接受。

真实工作流正是Agent时代稀缺的数据资源。

百度集团副总裁、个人超级智能事业群总裁王颖 认为 ,随着公共数据逐渐被模型充分学习, AI继续提升的过程中人产生的新知识、新经验和新想法会越来越重要。未来真正需要共同建立的是通用智能体能力、记忆与存储,以及个人知识和经验三部分能力。

模型池越丰富,越有机会提升不同任务的完成率,降低用户尝试一款Agent的门槛;只有更多用户真正把工作交给Agent,平台才能获得持续反馈,再去优化任务拆解、Context管理、工具选择、失败恢复等Harness能力。

模型聚合由此不只是模型能力的拼盘,也是在为数据飞轮争取更多真实任务。

但聚合并不意味着大厂之间的边界已经消失。

从目前产品端可见的默认模型池来看,WorkBuddy虽然接入了多家外部模型,但其中没有阿里的千问和字节Seed;TRAE Work已经内置千问模型,但没有腾讯混元;库库AI目前也未见混元、千问和Seed。

各家虽然都在扩大模型选择,但仍然保留着自己的生态边界。


不可能三角

把更多模型装进同一个Agent,只解决了“有没有得选”的问题,真正决定聚合路线能不能跑通的是下一步怎么选。

大模型落地一直存在一组近似“不可能三角”的权衡:效果、速度和成本很难同时拉满。

能力更强的模型通常意味着更高的推理价格,复杂任务为了得到更好的结果也往往需要更长的思考和执行时间;反过来,一味追求便宜和低延迟,又可能牺牲任务完成质量。

路由要解决的本质上就是这道三角题:为了把一项工作做完,应该在什么环节花更多钱换能力,又应该在什么环节用速度和成本换效率。

这也让聚合型办公Agent的竞争开始出现另一层差异。

理想的状态是用户只需要提出任务,后台根据任务难度、时效要求和模型成本完成选择。

到了这一步,用户看到的可能只是一次“帮我做完这份报告”的请求,后台却可能已经在不同步骤之间调用不同模型。

对于个人用户,这种差别最终体现在结果好不好、需要等多久、消耗多少积分;对于企业客户,则会进一步落到一项工作的单位算力成本。

办公Agent一旦进入大规模使用,几分钱、几毛钱的单次调用差异,都会随着任务量被不断放大。

路由由此也成为成为一笔规模化的经济账。但从Agent的完整执行链条看,路由也是Harness中的一环。

一项任务从用户提出,到最终交付,中间还涉及任务拆解、Context管理、工具调用、模型选择和失败恢复。路由决定“这一环该调用谁”,但真正决定任务能不能稳定完成的是整套Harness能否把这些环节协同起来。

这也是聚合路线真正可能形成壁垒的地方。模型本身可以接入,价格也可能随市场竞争不断下降,但如何在效果、速度和成本之间找到更好的平衡需要的是足够多的真实任务,以及平台长期积累下来的调度经验。

当WorkBuddy、TRAE Work、千问办公、库库AI手里的模型越来越多,真正拉开差距的可能是同一道题谁算得更精:什么时候该用最强模型,什么时候又根本没必要。

*本文为全天候科技原创作品,未经授权不得转载,如需转载,请在后台回复“转载”二字,获取转载格式要求。




点“在看”,变好看哦。