WorkBuddy、千问办公、TRAE Work:AI办公拼的是能力,赢得是顺手
厂商比的是谁更强,用户选的是谁更顺手。这条沟壑,比参数表的差距更难填。

01、三个月,赛道挤满了人
最近三个月,国内AI办公这条赛道突然挤满了人。TRAE Work、WorkBuddy、千问办公、WPS灵犀、Kimi Work、百度搭子、豆包专业版、库库AI, 后面还跟着360 Nano Work、商汤小浣熊、网易有道LobsterAI、智谱AutoClaw等一长串名字 ,每个互联网行业数一数二的大佬,都在抢同一个位置。
去年都还叫AI编程助手,今年全改叫AI办公助手。字节把TRAE SOLO改成TRAE Work;阿里把QoderWork、悟空、MuleRun这三款Agent合成千问办公;腾讯把CodeBuddy升级为WorkBuddy, 月访问量已经冲到2097万 ,稳居该赛道的第一。
| 字节 | ||
| 阿里 | ||
| 腾讯 |
改名不是小事,它代表产品定位在集体迁移:从给程序员写代码,转向给所有上班族干活。技术从Coding走向Work,方向没有问题。但名字换了, 谁能真正走进上班族的日常,看的不是名字,是下面这几件事 。
02、三巨头正面比较
业界的评价很诚实:头部三家的能力差距,各有各的最强项,也各有各的坑。把第三方实测、社区吐槽和官方口径摊开,画像很清楚:
| WorkBuddy | |||
| TRAE Work | |||
| 千问办公 |
WorkBuddy:六边形战士,积分刺客
生态厚度断层领先:原生打通腾讯文档、企业微信、QQ、腾讯会议,100多个领域专家加技能市场,Ask/Plan/Craft三模式分层,想省积分时切Ask只查资料。模型自由度接近满分,混元、DeepSeek、GLM、Kimi、MiniMax都能切,还能配自己的API Key。实测里它是会主动补充观点的分析师 ,做竞品监测、内容分析会主动补上模型参数、产品数据和竞争态势。
坑也集中在一个词上:积分刺客 。按输入加输出双向计费,每轮追问把历史对话重新算一遍token,改七八次烧掉近200积分;Auto模式还经常给简单任务调用最贵的推理模型,不同模型倍率最高差26倍,社区有人充58元三天见底。任务开始前你无法预知会花多少,消耗不透明是硬伤。老丁最近点运行前会下意识的看一眼模式的焦虑就来自于此,如果看到Auto就会如丧考妣。
TRAE Work:工程天花板,格式水土不服
工程化效率最高,三端可用(网页、电脑、手机),Work派活、Code写码、Design出稿三模式接力。最难得的是数据审计链路最好 :明确保留数据清洗过程,区分第一轮和第二轮结果,交付里能看到自我审计痕迹,像会查账、留证据的分析师。和飞书打通,读会议妙记出周报很顺。
短板也明显: 交付格式常不符合传统办公习惯 ,做周报做成网页、做PPT做成HTML,格式不对就要返工。额度从「不限量」一路缩到每日限额、再到月度总量锁死,还有隐私遥测的争议,让老丁至今仍有使用顾虑。
千问办公:成品最好,慢且锁死
成品质量最高:PPT视觉三家最好,复杂任务里唯一完整交付的,小红书笔记的语感和节奏是三家里最自然的。交付完整、成品化强, 最适合拿来直接用 。背靠钉钉2600万企业组织,25项原生能力。
劝退点第一条: 模型不能换 ,目前只能用Qwen3.8-Max,在别家都开放多模型的今天,这是显著减分项。然后它慢,实测每一轮都是最慢的,有网页任务耗时1小时8分钟,在一切平等,唯有时间珍贵的AI时代,慢就是原罪;关键指标还有遗漏和小错误,年龄占比、时区口径出过异常。对工作Agent来说,能在小数点上犯错,说明还没把「数据口径可验证」当成第一优先级。
三个不吹不黑的判断
第一, 积分机制不透明是全行业的原罪 。WorkBuddy被骂积分刺客,TRAE被骂额度层层缩水,千问一次任务烧掉半月额度,没有一家能在任务开始前丁是丁卯是卯的告诉你这件事大概要花多少钱。
第二, AI自查的数据不可靠,任何数字都要人工复核 。老丁拿三款产品做同一个看板,相同的数据占比WorkBuddy给85%、千问给92%、TRAE给80%,三家都没说明统计口径。凡是要拿去汇报的数字,必须自己要核一遍。
第三, 产品基因不是优劣,是适配问题。同一个能力,换个场景就从加分变减分:WorkBuddy的分析能力写公众号是加分,写小红书就显得太重;TRAE的工程思维做PPT水土不服,把口播脚本做成带画面、时长、字幕样式的分镜表格,视频团队反而觉得实用。
别问哪个最强,问哪个像你。能力上有长板,使用上有代价,谁也没做到没有硬伤。
03、用户的声音:嘴上嫌弃,手上诚实
厂商在台面上比参数、比生态,用户则在各大互联网平台用脚投票。老丁抽样了某书上十篇高热对比笔记、两千多条评论,结论出奇一致: 大家都承认某些产品更强,但很多人最后还是没选它 。
用户真正权衡的不是「智商」,而是能不能顺手用。装上、登录、在国内环境直接跑,不需要翻墙、国外账号和信用卡。对很多人来说, 可达性比能力排行更重要 。
抱怨最多的,是积分制在反复重试时会静默放大消耗,容易变成 「积分黑洞」 。标价看着便宜,任务失败一次重试一次,成本就滚起来了。相比之下,固定额度的方案更像一个封顶、可感知的池子,用户更容易估算要花多少钱。
第二类声音更直白: 没有更好的Agent,只有更适合场景的Agent。吾之蜜糖,彼之砒霜。脱离业务场景谈能力强弱,本身就没有意义。有的Agent擅长深度推理,有的擅长高频自动化执行,有的侧重轻量快速响应。选对场景、做好边界约束,普通的 Agent 也能产出巨大价值;脱离实际需求,再强大的大模型Agent也只是空中楼阁。产品基因不是绝对优势,要看场景适配。
更有意思的是职场使用方式的变化。晚上给AI派活、次日一早收结果,正在成为一群人的新职场流:律师、产业分析师、市场策划开始把AI当「夜班同事」,白天对接业务,夜里让智能体在后台跑任务。被AI「救赎」的打工人不少,被「气哭」的也多。
嘴上吐槽最多,手上用得最勤。骂归骂,走的没几个。因为换工具的代价,比吐槽的成本高多了。
04、决定体验的三件事
第一件:Agent能力
一个办公Agent能不能真正用起来,先看它能不能 同时解决五个问题 :
这五件事一件都省不掉。聊天助手可以只回答「怎么做」,能放心交付的Agent必须保证 「做对了、没越权、能交代」 。
第二件:迁移成本
能力榜上某家可能单项反超,但用顺手以后用户换工具要付出的,是三重资产全部重来:
第一重,配置资产。Skills、定时任务、连接器登录态、模型偏好、API Key, 换一家全部重来 ,没有一键迁移,只有从头再配一遍。
第二重,工作流依赖。WorkBuddy和腾讯文档、企业微信、QQ、腾讯会议原生打通,换工具等于 把协作链条拆了重建 ,同事还在那边等着收文件,你这边先把管道重接一遍。
第三重,习惯依赖。Ask/Plan/Craft三模式的操作肌肉记忆,社区里大量教程和Skill分享, 这些内容沉淀本身就是壁垒 。除非新产品好到能覆盖这三重成本,否则大多数人只会下载试两天,退回老工具。
所以有时候现在用的再不尽如人意,也很少有人会打算一股脑的换Agent,因为这意味着前面的沉淀你要统统抛弃。
第三件:生态
还有一个大家不怎么关注的,就是生态。没有生态,就没有人长期使用它。个人工具可以靠单点体验赢,长期拼的是生态厚度:能不能接进你常用的系统,能不能让开发者持续贡献能力,能不能在场景里越用越贴合。
能力决定能不能用,迁移成本决定走不走得掉,生态决定用多久。三件事合起来,才是真正的护城河。
05、AI办公未来的几个趋势判断
最后,老丁想谈谈自己对于AI办公未来的趋势判断:
趋势一:积分机制透明化,会是第一个分水岭
用户的耐心很容易被反复重试的静默扣费消耗光。老丁判断, 谁先把消耗算得明明白白、做成可预期的封顶池子,谁就能收割一大批被烧怕了的用户 。积分战争,会先从透明开始。老丁的建议是,跟腾讯会议学学,最好先给大家免费使用的窗口期,占领大家的心智,等培养起用户习惯再收费也不迟。如我上文所说,切换的成本实在是太巨大了。
趋势二:从「改名」到「改基因」,是下一个战场
名字从Coding换成Work只需要一次发布会,但产品从「给开发者用的工具」变成「给上班族用的同事」,改的是交互、交付和信任逻辑。下一步的竞争,是看谁先把「给你工具让你拼」的基因,换成「接过人话把活干完」的基因。
趋势三:数据可验证,会取代「好看」成为硬标准
AI能省掉90%的搬砖,那10%的核对暂时省不掉。未来能主动留下数据清洗痕迹、区分首轮二轮结果、把错误沉淀成规则的产品,才敢被放心交付核心工作。 报告可以做得漂亮,但能不能证明数字从哪来,才是下一代产品的分界线 。
趋势四:竞争会从「单品」转向「组合拳」
三家的产品基因不同,未来各自的长板会越来越分化:WorkBuddy守着本地文件与腾讯生态,TRAE往工程和飞书走,千问押注钉钉与成品质量。真正的竞争,不会是一款产品通吃,而是 谁先把模型、工具、场景串成一条顺手的工作流 ,谁就占住一个生态位。
趋势五:短板会决定终局
三家的长板都够亮,决定谁能笑到最后的,反而是短板:WorkBuddy能不能把积分算明白,TRAE能不能把交付格式掰回办公习惯,千问能不能开放模型、提提速。长板决定上限, 短板决定下限,而用户是用下限投票的 。
名字从Coding改成Work,只需要一次发布会。从榜单上的第一,变成用户心里顺手的那个,还有很长的路要走。但老丁觉得方向已经清楚:谁先让用户放心,谁先赢
- 暂时没有评论,来说点什么吧





