同做一份 PPT,豆包工作 和 WorkBuddy 哪家强
- 2026-09-22 13:33:17
豆包姐,你站起来啊!

一、两边都出了岔子
9 月 16 号,豆包 2.1 Pro 更新了,豆包工作里也能用上。

豆包工作是字节八月上线的 AI 办公 Agent——多 Agent 编排、云电脑、飞书深度集成、定时任务,一口气铺了很多能力。点进去送了 30 天标准会员,我打算拿 2.1 Pro 试试它的云电脑功能。
结果 2.1 Pro 用不了。界面弹了一行提示:「当前高峰期算力紧张,优先通道暂时繁忙。我们正在优先为你调度资源,请稍后再试。」

这句话让我有点困惑——我已经在排队了吗?还是要我自己再点一次?我选了重试。重试到第十次,还是同一句话,而十次就是上限。
算了,切到自动挡。任务成功跑起来了,估计分配到的是豆包 2.1 Turbo。
另一边,我在 WorkBuddy 也开了一份同样的任务。WorkBuddy 也有云端沙箱,两边用差不多的环境。我选了 hy4 preview。任务开始,等待,任务完成了——我才发现界面上显示的是 hy3。试了两次都显示 hy3,确定是 bug。hy4 preview 版在网页版沙箱跑任务时会回落到 hy3,这我解决不了,hy3 出来的东西完全不可用。
于是我计划中的「云电脑对云沙箱」变成了:豆包工作的云电脑模式,对 WorkBuddy 本地 App。
我给两边的是同一个提示词:
去平遥电影节官网,把这一届电影节的信息整理成 PPT。
二、一份是 demo,一份是可以用的东西
先把结果摆出来:
| 19 分钟 | ||
豆包工作赢在速度——云端跑,19 分钟交卷,不用盯着。但翻完就觉得不对,五个展映单元列了名字,入围影片几乎没有。第二轮我让它补全影片信息,又跑了一版,主要的影片还是没放上去。如果只是要一个好看的壳子快速交差,这份够了。但我是要去买票排片的人,一份连片名都不全的 PPT 对我来说只是个玩具。

WorkBuddy 这边,过程完全是另一个画风。
它动手做 PPT 之前先写了两个文件。一个叫 STORY.md,一个叫 DESIGN.md。前者规划叙事线,把整届影展拆成四个板块、二十页,每一页写清楚承担什么角色、放什么内容、留白多少;后者定视觉规范——四色色板、字体层级、密度门禁、配图风格,全部锁死。想清楚了才开始逐页生成。

我第一眼看到这两个文件的时候觉得挺好笑。做个 PPT 而已,还要先写故事线。后来发现它质量高的原因就在这儿——那份 PPT 有目录、有章节扉页、有页码区间,读起来像一份被精心编排过的东西。后来才知道 WorkBuddy 9 月 15 号刚更新了 PPT 能力,这套设计前置的 skill 是刚上的。
而且不知道是不是腾讯生态的原因,WorkBuddy 用腾讯元宝搜到的信息比豆包全面非常多。藏龙卧虎各十部片子全部在列,每一部带导演、监制、主演和获奖履历。首映单元八部,特别展映四场,迁徙计划十组对谈带作家、嘉宾和日期——这些豆包那边全是残缺的。
但过程里又暴露了一个harness里的问题。😓
DESIGN.md 里定了每一页配独立主视觉,于是它排了【八张图】要生成。我选的是「胶片暗调」风格——在暗调背景上,你用什么图其实没有太大差别,why需要8张?这也是浑元系列模型一直有的毛病:没有预算意识。上次浑元 3 就把我的生图额度烧穿了,这次浑元 4 还是没改。
八张图,每生一张弹一个确认卡片问我要不要生。我点到第四张的时候实在有点不解——我只是想说「无需8张,封面和末尾各一张就行,中间的可以通用」,这么一个意见。可是askuserquestion卡片上只有「生图 / 不生图」的选项,没有给我写字的空间,我递不进去,只能自己重新打字发一条消息。
等图生完,又弹askuserquestion卡片问我要不要去水印。去水印每张额外扣积分。我不太理解这个设计:既然生图本身就要钱,为什么还要带水印?如果带水印和不带水印是两个价格,是不是可以在第一次弹窗里就确认掉,不需要反复问?
生了水印,再去水印,造轮子拆轮子,非常心累。
整个过程 25 分钟,124 积分。hy4 这个价格,真不便宜。
但最终出来的东西效果非常好。20 页,信息量大,对我来说不是玩具,是实际可以用的东西。翻开就能找到我要的片名、信息。

wb的封面

豆包的藏龙单元

wb的藏龙单元

豆包的十周年特别活动

wb的十周年特别活动⬆️


图注:wb有很多豆包没有的信息与页面
所以第一个结论很朴素:想做个小玩意、快速呈现、轻信息重视觉,扔给豆包。想要可用的、信息量丰富的重工 PPT,选 WorkBuddy。两个工具解决的不是同一个问题。
如果你赶时间,可能要提前和workbuddy交流好,别太重了。
三、我拿官方原文一条条对
核对完是这样的:
官方的首映单元有 8 部片子,豆包漏了 4 部。特别展映官方有 4 场,它漏了 2 场。

图注:豆包的首映单元只有4个

图注:wb的首映单元齐了
我是要去买票的人,所以这份信息我看得比较直接。豆包漏掉的那 4 部首映片里,有詹姆斯·格雷的《纸老虎》、罗泓轸的《希望》、蕾雅·赛杜主演的《温柔的怪物》。我如果拿着豆包的那份去排片,会给我造成很大的困扰。
而 WorkBuddy 里那三处写错的信息,导演国籍写错了、奖项挂错了、单元名编了一个。
漏和错哪个更严重,取决于你拿它干嘛。拿去买票选片,漏更贵。拿去对外发布、要担责的那种,错更严重。不管是哪家harness都得再次核查事实。
四、两处编造,长得一模一样
两份 PPT 里的信息大部分是对的,但各自藏着编造。把它们摆在一起看,我找到了这次测试里两个好玩的地方。
第一处,WorkBuddy +hy4 的版本里,《峡湾》那一栏挂上了一个费比西影评人奖。官方公告里,费比西明明是《无名女孩》拿的。
第二处,豆包+2.1turbo 的版本里,卧虎单元四部片子整整齐齐标着「国际首映」。而官方写得很清楚,这几部在柏林论坛、洛迦诺、戛纳 ACID、釜山等影展都放过了。已经在国际影展亮过相的片子,标「国际首映」就是乱说的。
两处编造跨了两个产品,看起来毫无关联,但摆在一起,模式一样:
这俩模型好像有一个必须被填满的格子,像不会写的试卷必须乱写一个答案交上去一样。
是模型幻觉还是skill的要求呢?我无法知道。
我只知道做出来的东西,再漂亮也一定需要核。
五、谁在核查内容
写这篇的时候,我刷到 WorkBuddy 官方发的 PPT 能力升级说明。里面有一段教用户怎么验收:
生成后,你只需检查两个结果:把所有页面标题连起来,能不能讲清一件事;每一页是不是都有明确重点。

两条验收标准,都在问结构。没有一条在问内容对不对。
回头看我那几处编造,按这两条检查,一个都抓不出来。假单元名放在五个真单元中间毫无违和,费比西奖让奖项栏看起来很完整,四个「国际首映」让那一页的标签整整齐齐。结构全部合格,内容全部是编的。
以前用 AI 做 PPT,大多是人带着自己的数据和报告,让 AI 帮忙排版。内容对不对是人自己的事,AI 不用负责。
但现在这些工具越推越往「一句话全包」走——你出一个主题,它去搜、去整理、去排版、去交付,全程不需要你提供任何素材。能力升级了,验收标准还停留在「AI 只管排版」的假设里。
而排版越精美,结构越工整,人越不会逐条去查。
也许以后这些工具背后会跑一个专门核查事实的环节。但现在还没有。在那之前,最后把关的只能是你自己。

作者lili & Opus地点杭州时间2026 白露