这两天,我用3套AI智能体工作流,做了一次PPT实测。
不是看网上的演示,也不是听厂商介绍。
我把同一个课程大纲,分别交给3套组合去制作PPT。
测试之前,我对它们的期待完全不一样。
测试之后,结果也确实出乎我的预料。
我原本期望最高的组合,做出来的页面结构很清楚,但是使用起来没有想象中那么顺手。
我非常看好的 Kimi 3,效果基本能用,却直接把我的 WorkBuddy 积分消耗光了。
而那套我心里最没谱、甚至有点忐忑的组合,最后反而给了我最大的惊喜。
说实话,这次测试让我重新认识了 DeepSeek。
第一套方案是 Codex 加 ChatGPT 5.6 Sol。
这段时间我使用最多的智能体工具就是 Codex,所以测试之前,我对这套组合的期望值最高。
从结果看,它的能力没有问题。
这套PPT的信息结构很清楚。学习路径、案例关系、诊断模型和课堂任务,都不是简单地把一段文字塞进模板,而是用流程、图表和视觉层级重新组织了一遍。

单看页面,逻辑是清晰的,完成度也不错。
但是实际使用下来,我总觉得没有那么顺手。
一方面,最高档模型在长流程任务里的Token消耗非常大。只统计实际PPT制作阶段,8个独立页面大约消耗 2128万 Token,按公开单价折算约 116元。
如果把前面的课程大纲、120页逐字稿、技能比较、PPT制作和修改全部计算进去,整段会话约 5171万 Token,折算约 277元。

这里需要说明一下。
116元和277元都是按照Token公开价格计算的等价成本,不一定等于实际账单。277元也不能直接算成这8页PPT的费用,因为它还包含了很多前置工作。
但不管怎么说,这个消耗还是让我有些意外。
页面做得不错,但是如果整套几十页、上百页的企业培训课件都按照这个强度来做,成本和操作复杂度都会迅速上升。
我的真实感受是,Codex 加 ChatGPT 5.6 Sol 更适合做少量重点页面、关键模型页和高价值交付页。
如果全部页面都用最高档跑,多少有点拿着精密设备去做批量加工。
能做。
但不一定划算,也不一定顺手。
第二套方案是 WorkBuddy 加 Kimi 3。
我对 Kimi 3 的期望值同样很高。
它在长任务、知识工作和智能体执行方面一直比较受关注。WorkBuddy 本身又把模型、技能和工作区整合在了一个界面里,理论上应该更适合普通人使用。
最终生成的 26页PPT,整体效果基本可以使用。
页面风格统一,深蓝色商务风比较稳,模块页、流程页、对比页和模型页都有。作为企业培训课件底稿,它已经达到了可以继续修改和完善的水平。

问题出在成本上。
这次任务一共记录了 15次请求,积分明细合计 2181.93分。
做到后面,系统直接提示我的可用积分额度已经耗尽。


看到这个提示的时候,我第一反应就是,这也太花钱了吧。
一套26页的PPT,直接把2000积分级别的可用额度消耗光了。
如果只是偶尔做一次,或许还能接受。如果经常要做几十页课件、研究报告和复杂文档,这个积分消耗速度就必须认真考虑。
WorkBuddy 加 Kimi 3 的优点是门槛比较低。
不需要自己配置太多开发环境,也不需要理解过多底层调用过程。打开工作区、选择模型和技能,就可以开始干活。
但这种方便不是免费的。
当任务越来越长,读取的材料越来越多,来回修改的次数越来越多,积分也会跟着不断下降。
所以我的判断是,这套方案能够用,也比较容易上手,但做长任务之前一定要先算清积分预算。
不要做到一半才发现,工具还在工作,额度已经先下班了。
第三套方案是 Claude Code 加 DeepSeek V4 Pro。
坦率地讲,测试之前,我对这套组合只有隐约的期待。
我有一段时间没有怎么使用 Claude Code 了。
这段时间主要在用 Codex,对 Claude Code 现在做复杂文档和PPT到底是什么水平,我心里没有底。
再加上这次配合的是国产大模型 DeepSeek V4 Pro。
它的推理能力怎么样,能不能理解企业培训课程,能不能稳定调用PPT技能,最后做出来会不会只是内容堆砌,我都没有谱。
结果,它反而成了这次测试里最大的惊喜。
这套组合最终做出了 55页PPT,实际API账单只有 7.84元。

更重要的是,它不是只赢在便宜。
内容非常好。
课程结构完整,页面之间有连续的叙事关系,不是东拼西凑。对于知识管理、业务案例、方法模型和课堂应用的表达,也能够贴着课程目标往下走。
呈现效果也超出了我的预期。
页面有图表、有流程、有对比、有视觉重点。深蓝、灰白和红色的搭配比较有冲击力,整体不像一套只追求数量的机器生成稿。

55页,7.84元。
平均每页的模型费用大约 0.14元。
从内容质量、页面数量、视觉呈现和成本几个方面综合来看,这次 Claude Code 加 DeepSeek V4 Pro 的结果,非常符合并且超出了我的期望。
至少在这一次PPT制作任务里,我认为它已经能够平替,甚至超越 Codex 加 ChatGPT 5.6 Sol 这套组合。
注意,我说的是这一次PPT制作任务。
不是说 DeepSeek 在所有任务里都比国外模型强,也不是说 Claude Code 在所有场景里都一定优于 Codex。
但是这个结果已经足够提醒我,国产大模型不应该再被默认放在备选位置。
第一个启发,外界宣传得再好,也要自己亲手去用。
现在每个智能体产品都在讲自己的模型更强、任务更长、结果更专业。
这些介绍可以看,但不能代替真实使用。
工具好不好,最终还是要回到你的具体工作:
这些才是真正影响选择的东西。
同一套课程大纲,我如果没有把3种方案都跑一遍,很可能还会按照过去的印象做判断。
结果一跑,认知就变了。
第二个启发,不要一直迷信国外大模型。
过去大家做复杂任务,习惯先选择国外模型。国产模型往往被放在成本更低、能力差一点的位置上。
但这次 DeepSeek V4 Pro 给我的感受不是便宜但能凑合。
而是便宜,同时内容和视觉效果都很好。
这两者的差别非常大。
便宜但能凑合,只适合做低价值任务。
便宜而且结果好,才有机会真正进入高频生产流程。
第三个启发,不能用一次PPT测试给工具下最终结论。
客观地讲,AI智能体工具加大模型加技能的组合,制作PPT只是它们能力的一个方面。
同一个组合换到代码开发、深度研究、数据分析或者长周期任务里,结果可能完全不同。
这次测试也没有做到完全相同的页数、完全相同的交付范围和完全相同的计费方式,所以它不是一份严格的实验室评测。
它更像我在真实工作中的一次使用记录。
有结果,有成本,也有我自己的感受。
不能以偏概全,也不能因此给3套方案做永久排名。
但对我来说,这种真实使用比单纯看参数更有价值。
经过这次测试,我越来越确定一件事。
未来我们使用AI,不会只是打开一个聊天框,问一个问题,复制一段答案。
真正高效的方式,是把AI智能体工具、大模型和专业技能组合起来,形成一套能够持续交付结果的工作流。
我把这种能力称为驾驭AI。
不是被工具牵着走,也不是看到一个新产品就马上换工具。
而是知道什么任务该交给谁,知道怎么拆解工作,怎么组合模型,怎么用结果说话。
这也是我设计「AI驾驭者专属智能体实战」特训营的原因。
这不是一门只介绍AI工具的课。
我会带大家从趋势洞察和工具选型开始,拆解企业级架构思维,搭建智能创作、调研分析与办公工作流,并把智能体真正装进自己的业务场景。
课程计划在 8月上旬于北京开展,适合职场从业者、产品运营人员、技术开发者,以及希望用AI降本增效的创业者和自由职业者。
如果你不想只停留在知道几个工具,而是想真正搭建自己的AI生产力系统,可以扫描海报中的报名二维码预约。
最后,我还是希望大家能够真正用起来。
不要因为工具太多就一直观望,也不要一上来就追求最贵、最强的模型。
找到物美价廉、适合自己工作场景的AI智能体产品,从手头一个真实任务开始。
让AI帮你完成一份PPT、一份报告、一次调研或者一套内容。
在真实结果里积累判断,在一次次使用中形成自己的工作流。
AI真正的价值,不只是让某个任务快一点。
而是帮助我们突破个人时间限制,构建一套可以重复运行的生产力系统。
当别人每天只能依靠自己的时间工作时,你已经开始调动多个智能体、多个模型和多套技能协同完成任务。
这才是智能时代真正值得把握的机会。
如果你在使用AI办公、调研分析、内容创作、课程开发、知识库或智能体时,经常遇到具体问题,也可以加入我的AI提效线上咨询会员。
目前首发早鸟价 69元一年,提供365天群内公共图文答疑、会员直播分享,以及AI办公和业务应用的方法参考。
需要说明的是,这是群内线上咨询,不包含一对一咨询。
如果你希望在实际使用中有人帮你分析方向、提供方法参考,可以扫描下面海报中的付款码加入。

工具没有永远的第一名。
真正重要的是,你能不能用更合适的成本,把它变成自己的生产力。
如果你觉得这篇文章还不错,或者对你有一点帮助,欢迎顺手点个赞、点个在看,也可以转发给身边正在学习AI、使用AI,或者正在探索个人成长与内容创作的朋友。
长按 扫码 关注 视频号 李福东频道,回复666,免费获取Claude Opus 5提示词66页文档。

如果你想继续了解AI工具、Agent工作流和企业效率实践,欢迎关注「李福东频道」。