PART 01 · 概念
Agent:会自己干活的AI
普通AI对话就是这样:你问一句,它答一句。你想要一个PPT?它给你一段文字大纲,然后你自己去PowerPoint里排版。
Agent反过来了。你告诉它"帮我做一套关于新能源政策的8页PPT",它会自己规划步骤、调用工具、生成文件、检查结果。中间大部分环节你不用插手。
普通AI对话 你:帮我写个PPT大纲AI:好的,这是大纲...你:然后呢?AI:你自己去PPT里排版吧 → 你还得干80%的活 | | AI Agent 你:帮我做套新能源PPTAgent:我来规划步骤...生成蓝图 → 扫描文字 →写代码 → 生成PPTX → 渲染检查→ 交付可编辑文件 → 你只需要确认和提意见 |
说白了,Agent = AI大脑 + 工具双手 + 自主规划。它能自己决定"用什么工具""按什么顺序""怎么检查",像雇了一个数字员工。
在这个PPT项目里,Agent做的事情包括:
1. 理解需求:分析PPT主题,规划8页的内容结构
2. 调用ImageGen:用AI图像生成模型,画出每页的设计蓝图
3. 精准扫描:逐像素扫描蓝图中的文字,提取位置、大小、颜色
4. 写代码生成:用PptxGenJS编写脚本,生成可编辑PPTX
5. 渲染检查:调用PowerPoint渲染成图片,跟蓝图并排对比
6. 迭代修复:发现差异,自己改代码,重新生成再验证
这些步骤全部由Agent自主完成。你要做的事很简单:在几个关键节点看一眼,说"这页可以"或者"标题再大一点"。
PART 02 · 选模型
不同任务,用不同的"大脑"
很多人以为AI就是"一个模型干所有事"。在这个PPT项目里,Agent实际上调用了三种不同的AI模型,各有各的活:
① GPT ImageGen:AI的"设计师"
做PPT最难的地方其实不是写文字,是设计。配色、布局、图表样式、视觉层次,这些东西没有标准答案,靠审美和经验。大多数人卡在这里。
ImageGen解决的就是这个问题。你描述需求,它生成一张完整的PPT页面设计图。这项目里8页PPT的视觉方案全部由它生成。
实际用法:告诉ImageGen"生成一页关于绿色氢能产能数据的PPT设计图,深蓝色系,左侧表格右侧柱状图,底部四张卡片"。它直接给你一张能用的设计图。
GPT ImageGen生成的PPT蓝图,相当于AI出的设计稿
② GPT5.5:AI的"工程师"
蓝图有了,但它是图片,不可编辑。下一步是把图片变成真正的PPTX文件。这需要写代码,需要理解布局逻辑,需要精确的坐标计算。
GPT5.5负责这部分。它分析蓝图中的元素分布,算像素到英寸的坐标转换,写PptxGenJS脚本,生成可编辑的PPTX。
// GPT5.5生成的代码片段 const pptx = new PptxGenJS(); pptx.defineLayout({ name: "16x9", width: 13.333, height: 7.5 }); const slide = pptx.addSlide(); // 标题,完全可编辑的文本框 slide.addText("第42号令推动", { x: 0.48, y: 0.28, w: 9.57, h: 0.60, fontSize: 28, bold: true, color: "012E5C" }); // 柱状图,原生可编辑图表 slide.addChart(pptx.ChartType.bar, data, opts); pptx.writeFile({ fileName: "slide.pptx" });
这段代码不是我写的。GPT5.5看了蓝图之后,自己算出坐标、自己写出来的。说实话第一次看到的时候我有点惊讶。
③ 视觉模型:AI的"质检员"
生成PPTX后,怎么知道它像不像蓝图?Agent调用视觉模型,把PPTX渲染成PNG,跟原图并排对比,逐区域检查差异。
左边是ImageGen蓝图,右边是PPTX渲染结果。视觉模型自动对比差异
选模型的原则:看任务
| | 🧠 要推理和写代码 选GPT5.5类模型逻辑和代码能力强 | | |
给初学者的建议
别纠结"哪个模型最好"。换个问法:"我这个任务需要什么能力?"需要画图就找ImageGen,需要写代码就找GPT5.5,需要看图就找视觉模型。Agent会帮你自动调度,你不用操心选哪个。
PART 03 · 用Skills
Skills:给Agent装上"专业插件"
大模型是Agent的大脑,但光有大脑不够。还得给它专业知识和操作工具。这就是Skills。
什么是Skills?
打个比方:你雇了一个聪明的大学生,智商很高但没做过PPT。你给他一本《PPT制作标准操作手册》,他看完就知道该怎么做了。Skills就是这本手册。
每个Skill里装着一套标准操作流程、专业规则、代码模板和素材资源。Agent加载Skill后,就拥有了那个领域的专业能力。
| | |
| "帮我做PPT"+ 加载cyber-ppt Skill→ 按标准流程生成→ 质量可控 | Skill提供了:三阶段流程、坐标转换规则质量检查标准、11000+图标库 |
本项目用了哪些Skills?
1. cyber-ppt:PPT制作全流程技能包
三阶段流程(分析→蓝图→生成),含坐标转换规则、排版标准、图标库(11000+图标)、质量检查脚本
2. image-to-editable-ppt:图片转可编辑PPT
将图片或扫描PPT重建为对象级可编辑的PPTX,支持元素提取和文字分离
3. pptx-render-compare:渲染对比
将PPTX渲染为PNG,跟参考图并排对比,生成像素差异报告
4. pptx-generator:PPTX生成器
JSON驱动,11种幻灯片类型,5套配色,支持图表、表格、时间线、图片
怎么用?四步
| 发现:找到你需要的Skill 在Agent对话中直接说"帮我做PPT",Agent会自动搜索可用的Skills。也可以手动搜关键词,比如"PPT""文档""图片处理"。 比如输入"帮我从蓝图生成可编辑PPT",Agent自动找到 cyber-ppt 和 image-to-editable-ppt |
| 安装:一键加载 找到合适的Skill后,确认安装就行。Skill会自动加载到Agent环境里,规则、脚本、素材全包。 安装后Agent说"Skill已加载",就可以开始用了 |
| 使用:告诉Agent"做什么" 装好Skill后,你不需要学Skill的内部结构。用自然语言说你的需求就行,Agent按Skill定义的流程自动跑。 你:用cyber-ppt skill, 从蓝图生成PPT,逐页生成供我预览 Agent:好的,按照cyber-ppt的三阶段流程执行: Phase 1: 分析蓝图内容 → 锁定文字和组件 Phase 2: 生成设计蓝图 → 确认视觉方案 Phase 3: 生成可编辑PPTX → 逐页交付 开始执行 Phase 1... 你不需要知道"Phase 1"是什么。Agent按Skill流程自动走 |
| 反馈:在关键节点确认 Skill流程里有确认门。Agent干完一个阶段会暂停,等你点头了再继续。这是质量控制的设计。 比如第1页PPT生成后,Agent暂停。你预览一下,说"基本可接受",它就继续生成第2页 |
实际执行流程
真实对话记录(简化版)
第一轮:提需求
用cyber-ppt skill从蓝图生成PPT,逐页生成供我预览
Agent:好的。已加载cyber-ppt Skill。检测到8页蓝图。按Phase 3流程逐页生成。先从第1页开始...
第二轮:Agent自主执行
Agent:第1页完成了。生成蓝图重建计划 → 文字扫描(46行)→ 元素清单(15项)→ 图标选择(5个tabler-outline)→ PptxGenJS代码生成 → PowerPoint渲染 → 并排对比图。请预览。
交付物:slide-01.pptx + 渲染图 + 对比图
第三轮:用户确认
基本可接受,单独生成第2页,以后每页都单独生成
Agent:好的,slide-01确认通过。开始生成slide-02...
就这三轮对话。中间Agent自己完成了几十个操作步骤:读文件、写JSON、选图标、写代码、调PowerPoint、生成对比图。我要做的就是在几个节点看一眼,说"可以"或者"改一下"。
Agent生成的PPTX渲染效果。所有文字可编辑,所有形状可调整