感觉在做 PPT 这个事情上,充分体现了 AI 和真人的区别。
目前来看,如果直接让 AI 做可编辑 PPT,它能理解文字和逻辑,但页面一复杂,就容易出现字号不协调、元素重叠、留白奇怪等问题。
如果让 AI 直接生成 PPT 图片,做出来的 PPT 整体上看往往非常符合需求,但总会有几个字是乱码、形近字或者错字,而且因为是图片,很难对错误的地方进行校正。
通过更详细的 Prompt、增加 Agent、增加 Skill 等方式,上述问题有所改善,但始终不能完全解决,还是需要人工介入。
这其实体现了人和 AI 一个很大的区别。
AI 很擅长学习局部规律。它能从海量优秀 PPT 中学习哪些配色、版式和构图更受欢迎,也能理解文字之间的逻辑关系。但这些能力目前更多是分别存在的:负责图片的模型关注视觉效果,负责文字的模型关注语义逻辑。但是要把这些能力统一成一个整体,其实涉及极其复杂的全局关联和多目标优化。一个元素的位置、字号、留白发生变化,往往都会影响整个页面的视觉层级、阅读顺序和版面平衡,很难通过一套固定规则去描述。
人却不太一样。
我们看到一页 PPT,不会把它看成几十个文字框、图片和线条,而是会下意识把它们组织成一个整体,瞬间判断哪里舒服、哪里别扭、哪里需要留白、哪里应该强调。这种整体性的知觉,心理学里称为格式塔(Gestalt)。它会把视觉、语义、经验、情绪甚至价值判断联系在一起,因此一个地方改动了,会自然想到其他地方也应该一起调整。
人最大的特点,不只是会学习、会计算、会推理,而是能够在没有明确规则、没有明确目标、甚至没有明确答案的时候,依然凭借整体知觉、经验、价值和直觉,不断形成新的目标、新的关联和新的意义。
PS: 这段思考跟AI进行了反复讨论,结果从人和AI的区别发散到了自由意志是否真实存在,也不管它存不存在吧,突然感觉兴趣与好奇才是生活的动力