以 Manus 为例,拆解 AI 生成 PPT 的技术格局、完整工作流、工具选择与高阶使用方法。
开场
作为一个高频使用 Manus 的用户,我深知其强大之处。当前我可以不用为 PPT 的排版和美化而头疼,而是利用 Manus 在 10 分钟内生成一份设计精良、逻辑清晰的惊艳 PPT。
这并非夸张。为了让大家更直观地感受,本文中出现的所有 PPT 配图,均由 Manus 在本次任务中生成,整体耗时约 10 分钟。这些图片不仅是文章的配图,它们本身就是一套完整 PPT 的页面。
接下来,本文将以备受关注的 Manus 为例,深入剖析当前 AI 生成 PPT 的技术格局与主流工具的选择策略,并分享我个人总结的高阶使用技巧。

一、转折点:Nano Banana Pro 带来的美学革命
在 Nano Banana Pro 出现之前,AI 对 PPT 的理解更多停留在"结构"层面。它能帮助罗列大纲、填充文字,但视觉表现力始终是短板。而以 Nano Banana Pro 为核心驱动的新一代工具,则带来了两大革命性变化:强大的中文生成精度和惊人的多图风格一致性。 这些新工具生成的 PPT 不再是简单的图文拼接,而是具备了真正的美学视觉冲击力。每一页都像是由专业设计师精心打造,无论是色彩搭配、元素构图还是整体风格,都达到了前所未有的高度。这标志着 AI 生成 PPT 正式从"格式化"时代迈入了"美学化"时代。
然而,这种"图片式 PPT"也带来了新的挑战。为了追求极致的视觉融合效果,生成的文字和元素被"焊"在了图片里,牺牲了传统 PPT 的独立可编辑性。不过,目前业内大部分工具已经支持通过选中文字来进行编辑,在一定程度上弥补了这一不足。

二、完整的工作流:为什么不能只依赖 Nano Banana Pro?
一个普遍的误区是,既然 Nano Banana Pro 这么强大,我们直接调用它的 API 不就行了吗?但在实际操作中,这远非最高效的解决方案。 虽然 Nano Banana Pro 具备一定的中文理解和推理能力,但在实操过程中,依旧需要 文生文类的模型 帮忙做文字的润色、大纲梳理等工作。因此,如果仅仅通过调用 Nano Banana Pro 模型的 API,没有办法以更高的效率完成一份 PPT,而是应该依赖平台、工具的整合能力。 一份完整的 PPT 包含两大核心:文字内容(大纲与讲稿)和视觉设计(排版与美化)。文生文模型(LLM)负责前期的脑力工作,如思路整理、大纲生成、内容扩写。模型选择相对灵活,例如 DeepSeek、Kimi 等在深度思考和结构化输出方面表现优异。而文生图模型负责后期的视觉呈现,将文字内容转化为幻灯片。Nano Banana Pro 是这一领域的佼佼者。 因此,真正的效率提升来源于平台和工具的整合能力。一个好的工具应该是一个"指挥家",它懂得在什么时候调用哪个模型,如何将不同模型的优势组合起来,最终为用户提供一个无缝、高效的创作流程。

三、工具选择:内部平台与外部平台的推荐
基于上述分析,业内有几类优秀的工具,可以帮助我们在日常完成一份高质量的 PPT。这里先说结论:公司内部平台推荐 Vedas,公司外部平台推荐 Lovart 和 Manus。这两款外部工具也代表了业内生成 PPT 的两种主流方向。
Vedas:传统优化路线
体验链接:ai.woa.com/#/vedas/a...
Vedas 没有调用 Nano Banana Pro,所以在图文融合、美学冲击效果上表现一般。但这类传统的生成 PPT 的方式,有其独特的优势。 首先是 成本低。生成速度快,计算资源消耗低。其次是 高度可编辑。生成的各类元素可以拖拽、编辑,方便我们快速梳理 PPT 思路,并提供清晰的范式参考。第三是 数据安全。公司内部提供的平台,最大程度地保护了我们的数据隐私安全。 以 Vedas 为例,Gamma 等传统 AI 生成 PPT 的工具也采用了类似的方式。值得注意的是,在 Nano Banana Pro 推出后,这些平台并未完全抛弃传统范式,而是选择了"拥抱新技术"。它们依然保留了传统的可编辑模式,但同时也集成了文生图能力,通过一些技术手段来支持对生成图片中的文字进行编辑。
Lovart:垂直场景的"专家"
除了传统工具之外,还有一些新兴的工具涌现,以 Lovart 为代表。这类工具 完全拥抱并主推以 Nano Banana Pro 为基础的生成 PPT、海报等方案。 Lovart 通过 UI 呈现多类 PPT 风格供用户选择,也会引导用户提供材料帮助生成 PPT 大纲。这类工具做的是独立场景,因此整个工具的设计都是为了帮助用户如何 低门槛、高效率、高质量 地生成一份 PPT。 其优缺点同样明显:好用但是贵。
Manus:复杂任务的"瑞士军刀"
还有一类工具就是以 Manus 为代表的,这也是我日常高频在用的工具。这一类工具设计的目标是 用来处理各类复杂任务,PPT 只是其中一个很小的、用户需要被解决的任务的代表。 因为要处理各类任务而不区分具体场景,对平台的要求很高,所以这一类工具的水平在我看来是参差不齐的。但这一类工具的发展我觉得可以值得关注,代表工具包括 Manus、Kimi 等。其中,我重点推荐的、也是我自己高频在使用的就是 Manus。 Manus 前段时间因被 Meta 收购而再次收获大家关注,但国内对其的评价还是贬义大于褒义。关于为什么 Manus 在我心中是一个天花板级的工具,以及我认为它为什么会被 Meta 收购,我最近也在准备写一份分析文章深入探讨。 Manus 的优势和劣势同样明显:比起刚刚提到的 Lovart,更贵了但是更好用了。

四、深入理解:不同工具的优化重点
回到生成 PPT 这个领域,我们刚刚提到了不管是 Lovart、还是 Gamma,它们都是 专门针对 PPT 生成、海报生成这些场景 的,所以做了比较多的专门优化。但这些优化 并不是技术维度的,而是在 降低用户使用门槛、提升用户易用性 方面的。 而 Manus 因为目标是处理复杂任务,所以它并没有这些针对性的易用性优化。但我觉得,如果掌握了生成 PPT 的一系列方法后,可以尝试使用 Manus,因为 Manus 提供了一些别的平台没有的能力,可以帮助你更快速、更高效地完成一份 PPT。
图片式 PPT 的可编辑性解决方案
如前所述,Nano Banana Pro 生成的是"图片式 PPT",文字被融入图片中。为了解决编辑问题,主流平台提供了不同的技术路径。 路径一:图像修复与文字识别。当用户选中文字时,平台通过 OCR 技术定位文字区域,然后利用 Inpainting(图像修复)技术,将原文字抹去并用符合背景风格的图像补全,最后将新文字叠加到这个区域。这种方式能最大程度保持设计风格,但每次修改都需要几秒到十几秒的模型调用时间。 路径二:图片与文字框叠加。在 AI 生成的背景图上,叠加一个独立的透明文字层。用户编辑的只是这个文字层。这种方式响应速度快,体验接近传统 PPT,但图文融合的美学效果可能稍逊一筹。 路径三:重新生成整张图片。理论上可以要求模型在保留其他部分不变的情况下修改文字,但实际上 AI 模型很难精确遵循这类复杂指令,容易导致整个页面发生非预期的变化,因此很少被采用。
流程自动化与提示词预置
为了降低用户的使用门槛,平台在"简化流程"和"降低提示词难度"上做了大量工作。例如,用户只需输入一个主题,平台会自动调用 LLM 生成大纲,再将大纲分发给文生图模型生成页面。同时,平台内置了大量"商务风"、"科技风"、"赛博朋克风"等风格模板,用户只需点击选择,后台会自动匹配优化好的、复杂的提示词,让普通人也能轻松生成专业级的设计。

五、高阶技巧:如何驾驭 Manus 这样的复杂任务平台?
使用 Manus 这类通用型工具,我们需要转变思路,从傻瓜式操作转向专家式驾驭。这里分享几个我的独门技巧。
技巧一:善用"前置任务预览"与及时干预
这是 Manus 的一个关键功能。在结果生成出来前,通过 预览前置任务结果,判断生成的结果是否符合预期。 这就好比我希望模型帮我生成一座城堡,但如果模型刚生成一个城堡尖尖,配色是暗黑风的,那我就已经知道不是我想要的童话风的风格了。那么我就可以 及时干预,这样既节省了时间也节省了 Token 消耗数。 这种"可视化工作流反馈"的设计,让用户能够在过程中及时发现问题、调整方向,从而大幅提高了生成效率。
技巧二:开启"多任务并发"的"抽卡"策略
另外一个是 多并发能力。我可以同时并行开启多个任务,这样做的好处在于,模型的生成具备一定的随机性。特别是利用 Nano Banana 这种模型时,同一套提示词生成的结果是不一致的。 我把这个过程叫做 "抽卡"。你增加抽卡数,那么你获得一个好的 PPT 的概率就更高。Manus 强大的多任务并发能力,允许我同时开启多个生成任务,相当于同时进行多次"抽卡",总有一个结果能正中靶心。
结语
AI 生成 PPT 的技术浪潮已然来临,其核心价值 并非取代人类的创造力,而是将使用者从繁琐的排版和美化工作中解放出来,从而能更专注于内容的深度思考与逻辑表达。 在工具选择上,内部平台 Vedas 提供了成本低、可编辑、数据安全的传统方案;外部平台 Lovart 则代表了完全拥抱新技术、垂直场景优化的新兴方向;而 Manus 则是为掌握高阶技巧的用户提供了最大灵活性和独特能力的复杂任务平台。 深入理解当前的技术格局、不同工具的价值主张及其背后的实现路径,将有助于我们更好地驾驭 AI,使其成为提升工作质量与效率的强大伙伴。




